Pendant des siècles, les historiens ont travaillé avec soin à travers les archives, à lire lettre par lettre, page par page, pour rassembler le récit de l'expérience humaine. Bien que cette approche manuelle ait donné des indications inestimables, le volume de documents historiques numérisés maintenant disponibles — des millions de livres, journaux, journaux et dossiers gouvernementaux — exige de nouvelles méthodes. La linguistique computationnelle, domaine interdisciplinaire assis à l'intersection de l'informatique et de la linguistique, offre exactement cela : des algorithmes et des modèles capables de traiter le langage à l'échelle. Appliquée aux textes historiques, elle transforme les archives poussiéreuses en ensembles de données riches, permettant aux chercheurs de détecter des modèles subtils de changement linguistique, de révéler des thèmes culturels cachés, voire d'attribuer la paternité à des œuvres anonymes.

Qu'est-ce que la linguistique computationnelle?

La linguistique computationnelle ne se limite pas à écrire des logiciels pour compter les mots. Elle englobe la conception de modèles formels de langage que les machines peuvent exécuter, couvrant tout, de la phonétique et de la morphologie à la syntaxe, la sémantique et les pragmatiques. Les tâches principales comprennent le marquage en partie de la parole, l'analyse de la structure de la phrase, la désambitation des sens des mots et la compréhension du discours.

Dans le contexte des textes historiques, la linguistique computationnelle devient une sorte de machine à remonter le temps. Les langues évoluent : l'orthographe s'unifie, les mots nouveaux émergent, les vieux deviennent archaïques, et les changements de grammaire. Un modèle computationnel formé sur l'anglais moderne va se heurter à une brochure du XVIIe siècle. Par conséquent, les chercheurs doivent adapter ces outils – créant des corps historiques, développant des lexiques spécialisés et des modèles de réglage fin pour tenir compte de la diversité linguistique des époques passées.

Analyser les textes historiques avec la technologie

Numérisation de texte et OCR

Les systèmes de reconnaissance optique des caractères (OCR) sont la principale technologie pour cette tâche. Les systèmes de reconnaissance optique des caractères (OCR) sont notoirement inexacts avec les polices historiques, l'encre qui s'affaiblit et les pages inégales. Les moteurs modernes de l'OCR, comme Tesseract et ABBYY FineReader, se sont améliorés de façon spectaculaire, surtout lorsqu'ils sont combinés à des modèles de prétraitement d'images et de langages avancés adaptés aux scripts historiques.

Une fois numérisé, le texte entre dans un pipeline de prétraitement : tokenisation (en scindant en mots ou en jetons), normalisation (standardisation de l'orthographe, manipulation de caractères variants comme les longs 's'), et balisage (ajout de balises structurales pour les paragraphes, les pauses de page, ou les marginalités).

Construction et annotation de Corpus

Un corpus historique est plus qu'un simple dump texte. Il est soigneusement préparé pour équilibrer des facteurs comme la période, le genre, le dialecte et l'auteur. Des projets tels que Corpus of Historical American English (COHA) et Helsinki Corpus of English Texts fournissent des ensembles de données structurés et annotés couvrant des siècles. Ces corpus comprennent souvent des métadonnées : date de composition, information de l'auteur (quand connue), type de texte (p. ex. fiction, juridique, scientifique), et parfois annotations manuelles pour des caractéristiques linguistiques comme les noms ou les verbes.

Techniques informatiques clés pour les textes historiques

Analyse de fréquence et extraction de mots clés

Par exemple, une augmentation marquée des mots comme -war, -kingdom, -enemy et -enemy, dans les brochures anglaises du XVIIe siècle pourrait être en corrélation avec la guerre civile anglaise. L'extraction de mots-clés plus sophistiquée compare les fréquences relatives entre un corpus cible et un corpus de référence pour identifier des termes statistiquement surreprésentés. Cette technique est largement utilisée dans les humanités numériques [ pour identifier le vocabulaire distinctif d'un auteur, d'un genre ou d'une époque particulier.

Modélisation des thèmes

La modélisation thématique est une méthode d'apprentissage automatique non supervisée qui découvre des thèmes latents à travers une collection de documents. L'algorithme le plus commun, Latent Dirichlet Allocation (LDA), traite chaque document comme un mélange de sujets, et chaque sujet comme une distribution sur des mots. Pour un corpus de romans victoriens, la modélisation thématique pourrait regrouper des mots comme -jardin, -field, -walk, et -summer, dans un sujet -nature, et -usine, -worker, -machine, et -city, dans un sujet -industrialisation.

Analyse des sentiments

L'analyse du sentiment va au-delà des fréquences des mots pour mesurer le ton émotionnel des textes, positifs, négatifs ou neutres. Les premières méthodes reposaient sur les lexiques sentimentaux (listes de mots pré-assignées une note de valence), mais les approches modernes utilisent des modèles d'apprentissage profond formés sur des ensembles de données étiquetés. L'analyse du sentiment dans les journaux historiques peut tracer l'opinion publique lors d'événements comme la Révolution américaine ou le mouvement abolitionniste.

Reconnaissance de l'entité désignée (NER)

Le RNE historique est particulièrement difficile car les entités peuvent être écrites dans des orthographes différentes (par exemple, -Shakspere ou -Shakespeare), ou se référer à des institutions à long terme. Les modèles du RNE personnalisés formés aux nomenclatures historiques et aux bases de données biographiques peuvent extraire les personnes mentionnées, où les événements ont eu lieu, et quand. Cela permet la construction de réseaux sociaux[ à partir de réseaux de correspondance ou d'alliances politiques, permettant aux historiens de visualiser les connexions invisibles dans un document unique.

Stylométrie et attribution de l'auteur

La sylométrie applique l'analyse statistique au style d'écriture, comme la longueur des phrases, la distribution des fréquences de mots et l'utilisation des mots-fonctions (p. ex., -le,-le,-le,-le et-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-le-de-le-de-le-le-de-

Détection de changement lexique et changement sémantique

Les mots changent de sens au fil du temps. Des approches informatiques comme les ancrages diachroniques (par exemple, en alignant les vecteurs de mots d'un siècle à l'autre) permettent aux chercheurs de quantifier la dérive sémantique. Par exemple, le mot =gay= dans les années 1900, qui se réfère au bonheur, mais dans les années 1970 est principalement associé à l'homosexualité.

Études de cas et applications du monde réel

Suivi du langage de la démocratie

Des chercheurs d'institutions comme Digital Humanities Center[ ont utilisé la modélisation thématique et l'analyse des sentiments pour examiner le langage des brochures politiques américaines de 1750 à 1800. Ils ont trouvé un changement dramatique de la loyauté coloniale à la rhétorique révolutionnaire, avec des mots comme -liberty, -droits, -taxe et --taxe - passer de l'usage général à des grappes hautement polarisées après 1775.

Reconstruire l'ancienne paternité

Les chercheurs qui étudient les œuvres attribuées à Platon ont utilisé l'analyse stylométrique pour distinguer ses dialogues précoces, intermédiaires et tardifs basés sur des changements dans son utilisation des particules grecques et des terminaisons de phrases. Des méthodes similaires ont été appliquées à la Bible, les Scrolls de la mer Morte, et chroniques médiévales. Dans chaque cas, la linguistique computationnelle fournit des preuves qui complètent la critique paléographique et historique traditionnelle.

Cartographie de l'émotion historique

L'analyse des sentiments sur un corpus de lettres du XIXe siècle de migrants à l'Ouest américain révèle un modèle : les premières lettres sont optimistes, avec des scores positifs élevés, mais après le premier hiver rigoureux, les pics de négativité.

Défis en matière de linguistique historique computationnelle

Malgré sa promesse, l'application de la linguistique computationnelle aux textes historiques est difficile.

Erreurs OCR et données sonores

L'OCR historique produit souvent du texte en guillemet : -long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-

Variation orthographique et changement de langue

Avant le 19ème siècle, l'orthographe anglaise était très variable : -Shakespeare , -Shakspeare, -Shagspere, -Shaxberd.- La lémmatisation (réduction des mots à leur forme de base) nécessite la cartographie de ces variantes à une forme canonique, un processus qui exige des lexiques étendus et des algorithmes flexibles de couplage de chaînes.

La rareté des données et l'adaptation des domaines

Bien que les archives numérisées soient énormes, elles sont souvent déséquilibrées. Certains dialectes, périodes ou types de textes sont surreprésentés, tandis que d'autres (par exemple, lettres privées de femmes, langues autochtones) sont rares. Les modèles d'apprentissage automatique formés à l'abondante donnée moderne ne se transfèrent pas bien dans des domaines historiques peu nombreux.

Ambiguïté et interprétation

La signification de tout texte est en partie un produit de son contexte. Les méthodes informatiques peuvent identifier les modèles, mais l'interprétation de ces modèles nécessite une connaissance historique profonde. Une augmentation soudaine des références à l'épidémie pourrait être due à une épidémie réelle, mais elle pourrait également refléter un changement de terminologie médicale ou une nouvelle réglementation exigeant la déclaration des maladies.

Orientations futures : l'IA et les grands modèles linguistiques

Contrairement aux modèles précédents, les LLM peuvent effectuer des tâches comme la traduction automatisée de la langue archaïque dans l'anglais moderne, la réponse à la question[ sur les corps historiques, et l'extraction d'information complexe[ aux niveaux quasi humains. Par exemple, un modèle affiné sur l'anglais du XVIIe siècle peut corriger les erreurs de l'OCR, normaliser l'orthographe et même répondre à des questions comme - Quels arguments le roi Charles I a-t-il utilisés dans ses discours?

Les chercheurs doivent les utiliser avec prudence, en vérifiant les résultats par rapport aux sources originales. Les approches hybrides qui combinent les connaissances historiques symboliques (par exemple, les gazetteurs, les bases de données biographiques) et les modèles neuraux sont susceptibles de dominer la prochaine décennie.

Outils et ressources pour les chercheurs

Pour ceux qui souhaitent commencer leur propre analyse historique computationnelle, plusieurs outils ouverts et commerciaux sont disponibles :

  • Voyant Tools:[ Une plateforme d'analyse de texte basée sur le Web qui ne nécessite aucune programmation. Elle offre des listes de fréquences, des nuages de mots et une modélisation de sujets simples.
  • Python Libraries: NLTK, spaCy et scikit-learn fournissent des fonctions robustes pour la tokenisation, le NER, et la classification.
  • TEI (Initiative de codage de texte):[ Norme pour le marquage des documents historiques en XML, permettant une analyse structurée entre les projets.
  • Stanford CoreNLP:[ Offre des pipelines pré-formés pour plusieurs langues, avec des options de recyclage sur les données historiques.
  • Historical OCR Platforms:[ Transtribus et OCR4all se spécialisent dans les scans historiques, fournissant une formation sur mesure pour des polices et des scripts spécifiques.

Conclusion

La linguistique computationnelle ne remplace pas la lecture attentive et critique des textes historiques; elle est une augmentation puissante. En permettant l'analyse de corps massifs, en identifiant des motifs subtils et en testant des hypothèses à l'échelle, elle permet aux historiens de poser des questions qui n'étaient auparavant pas réceptibles. Le domaine est encore en train de mûrir, les défis en matière de qualité des données, d'adaptation du domaine et d'interprétation demeurant au premier plan de l'agenda de recherche.