historical-analysis-and-study-techniques
Analyser les textes historiques avec les outils de traitement de la langue naturelle
Table of Contents
La Fondation de l'extraction de texte dans l'histoire
L'historien travaillant avec les archives numériques est confronté à un paradoxe d'abondance. Des millions de livres, journaux et lettres personnelles sont maintenant disponibles en un seul clic, mais la capacité humaine de les lire et de les synthétiser reste finie. Le traitement des langues naturelles (NLP) offre un chemin à travers cette abondance.
Le traitement du langage naturel est une branche de l'intelligence artificielle qui se concentre sur l'interaction entre les ordinateurs et le langage humain. Son objectif premier est d'enseigner aux machines à lire, interpréter et tirer le sens du texte d'une manière à la fois statistiquement robuste et contextuelle.Dans le contexte de la recherche historique, cela signifie la conversion de documents fragiles, bruyants et très variables – des manuscrits médiévaux aux télégrammes du XXe siècle – en données structurées qui peuvent être posées et quantifiées.
Les méthodes historiques traditionnelles reposent fortement sur une lecture étroite : une analyse profonde et interprétative d'un petit nombre de documents. Cette approche génère des idées riches et contextualisées mais souffre de problèmes d'évolutivité. L'historien ne peut lire que tant de pages. Le NLP introduit le concept de lecture lointaine, terme popularisé par le savant littéraire Franco Moretti. La lecture lointaine traite des milliers de textes comme un seul paysage de données, les analysant par des agrégats statistiques. Cela ne remplace pas une lecture étroite; elle le complète en fournissant une vue macro-niveaux qui peut guider une enquête approfondie. Par exemple, un savant étudiant la rhétorique politique du XVIIIe siècle pourrait utiliser une lecture lointaine pour identifier une augmentation soudaine de l'utilisation du mot « représentation » dans des dizaines de brochures, puis revenir à une lecture rapprochée pour interpréter ces textes en contexte.
Composantes essentielles d'un pipeline NLP pour l'histoire
Pour comprendre comment fonctionne le NLP sur les documents historiques, il est utile de décomposer le pipeline de traitement standard. Chaque étape transforme le texte brut en un format lisible par machine :
- Tokénisation:[ La division d'un flux de texte en mots individuels, en marques de ponctuation ou en phrases. Cela sonne simple, mais des textes historiques avec espacement irrégulier, ponctuation archaïque, et l'utilisation du long caractère ‘s=" (qui ressemble à un ‘f=") peuvent faire trébucher des tokenizers modernes.
- Tagnage de la partie de parole (POS) : Étiqueter chaque mot avec son rôle grammatical (nom, verbe, adjectif, adverbe). Ceci est essentiel pour déconcentrer le sens. Par exemple, le mot -Light-S peut être un nom (une source d'éclairage) ou un adjectif (pas lourd). Le marquage POS permet aux algorithmes de distinguer ces utilisations, qui est critique pour des tâches comme la modélisation de sujets ou l'analyse de sentiments.
- Lémisation et stemming:[ Réduire les mots à leur base ou forme de dictionnaire. -Running devenant -Run; -Better devenant -Good. -Pour les textes historiques, cela aide les variantes agrégées d'un mot à travers un corpus. Cependant, un lemmatiseur formé sur l'anglais moderne peut ne pas reconnaître les formes archaïques comme -Doth (does) ou -Hath (has), donc des dictionnaires personnalisés ou la correction manuelle sont souvent nécessaires.
- Reconnaissance d'entités nommées (NER) :[ Identifier et classer les noms appropriés en catégories prédéfinies telles que les noms de personnes, les organisations, les lieux, les dates et les valeurs monétaires.C'est l'un des outils les plus utiles immédiatement pour les historiens.Un chercheur qui analyse un siècle de correspondance diplomatique peut utiliser le RNE pour extraire chaque mention d'un ministre des affaires étrangères, d'une capitale ou d'un traité, puis cartographier ces entités dans le temps et l'espace.
Principales applications dans la recherche historique
L'application du NLP aux documents historiques est en train de remodeler plusieurs domaines d'enquête. Les chercheurs ne se limitent plus à poser des questions simples sur ce que disent les textes; ils peuvent maintenant poser des questions complexes sur la façon dont la langue fonctionne dans le temps et dans l'espace.
Lecture et macroanalyse lointaines
La lecture lointaine permet aux chercheurs d'analyser les tendances d'un siècle de publication en un seul après-midi. En calculant la fréquence de mots ou de thèmes spécifiques au fil du temps, les chercheurs peuvent suivre la montée et la chute des idées. Par exemple, suivre l'utilisation de termes comme -liberty, -empire, ou -republic, dans les journaux du XVIIIe siècle fournit une mesure quantitative du discours public.
Modélisation des thèmes
La modélisation thématique est une technique d'apprentissage automatique non supervisée qui scanne une collection de documents et découvre automatiquement des grappes de mots qui apparaissent souvent ensemble. Ces grappes, ou -topics,-- représentent des thèmes latents dans le corpus. Un historien travaillant avec des discours parlementaires victoriens pourrait utiliser la modélisation thématique pour trouver qu'un sujet regroupe systématiquement des mots comme -railway,------------------------------------------------------------------------------------------------------------------------------------------------------------------------
Stylométrie et attribution de l'auteur
La stylométrie utilise l'analyse statistique pour quantifier un style d'écriture unique d'un auteur. En mesurant des caractéristiques telles que la longueur de phrase, la richesse du vocabulaire et la fréquence des mots fonctionnels (par exemple, -le,-le,-le,-le,-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-de-le-le-de-le-de-le-de-de
Analyse des sentiments et arcs émotionnels
L'analyse du sentiment tente de mesurer le ton émotionnel ou la polarité d'un texte (positif, négatif, neutre). Lorsqu'elle est appliquée à des textes historiques, cela nécessite un calibrage minutieux. L'application d'un lexique moderne au roman du XIXe siècle produirait probablement des résultats trompeurs parce que les significations des mots changent. Cependant, lorsque les chercheurs construisent des lexiques spécifiques à une période donnée, tirés de dictionnaires contemporains ou annotés par des experts, ils peuvent tracer des arcs émotionnels à travers un récit ou suivre le moral public par correspondance en temps de guerre.
Analyse des chiffres historiques par réseau
En extrayant des entités nommées d'un corpus de lettres ou de documents diplomatiques, les chercheurs peuvent construire des réseaux complexes de relations, appelés analyse historique des réseaux. Par exemple, un pipeline NLP pourrait extraire chaque personne mentionnée dans la correspondance de John Adams. Un historien pourrait alors cartographier qui il correspondait le plus souvent, qui a été cité comme une influence, et comment ces réseaux ont changé au cours de sa carrière. Cela transforme le texte statique en une carte sociale dynamique.
Géographie et histoire spatiale
Un sous-domaine croissant de NLP historique est géoparsing[: l'extraction et la désambigation des noms de lieux à partir du texte. Combiné avec les systèmes d'information géographique (SIG), le géoparsage permet aux historiens de cartographier les dimensions spatiales des événements et des discours historiques. Par exemple, un chercheur étudiant la propagation de la Mort noire pourrait utiliser le géoparsage sur les chroniques contemporaines pour tracer la séquence des épidémies signalées, puis comparer ces données avec des modèles épidémiologiques modernes.
Confronter les défis des données historiques
L'application du NLP aux articles d'actualité contemporains est assez difficile. L'application aux manuscrits séculaires introduit un ensemble spécifique de défis techniques et d'interprétation qui doivent être abordés pour que les résultats soient valides.
Erreurs de reconnaissance optique de caractères (ROC)
La plupart des textes historiques numériques sont créés par balayage des pages physiques et les exécuter à travers le logiciel de reconnaissance optique de caractères (OCR). Historiquement, le logiciel OCR a lutté avec les polices archaïques (comme les longues-s), l'encre effacée, le type cassé et les liaisons serrées qui masquent le texte près de la colonne vertébrale. La sortie résultante est souvent garble. Un mot comme -histoire -- peut devenir ---histoire,-------------------------------------------------------------------------------------------------------------------------------------------------------
Variation historique de l'orthographe
Avant la normalisation de l'orthographe anglaise à la fin du XVIIIe siècle, les écrivains épellaient souvent des mots phonétiques ou selon une convention régionale. -Glorious , peut apparaître comme -glorieux, -glorius, -glorius, ou -gloriouse.- Un outil NLP moderne traitera ces mots comme des mots entièrement différents. Pour y répondre, les chercheurs utilisent des techniques comme des correspondances d'expression régulière[ (p. ex., le modèle capture plusieurs variantes) ou des algorithmes d'encodage phonétique[, comme Soundex ou Metaphone, qui sont des mots de regroupement qui sonnent semblables.
Maj sémantique et anachronisme
Le mot -gay-y- dans les années 1830 signifient légèreté et insouciance; -wawful-y-fabrication signifient plein d'admiration;--fabrication signifient à l'origine par la main. L'application d'un sentiment moderne au texte historique conduira à des erreurs d'interprétation significatives. Les chercheurs doivent être conscients du changement sémantique [] et soit construire des dictionnaires spécifiques à une période donnée ou utiliser des algorithmes qui détectent des changements de signification mot au fil du temps.-- Des modèles d'intégration de mots – tels que ceux générés par word2vec ou GloVe – offrent une solution puissante: en formant des ancrages séparés sur des textes de différentes périodes, les chercheurs peuvent suivre comment les voisins les plus proches d'un changement de mot.
Sparté et fragmentation des données
Contrairement aux ensembles de données modernes, les corps historiques sont souvent incomplets. Seule une fraction de ce qui a été écrit a survécu à nos jours, et une fraction encore plus petite a été numérisée. Cela crée un biais de survie qui peut fausser les résultats. Une analyse NLP des tendances à long terme doit tenir compte du fait que les données du XIXe siècle sont beaucoup plus abondantes que les données du seizième. Les modèles statistiques doivent être suffisamment robustes pour gérer cette sparté sans tirer de fausses conclusions de données manquantes.
Flux de travail et outils pratiques pour les historiens
Les historiens n'ont pas besoin d'être des programmeurs experts pour intégrer NLP dans leurs recherches. Il existe un éventail d'outils, allant des interfaces graphiques de haut niveau aux bibliothèques de programmation de bas niveau. Le choix dépend du confort technique du chercheur et de la complexité des questions posées.
Outils basés sur l'interface graphique pour l'analyse rapide
Pour les chercheurs qui veulent commencer rapidement sans code d'écriture, plusieurs plateformes d'analyse de texte robustes sont disponibles. Voyant Tools est une application Web qui permet aux utilisateurs de télécharger du texte et de générer immédiatement des nuages de mots, des listes de fréquences, des graphiques de collocation et des modèles de sujets. Il est gratuit et ne nécessite aucune installation, ce qui le rend idéal pour l'utilisation en classe ou l'analyse exploratoire. AntConc est une boîte à outils d'analyse de corpus pour Windows, Mac et Linux qui supporte la concordance, le cluster et l'analyse de listes de mots, ainsi que des fonctionnalités avancées comme les listes de mots clés et l'extraction de n-gram.
Programmation avec Python et R
Pour des recherches plus rigoureuses, reproductibles et personnalisées, les historiens se tournent de plus en plus vers les langages scriptifs. Python est la langue dominante pour les NLP, avec des bibliothèques comme Natural Language Toolkit (NLTK)[, spaCy et Gensim fournissant des fonctions préconstruites pour tout, de la tokenisation à la modélisation thématique. R est un environnement informatique statistique qui offre les paquets et pour l'analyse du texte, ainsi que pour l'intégration avec l'écosystème triversal. L'apprentissage du script permet à un chercheur de construire un pipeline transparent et répétable qui peut être partagé et critiqué.
Construction d'une société
La première étape de tout projet NLP est la construction d'un corpus de haute qualité. Les textes d'approvisionnement à partir d'archives numériques fiables sont essentiels.
- HathiTrust Digital Library:[ Un dépôt massif de livres numérisés provenant des grandes bibliothèques de recherche, offrant une recherche en texte intégral et un téléchargement pour les travaux du domaine public.
- Chronicling America:[ Une base de données consultable de journaux américains historiques de 1777 à 1963, fournie par la Bibliothèque du Congrès.
- Old Bailey Online[:[ Une édition entièrement consultable des délibérations de la Cour pénale centrale de Londres, couvrant de 1674 à 1913. Il comprend des transcriptions de procès détaillées riches en données sociales et linguistiques.
- Projet Gutenberg:[ Un effort bénévole pour numériser et archiver des oeuvres culturelles, en grande partie limitées aux textes du domaine public. Bien qu'utile pour l'analyse littéraire, il manque souvent les métadonnées et le contrôle de la qualité des archives universitaires.
Une fois assemblé, un corpus doit être nettoyé et prétraité, ce qui comprend la suppression des en-têtes et des pied de page des métadonnées, la standardisation des ruptures de ligne, la conversion des ligatures (par exemple «fi» en «fi» et l'application de toute correction nécessaire au texte.
Orientations futures : modèles linguistiques de grande envergure et histoire numérique
L'explosion récente des grands modèles linguistiques (LLM) – tels que GPT-4, Claude et des alternatives open-source comme Lama et Mistral – représente un changement de paradigme pour l'analyse de texte. Ces modèles sont capables de résumer, traduire et générer du texte de qualité humaine. Pour les historiens, les LLM offrent la possibilité tantalisante de interroger une archive en langage naturel. Au lieu d'écrire un script de modélisation complexe, un chercheur pourrait simplement demander : --------------------------------------------------------------------------------------------------------------------------------------------------------
Cependant, les LLM présentent des risques importants pour la recherche historique. Ils sont sujets à hallucination, ce qui signifie qu'ils produiront de fausses informations en toute confiance, inventant des citations, des citations erronées ou des événements. Ils sont également formés à des ensembles de données massives et non sécurisées qui manquent de contexte historique. Un LLM pourrait imposer un cadre idéologique moderne à un texte historique, produisant un résumé anachronique qui reflète les biais du XXIe siècle plutôt que les réalités du XVIIIe siècle. Par conséquent, bien que les LLM offrent des outils puissants pour l'exploration et la génération de texte, ils ne peuvent remplacer les méthodes rigoureuses et fondées sur des hypothèses de NLP traditionnel.
Le rôle de l'analyse multimodale
L'avenir de l'analyse historique du texte réside dans le passage au-delà du texte pur. Les documents historiques ne sont pas seulement des mots; ce sont des objets physiques avec la mise en page, les illustrations, la marginalité et la liaison. L'analyse multimodale combine NLP avec la vision informatique pour analyser simultanément le texte et l'image. Cela permet aux chercheurs d'étudier la relation entre un texte et ses illustrations, d'analyser les annotations manuscrites aux côtés du texte imprimé d'un livre, ou de transcrire automatiquement et indexer les marginalités manuscrites. Par exemple, un projet étudiant les premiers traités alchimiques modernes pourrait utiliser la reconnaissance optique des caractères sur le texte principal tout en appliquant la vision informatique pour identifier et classer les dessins complexes d'alambiques et de fours qui accompagnent les instructions.
Questions humanistes, outils informatiques
L'intégration du traitement du langage naturel dans la recherche historique ne consiste pas à automatiser l'historien hors d'un emploi. Il s'agit d'élargir la portée de ce que les historiens peuvent savoir. La production de calcul brut n'est pas un argument historique fini; c'est une preuve qui nécessite une interprétation critique. L'historien doit se demander: Pourquoi ce modèle a-t-il émergé?
En maîtrisant ces outils, les chercheurs peuvent naviguer avec confiance dans les vastes archives numériques du XXIe siècle, tester des hypothèses à l'échelle, découvrir des modèles cachés d'influence et poser des questions nuancées sur la langue, la culture et le pouvoir à travers le temps. La transformation numérique de l'histoire n'est pas une menace pour la discipline; c'est une occasion d'affiner nos méthodes et d'approfondir notre compréhension du passé.