historical-analysis-and-study-techniques
Utilisation de la linguistique computationnelle pour étudier les textes politiques du 19e siècle
Table of Contents
Introduction : Exploitation minière du passé avec des méthodes modernes
Les historiens du XIXe siècle se sont longtemps appuyés sur une analyse manuelle minutieuse des journaux, des discours, des brochures et de la correspondance personnelle pour comprendre les forces qui ont façonné le monde moderne. Pourtant, le volume de matériel qui survivait de cette époque — des millions de pages de texte produites pendant la Révolution industrielle, la montée de la politique de masse et des conflits transformatifs comme la guerre civile américaine — peut submerger les méthodes qualitatives traditionnelles. La linguistique computationnelle offre une approche complémentaire : en appliquant des algorithmes et des modèles statistiques à de grands corpus de texte, les chercheurs peuvent détecter des modèles, suivre des changements de langage et tester des hypothèses à une échelle impossible pour un seul érudit.Cette synthèse de l'informatique et de la linguistique ne remplace pas la lecture étroite mais l'étend, permettant aux historiens de poser de nouvelles questions sur la rhétorique politique, l'idéologie et le changement social.
Qu'est-ce que la linguistique computationnelle?
La linguistique computationnelle (CL) se situe à l'intersection de la linguistique, de l'informatique et de l'intelligence artificielle. Son objectif principal est de modéliser le langage naturel de sorte que les machines puissent traiter, analyser et même générer des paroles et des textes humains.
Analyse des sentiments
Pour les textes politiques du XIXe siècle, cette technique peut révéler comment l'humeur publique a évolué au cours d'événements tels que les révolutions de 1848, le débat sur les lois du maïs ou la crise de sécession aux États-Unis. En inscrivant le sentiment au fil du temps, les historiens peuvent identifier des périodes de nationalisme croissant, d'optimisme réformiste ou de désespoir de guerre. Par exemple, une étude des journaux américains au cours du cycle électoral de 1860 pourrait montrer comment les journaux de l'époque républicaine, qui avaient été l'objet d'une réflexion sur Lincoln, ont changé de rhétorique pour se tourner vers des appels anxieux à l'union, tandis que la Caroline du Sud débattait sur la sécession.
Modélisation des thèmes
Appliquée à un corpus de discours parlementaires britanniques du XIXe siècle, les modèles thématiques pourraient regrouper des mots comme « commerce », « tarif », « fabrication » et « empirique » dans un thème de politique économique, tandis que « suffisance », « représentation » et « propriété » autour de la réforme électorale. Les chercheurs peuvent ensuite tracer comment la prévalence de chaque thème s'est accrue et s'estompée au fil des décennies. La modélisation thématique a été utilisée pour montrer, par exemple, que les références à la religion dans les débats parlementaires britanniques ont diminué régulièrement après 1850, tandis que les discussions sur les infrastructures et la santé publique ont augmenté. Cette technique est particulièrement utile pour découvrir la structure cachée des grandes archives, révélant quels sujets ont été débattus plutôt que de se fier aux sujets canoniques mis en évidence par les historographies traditionnelles.
Reconnaissance de l'entité désignée (NER)
Pour les textes du XIXe siècle, le RNE peut aider à cartographier les réseaux d'acteurs politiques, à suivre la fréquence des références à des nations ou des mouvements spécifiques (p. ex., « Chartisme », « abolition », « Zollverein »), et même à reconstituer la diffusion géographique de la couverture médiatique. Lorsqu'il est appliqué à des milliers d'éditorials des années 1850, le RNE peut montrer que le nom « John Brown » apparaît beaucoup plus souvent dans les journaux du Nord que dans les journaux du Sud dans les mois qui ont suivi le raid Harpers Ferry, mais que les deux régions le référent en lien avec différentes émotions et arguments.
Collocation et analyse des mots clés
L'analyse de la collocation identifie les mots qui apparaissent plus souvent que le hasard ne le prévoit. Étudier les collocats de « démocratie » dans les journaux américains avant et après la guerre civile révèle un changement d'idéal abstrait (p. ex., « égalité », « liberty ») vers un langage institutionnel concret (p. ex., « parti », « ballon », « constitution »). L'analyse de mots clés compare un corpus cible à un corpus de référence pour trouver des mots qui sont inhabituellement fréquents, ce qui indique souvent ce que les contemporains considéraient comme urgent ou distinctif.
Stylométrie
La stylométrie utilise des mesures statistiques du style d'écriture (longueur de la phrase, choix de mots, habitudes de ponctuation) pour attribuer l'auteur. Cette technique a été employée pour résoudre les textes contestés, comme les éditoriaux anonymes de journaux ou l'auteur de brochures politiques, donnant aux historiens un terrain plus solide pour les débats d'attribution. Une application classique impliquait de prouver qu'une série de brochures anti-abolisantes des années 1830 ont probablement été rédigées par un seul avocat de New York, même si elles avaient été publiées sous un pseudonyme. La stylométrie peut également détecter l'évolution du style d'un auteur individuel au cours d'une carrière, offrant des indications sur la façon dont la rhétorique d'un politicien a mûri ou a changé sous pression.
Appliquer la linguistique computationnelle aux textes politiques du 19e siècle
Le XIXe siècle présente à la fois des possibilités et des obstacles pour CL. L'augmentation de l'alphabétisation de masse, l'expansion de la presse écrite et la diffusion de reportages courts ont produit une explosion de discours politiques. En même temps, l'orthographe était souvent irrégulière, les polices étaient variées, et le langage comprend des archaïsmes qui remettent en question les modèles modernes.
Étude de cas : La langue de la guerre civile américaine
L'une des applications les plus riches est l'étude de la rhétorique de la guerre civile. En analysant le Globe de la Congression (le précurseur du Congressional Record moderne) aux côtés de milliers d'éditorials de journaux, les chercheurs ont suivi comment le terme «Union» est passé d'un concept légaliste à un idéal presque sacré pendant la guerre. La modélisation thématique des discours du Congrès confédéré montre que les références aux «states» ont fortement diminué après 1863, tandis que le langage sur «l'indépendance» et «le sacrifice» a augmenté – un modèle compatible avec la prise de main serrée de la nécessité militaire.
Étude de cas : Débats parlementaires britanniques
La numérisation de Hansard[ (le dossier officiel des débats parlementaires britanniques) a ouvert un vaste corpus pour CL. Des études ont examiné comment le vocabulaire des réformes – des mots comme « devoir », « philanthropie », « amélioration » – a évolué au cours du XIXe siècle. L'analyse du sentiment des discours sur les Factory Acts révèle que les députés whig et libéraux ont utilisé un langage émotionnel de plus en plus positif au cours du siècle, tandis que l'opposition conservatrice est passée de l'indignation morale aux objections pratiques.
Étude de cas: Littérature abolitionniste et anti-abolitionniste
Les méthodes informatiques ont éclairé les débats transatlantiques sur l'esclavage. Les modèles thématiques appliqués aux brochures abolitionnistes britanniques et américaines (1830-1865) mettent en évidence l'émergence d'un vocabulaire distinct de l'« économie morale » – « péché », « repentance », « victimisation du sang » – qui différait fortement de la langue utilitaire (« productivité », « travail libre ») utilisée par les anti-abolitionnistes.L'analyse de la collocation de l'« émancipation » dans les sources britanniques et américaines montre que les textes britanniques l'ont conçue comme une politique impériale, tandis que les textes américains l'ont largement liée aux craintes raciales et aux élections.
Suivi de l'évolution du vocabulaire politique
Une question permanente pour les historiens politiques est de savoir comment les concepts clés changent au fil du temps. Par exemple, l'analyse de fréquence et les modèles de mots ont permis de retracer des changements de mots comme « libéral », « conservateur », « socialisme » et « démocratie ». Par exemple, « libéral » dans la presse britannique de 1820 a fait référence principalement à l'ouverture du commerce; dans les années 1880, il s'agissait d'un label de parti chargé de connotations d'intervention de l'État.Ces changements sémantiques révèlent les réalignements idéologiques sous-jacents du siècle.
Étude de cas : La Révolution française de 1848 et l'élévation du socialisme
Au-delà du monde anglophone, CL a été utilisé pour étudier la presse politique française pendant la Seconde République. Des modèles thématiques appliqués aux journaux de 1848 à 1851 révèlent l'émergence rapide d'un vocabulaire socialiste distinct centré sur « l'atelier », « l'association » et « le droit au travail ». L'analyse du sentiment montre que le langage du conservateur Le Journal des Débats est devenu de plus en plus alarmiste après le soulèvement de juin Days, en utilisant des expressions comme « Danger rouge » (danger rouge) avec une fréquence croissante.
Avantages pour les historiens et les éducateurs
Échelle et objectivité
CL permet aux historiens de tester des revendications sur des modèles généraux – par exemple, que le nationalisme s'est intensifié après 1870 – contre des archives entières plutôt qu'un échantillon curé. La sortie quantitative permet de vérifier les biais de confirmation et oblige les chercheurs à tenir compte de la contre-preuve.Pour les éducateurs, les visualisations interactives des tendances sentimentales ou de la prévalence des sujets peuvent rendre tangibles les forces historiques abstraites dans la classe.
Découverte des motifs silencieux
Les algorithmes peuvent trouver des modèles que les lecteurs humains ignorent. Une analyse stylométrique de Harper , hebdomadaire éditoriales pourrait révéler qu'un changement de voix éditoriale s'est produit des mois avant une déclaration formelle d'allégeance du parti – en se tenant derrière les « manœuvres factionnelles ». Les modèles thématiques appliqués aux pétitions au Parlement britannique ont révélé des grappes de demandes de droits des femmes qui ont été largement ignorées dans les débats contemporains.
Intégration aux archives numériques
Les bibliothèques et les archives continuent de numériser les collections du XIXe siècle, et les outils CL deviennent des passerelles vers ces collections. Des projets comme European Parliamentary Debate Corpus et Chronicling America sont déjà des corpus de presse prêts à être créés. Les chercheurs peuvent combiner les extrants CL avec les systèmes d'information géographique (SIG) pour cartographier la diffusion du langage politique dans les régions.
Défis et limites
Langue archaïque et variantes orthographiques
Les mots comme «chuse» (choisir), «shew» (montrer) et «capitalisation incohérente» peuvent confondre les tangeurs modernes de la partie de la parole et les lexiques sentimentaux. Les chercheurs doivent souvent former des modèles personnalisés sur des ensembles de données historiques ou utiliser des outils de normalisation orthographique. Même alors, le sens peut être insaisissable : «gay» dans les années 1800, un méritoire, non la sexualité, et «adroit» pourrait signifier une émerveillement plutôt que terrible.
Erreurs de ROC dans les textes numérisés
Une erreur courante – qui se transforme en « long s » en « f » – peut fausser le comptage des fréquences.Les pipelines de correction post-traitement et la validation manuelle sont essentiels pour des résultats fiables, ajoutant du temps et des coûts aux projets. Pour les grands projets, les chercheurs utilisent souvent des outils comme Tesseratt[ avec des modèles affinés sur des polices historiques.Les plateformes de sourcing de foule comme Zooniverse ont également contribué à corriger les erreurs de ROC dans des collections importantes comme British Library .
Contexte et ironie
Les modèles computationnels luttent avec le sarcasme, l'ironie et la citation indirecte – tous communs dans la rhétorique politique. Un article satirique qui se moque du langage expansionniste peut être mal classé comme réellement expansionniste par un algorithme sentimental. De même, les modèles thématiques traitent tous les mots comme tout aussi informatif, mais un lecteur contemporain sait que « la cause glorieuse » signifie différentes choses dans une adresse Union que dans une autre Confederate.
Diagnostics de données et formation de canons
Les collections numérisées ne sont pas neutres. Les grandes archives reflètent souvent les biais des institutions qui les ont créées : les journaux métropolitains à grande circulation sont surreprésentés, tandis que les journaux radicaux de petites villes sont rares.Les études CL qui se basent uniquement sur Hansard ou le New York Times[ risquent de renforcer une vision de l'histoire centrée sur l'élite.Les chercheurs doivent rechercher activement des voix marginalisées – publications de classe ouvrière, d'immigrants, d'autochtones et de femmes – et les intégrer dans leur corpus.
Orientations futures
Modèles linguistiques historiques
Les percées récentes dans le domaine de l'apprentissage profond, comme les modèles basés sur les transformateurs (BERT, GPT), sont adaptées aux textes historiques. Finement adaptés aux corpus du XIXe siècle, ces modèles peuvent gérer l'orthographe irrégulière, saisir les dépendances à longue distance, et même générer des textes synthétiques qui imitent les styles historiques. Ils promettent une analyse plus précise des RNE et des sentiments, bien qu'ils nécessitent des ressources informatiques substantielles et une validation soigneuse des faits connus. Le modèle MacBERTh, formé sur un corpus de textes historiques néerlandais, montre comment ces outils peuvent être adaptés à des langues et des périodes précises.
Analyse multilingue et transnationale
Les futurs outils de CL qui peuvent gérer les comparaisons entre codes, traductions et cross-lingual permettront aux historiens d'étudier, par exemple, comment le concept de « liberté » a voyagé entre des textes français, allemands, anglais et espagnols. Des projets comme ]Linguistique Linked Open Data commencent à créer des corpus translingues qui permettent de telles comparaisons. Une étude de brochures révolutionnaires de 1848 à travers l'Allemagne, la France et l'Italie pourrait révéler si des métaphores similaires de « tempête » et de « réveil » apparaissent dans les trois langues, indiquant un répertoire idéologique partagé.
Collaboration interdisciplinaire
Les travaux les plus fructueux se produisent lorsque les linguistes, historiens et bibliothécaires de la conception de projet et de la publication collaborent. L'expertise combinée permet de s'assurer que les questions de recherche sont historiquement fondées, que les algorithmes sont appropriés et que les priorités de numérisation sont éclairées par des besoins scientifiques. Des initiatives comme le Centres de Numériques des humanités[ dans les grandes universités favorisent ce genre de travail d'équipe, créant des pipelines réutilisables pour la recherche future. Par exemple, le Lab littéraire de Stanford publie régulièrement des études qui combinent des méthodes de calcul et des connaissances historiques profondes, établissant une norme pour le domaine.
Histoire publique et science citoyenne
Les outils CL peuvent également engager le public. Des plateformes en ligne permettent aux bénévoles de corriger les erreurs de RC, de marquer des entités ou de classer les sentiments dans des documents historiques – contribuant à la recherche tout en apprenant le passé.Ces projets de crowdsourcing ont déjà amélioré la qualité des corps utilisés dans les études historiques évaluées par des pairs.Le projet Transcribe Bentham, qui invite les bénévoles à transcrire les manuscrits du philosophe Jeremy Bentham, a produit un vaste ensemble de données de haute qualité qui est actuellement analysé avec CL. Des projets similaires pour des pétitions politiques du XIXe siècle ou des lettres aux éditeurs pourraient transformer une archive massive en ressource communautaire.
Analyse multimodale
Les journaux comprenaient des illustrations sur bois, des cartes et des photographies ultérieures. L'analyse optique des images sera intégrée à l'analyse textuelle, reconnaissant que les messages politiques étaient portés visuellement et verbalement. Par exemple, une étude pourrait comparer la fréquence des images de symboles de « liberté » (capsules, statues) dans les journaux radicaux et conservateurs et le corréler avec le sentiment d'accompagnement du texte.
Conclusion
La linguistique computationnelle offre aux historiens du XIXe siècle un ensemble d'outils puissants pour compléter les méthodes d'analyse traditionnelles. En mesurant le sentiment, en découvrant des thèmes latents et en traçant l'évolution du vocabulaire politique dans de vastes archives, les chercheurs peuvent répondre à des questions classiques et à des questions entièrement nouvelles. L'approche n'est pas sans pièges – langage archaïque, erreurs de l'OCR et nuance contextuelle – mais son potentiel de révéler des motifs invisibles à l'œil nu en fait une composante essentielle de la boîte à outils de l'historien moderne.
Pour plus de détails, voir Stanford University.]Groupe de traitement des langues naturelles[ pour des aperçus techniques, JSTOR article =Modèle topique du dix-huitième-century britannique=] pour une discussion méthodologique, Bibliothèque britannique==19e-century Journaux collection]][FLT:][F=F=F=F=F=F=F
- Analyser les discours politiques pour les stratégies rhétoriques en utilisant la collocation et le sentiment.
- Suivi de l'évolution du vocabulaire politique par la fréquence des mots clés au cours des décennies.
- Comprendre les attitudes de la société au moyen de modèles thématiques de pétitions, de brochures et d'éditorials.
- Attribuer des textes anonymes avec stylométrie pour résoudre les litiges d'auteur.
- Cartographie de la diffusion géographique du langage politique en combinant le RNE et le SIG.