Table of Contents
Introduction : Le changement numérique dans les études littéraires historiques
L'étude de la littérature historique repose depuis longtemps sur une lecture étroite, une expertise philologique et un travail d'archivage minutieux.Au cours de la dernière décennie, cependant, une révolution tranquille s'est déroulée.Les chercheurs se tournent de plus en plus vers des méthodes informatiques – algorithmes, extraction de données et apprentissage automatique – pour analyser de grands corpus de texte qui seraient impossibles à un seul érudit de lire dans une vie.
En traitant des millions de mots comme des données structurées, les approches computationnelles révèlent des thèmes récurrents, des empreintes stylistiques et des connexions cachées dans l'enregistrement littéraire. Ces méthodes, qui attribuent des brochures anonymes à la cartographie de la propagation des idées des Lumières, complètent de façon puissante les bourses traditionnelles.
Cet article explore les techniques de base, les applications, les avantages, les limites et les orientations futures de l'analyse computationnelle dans la littérature historique, en s'appuyant sur des exemples concrets et des recherches récentes.
Quelles sont les méthodes de calcul dans les humanités?
Dans les études littéraires historiques, ces méthodes relèvent généralement de les humanités numériques (DH) ou l'analyse culturelle[. L'idée principale est de convertir des textes analogiques – livres, lettres, journaux, manuscrits – en formats lisibles par machine et ensuite d'appliquer des algorithmes pour détecter des modèles qui pourraient échapper à l'œil humain.
Les principales techniques sont les suivantes :
- Traitement du texte – Extraction de termes, de collocations et de n-grammes fréquents pour identifier les grappes thématiques.
- Stylométrie – mesure des caractéristiques stylistiques (longueurs de mots, structures de phrases, fréquences de mots fonctionnels) pour l'attribution de la paternité ou la classification de genre.
- Analyse des sentiments – Attribuer des notes émotionnelles aux passages ou aux documents pour suivre les changements d'humeur au fil du temps.
- Modélisation topique – utilisant des modèles probabilistes (p. ex., attribution de dirichlet latent) pour découvrir des thèmes latents dans un corpus.
- Analyse réseau – cartographie des relations entre personnages, correspondants ou éditeurs pour révéler les structures sociales et intellectuelles.
- Systèmes d'information géographique (SIG) – tracé des emplacements mentionnés dans les textes pour visualiser les récits spatiaux.
Chacune de ces méthodes nécessite un réglage spécifique au domaine : un modèle sentimental basé sur des données Twitter modernes va mal lire la satire du XVIIIe siècle. Par conséquent, les historiens computationnels doivent collaborer étroitement avec les ingénieurs logiciels et les linguistes pour s'assurer que les algorithmes respectent les particularités linguistiques et culturelles des sources historiques.
Principales applications de la littérature historique
Extraction de texte pour découverte thématique
Une des applications les plus simples est de scanner des corps massifs pour les fréquences et les motifs de mots. Par exemple, les chercheurs ont analysé l'ensemble du corpus de poésie anglaise de 1700 à 1900 pour suivre la montée et la chute de mots comme -melancholy, - -sublime, ou -industrial.- Ces analyses peuvent révéler comment les mouvements littéraires – romantisme, réalisme, modernisme – laissent des traces mesurables dans le vocabulaire et le style.
Un projet historique, .L'exploitation minière de textes à l'Université de Richmond, a utilisé plus de 100 000 articles de l'ère de la guerre civile Richmond Daily Dispatch. L'équipe a identifié comment la couverture de l'esclavage, la sécession et les engagements militaires ont changé au cours de la guerre.
Ressource externe:[ Le projet Mining the Dispatch montre comment l'extraction de texte éclaire le discours historique.
Attribution d'auteurs et oeuvres contestées
La sylométrie est devenue un outil de confiance pour résoudre les énigmes de l'auteur. L'exemple le plus célèbre est l'analyse des Federalist Papers: les historiens ont utilisé une étude statistique des mots fonctionnels (prépositions, articles, pronoms) pour déterminer lequel des douze essais contestés ont été écrits par Alexander Hamilton et qui par James Madison.
Dans les études littéraires, des méthodes similaires ont été appliquées à Shakespeares apocrypha, au manuscrit anonyme Sir Thomas More et aux œuvres attribuées à Jane Austen. En comparant la longueur des phrases, la fréquence des mots et les modèles de rythme, les ordinateurs peuvent souvent détecter des différences invisibles à même les lecteurs experts.
Les progrès récents dans l'attribution de la paternité [stylométrique[ utilisent les réseaux neuraux pour considérer le contexte, par exemple la probabilité qu'un mot donné apparaisse après une séquence de mots antérieurs.
Analyse des sentiments dans les siècles
Appliquée à la littérature historique, elle peut suivre les humeurs collectives. Une étude de plus de 200 000 romans britanniques des XVIIIe et XIXe siècles a révélé que les scores de sentiment moyen des romans corrélés avec la confiance économique et la stabilité politique. Par exemple, les romans publiés dans des années de prix élevés des céréales ou de bouleversements politiques tendaient à être plus sombres.
Cependant, l'analyse du sentiment historique fait face à des défis uniques. Les mots changent de sens (par exemple, -gaï, signifie joyeux dans les années 1800; -nice, signifie stupide en anglais moyen). L'argot, l'ironie et le sarcasme sont notoirement difficiles à analyser.
Analyse des réseaux de cercles intellectuels et sociaux
L'analyse des réseaux permet de visualiser comment les figures, les institutions et les idées historiques étaient reliées. En extrayant des noms de lettres, de dédicaces et de mentions, les chercheurs peuvent reconstruire les réseaux de correspondance, les systèmes de parrainage et les chaînes de citation.
Par exemple, le projet Mapping the Republic of Letters à Stanford a tracé la correspondance de penseurs d'illumination tels que Voltaire, Benjamin Franklin et John Locke. Les graphiques qui en résultent montrent des hubs comme Paris et Londres et révèlent comment les nouvelles et les idées voyageaient le long des itinéraires commerciaux.
Resource externe:[ Explorez Appartissage de la République de Lettres pour des visualisations interactives.
Modélisation thématique pour l'évolution thématique
La modélisation thématique identifie des grappes de mots qui se produisent fréquemment ensemble, les qualifiant de -topiques. - Appliquée à un corpus diachronique, elle peut montrer comment les thèmes se cirent et s'évanouissent. Un modèle thématique de périodiques victoriens, par exemple, pourrait produire des sujets comme -religion et morale, - expansion impériale, -- vie domestique, --science et progrès.
Le projet -----------]----]-[FLT:]-]----]-[FLT:]-][FLT:]-----[FLT:]-]-[FLT:]-[FLT:]-[FLT:]-]-[FLT:]-[FLT:]-]-[FLT:]-[FLT:]-]-[FLT:]-[FLT:]-[FLT:]-[FLT:]-[F]-F]-F][
Avantages de l'analyse computationnelle
L'adoption de méthodes de calcul offre plusieurs avantages distincts pour la bourse littéraire historique.
Écailabilité et vitesse
Un seul chercheur peut lire peut-être quelques centaines de romans dans une carrière. Un ordinateur peut traiter l'ensemble de la production de l'édition anglaise du XIXe siècle (en dizaines de milliers de volumes) en jours. Cette magnitude permet aux chercheurs de tester des hypothèses sur des corps entiers plutôt que des exemples de cerises, réduisant ainsi les biais de sélection.
Détection des patrons subtils
De nombreuses tendances historiques importantes sont trop diffuses pour être remarquées par un lecteur humain. Par exemple, une augmentation progressive de la longueur moyenne des phrases au cours du XIXe siècle pourrait refléter des styles de prose changeants. Seule une méthode de calcul peut quantifier ces tendances de façon fiable.
Reproductibilité et transparence
Les méthodes informatiques, par contre, peuvent être documentées comme algorithmes et pipelines. D'autres chercheurs peuvent vérifier les données, exécuter le code et obtenir les mêmes résultats – ou contester les hypothèses. Cette rigueur s'aligne sur l'éthique scientifique et renforce la crédibilité des revendications des humanités numériques.
Collaboration interdisciplinaire
Les projets de calcul réunissent généralement des historiens, des chercheurs littéraires, des informaticiens, des statisticiens et des bibliothécaires. Cette pollinisation croisée génère de nouvelles questions et méthodes de recherche. Les historiens apprennent à penser en termes de structures de données et de validation; les informaticiens confrontent le désordre des sources historiques du monde réel et le besoin de sensibilité culturelle.
Défis et limites
Malgré leur promesse, les méthodes de calcul ne sont pas une panacée. Elles viennent avec des obstacles importants qui doivent être reconnus.
Expertise technique et infrastructure
Chaque historien n'a pas les compétences nécessaires pour écrire des scripts Python, créer des bases de données ou former des réseaux neuraux. Les institutions manquent souvent de ressources informatiques ou de personnel de soutien. De nombreux chercheurs qui souhaitent utiliser des méthodes de calcul doivent apprendre eux-mêmes, ce qui peut être intimidant.
Qualité des données et erreurs de ROC
Les textes historiques numérisés sont rarement parfaits. La reconnaissance optique des caractères (OCR) appliquée aux anciennes typographies, pages endommagées ou petites polices produit des erreurs. Un mot comme -long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-long-
Simplification excessive du contexte historique
Les algorithmes réduisent les phénomènes culturels complexes à des nombres. Attribuer un score sentimental de +0,8 à un paragraphe de Jonathan Swift , satire manque l'ironie, l'intention de l'auteur et le lecteur , la réception historique. Un modèle thématique pourrait assembler , Race , et , ,slavery , d'une manière qui masque les débats nuancés du mouvement de colonisation.
Bias algorithmiques et sur-ajustement
Par exemple, un modèle stylométrique formé principalement aux auteurs masculins pourrait fausser la classification des textes d'auteurs féminins. L'utilisation excessive – lorsqu'un modèle apprend des modèles spécifiques aux données de formation plutôt qu'à des caractéristiques généralisables – peut aussi conduire à des résultats fallacieux. L'examen par les pairs des documents de calcul dans l'histoire doit inclure un examen à la fois des algorithmes et du raisonnement historique.
Résistance disciplinaire
Certains historiens et chercheurs littéraires traditionnels restent sceptiques quant aux approches informatiques, les considérant comme réductrices ou comme une menace pour l'expertise en interprétation.Combler cette lacune exige une communication claire : les outils informatiques ne sont pas destinés à remplacer la lecture rapprochée mais à la compléter.
Orientations futures
À mesure que la technologie évoluera, le rôle du calcul dans les études littéraires historiques s'approfondira et se diversifiera.
Modèles de langages de grande taille (LLM) et architectures de transformateurs
Les modèles comme GPT-4, BERT et leurs descendants peuvent être affinés sur des textes historiques. Ils peuvent accomplir des tâches telles que la reconnaissance d'entités nommées, l'extraction de relations, et même la génération de passages fac-similés. Pour les historiens, les LLM offrent la capacité de rechercher -Le concept de... expliqué dans le contexte de la Réforme et obtenir des résultats contextuels plutôt que des correspondances de mots-clés.
Cependant, les LLM sont sujettes à des anachronismes d'hallucination, ils peuvent inventer des faits ou mélanger des siècles. Ils doivent être utilisés avec prudence et toujours vérifiés par rapport aux sources primaires.
Analyse multimodale
La littérature historique n'est pas seulement un texte : elle comprend des illustrations, des marginalités, des liens et des publicités d'éditeurs. Les futures approches informatiques intégreront l'analyse d'images (p. ex., détection d'emblèmes, de pages mises en page ou d'illustrations) avec le texte.
Données liées et dépôts persistants
Le passage à principes de données FAIR[ (Retrouvable, accessible, interopérable, réutilisable) signifie que des corps plus historiques seront disponibles comme ensembles de données structurés et annotés. Des projets comme Initiative d'encodage de texte (TEI)[ et Archives de texte d'Oxford fournissent des normes pour marquer les textes littéraires, les rendant actionnables par machine.
Plateformes interactives pour les bourses d'études publiques
Des outils comme Voyant Tools ou Palladio[ permettent aux étudiants et aux passionnés d'explorer des textes historiques sans codage. On peut voir d'autres éditions numériques qui offrent des visualisations dynamiques à côté du texte original, permettant aux lecteurs de voir des nuages de mots, des réseaux de caractères ou des graphiques sentimentaux.
Conclusion: Relier le Quantitative et le Qualitative
L'utilisation de méthodes de calcul pour analyser la littérature historique ne signifie pas la fin de la bourse traditionnelle. Au contraire, elle offre une expansion puissante de la boîte à outils des historiens. En embrassant des algorithmes tout en restant critiques de leurs limites, les chercheurs peuvent découvrir des modèles qui ont été cachés pendant des siècles, tester des hypothèses de longue date, et poser des questions entièrement nouvelles.
Les projets les plus réussis sont ceux où l'analyse computationnelle est profondément influencée par le contexte historique et où les résultats sont interprétés avec la même nuance et la même rigueur qu'une lecture étroite.
Ressource externe:[ Pour un aperçu complet des méthodes et des outils, consultez la série de leçons Alliance des organisations de sciences humaines numériques et Programmation historique.