Des encres aux algorithmes : comment l'analyse du texte calculationnel éclaire la propagation de l'alphabétisation

L'histoire de l'alphabétisation n'est pas simplement une histoire d'un plus grand nombre de personnes apprenant à lire et à écrire. C'est un processus complexe et inégalé façonné par l'économie, la religion, la politique et la technologie. Pendant des siècles, les historiens ont compté sur des proxies – des registres scolaires, des inventaires de propriété de livres et des comptes anecdotiques – pour estimer quand et où l'alphabétisation s'est tenue.Ces méthodes ont produit des vues précieuses mais fragmentées.

Cet article explique comment l'analyse de texte computationnelle fonctionne, pourquoi elle compte pour comprendre l'histoire de l'alphabétisation, et ce que ses conclusions révèlent sur le mouvement des compétences de lecture et d'écriture dans le temps et l'espace.

Qu'est-ce que l'analyse de texte computationnelle?

L'analyse de texte computationnelle (ACT) fait référence à une série de techniques qui utilisent des algorithmes pour traiter, quantifier et interpréter de grandes collections de textes écrits. Contrairement à la lecture étroite, qui se concentre sur un seul document ou un petit corpus, le CTA fonctionne à l'échelle, en identifiant les modèles statistiques sur des milliers ou des millions d'ouvrages.

  • Analyse de fréquence[ – compter la fréquence des mots ou des phrases qui apparaissent au fil du temps pour suivre les changements thématiques.
  • Modèle topique – une technique d'apprentissage automatique qui regroupe les mots en grappes (sujets) basées sur des motifs de co-occurrence, révélant des thèmes latents dans un corpus.
  • Analyse des sentiments – mesure du ton émotionnel des textes pour évaluer l'humeur publique ou la position de l'autorité.
  • Analyse métrique stylée – comparant les notes de lisibilité, la longueur des phrases et la richesse du vocabulaire comme des proxies pour la sophistication de l'auditoire.
  • Reconnaissance de l'entité nommée et de la géoparsing – Extraire des lieux, des personnes et des organisations pour cartographier les modèles spatiaux du discours.

Ces méthodes dépendent de textes numérisés.Au cours des deux dernières décennies, des bibliothèques numériques massives – comme Google Books, la HathiTrust Digital Library et la British Newspaper Archive – ont mis des centaines de milliards de mots à la disposition des chercheurs.

Pourquoi l'alphabétisation laisse un trace numérique

L'alphabétisation n'est pas seulement une compétence, c'est une pratique sociale ancrée dans la production de textes. À mesure que les gens deviennent alphabétisés, le volume de l'écriture augmente, ses changements de langue et ses publics se diversifient. L'analyse computationnelle capture ces transformations d'au moins trois façons :

Premièrement, l'expansion du vocabulaire. Les populations nouvellement alphabétisées adoptent souvent des structures grammaticales simplifiées et un vocabulaire plus concret avant de se diriger vers l'abstraction.En suivant la fréquence des mots fonctionnels (articles, prépositions) par rapport aux mots de contenu (noms, verbes), les chercheurs peuvent déduire des changements dans le genre et le public.

Deuxièmement, la prolifération des genres. À mesure que l'alphabétisation se répand, de nouveaux types de textes émergent : almanacs, brochures, lettres personnelles, journaux, et éventuellement journaux et romans.

Troisièmement, diffusion géographique. À l'aide de métadonnées sur le lieu de publication ou l'auteur, les chercheurs peuvent cartographier la façon dont les innovations lexicales – comme les nouveaux mots ou les conventions d'orthographe – se déplacent le long des routes commerciales, des lignes de chemin de fer ou des réseaux postaux.

Les premières applications : l'élévation des langues vernaculaires

De la langue latine au peuple

Au Moyen Age, la production littéraire était dominée par le latin, accessible uniquement aux ecclésiastiques et à une élite mince.Au XVIe siècle, l'impression permettait la production en masse de livres en allemand, français, anglais et italien.Les analyses informatiques du corpus Early English Books Online montrent que la proportion de publications en anglais est passée de moins de 10 % en 1500 à plus de 80 % en 1700. Ce changement n'était pas uniforme; il s'est produit plus tôt dans les régions protestantes où les Bibles vernaculaires étaient encouragées, et plus tard dans les régions catholiques où le latin conservait l'autorité liturgique.

Mesure de la lisibilité comme un proxy d'alphabétisation

Les chercheurs ont également utilisé des formules de lisibilité – élaborées pour l'éducation moderne – sur des textes historiques. La note Flesch Reading Ease, appliquée aux brochures britanniques du XVIIIe siècle, révèle une diminution constante de la complexité, car les imprimantes ciblent les lecteurs moins qualifiés. Les textes destinés aux lecteurs communs - ont utilisé des phrases plus courtes, moins de syllabes par mot et des références plus concrètes.

Études de cas en lecture et écritures numériques Histoire

1. L'Europe du dix-neuvième siècle : le boom de l'alphabétisation urbaine

L'article original mentionne cette étude de cas. Let-s l'amplifie avec des détails informatiques. En utilisant la base de données Chronicling America (Bibliothèque du Congrès), les historiens ont examiné l'explosion des journaux locaux à travers les États-Unis et l'Europe. En Prusse, par exemple, les journaux par habitant ont doublé entre 1820 et 1860. La modélisation thématique de ces journaux révèle un passage du contenu religieux et agricole aux nouvelles et publicités politiques – un changement qui présuppose une lecture publique avec une alphabétisation fondamentale et un intérêt civique.

L'analyse des lettres adressées à l'éditeur dans les journaux provinciaux français de 1830 à 1870 révèle une corrélation entre les taux d'alphabétisation et la fréquence des arguments politiques complexes.Dans les régions où l'on s'inscrit à l'école supérieure, les lettres utilisent une humeur plus subjonctive et des noms abstraits, ce qui laisse entendre que l'alphabétisation permet aux lecteurs de s'engager dans des concepts abstraits comme la démocratie et les droits.

2. La Révolution de l'impression

La première campagne d'alphabétisation de masse dans le monde anglophone a eu lieu en Angleterre au cours des XVIe et XVIIe siècles, sous l'impulsion de la Réforme protestante, qui met l'accent sur la lecture de la Bible.L'analyse numérique du catalogue (ESTC) montre qu'entre 1550 et 1640, le nombre de titres publiés par décennie a augmenté d'un facteur de dix.

Une étude a utilisé la modélisation de sujets sur 20 000 brochures anglaises de 1600 à 1700. Le modèle a révélé un groupe distinct de sujets Instructionnels contenant des mots comme -read, -spell, -catéchisme, et -child. - La proportion de textes dans ce sujet a atteint un sommet pendant les années 1640 et 1650, une période de bouleversement révolutionnaire lorsque le Parlement a promu l'alphabétisation parmi les soldats et les gens du commun.

3. Contextes coloniaux et postcolonial

Des chercheurs de l'Université d'Helsinki ont utilisé l'analyse n-gram sur les journaux indiens du XIXe siècle en anglais et en langues régionales. Ils ont constaté que l'utilisation de mots anglais dans les journaux vernaculaires augmentait rapidement après 1857, ce qui indique qu'une classe de littératie bilingue se faisait jour. L'analyse du sentiment des éditoriaux dans les journaux bengali de 1860 à 1900 montre un changement de langage déférent vers une rhétorique nationaliste affirmée, ce qui aurait nécessité un lecteur à l'aise avec des arguments politiques complexes – preuve d'une alphabétisation plus profonde parmi la classe moyenne indienne.

En Afrique subsaharienne, les textes produits par les missionnaires constituent le premier matériel écrit en de nombreuses langues. La stylométrie computationnelle (comparant les styles d'auteur) suggère que les premières traductions de la Bible en Yoruba et Xhosa simplifient les structures grammaticales natives pour correspondre au niveau de lecture des convertis nouvellement alphabétisés.

Innovations méthodologiques : comment les chercheurs extraient des signaux

Analyse N-Gram

Pour les études d'alphabétisation, les n-grams révèlent l'adoption de nouveaux mots – tels que -telegraph ou -newspaper , qui indiquent l'expansion des réseaux d'information. Une étude des n-grams anglais britanniques de 1700-1900 a révélé que la phrase -l'augmentation de la fréquence de 400% entre 1750 et 1850, tandis que l'expression -l'augmentation de l'écriture après 1830, suggérant que les compétences d'écriture se répandent plus tard que les compétences de lecture.

Modélisation du sujet dans le temps

La modélisation des sujets, utilisant des algorithmes comme Latent Dirichlet Allocation (LDA), regroupe le vocabulaire en sujets que les humains peuvent interpréter. Appliquée au corpus Eighteenth Century Collections Online[ (ECCO) (Eighteenth Century Collections Online (ECCO)), la modélisation des sujets a permis de déterminer une transition claire des volumes dominés par des sujets religieux et classiques vers ceux dominés par la science, le commerce et la fiction après 1760.

Stylométrie de lecture

Au-delà du contenu, les outils informatiques mesurent la lisibilité des textes. L'index Coleman-Liau, conçu à l'origine pour l'anglais moderne, peut être adapté aux textes historiques en adaptant pour les changements d'orthographe. Appliqué à un corpus de 10 000 romans américains de 1770–1920, les notes de lisibilité ont chuté de façon significative après 1840, lorsque le mouvement scolaire commun a commencé.

Avantages de l'analyse computationnelle pour l'histoire de l'alphabétisation

  • Échelle: CTA peut traiter des millions de textes en heures, impossible pour un seul érudit.
  • Objectivité: Les mesures quantitatives réduisent le risque de mise en évidence de cerises pour appuyer une narration préexistante.
  • Comparabilité : Les mêmes méthodes peuvent être appliquées à différentes langues, régions et périodes, permettant une analyse interculturelle.
  • Visualisation : Les graphiques et les cartes rendent les tendances visibles instantanément, ce qui facilite la recherche et la communication publique.
  • Génération de l'hypothèse: Des modèles inattendus dans les données peuvent amener les chercheurs à poser de nouvelles questions sur la causalité.

Par exemple, un modèle thématique de journaux germanophones de 1848-1850 révélait de façon inattendue une forte baisse de la diversité du vocabulaire dans les publications conservatrices, tandis que les publications libérales accroissaient les leurs. Cela a laissé entendre que la censure supprimait l'expression parmi les écrivains conservateurs, mais que les conservateurs étaient au pouvoir, cela semblait paradoxal.

Défis et limites

Diminution de la numérisation

Les archives européennes ont priorisé les archives gouvernementales et la littérature canonique sur les éphemères comme les cartes de commerce ou les lettres personnelles. Par conséquent, les analyses computationnelles peuvent surreprésenter les perspectives masculines élites. Les bibliothèques du Sud mondial sont souvent sous-numériques, en train de fausser notre image de l'alphabétisation.

Qualité de l'OCR

Les erreurs peuvent être aussi élevées que 30% pour les textes modernes. Si le chercheur ne nettoie pas les données, les nombres de fréquences deviennent peu fiables. Des outils comme OCR-D[ améliorent la précision mais nécessitent une expertise.

Complexité linguistique

Les langues avec morphologie complexe (finnois, arabe, quechua) présentent des défis pour la tokenisation. Aussi, l'orthographe historique n'était pas normalisée; -read , peut apparaître comme -rede, -reade, ou -reed. - Les chercheurs doivent soit moderniser l'orthographe ou utiliser des modèles de niveau de caractère qui sont plus calculalement coûteux.

Précautions interprétatives

La corrélation n'est pas une cause. Une montée en puissance des mots -liberté - en 1790 les journaux américains peuvent refléter la croissance de l'alphabétisation – ou simplement la Révolution française comme sujet. Les découvertes computationnelles doivent être fondées sur un contexte historique et triangulées avec des sources d'archives. Ce n'est pas un remplacement de la bourse traditionnelle mais un complément.

Obstacles à la compétence

L'analyse de texte computationnelle nécessite des compétences en programmation (Python, R) et une connaissance des statistiques.De nombreux départements d'histoire manquent encore de formation dans ces domaines, bien que les centres d'humanités numériques soient en croissance.

Questions éthiques et épistémologiques

Comme pour toute méthode numérique, le CTA soulève des questions sur ce qui compte comme preuve. Les fréquences de mots mesurent-elles vraiment l'alphabétisation, ou simplement les intérêts des éditeurs? Un modèle thématique révèle-t-il l'intention de l'auteur ou seulement les contraintes du genre? Le domaine débat toujours de ces questions.

Les modèles thématiques sont formés sur tous les textes disponibles; si un corpus est de 90% d'auteurs masculins, les sujets refléteront les préoccupations masculines.Les chercheurs doivent activement chercher à inclure l'écriture des femmes, la littérature coloniale et d'autres voix marginalisées. Des projets comme ]Le projet d'histoire d'impression des femmes construisent des corpus plus inclusifs à cette fin.

Orientations futures

Analyse multilingue et transcrite

La plupart des travaux du CTA ont porté sur l'anglais. Mais la diffusion de l'alphabétisation était souvent multilingue, les gens lisaient dans deux langues ou plus. De nouveaux modèles comme le BERT multilingue permettent aux chercheurs d'analyser simultanément des textes en plusieurs langues, révélant comment les idées et les mots se déplacent au-delà des frontières linguistiques.

Petites données et infrastructures

Toutes les recherches ne nécessitent pas des millions de textes. ----------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------

Apprentissage automatique et reconnaissance manuscrite du texte

Jusqu'à récemment, l'analyse du texte computationnel se limitait aux textes imprimés.Mais (HTR) s'améliore rapidement, permettant aux chercheurs d'analyser les journaux, les lettres personnelles et les documents administratifs – les documents mêmes qui étaient souvent les premières preuves de l'alphabétisation pour les gens ordinaires.

Conclusion

En transformant des milliards de mots en modèles quantifiables, il permet aux historiens de voir la lente et inégale diffusion de l'alphabétisation telle qu'elle se produit, non pas comme une courbe lisse, mais comme une série de montées, de plateaux et d'inversions façonnés par la guerre, la religion, le commerce et la politique. La méthode a montré que la vernacularisation a précédé l'alphabétisation dans de nombreux contextes, que la lisibilité a diminué à mesure que l'alphabétisation s'est développée, et que les réseaux d'impression étaient essentiels à la diffusion des compétences en lecture.

Mais les leçons les plus importantes peuvent être sur les limites de la preuve. L'analyse de texte computationnel révèle en grande partie la littératie de ceux qui pourraient se permettre d'imprimer et de stocker des textes. Les vraiment marginaux – ceux qui n'ont pas laissé de trace écrite – restent cachés. Mais en combinant ces nouveaux outils avec les travaux d'archives traditionnels, les chercheurs peuvent écouter plus attentivement les voix qui ont survécu et poser de meilleures questions sur la littératie du passé.

Comme plus de textes sont numérisés et que les algorithmes deviennent plus sophistiqués, notre compréhension de la façon dont la lecture et l'écriture se répandront ne fera qu'approfondir. Pour l'instant, le champ est à un seuil prometteur, où l'ancienne et la nouvelle – l'encre et l'algorithme – travaillent ensemble pour éclairer l'un des développements les plus conséquents de l'histoire humaine.