Le virage numérique dans les études médiévales

L'étude des manuscrits médiévaux dépend depuis longtemps du travail patient des paléographes, des codicologues et des savants textuels.Mais au cours des deux dernières décennies, les méthodes computationnelles ont fondamentalement changé ce qui est possible.En appliquant des algorithmes, l'apprentissage automatique et l'imagerie haute résolution au parchemin et au papier, les chercheurs peuvent maintenant analyser des corpus entiers de manuscrits de manière qui aurait été impensable même il y a une génération.

Imagerie numérique : voir l'invisible

Les technologies numériques d'imagerie peuvent permettre aux chercheurs de voir des détails invisibles à l'œil nu. Ces méthodes révèlent des effacements, des palimpsestes, des annotations, et même la composition chimique des encres et des pigments. La capacité de sonder de façon non invasive la matérialité des manuscrits a ouvert un nouveau chapitre en codicologie, l'étude du livre physique.

Imagerie multispectrale et hyperspectrale

Cette technique a été utilisée pour récupérer le texte effacé ou écrasé, comme le Palimpsest d'Archimède, où des travaux mathématiques cachés ont été révélés sous un livre de prière du XIIIe siècle. Le projet Archimèdes Palimpsest a démontré comment l'imagerie non invasive peut récupérer des traités entiers qui ont été rayés et réutilisés — des textes d'Archimède, d'Hyperides et d'autres qui avaient été perdus pendant des siècles. De même, l'Évangile de Saint-Cuthbert, le plus ancien livre européen intact, a été soumis à une analyse multispectrale pour étudier ses liaisons et pigments sans perturber le villémus fragile.

L'imagerie hyperspectrale va plus loin, enregistrant des données spectrales pour chaque pixel. Cela permet aux chercheurs de différencier les encres et les pigments qui semblent identiques sous la lumière ordinaire. Par exemple, elle peut distinguer l'encre de gall de fer et l'encre à base de carbone, aidant à identifier les ajouts ou les falsifications ultérieurs.

Fluorescence des rayons X (XRF) et cartographie élémentaire

La spectroscopie XRF révèle la composition élémentaire des encres et des pigments. En cartographieant des éléments tels que le fer, le cuivre et le plomb, les chercheurs peuvent tracer la provenance d'un manuscrit ou identifier les pratiques d'atelier. Cette technique a été utilisée pour étudier les Évangiles Lindisfarne et d'autres manuscrits enluminés, fournissant des indications sur les itinéraires commerciaux qui fournissaient des pigments.

Imagerie de transformation de la réflectance (ITR)

RTI capture les détails de surface en photographieant un objet sous différentes directions lumineuses. Ceci est inestimable pour étudier la texture physique du parchemin, de la pression scribale et des marques d'outils. Il peut également révéler des lignes de décision faibles et des impressions aveugles laissées par les instruments d'écriture. RTI a été appliqué au Domesday Book[ pour examiner les effacements et les corrections, et au Vercelli Book[ pour étudier la structure de ses rassemblements. La technique est particulièrement utile pour les manuscrits endommagés par le feu, l'eau ou le moule, où la topographie de surface peut contenir les seuls indices restants au texte original.

Analyse du texte et reconnaissance des motifs

Au-delà de l'imagerie, l'analyse de texte computationnel a ouvert de nouvelles frontières dans les études manuscrites. Les techniques comme l'extraction de texte, la stylométrie et la modélisation thématique permettent aux chercheurs d'analyser de grands corpus pour des motifs que les lecteurs humains pourraient manquer.

Reconnaissance optique des caractères pour les Scripts médiévaux

Contrairement au texte imprimé, les scripts médiévaux sont très variables, avec des ligatures, des abréviations et des lettres inconsistantes. Les modèles traditionnels de l'OCR échouent, mais les modèles neuraux basés sur le réseau – souvent appelés reconnaissance manuscrite (HTR) – ont fait de grands pas. Des outils comme Transtribus[ utilisent l'apprentissage automatique pour transcrire des manuscrits avec une précision croissante. Les chercheurs forment des modèles sur des mains scribales spécifiques, obtenant des taux d'erreur inférieurs à 5% pour de nombreux scripts. Cela permet la création d'éditions lisibles par machine de milliers de manuscrits qui existaient auparavant uniquement sous forme d'images.

Stylométrie et attribution de l'auteur

Pour les œuvres médiévales, où l'auteur est souvent incertain, cette méthode a aidé à identifier les scribes, les traducteurs, et même les mains de plusieurs collaborateurs dans un seul manuscrit. En comparant les profils stylométriques à travers un corpus, les chercheurs peuvent tracer comment un texte particulier a évolué comme il a été copié et adapté. Par exemple, l'analyse stylométrique de la Chronique de Peterborough (une version de la Chronique anglo-saxonne) a distingué entre les contributions de différents scribes, révélant des changements de dialecte et d'allégeance politique à travers les entrées. De même, les études des manuscrits de Canterbury Tales ont utilisé la stylométrie pour identifier quels scribes ont pu introduire des changements rédactionnels.

Modélisation thématique et sémantique historique

Appliquée à une collection de sermons médiévaux, par exemple, la modélisation thématique peut révéler des changements dans l'accent théologique au fil du temps, par exemple, l'attention croissante portée au purgatoire au XIIIe siècle ou l'élévation de la dévotion mariale au XIVe siècle. De même, les modèles sémantiques de distribution peuvent cartographier comment les significations des mots changent au fil des siècles, offrant des idées sur l'évolution de concepts comme la justice, la foi ou la nature. La bibliothèque universitaire de Bâle a utilisé la modélisation thématique sur sa collection de manuscrits du XVe siècle pour retracer la réception des idées humanistes au fur et à mesure qu'elles se propagent de l'Italie au nord de l'Europe.

Analyse réseau de la transmission scribale et textuelle

Les manuscrits n'ont pas été créés isolément, ils ont été copiés, empruntés et diffusés par des réseaux de monastères, d'universités et de collectionneurs privés. L'analyse des réseaux sociaux, appliquée aux colophons, aux inscriptions de propriété et aux dossiers d'emprunt, peut reconstruire ces réseaux. De telles études ont révélé comment des textes ont voyagé le long des itinéraires de pèlerinage ou comment les bibliothèques monastiques ont échangé des exemplaires. Par exemple, le projet Mapping Medieval Manuscrits[ utilise des graphiques de réseau pour visualiser la diffusion d'œuvres comme Bible moralisée[ à travers l'Europe.

Catalogue, métadonnées et archives numériques

La numérisation des manuscrits a créé de vastes dépôts en ligne, mais les images brutes sont de valeur limitée sans métadonnées riches. L'historique computationnel dépend de normes de catalogage cohérentes et lisibles par machine. Sans bonnes métadonnées, même les algorithmes les plus sophistiqués ne peuvent pas fonctionner efficacement.

Données ouvertes et interopérabilité liées

Les projets comme Recherche de correspondance[ et Manuscrita[ utilisent des principes de données liés pour connecter les documents manuscrits entre les institutions. En attribuant des identifiants persistants (URI) aux manuscrits, aux scribes et aux textes, les chercheurs peuvent interroger des collections distribuées comme s'il s'agissait d'une seule base de données. Cela permet une analyse à grande échelle : par exemple, la recherche dans des centaines de bibliothèques pour tous les manuscrits contenant un filigrane spécifique ou la collecte de toutes les copies connues d'une oeuvre donnée. Le Cadre international d'interopérabilité des images (IIIF) est devenue une pierre angulaire de cet effort, permettant de voir côte à côte et de les comparer à haute résolution les images provenant de différents dépôts.

Crowdsourcing et la science citoyenne

Des efforts massifs de numérisation ont créé des retards dans la production de manuscrits non transcrits.Les plateformes de crowdsourcing, comme le projet Trancrivez Birmingham, font appel à des bénévoles pour transcrire et marquer des images.Ces contributions servent ensuite à former des modèles HTR, créant un cycle vertueux d'amélioration.Ces efforts communautaires non seulement accélèrent la transcription mais aussi sensibilisent le public au patrimoine médiéval.La Bibliothèque numérique Cambridge a mené des campagnes de crowdsourcing réussies pour ses manuscrits du XIIe siècle, générant des transcriptions qui auraient pris des années pour qu'un seul érudit puisse les compléter.

Extraction automatisée des métadonnées

En classant ces éléments, les algorithmes peuvent automatiquement générer des balises pour des sujets iconographiques, des types de scripts et des mises en page. Cela réduit le fardeau des catalogueurs et permet des recherches plus granulaires. La Vatican Lib a utilisé de telles techniques pour marquer automatiquement des centaines de milliers d'images avec des mots-clés, permettant aux chercheurs de trouver tous les manuscrits représentant la Vierge Marie ou tous les initiales ornées de feuilles d'or. La classification automatisée des types de scripts (par exemple, carolingiens minuscules, gothiques textuels) a également été démontrée avec une grande précision, aidant les paléographes à trier rapidement de grandes collections numériques.

Paléographie et analyse des scripts

Les méthodes informatiques ont également pénétré dans le domaine de la paléographie, l'étude de l'écriture ancienne. Plutôt que de se fier uniquement à l'intuition d'expert, les chercheurs utilisent maintenant des mesures quantitatives pour classer et comparer les scripts.

Paléographie quantitative

En mesurant la géométrie de la forme des lettres, le rapport d'aspect, la courbure, l'épaisseur des traits, les scholars peuvent créer des vecteurs de profil pour les mains scribales individuelles. Les algorithmes de regroupement peuvent alors regrouper des mains similaires, révélant potentiellement la sortie d'un scriptorium unique ou même le même scribe travaillant sur différents manuscrits. Ceci a été appliqué à l'analyse des collections [Bodleian Library pour identifier des copistes précédemment non reconnus.

Deep Learning pour la reconnaissance de l'écriture

Les progrès récents dans l'apprentissage profond, en particulier les réseaux neuronaux convolutionnels et récurrents, ont permis de reconnaître de bout en bout les scripts médiévaux. Des systèmes comme ceux développés par le projet Himstag (Manuscrits historiques et Scripts: Analyse et génération de texte) peuvent transcrire des pages manuscrites entières avec un traitement minimal. Ces outils sont particulièrement utiles pour de grandes collections de scripts uniformes, tels que des documents juridiques ou des cartuaires, où l'OCR conventionnel échoue.L'équipe de Himstag a formé des modèles sur Chartes de la Haute-Saône, une collection de plus de 5 000 chartes médiévales, atteignant des taux d'erreur de mots inférieurs à 10%.

Identification de l'auteur et attribution de la scribale

L'identification des auteurs va au-delà de la reconnaissance : elle utilise des caractéristiques de l'écriture pour relier plusieurs manuscrits au même scribe. Des modèles d'apprentissage approfondi formés sur de grandes séries de données de mains connues peuvent maintenant attribuer des fragments de manuscrits anonymes avec une grande fiabilité. Cela s'est avéré utile pour reconstruire des bibliothèques dispersées – par exemple, identifier qu'une feuille à New York et une feuille à Stockholm ont été écrites par le même scribe, ce qui implique qu'ils appartenaient autrefois au même livre.

Défis et considérations éthiques

Malgré ces succès, l'histoire computationnelle est confrontée à des défis importants. La qualité des données reste un enjeu majeur : de nombreux manuscrits numérisés sont des métadonnées clés de faible résolution, mal éclairées ou manquantes. Les algorithmes formés sur un type de script ne se généralisent pas à un autre, ce qui entraîne des erreurs systématiques.

Précision et représentativité des données

Les modèles d'apprentissage automatique ne sont que aussi bons que leurs données de formation. Si un corpus de formation est biaisé vers certaines régions, scripts ou périodes, les modèles résultants seront mal utilisés sur des matériaux sous-représentés. Par exemple, les modèles HTR formés principalement sur des manuscrits latins peuvent échouer sur des textes vernaculaires ou scripts d'Europe orientale. Les chercheurs doivent documenter et partager soigneusement des ensembles de données de formation, et s'assurer que les modèles sont testés sur divers ensembles de manuscrits. Le projet Holmfont tente de s'attaquer à ce problème en installant un catalogue mondial de scripts médiévaux, y compris des manuscrits thiopiques, arméniens et géorgiens, pour former des modèles plus inclusifs.

Préservation numérique

La Coalition de préservation numérique fournit des lignes directrices pour s'assurer que les archives numériques demeurent aujourd'hui utilisables pour les générations futures. De nombreux projets reposent sur des dépôts institutionnels ou une infrastructure nationale (comme la Swiss National Library=s e-Helvetica), mais des projets communautaires fragiles peuvent disparaître si le financement prend fin. Le terrain a besoin de modèles durables pour la préservation numérique, y compris des archives communautaires et des arrangements de séquestration des données.

Compétences spécialisées et collaboration interdisciplinaire

L'histoire computationnelle exige une expertise en études médiévales et en informatique. Peu de chercheurs sont formés dans les deux domaines et la collaboration peut être entravée par des terminologies et des méthodologies différentes.Pour combler cette lacune, les universités élaborent des programmes et des ateliers conjoints, et de nombreux projets de sciences humaines numériques comprennent des composantes de formation explicites. Néanmoins, le domaine a besoin de financement et de cheminements de carrière plus spécialisés pour les chercheurs-technologues.

Orientations futures : l'IA et au-delà

Plusieurs technologies émergentes promettent de transformer encore l'étude des manuscrits médiévaux. Le rythme de l'innovation dans la vision informatique et le traitement du langage naturel suggère que des outils encore plus puissants seront disponibles dans la prochaine décennie.

Intelligence artificielle pour la transcription et la traduction

Les premières expériences avec des modèles comme GPT-4 ont montré des promesses en générant des éditions critiques à partir de transcriptions brutes, bien que la surveillance humaine soit essentielle. Le pipeline LatinCy[, un outil NLP pour latin basé sur spaCy, offre déjà la lémmatisation, le marquage en partie de la parole et la reconnaissance d'entités pour les textes médiévaux. La combinaison de la sortie HTR et de l'analyse basée sur la LLM pourrait permettre aux chercheurs de consulter un manuscrit en langage naturel, par exemple, « Trouver toutes les références aux prix des céréales dans les livres de comptes du 13e siècle » et recevoir des résultats ciblés en quelques secondes.

Dépliage virtuel des manuscrits laminés ou endommagés

Pour les manuscrits trop fragiles pour s'ouvrir ou qui survivent sous forme de rouleaux roulés, le balayage micro-CT combiné à des algorithmes de déploiement computationnel peut créer des modèles virtuels en 3D. Cette technique a été utilisée sur le Herculaneum papyri et est maintenant adaptée pour le matériel médiéval. Une fois pratiquement déplié, le texte peut être lu sans toucher physiquement l'artefact. Le Projet de livre de chansons le plus ancien utilise le micro-CT pour lire le livre de chansons du 13e siècle du chanteur Minne Neidhart, dont les pages étaient coincées ensemble par un feu au 15e siècle. L'algorithme de déploiement, basé sur la simulation physique, séparait chaque page dans l'environnement virtuel, révélant des chansons qui n'avaient pas été vues depuis le feu. Cette technologie promet de récupérer des textes de livres qui étaient auparavant considérés comme inopérables.

AI et gamification avec sources de financement

Des plateformes qui combinent l'esprit humain et l'analyse machine, parfois appelées systèmes « humains dans la boucle », accélèrent la recherche manuscrite. Des jeux comme Des vies anciennes ont permis aux bénévoles de transcrire le papyri grec, et des approches similaires sont appliquées aux manuscrits médiévaux. En gamifiant la transcription, les projets peuvent engager un large public tout en produisant des données de formation de haute qualité. L'initiative Transtribus Citizen Science[ a étendu ce modèle aux chartes médiévales, invitant les bénévoles à corriger et valider les transcriptions générées par machine.

Intégration avec les données archéologiques et historiques

À mesure que les métadonnées manuscrites deviennent liées à d'autres ensembles de données – découvertes archéologiques, registres climatiques, itinéraires commerciaux – les chercheurs peuvent poser des questions interdisciplinaires. Par exemple, la distribution de certains genres manuscrits correspond-elle à des périodes de croissance économique? Comment les événements climatiques comme le Petit Age de glace ont-ils affecté la production et la survie des livres de parchemin? Le projet Anomal Climatique Médiéval et Production Manuscrit a-t-il corrélé les données de la chaîne des arbres avec la production de scriptories monastiques, suggérant que des périodes de climat chaud et stable permettaient des rendements agricoles plus élevés et, par conséquent, plus de villémisme et plus de livres.

Conclusion

L'histoire computationnelle a dépassé la nouveauté et s'est transformée en une pratique courante d'études manuscrites médiévales. L'imagerie numérique révèle des couches perdues; l'extraction de texte découvre des motifs invisibles à l'œil humain; l'analyse en réseau reconstitue la vie sociale des livres; et l'apprentissage automatique accélère la transcription et la classification. Pourtant, ces outils restent des aides, et non des remplacements, pour l'expertise humaine.