Quelles sont les langues perdues?

Une langue perdue est une langue qui n'a pas de locuteurs vivants et pour laquelle les enregistrements survivants sont fragmentaires ou entièrement absents. Certaines langues perdues sont éteintes mais ont des descendants connus – par exemple, le latin est l'ancêtre des langues romanes, mais ses formes plus anciennes sont bien documentées. D'autres sont complètement inconnues, sans parents identifiables et sans pierre de Rosetta pour fournir une clé. Ces langues représentent les cas les plus difficiles en linguistique historique.

  • Linear A – le script de Minoan Crète (vers 1800-1450 avant JC). Malgré de nombreuses tentatives, il reste non dérivé, en partie parce que le langage sous-jacent ne peut appartenir à aucune famille connue.
  • Scrime harappan (Indus Valley Civilization, vers 2600-1900 avant notre ère) – trouvé sur des milliers de minuscules phoques et de fard de poterie, mais il n'existe pas d'inscription bilingue.
  • Proto-Elamite – un des plus anciens systèmes d'écriture non décipés, utilisés dans ce qui est maintenant l'Iran vers 3100 avant JC. Il peut ne pas avoir de connexion avec une langue ultérieure.
  • Rongorongo – le mystérieux script de l'île de Pâques, inscrit sur des tablettes en bois après le XIIIe siècle. Son origine et sa signification sont encore vivement contestées.
  • Méroïtique – la langue du Royaume de Kush (aujourd'hui Soudan). Le script peut être lu phonétiquement, mais la langue sous-jacente a peu de cognats et aucune grammaire complète.

Chaque mot déchiffré éclaire les anciennes voies commerciales, les croyances religieuses, les migrations et les contacts interculturels. Par exemple, le déchiffrement du linéaire B dans les années 1950 a transformé notre compréhension de la société grecque mycénienne et révélé un système bureaucratique et économique qui précède les épopées homériques par des siècles. Le même potentiel existe pour d'autres langues perdues : une fois déverrouillées, elles peuvent aider à remplir des chapitres entiers de l'histoire humaine qui restent actuellement vides.

Le rôle de l'apprentissage automatique dans la reconstruction linguistique

La linguistique historique traditionnelle repose sur la méthode comparative : les linguistes identifient les cognates (mots qui partagent un ancêtre commun) et en déduitnt les changements sonores et morphologiques qui se sont produits au fil du temps. Cette méthode fonctionne parfaitement pour des familles de langues bien documentées comme Indo-Européenne ou Sémitique. Mais elle échoue lorsque les données sont rares, lorsque la langue n'a pas de parents connus, ou lorsque les textes disponibles sont trop courts pour révéler des modèles cohérents.

Les modèles sont formés à de grands corpus de langues connues, qui couvrent souvent des dizaines de familles et des millénaires, pour apprendre les tendances universelles du changement sonore, de la structure syllabique et de la morphologie grammaticale. Lorsqu'ils sont présentés avec un fragment de langue inconnue, le modèle peut extrapoler des formes ancestrales plausibles ou des caractères manquants, limitées par ce qu'il a appris sur l'évolution des langues. Cette technique a déjà été utilisée pour reconstruire des parties de Proto-Indo-European et pour suggérer des lectures pour les inscriptions endommagées en Etruscan et dans l'écriture ibérique.

Techniques clés

Réseaux neuronaux pour la prévision des séquences

Les réseaux neuronaux, en particulier les réseaux neuronaux récurrents (RNN) et les architectures de transformateurs plus récentes, sont conçus pour modéliser des séquences. Dans la reconstruction des langues, ils sont formés sur des listes de mots alignées provenant de langues apparentées. Par exemple, un réseau présenté avec l'italien vino, l'espagnol vino[ et le français vin[ peut apprendre à prédire l'ancêtre latin vinum[. Le même principe s'applique à des milliers de ensembles de cognats. Une fois formés, le réseau peut être demandé de reconstruire une forme ancestrale, avec un seul mot descendant ou une inscription fragmentaire.

Pour les langues perdues avec très peu de texte, les chercheurs utilisent parfois une approche trans-langue. Un réseau formé sur les correspondances sonores entre le grec et le sanscrit, par exemple, peut ensuite être appliqué à une langue mal attestée comme le phrygien, faisant des prédictions basées sur les modèles universels qu'il a internalisé. Cette approche a été utilisée pour proposer des reconstructions pour des dizaines de mots phrygien qui étaient auparavant considérés comme inanalyzables.

Phylogénétique statistique

Ces phylogénies montrent comment les langues divergeaient au fil du temps et permettent aux chercheurs d'estimer les propriétés des langues ancestrales. La méthode fonctionne en comparant les caractères lexicals et grammaticaux entre les langues apparentées, puis en utilisant un algorithme de la chaîne Markov Monte Carlo pour échantillonner les états les plus probables de l'arbre et des ancêtres. Appliquée aux scripts non décipérés, les modèles phylogénétiques peuvent déduire des valeurs phonétiques probables pour les signes basés sur leurs patrons de co-occurrence et leurs distributions positionnelles. Par exemple, si un signe particulier apparaît dans des contextes statistiquement similaires au signe d'une voyelle connue dans un script connexe, le modèle peut attribuer un son hypothétique de voyelle au signe inconnu.

Cette technique a été particulièrement efficace pour le script Meroitic, où il existait un déchiffrement phonétique partiel, mais de nombreux signes sont restés ambigus. En construisant une phylogénie des langues nilo-sahariennes et en comparant la distribution des signes, les chercheurs ont pu réduire les prononciations possibles pour plusieurs caractères auparavant incertains.

Transfert de l'apprentissage et de la formation préalable multilingue

Le transfert de l'apprentissage permet de tirer parti de modèles pré-formés sur des quantités massives de données textuelles, parfois de dizaines de langues, puis affinés sur le petit corpus disponible d'une langue perdue. C'est crucial parce que la plupart des langues perdues ne possèdent que quelques centaines ou quelques milliers de caractères de texte. Un modèle pré-formé qui a appris des caractéristiques linguistiques générales (comme la tendance à changer de certaines façons les sons ou la structure typique des phrases nominatives) peut être adapté à une nouvelle langue avec des données minimales.

Études de cas sur la reconstruction assistée par machine

Ligne B et le Puzzle Mino-Mycénaien

Le déchiffrement de la ligne B en 1952 par Michael Ventris a été un point de repère dans la linguistique historique. Ventris a montré que la ligne B a enregistré une forme primitive de grec, et il a utilisé une combinaison d'analyse cryptographique et de preuves comparatives pour casser le code. Mais son parent aîné, Linear A, continue de résister. Le corpus disponible de la ligne A comprend environ 1500 inscriptions, dont beaucoup fragmentaires, et la langue sous-jacente semble être ni grec ni aucune autre langue connue de l'Égée de Bronze.

Les chercheurs ont formé un réseau neuronal sur des paires de signes de la ligne B et de la ligne A, en utilisant les valeurs phonétiques connues de la ligne B comme cible d'entraînement. Le réseau a appris à cartographier les séquences de signe de la ligne A vers les séquences de signe de la ligne B, et de celles vers les valeurs phonétiques. Les résultats ont été suggestifs : le modèle a proposé des lectures phonétiques pour plus d'une douzaine de signes de la ligne A non lus, dont beaucoup s'alignent sur des intuitions philologiques antérieures.

Hiéroglyphes mayas : Automatiser les lacunes

Le script maya a été largement déchiffré au cours du XXe siècle, grâce au travail pionnier de Yuri Knorozov et des chercheurs ultérieurs. Cependant, de nombreuses inscriptions restent endommagées, et certains blocs de glyphes sont illisibles. L'apprentissage automatique est maintenant utilisé pour restaurer le texte manquant. Réseaux neuronaux convolutionnels (CNN) formés sur des milliers de panneaux de glyphe photographiés peuvent classer les signes individuels avec plus de 90% de précision.

Dans une étude de 2021, les chercheurs ont alimenté un modèle de transformateur le corpus complet de textes hiéroglyphes mayas de la période classique. Le modèle a appris à compléter des phrases fragmentaires en prédisant les glyphes manquants. Lorsqu'il a été testé sur des textes intentionnellement endommagés, il a corrigé les lectures restaurées avec une précision d'environ 80%, dépassant de façon significative les prévisions aléatoires.

Proto-Indo-Reconstruction des racines européennes à l'échelle

Une étude historique publiée dans Procédures de l'Académie nationale des sciences (2019) a appliqué un réseau neuronal au problème de la reconstruction des racines du Proto-Indo-European (PIE). Le réseau a été formé sur plus de 100 000 ensembles de cognats de plus de 200 langues indo-européennes, anciennes et modernes. Il a appris à cartographier les mots attestés dans les langues descendantes à leurs ancêtres reconstruits. Le modèle prédit correctement plus de 80% des racines du PIE qui avaient été établies par des méthodes traditionnelles.

Ce succès a incité les chercheurs à appliquer des méthodes similaires aux familles linguistiques avec une documentation beaucoup plus clairsemée. Par exemple, les familles afro-asiatiques et austronésiennes ont maintenant leurs propres projets de reconstruction assistée par ML. Les modèles peuvent suggérer des formes pour des proto-mots qui n'ont jamais été reconstruits auparavant, offrant des hypothèses concrètes que les linguistes de terrain peuvent tester contre de nouvelles données ou des preuves comparatives.

Défis et limites

Malgré sa promesse, l'apprentissage automatique n'est pas une baguette magique pour la reconstruction du langage perdu. Le terrain est confronté à plusieurs obstacles critiques qui limitent ce que le ML peut réaliser aujourd'hui.

La rareté et la qualité des données

La plupart des langues perdues ne survivent qu'en quelques centaines de caractères ou en inscriptions partielles. La formation d'un modèle d'apprentissage profond robuste nécessite généralement des milliers, voire des millions de points de données. Pour y parvenir, les chercheurs utilisent des techniques d'augmentation des données : étendre artificiellement le corpus en permutant les ordres de signes, ajouter du bruit synthétique ou générer des paraphrases basées sur des règles grammaticales connues.

Unicité du script et nécessité d'un ancêtre

Certains scripts, comme le script Harappan ou le Proto-Elamite, n'ont pas de texte bilingue connu et aucune famille de langage identifiable. Sans ancre externe, comme un langage cogné connu ou un nom propre qui peut être lu, les modèlesML ne peuvent détecter que les modèles internes : fréquences des signes, contraintes de position et statistiques de co-occurrence. Ceux-ci peuvent révéler quelque chose sur la structure des scripts, comme s'il s'agit de logographie ou de syllabique, mais ils ne peuvent pas attribuer de valeurs phonétiques.

Interprétation et validation

Il n'existe pas de mesure standard pour évaluer l'exactitude d'une reconstruction lorsque la vérité terrestre est inconnue. Un modèle peut proposer une lecture phonétique qui semble plausible sur le plan statistique mais contredite par le contexte archéologique ou par des développements linguistiques ultérieurs. L'expertise humaine demeure essentielle pour valider les suggestions de ML contre l'ensemble des connaissances historiques et linguistiques. De plus, les modèles peuvent perpétuer des biais présents dans les données de formation – par exemple, en se fondant sur les modèles indo-européens lorsqu'il s'agit d'un script non indo-européen. Si le modèle n'a jamais vu un langage ergatif-absolutif, il peut se battre pour le reconstruire.

L'avenir de la reconstruction linguistique

La prochaine décennie promet des progrès importants dans la reconstruction automatique du langage, alimentée par plusieurs tendances convergentes dans l'apprentissage automatique et les humanités numériques.

Peu d'apprentissages chauds et non supervisés pour les scénarios à faible ressource

Les chercheurs développent activement des méta-apprentissages et des algorithmes d'apprentissage à faible résolution qui ne nécessitent que quelques exemples pour généraliser. Appliquées à des scripts uniques, ces méthodes pourraient déduire des règles morphologiques et des correspondances phonétiques de 50 à 100 jetons. L'apprentissage non supervisé avance également : les modèles peuvent maintenant découvrir des correspondances phonétiques entre les langues sans données parallèles marquées, en alignant les espaces d'intégration apprises à partir de texte brut.

Partage de données interdisciplinaires

Des projets de numérisation à grande échelle permettent de rendre librement disponibles des images d'inscriptions à haute résolution. Corpora, comme la base de données Linnea[ pour Linear A et l'initiative pour la bibliothèque numérique cunéiforme pour les scripts mésopotamiens, fournissent des métadonnées normalisées et des annotations de signature qui peuvent être directement transmises dans des pipelines d'apprentissage automatique.

Plateformes de collaboration pour la cocréation de l'IA humaine

Des plateformes en ligne comme le Ancien projet de décapissement linguistique permettent aux linguistes, amateurs et amateurs de systèmes d'IA de collaborer en temps réel. Des volontaires humains valident des propositions générées par la machine, clignotant des lectures peu plausibles et confirmant des données prometteuses. Les modèles ML raffinent ensuite leurs prédictions en fonction de ces retours humains, créant un cycle vertueux d'amélioration. Cette synergie est déjà utilisée pour la transcription des tablettes d'argile endommagées et pour l'annotation des inscriptions de phoques de la vallée de l'Indus.

Conclusion

L'apprentissage automatique ne déchiffrera pas chaque langue perdue du jour au lendemain. Les cas les plus difficiles – ceux qui ont de petits fragments et aucun parent – ne peuvent jamais se produire complètement sans une nouvelle découverte archéologique. Mais ML fournit déjà des linguistes historiques avec des outils puissants pour tester les idées, combler les lacunes et explorer un espace combinatoire qui serait impossible pour les humains à gérer manuellement. La voie la plus prometteuse est la collaboration étroite entre les experts de domaine et les spécialistes du calcul, où le raisonnement humain guide les prédictions d'apprentissage et de modèle. Ensemble, ils forgent un avenir dans lequel les voix fragmentées des civilisations anciennes peuvent parler une fois de plus – non pas par des murmures, mais par des phrases cohérentes et décryptables qui approfondissent notre compréhension de l'histoire humaine.