Was sind verlorene Sprachen?

Eine verlorene Sprache ist eine, die keine lebenden Sprecher hat und für die die überlebenden Aufzeichnungen fragmentarisch sind oder völlig fehlen. Einige verlorene Sprachen sind ausgestorben, haben aber bekannte Nachkommen - zum Beispiel ist Latein der Vorfahr der romanischen Sprachen, aber seine älteren Formen sind gut dokumentiert. Andere sind völlig unbekannt, ohne identifizierbare Verwandte und ohne Rosetta Stone, um einen Schlüssel zu liefern. Diese Sprachen stellen die schwierigsten Fälle in der historischen Linguistik dar. Unter den berühmtesten nicht entschlüsselten Schriften und Sprachen sind:

  • Linear A – die Schrift des minoischen Kretas (um 1800–1450 v. Chr.) Trotz vieler Versuche bleibt es unentziffert, teilweise weil die zugrunde liegende Sprache möglicherweise keiner bekannten Familie angehört.
  • Harappan-Schrift (Indus Valley Civilization, ca. 2600–1900 v. Chr.) – gefunden auf Tausenden von winzigen Siegeln und Keramikscherben, aber es gibt keine zweisprachige Inschrift.
  • Proto-Elamite – eines der ältesten unentzifferten Schriftsysteme, das im heutigen Iran um 3100 v. Chr. verwendet wird.
  • Rongorongo – die geheimnisvolle Schrift der Osterinsel, die nach dem 13. Jahrhundert auf Holztafeln eingeschrieben ist.
  • Meroitic – die Sprache des Königreichs Kush (heute Sudan). Das Skript kann phonetisch gelesen werden, aber die zugrunde liegende Sprache hat nur wenige verwandte und keine vollständige Grammatik.

Die Rekonstruktion solcher Sprachen ist alles andere als eine akademische Übung. Jedes entschlüsselte Wort beleuchtet alte Handelswege, religiöse Überzeugungen, Migrationen und interkulturelle Kontakte. Zum Beispiel hat die Entschlüsselung von Linear B in den 1950er Jahren unser Verständnis der mykenischen griechischen Gesellschaft verändert und ein bürokratisches und wirtschaftliches System offenbart, das den homerischen Epen um Jahrhunderte vorausgeht. Das gleiche Potenzial besteht für andere verlorene Sprachen: Einmal entschlüsselt, können sie helfen, ganze Kapitel der Menschheitsgeschichte zu füllen, die derzeit leer bleiben.

Die Rolle des maschinellen Lernens bei der Rekonstruktion der Sprache

Die traditionelle historische Linguistik stützt sich auf die vergleichende Methode: Linguisten identifizieren verwandte Personen (Worte, die einen gemeinsamen Vorfahren haben) und schließen dann die Schallverschiebungen und morphologischen Veränderungen ab, die im Laufe der Zeit aufgetreten sind. Diese Methode funktioniert hervorragend für gut dokumentierte Sprachfamilien wie Indoeuropäer oder Semitiker. Aber sie versagt, wenn Daten spärlich sind, wenn die Sprache keine bekannten Verwandten hat oder wenn die verfügbaren Texte zu kurz sind, um konsistente Muster zu offenbaren. Maschinelles Lernen (ML) bietet einen komplementären Ansatz: Es kann statistische Regelmäßigkeiten erkennen, die für das menschliche Auge unsichtbar sind, Rekonstruktionen für Lücken vorschlagen und sogar phonetische Werte für nicht entschlüsselte Zeichen vorschlagen.

Im Kern behandelt maschinelles Lernen die Sprachrekonstruktion als ein Problem der Mustererkennung. Modelle werden auf großen Korpora bekannter Sprachen trainiert - oft über Dutzende von Familien und Jahrtausenden -, um die universellen Tendenzen der Klangänderung, der Silbenstruktur und der grammatikalischen Morphologie zu lernen. Wenn es mit einem Fragment einer unbekannten Sprache präsentiert wird, kann das Modell plausible Ahnenformen oder fehlende Zeichen extrapolieren, eingeschränkt durch das, was es über die Entwicklung von Sprachen gelernt hat. Diese Technik wurde bereits verwendet, um Teile von Proto-Indo-Europäisch zu rekonstruieren und Messwerte für beschädigte Inschriften in der etruskischen und iberischen Schrift vorzuschlagen.

Schlüsseltechniken

Neuronale Netze für die Sequenzvorhersage

Neuronale Netze, insbesondere rezidivierende neuronale Netze (RNNs) und die neueren Transformatorarchitekturen, sind für die Modellierung von Sequenzen konzipiert. Bei der Sprachrekonstruktion werden sie auf ausgerichteten Wortlisten aus verwandten Sprachen trainiert. Beispielsweise kann ein Netzwerk, das mit dem Italienischen vino, Spanisch vino und Französisch vin präsentiert wird, lernen, den lateinischen Vorfahren vinum vorherzusagen. Das gleiche Prinzip skaliert sich auf Tausende von verwandten Mengen. Einmal trainiert, kann das Netzwerk aufgefordert werden, eine Ahnenform zu rekonstruieren, wenn es nur ein einzelnes absteigendes Wort oder eine fragmentarische Inschrift erhält.

Die interne Darstellung von Klangänderungen - gelernt aus den Trainingsdaten - ermöglicht es ihm, fehlende Phoneme oder Morpheme mit Wahrscheinlichkeiten zu füllen, die oft sprachlich plausibel sind.

Für verlorene Sprachen mit sehr wenig Text verwenden Forscher manchmal einen sprachübergreifenden Ansatz. Ein Netzwerk, das zum Beispiel auf die gesunden Korrespondenzen zwischen Griechisch und Sanskrit trainiert ist, kann dann auf eine schlecht beglaubigte Sprache wie Phrygisch angewendet werden, indem Vorhersagen auf der Grundlage der universellen Muster gemacht werden, die es verinnerlicht hat. Dieser Ansatz wurde verwendet, um Rekonstruktionen für Dutzende von phrygischen Wörtern vorzuschlagen, die zuvor als nicht analysierbar angesehen wurden.

Statistische Phylogenetik

Aus der Evolutionsbiologie entlehnt, werden Bayes'sche statistische Modelle verwendet, um Sprachstammbäume zu erstellen. Diese Phylogenien zeigen, wie Sprachen im Laufe der Zeit auseinandergingen und erlauben es Forschern, die Eigenschaften von Ahnensprachen abzuschätzen. Die Methode funktioniert durch den Vergleich lexikalischer und grammatikalischer Zeichen über verwandte Sprachen hinweg und dann mit einem Markov Chain Monte Carlo Algorithmus, um die wahrscheinlichsten Baum- und Ahnenzustände zu untersuchen. Angewandt auf nicht entschlüsselte Skripte können phylogenetische Modelle wahrscheinliche phonetische Werte für Zeichen basierend auf ihren Ko-Auftretensmustern und Positionsverteilungen ableiten. Wenn zum Beispiel ein bestimmtes Zeichen in Kontexten erscheint, die dem Zeichen für einen bekannten Vokal in einer verwandten Schrift statistisch ähnlich sind, kann das Modell dem unbekannten Zeichen einen hypothetischen Vokalton zuweisen.

Diese Technik war besonders effektiv für die Meroitische Schrift, wo eine teilweise phonetische Entzifferung existierte, aber viele Zeichen mehrdeutig blieben. Durch den Aufbau einer Phylogenie der Nilo-Sahara-Sprachen und den Vergleich der Zeichenverteilungen konnten die Forscher mögliche Aussprachen für mehrere zuvor unsichere Zeichen eingrenzen.

Transfer Learning und mehrsprachiges Pre-Training

Transfer Learning nutzt Modelle, die auf massiven Mengen an Textdaten vortrainiert wurden – manchmal aus Dutzenden von Sprachen – und dann auf den kleinen verfügbaren Korpus einer verlorenen Sprache fein abgestimmt wurden. Dies ist entscheidend, weil die meisten verlorenen Sprachen nur einige wenige hundert oder einige tausend Zeichen Text haben. Ein vortrainiertes Modell, das allgemeine sprachliche Merkmale gelernt hat (wie die Tendenz, dass sich Klänge auf bestimmte Weise ändern, oder die typische Struktur von Substantivphrasen) kann mit minimalen Daten an eine neue Sprache angepasst werden. Für Linear A haben Forscher ein mehrsprachiges Transformatormodell verwendet, das ursprünglich auf 50+ modernen Sprachen trainiert wurde, dann fein abgestimmt auf den Linear A Korpus. Das Modell lernte, das nächste Zeichen in einer Sequenz mit überraschend hoher Genauigkeit vorherzusagen, was darauf hindeutet, dass es einige zugrunde liegende grammatikalische Regeln erfasst hatte - obwohl die Sprache selbst unbekannt bleibt.

Fallstudien zum maschinellen Lernen-unterstützten Wiederaufbau

Linear B und das minoisch-mykenische Puzzle

Die Entzifferung von Linear B 1952 durch Michael Ventris war ein Meilenstein in der historischen Linguistik. Ventris zeigte, dass Linear B eine frühe Form des Griechischen aufzeichnete, und er benutzte eine Kombination aus kryptographischer Analyse und vergleichenden Beweisen, um den Code zu knacken. Aber sein älterer Verwandter, Linear A, widersteht weiterhin. Der verfügbare Korpus von Linear A umfasst etwa 1.500 Inschriften, viele davon fragmentarisch, und die zugrunde liegende Sprache scheint weder Griechisch noch eine andere bekannte Sprache der Bronzezeit zu sein Ägäis.

Neuere maschinelle Lernstudien haben sich Linear A angenähert, indem sie das Problem als Aufgabe der statistischen Ausrichtung behandelten. Forscher trainierten ein neuronales Netzwerk auf Paaren von Zeichen von Linear B und Linear A, wobei die bekannten phonetischen Werte von Linear B als Trainingsziel verwendet wurden. Das Netzwerk lernte, lineare A-Zeichenfolgen auf lineare B-Zeichenfolgen und von diesen auf phonetische Werte abzubilden. Die Ergebnisse waren suggestiv: Das Modell schlug phonetische Werte für über ein Dutzend zuvor ungelesene lineare A-Zeichen vor, von denen viele mit früheren philologischen Vorstellungen übereinstimmen. Da das Modell probabilistisch ist, bietet es auch Vertrauenspunkte, so dass Linguisten sich auf die vielversprechendsten Hypothesen konzentrieren können.

Obwohl keine vollständige Entschlüsselung erreicht wurde, verengen diese computergestützten Ansätze den Suchraum für Epigraphen.

Maya Hieroglyphen: Die Lücken automatisieren

Die Maya-Schrift wurde im 20. Jahrhundert weitgehend entschlüsselt, dank der Pionierarbeit von Juri Knorozov und späteren Wissenschaftlern. Viele Inschriften bleiben jedoch beschädigt und einige Glyphenblöcke sind unlesbar. Maschinelles Lernen wird jetzt verwendet, um fehlenden Text wiederherzustellen. Faltungsneurale Netze (CNNs), die auf Tausenden von fotografierten Glyphentafeln trainiert wurden, können einzelne Zeichen mit über 90% Genauigkeit klassifizieren.

Noch wichtiger ist, dass Sequenzmodelle vorhersagen können, welche Glyphe am wahrscheinlichsten in einer Lücke (einer physischen Lücke in der Inschrift) erscheint, basierend auf dem umgebenden Kontext.

In einer Studie aus dem Jahr 2021 fütterten die Forscher ein Transformatormodell mit dem vollständigen Korpus von Maya-Hieroglyphentexten aus der Klassik. Das Modell lernte, fragmentarische Sätze zu vervollständigen, indem es die fehlenden Glyphen vorhersagte. Bei Tests an absichtlich beschädigten Texten korrigierte es die wiederhergestellten Messwerte mit einer Genauigkeit von etwa 80% und übertraf damit die zufällige Schätzung. Epigraphen verwenden diese Vorhersagen nun als ersten Durchlauf, indem sie die automatischen Wiederherstellungen manuell überprüften. Diese Zusammenarbeit zwischen menschlicher Expertise und Maschineneffizienz hat die Veröffentlichung neuer Messwerte beschleunigt.

Proto-indo-europäische Wurzelrekonstruktion im Maßstab

Eine wegweisende Studie, veröffentlicht in Proceedings of the National Academy of Sciences (2019) wendete ein neuronales Netzwerk auf das Problem der Rekonstruktion von proto-indoeuropäischen (PIE) Wurzeln an. Das Netzwerk wurde an über 100.000 verwandten Sätzen aus mehr als 200 indoeuropäischen Sprachen, sowohl alt als auch modern, trainiert. Es lernte, die beglaubigten Wörter in absteigenden Sprachen zurück zu ihren rekonstruierten Vorfahren abzubilden. Das Modell prognostizierte korrekt über 80% der PIE Wurzeln, die mit traditionellen Methoden etabliert wurden. Noch bemerkenswerter ist, dass es plausible neue Rekonstruktionen für Wurzeln erzeugte, die noch unter Linguisten diskutiert werden, einschließlich Formen, die bisher unerklärte Klangkorrespondenzen ausmachen.

Dieser Erfolg hat Forscher dazu inspiriert, ähnliche Methoden auf Sprachfamilien mit viel spärlicherer Dokumentation anzuwenden. Zum Beispiel haben die afroasiatischen und austronesischen Familien jetzt ihre eigenen ML-unterstützten Rekonstruktionsprojekte. Die Modelle können Formen für Proto-Wörter vorschlagen, die noch nie zuvor rekonstruiert wurden, und konkrete Hypothesen liefern, die Feldlinguisten gegen neue Daten oder vergleichende Beweise testen können.

Herausforderungen und Einschränkungen

Trotz seines Versprechens ist maschinelles Lernen kein Zauberstab für die Rekonstruktion verlorener Sprache. Das Feld steht vor mehreren kritischen Hindernissen, die das einschränken, was ML heute erreichen kann.

Datenknappheit und Qualität

Die meisten verlorenen Sprachen überleben in nur wenigen hundert Zeichen oder Teilinschriften. Das Training eines robusten Deep-Learning-Modells erfordert typischerweise Tausende oder sogar Millionen von Datenpunkten. Um dies zu umgehen, verwenden Forscher Datenvergrößerungstechniken: das künstliche Erweitern des Korpus durch Permutieren von Zeichenbefehlen, Hinzufügen von synthetischem Rauschen oder Erzeugen von Paraphrasen basierend auf bekannten grammatikalischen Regeln. Aber das Risiko des Überpassens ist hoch - das Modell kann Muster lernen, die für den winzigen Trainingssatz spezifisch sind, anstatt echte sprachliche Regelmäßigkeiten. Darüber hinaus können die verfügbaren Daten durch Fehler in der Transkription, Schäden oder inkonsistente Schreibkonventionen beschädigt werden.

Müll in, Müll aus gilt genauso für neuronale Netze wie für jedes andere Werkzeug.

Script Einzigartigkeit und die Notwendigkeit eines Ankers

Einige Skripte, wie die Harappan-Schrift oder Proto-Elamite, haben keinen bekannten zweisprachigen Text und keine identifizierbare Sprachfamilie. Ohne einen externen Anker - wie eine bekannte verwandte Sprache oder einen Eigennamen, der gelesen werden kann - können ML-Modelle nur interne Muster erkennen: Zeichenfrequenzen, Positionsbeschränkungen und Statistiken zum gleichzeitigen Auftreten. Diese können etwas über die Struktur der Schrift aufdecken, wie etwa, ob es logografisch oder syllabisch ist, aber sie können keine phonetischen Werte zuweisen. Die Entschlüsselung erfordert im Grunde einen Durchbruch, wie die Entdeckung einer neuen zweisprachigen Inschrift oder die Identifizierung einer verwandten Sprache. Maschinelles Lernen kann helfen, die Analyse zu beschleunigen, sobald dieser Durchbruch eintritt, aber es kann keine Bedeutung aus dem Nichts heraufbeschwören.

Interpretation und Validierung

Ergebnisse des maschinellen Lernens sind probabilistische Hypothesen, keine etablierten Fakten. Es gibt keine Standardmetrik für die Bewertung der Genauigkeit einer Rekonstruktion, wenn die Grundwahrheit unbekannt ist. Ein Modell könnte eine phonetische Lesart vorschlagen, die statistisch plausibel aussieht, aber durch archäologische Kontexte oder spätere sprachliche Entwicklungen widerlegt wird. Menschliche Expertise bleibt unerlässlich, um ML-Vorschläge gegen den gesamten Bestand an historischem und sprachlichem Wissen zu validieren. Darüber hinaus können Modelle Vorurteile in den Trainingsdaten verewigen, beispielsweise indem sie sich im Umgang mit einer nicht-indogermanischen Schrift zu sehr auf indoeuropäische Muster verlassen.

Wenn das Modell noch nie eine ergativ-absolutive Sprache gesehen hat, kann es schwierig sein, eine zu rekonstruieren. Kreuzvalidierung über verschiedene Sprachfamilien hinweg und unabhängige archäologische Beweise sind notwendig, um falsche Positive zu vermeiden.

Die Zukunft der Sprachrekonstruktion

Das nächste Jahrzehnt verspricht erhebliche Fortschritte bei der automatisierten Sprachrekonstruktion, die durch mehrere konvergierende Trends im maschinellen Lernen und in den Digital Humanities angetrieben werden.

Wenige Schuss und unbeaufsichtigtes Lernen für Low-Resource-Szenarien

Forscher entwickeln aktiv Meta-Lern- und Wenige-Schuss-Lernalgorithmen, die nur eine Handvoll Beispiele zur Verallgemeinerung benötigen. Angewendet auf einzigartige Skripte könnten diese Methoden morphologische Regeln und phonetische Korrespondenzen von nur 50-100 Token ableiten. Unüberwachtes Lernen schreitet ebenfalls voran: Modelle können jetzt phonetische Korrespondenzen über Sprachen hinweg ohne beschriftete parallele Daten entdecken, indem sie aus Rohtext gelernte Einbettungsräume ausrichten. Für ein Skript wie Rongorongo, in dem kein zweisprachiger Text existiert, könnte eine unüberwachte Ausrichtung zwischen den Zeichenverteilungen des Skripts und denen bekannter Entzifferungen die ersten überprüfbaren Hypothesen liefern.

Disziplinübergreifender Datenaustausch

Große Digitalisierungsprojekte machen hochauflösende Bilder von Inschriften frei verfügbar. Corpora wie die Linnea-Datenbank für Linear A und die Cuneiform Digital Library Initiative für mesopotamische Skripte liefern standardisierte Metadaten und Zeichenanmerkungen, die direkt in Machine Learning-Pipelines eingespeist werden können. Verknüpfte offene Daten zu archäologischen Kontexten - Provenienz, zugehörige Artefakte, Radiokohlenstoffdaten - werden das Trainingssignal weiter bereichern. Je mehr Daten in maschinenlesbarem Format verfügbar werden, desto leistungsfähiger werden ML-Modelle.

Kooperationsplattformen für Human-AI Co-Creation

Online-Plattformen wie das Ancient Language Decipherment Project ermöglichen Linguisten, Amateur-Enthusiasten und KI-Systeme in Echtzeit zusammenzuarbeiten. Menschliche Freiwillige validieren maschinengenerierte Vorschläge, markieren unplausible Messwerte und bestätigen vielversprechende. Die ML-Modelle verfeinern dann ihre Vorhersagen basierend auf diesem menschlichen Feedback und schaffen einen tugendhaften Verbesserungszyklus. Diese Synergie wird bereits für die Transkription beschädigter Tontafeln und für die Annotation von Indus Valley-Siegelinschriften verwendet. Wenn die Plattformen skaliert werden, werden sie die Art von iterativen Hypothesentests ermöglichen, die historisch gesehen Entzifferungen ausgelöst haben - nur in einem viel schnelleren Tempo.

Schlussfolgerung

Maschinelles Lernen wird nicht jede verlorene Sprache über Nacht entschlüsseln. Die schwierigsten Fälle – solche mit winzigen Fragmenten und keinen Verwandten – werden vielleicht nie ganz ohne einen neuen archäologischen Fund nachgeben. Aber ML bietet historischen Linguisten bereits mächtige Werkzeuge, um Ideen zu testen, Lücken zu füllen und einen kombinatorischen Raum zu erkunden, den Menschen nicht manuell bewältigen können. Der vielversprechendste Weg nach vorne liegt in einer engen Zusammenarbeit zwischen Domänenexperten und Computerwissenschaftlern, wo menschliches Denken das Lernen des Modells leitet und Modellvorhersagen neue Forschungslinien inspirieren. Zusammen schmieden sie eine Zukunft, in der die fragmentierten Stimmen alter Zivilisationen wieder sprechen können - nicht in Flüstern, sondern in kohärenten, entzifferbaren Sätzen, die unser Verständnis der menschlichen Geschichte vertiefen.