Cosa sono le lingue perdute?

Una lingua perduta è quella che non ha diffuso vivai e per cui i registri sopravvissuti sono frammentari o del tutto assenti. Alcune lingue perdute sono estinte ma hanno discendenti noti — ad esempio, il latino è l'antenato delle lingue romanze, ma le sue forme più antiche sono ben documentate. Altri sono completamente sconosciuti, senza parenti identificabili e senza Rosetta Stone per fornire una chiave.

  • Linear A[] – la sceneggiatura di Minoan Crete (c. 1800–1450 a.C.), nonostante molti tentativi, rimane indecifrabile, in parte perché la lingua sottostante non appartiene a nessuna famiglia conosciuta.
  • Scritto di Harappan[[] (Vicillazione della valle dell'Indus, c. 2600-1900 a.C.) – trovato su migliaia di piccoli sigilli e frammenti di ceramica, ma non esiste alcuna iscrizione bilingue.
  • Proto-Elamite[[] – uno dei più antichi sistemi di scrittura non decifrati, utilizzati in quello che è ora l'Iran intorno al 3100 a.C. Potrebbe non avere alcun collegamento con qualsiasi lingua successiva.
  • Rongorongo[ – il misterioso copione dell'isola di Pasqua, iscritto su tavolette di legno dopo il XIII secolo.
  • Meroitic[ – la lingua del Regno di Kush (attuale Sudan). Lo script può essere letto foneticamente, ma la lingua sottostante ha pochi cognati e nessuna grammatica completa.

Ogni parola decifrata illumina le antiche vie commerciali, le convinzioni religiose, le migrazioni e i contatti interculturali. Ad esempio, la decifrazione di Linear B negli anni '50 ha trasformato la nostra comprensione della società greca micenea e ha rivelato un sistema burocratico ed economico che preda le epiche omeiche di secoli.

Il ruolo dell'apprendimento della macchina nella ricostruzione della lingua

La linguistica storica tradizionale si basa sul metodo comparativo: i linguisti identificano i cognati (parole che condividono un antenato comune) e deducono i cambiamenti sonori e morfologici che si sono verificati nel tempo. Questo metodo funziona magnificamente per famiglie di lingue ben documentate come la ricostruzione indoeuropea o semitica. Ma non riesce a rivelare i dati radi, quando il linguaggio non ha parenti conosciuti, o quando i testi disponibili offrono troppo poco tempo per rivelare.

I modelli sono formati su grandi corporae di lingue conosciute – spesso spanning decine di famiglie e millenni – per imparare le tendenze universali del cambiamento sonoro, la struttura sillaba, e la morfologia grammaticale. Quando presentato con un frammento di una lingua sconosciuta, il modello può estrapolare forme ancestrali plausabili o personaggi mancanti, constratte da quello che ha imparato.

Tecniche chiave

Reti neurali per la Predizione di Sequenza

Le reti neurali, specialmente le reti neurali ricorrenti (RNN) e le architetture di trasformazione più recenti, sono progettate per modellare le sequenze. In una ricostruzione linguistica, sono addestrate a liste di parole allineate da linguaggi correlati. Ad esempio, una rete presentata con il discendente italiano vino, spagnolo ][FLT]

Per le lingue perdute con pochissimo testo, i ricercatori a volte usano un approccio trasversale. Una rete formata sulle corrispondenze sonore tra greco e sanscrito, per esempio, può essere applicata a un linguaggio scarsamente attestato come Phrygian, facendo previsioni basate sui modelli universali che ha internalizzato.

Statistica Phylogenetics

I modelli di studio Bayesian sono utilizzati per costruire alberi di famiglia linguistica. Queste filogenesi mostrano come le lingue divergono nel tempo e permettono ai ricercatori di valutare le proprietà delle lingue ancestrali. Il metodo funziona confrontando caratteri lessicali e grammaticali tra i linguaggi correlati, e quindi utilizzando un algoritmo di Markov Chain Monte Carlo per valutare i più probabili stati di alberi e ancestrali.

Questa tecnica è stata particolarmente efficace per lo script meroitico, dove esisteva una parziale decifrazione fonetica, ma molti segni sono rimasti ambigui.

Imparare e Pre-Training multilingue

L'apprendimento del trasferimento fa leva sui modelli pre-trained su enormi quantità di dati di testo, a volte da decine di lingue, e poi affinati sul piccolo corpus disponibile di una lingua perduta. Questo è fondamentale perché la maggior parte delle lingue perdute hanno solo poche centinaia o poche migliaia di caratteri di testo.

Case Studies in Ricostruzione assistita da macchine

Linear B e il puzzle Minoan-Mycenaean

Ventris ha dimostrato che Linear B ha registrato una prima forma di greco, e ha usato una combinazione di analisi crittografica e prove comparative per rompere il codice. Ma il suo parente più vecchio, Linear A, continua a resistere. Il corpus disponibile di Linear A comprende circa 1.500 iscrizioni, molti di loro frammento è conosciuto e la lingua di fondo greca.

I ricercatori hanno formato una rete neurale su coppie di segni di Linear B e Linear A, utilizzando i valori fonetici noti di Linear B come obiettivo di formazione. La rete ha imparato a mappare le sequenze di segni lineari A che permettono sequenze di segni lineari B, e da quelle a valori fonetici. I risultati sono stati suggestivi: il modello proposto di letture fonetiche per una dozzina di precedenti

Ieroglifi Maya: Automazione dei Gaps

Lo script Mayan è stato decifrato in gran parte durante il XX secolo, grazie al lavoro pionieristico di Yuri Knorozov e successivamente studiosi. Tuttavia, molte iscrizioni rimangono danneggiate, e alcuni blocchi di glifo sono illeggibili. L'apprendimento automatico è ora utilizzato per ripristinare il testo mancante.

In uno studio del 2021, i ricercatori hanno alimentato un modello di trasformatore il corpus completo dei testi geroglifici Maya del periodo Classico. Il modello ha imparato a completare le frasi frammentarie predicendo i glifi mancanti.Quando testato su testi intenzionalmente danneggiati, ha corretto le letture restaurate con una precisione di circa l'80%, superando significativamente l'ipotesi casuale.

Ricostruzione di radici indoeuropea a scala

Uno studio di riferimento pubblicato in ]I procedimenti dell'Accademia Nazionale delle Scienze (2019) hanno applicato una rete neurale al problema di ricostruire le radici proto-Indoeuropee (PIE). La rete è stata addestrata su oltre 100.000 cognate da più di 200 lingue indoeuropee, sia antiche che moderne.

Questo successo ha ispirato i ricercatori ad applicare metodi simili alle famiglie linguistiche con una documentazione molto più scarsa, ad esempio le famiglie afroasiatiche e austronesiane hanno ora i loro progetti di ricostruzione assistiti da ML. I modelli possono suggerire forme per parole proto-che non sono mai state ricostruite prima, offrendo ipotesi concrete che i linguisti del campo possono testare contro nuovi dati o prove comparative.

Sfide e limitazioni

Nonostante la sua promessa, l'apprendimento automatico non è una bacchetta magica per la ricostruzione del linguaggio perso. Il campo affronta diversi ostacoli critici che limitano ciò che ML può raggiungere oggi.

Scarsità e qualità dei dati

Per lavorare in questo modo, i ricercatori utilizzano tecniche di ingrandimento dei dati: espandere artificialmente il corpus attraverso la permutazione degli ordini dei segni, l'aggiunta di rumore sintetico, o generare parafrasi basati su regole grammaticali conosciute. Ma il rischio di sovraccarico è alto, il modello può imparare modelli che sono specifici per la piccola formazione.

Uniconess Script e la necessità di un'ancora

Alcuni script, come lo script Harappan o Proto-Elamite, non hanno un testo bilingue conosciuto e nessuna famiglia di lingua identificabile. Senza alcun ancoraggio esterno, come un linguaggio cognato conosciuto o un nome appropriato che può essere letto - i modelli LML possono solo rilevare i modelli interni: le frequenze di segno, i vincoli di posizione e le statistiche di co-occurrenza.

Interpretazione e convalida

I risultati dell'apprendimento automatico sono ipotesi probabilistiche, non sono fatti accertati. Non esiste una metrica standard per valutare l'accuratezza di una ricostruzione quando la verità di base è sconosciuta. Un modello potrebbe proporre una lettura fonetica che sembra statisticamente plausibile ma è contradditto da un contesto archeologico o da sviluppi linguistici successivi.

Il futuro della ricostruzione linguistica

Il prossimo decennio promette significativi progressi nella ricostruzione automatizzata del linguaggio, alimentati da diverse tendenze convergenti nell'apprendimento automatico e nelle umanità digitali.

Apprendimento a basso contenuto di risorse e poco supervisionato

I ricercatori stanno sviluppando attivamente meta-learning e algoritmi di apprendimento a poche immagini che richiedono solo una manciata di esempi per generalizzare. Applicati a script unici, questi metodi potrebbero dedurre regole morfologiche e corrispondenze fonetiche da appena 50-100 token. L’apprendimento non supervisionato sta anche avanzando: i modelli possono ora scoprire le corrispondenze fonetiche attraverso le lingue senza alcun dato parallelo etichettato, allineando gli spazi di embedding appre.

Condivisione dei dati interdisciplinari

I progetti di digitalizzazione su larga scala stanno rendendo disponibili immagini ad alta risoluzione di iscrizioni. Corpora come il Linnea Database] per Linear A e il Creadiform Digital Library Initiative per gli script Mesopotamian forniscono metadati standardizzati e annotazioni di segnale che possono essere alimentati direttamente in data di apprendimento automatico.

Piattaforme collaborative per la Co-creazione Umana-AI

Piattaforme online come il Ancient Language Decipherment Project permettono ai linguisti, agli appassionati dilettanti e ai sistemi AI di collaborare in tempo reale. I volontari umani convalidano le proposte generate dalla macchina, flagging letture implausible e confermano quelle promettenti. I modelli ML poi affinano le loro previsioni basate su questo feedback umano, creando un ciclo virtuoso di miglioramento.

Conclusioni

L’apprendimento delle macchine non decifra ogni lingua perduta durante la notte. I casi più difficili, quelli con piccoli frammenti e nessun parente, non possono mai cedere completamente senza una nuova scoperta archeologica. Ma ML sta già fornendo ai linguisti storici strumenti potenti per testare le idee, riempire le lacune e esplorare uno spazio combinatorio che sarebbe impossibile per gli esseri umani gestire manualmente.