Table of Contents

Что такое потерянные языки?

Потерянный язык — это тот, в котором нет живых носителей, и для которого сохранившиеся записи фрагментарны или полностью отсутствуют. Некоторые потерянные языки вымерли, но имеют известных потомков — например, латынь является предком романских языков, но ее более старые формы хорошо документированы. Другие совершенно неизвестны, без опознаваемых родственников и Розеттского камня, чтобы обеспечить ключ. Эти языки представляют собой самые трудные случаи в исторической лингвистике. Среди самых известных нерасшифрованных сценариев и языков:

  • Linear A — сценарий минойского Крита (ок. 1800—1450 гг. до н.э.).Несмотря на множество попыток, он остаётся нерасшифрованным, отчасти потому, что лежащий в его основе язык может не принадлежать ни к одной известной семье.
  • Сценарий Хараппана (Цивилизация долины Инда, с. 2600-1900 до н.э.) — найден на тысячах крошечных тюленей и керамических осколков, но двуязычной надписи не существует.
  • Прото-эламит — одна из старейших нерасшифрованных систем письма, используемая в том, что сейчас является Ираном около 3100 года до нашей эры.
  • Ронгоронго — таинственный сценарий острова Пасхи, написанный на деревянных табличках после 13 века. Его происхождение и значение до сих пор горячо оспариваются.
  • Мероити́ческий — язык Королевства Куш (современный Судан).Сценарий может читаться фонетически, но в базовом языке мало родственных языков и нет полной грамматики.

Реконструкция таких языков далека от академического упражнения. Каждое расшифрованное слово освещает древние торговые пути, религиозные верования, миграции и межкультурные контакты. Например, расшифровка Linear B в 1950-х годах трансформировала наше понимание микенского греческого общества и выявила бюрократическую и экономическую систему, которая предшествовала гомеровским эпосам на века. Такой же потенциал существует и для других утраченных языков: разблокированные, они могут помочь заполнить целые главы человеческой истории, которые в настоящее время остаются пустыми.

Роль машинного обучения в реконструкции языка

Традиционная историческая лингвистика опирается на сравнительный метод: лингвисты идентифицируют родственных (слова, которые имеют общего предка), а затем выводят звуковые сдвиги и морфологические изменения, которые произошли с течением времени. Этот метод прекрасно работает для хорошо документированных языковых семей, таких как индоевропейские или семитские. Но он не работает, когда данные редки, когда язык не имеет известных родственников или когда доступные тексты слишком короткие, чтобы выявить согласованные закономерности. Машинное обучение (ML) предлагает дополнительный подход: он может обнаруживать статистические закономерности, которые невидимы для человеческого глаза, предлагать реконструкции для пробелов и даже предлагать фонетические значения для нерасшифрованных знаков.

По своей сути, машинное обучение рассматривает реконструкцию языка как проблему распознавания образов. Модели обучаются на больших корпусах известных языков - часто охватывающих десятки семей и тысячелетий - для изучения универсальных тенденций изменения звука, структуры слогов и грамматической морфологии. Когда модель представлена фрагментом неизвестного языка, модель может экстраполировать правдоподобные формы предков или отсутствующие символы, ограниченные тем, что она узнала о том, как развиваются языки. Эта техника уже использовалась для реконструкции частей Прото-индоевропейский и предложить чтения для поврежденных надписей на этрусском и иберийском скрипте. В то время как ни одна система ML не расшифровала в одиночку потерянный язык, инструменты становятся все более мощными с каждым годом.

Ключевые техники

Нейронные сети для прогнозирования последовательностей

Нейронные сети, особенно рекуррентные нейронные сети (RNN) и более поздние архитектуры трансформаторов, предназначены для моделирования последовательностей. В реконструкции языка они обучаются на выровненных списках слов из родственных языков. Например, сеть, представленная итальянским vino, испанским vino и французским vinvinum, может научиться предсказывать латинский предокvinum. Тот же принцип масштабируется до тысяч родственных наборов. После обучения сеть может быть предложена для реконструкции родовой формы, данной только одному нисходящему слову или фрагментарной надписи. Внутреннее представление модели звуковых изменений — извлеченное из данных обучения — позволяет ей заполнять отсутствующие фонемы или морфемы вероятностями, которые часто лингвистически правдоподобны.

Для утраченных языков с очень небольшим количеством текста исследователи иногда используют межъязыковой подход. Сеть, обученная на звуковых соответствиях между греческим и санскритским, например, может затем применяться к плохо заверенному языку, такому как фригийский, делая прогнозы на основе универсальных шаблонов, которые он усвоил. Этот подход использовался для предложения реконструкций десятков фригийских слов, которые ранее считались неразборчивыми.

Статистическая филогенетика

Заимствованные из эволюционной биологии байесовские статистические модели используются для построения языковых семейных древ. Эти филогенезы показывают, как языки расходились во времени и позволяют исследователям оценивать свойства родовых языков. Метод работает путем сравнения лексических и грамматических символов на родственных языках, а затем с помощью алгоритма Markov Chain Monte Carlo для выборки наиболее вероятных древовидных и предковых состояний. Применительно к нерасшифрованным сценариям филогенетические модели могут выводить вероятные фонетические значения знаков на основе их сопоставительных паттернов и позиционных распределений. Например, если в контекстах, которые статистически подобны знаку для известного гласного в родственном скрипте, модель может присвоить неизвестному знаку гипотетический гласный звук.

Особенно эффективен этот метод для меройтского письма, где существовала частичная фонетическая расшифровка, но многие знаки оставались неоднозначными.Построив филогенез нило-сахарских языков и сравнив распределение знаков, исследователи смогли сузить возможные произношения для нескольких ранее неопределённых символов.

Трансферное обучение и многоязычная предварительная подготовка

Передача обучения использует модели, которые были предварительно обучены на огромных объемах текстовых данных - иногда из десятков языков - и затем настроены на небольшом доступном корпусе потерянного языка. Это важно, потому что большинство потерянных языков имеют только несколько сотен или несколько тысяч символов текста. Предварительно обученная модель, которая узнала общие лингвистические особенности (такие как тенденция к изменению звуков определенным образом или типичная структура существительных фраз), может быть адаптирована к новому языку с минимальными данными. Для линейного А исследователи использовали многоязычную модель трансформатора, первоначально обученную на 50+ современных языках, затем настроили ее на линейном корпусе А. Модель научилась предсказывать следующий знак в последовательности с удивительно высокой точностью, предполагая, что она захватила некоторые основные грамматические правила - даже если сам язык остается неизвестным.

Тематические исследования в области машинного обучения-ассистированной реконструкции

Линейный B и минойско-микенский пазл

Расшифровка линейного B в 1952 году Майклом Вентрисом была вехой в исторической лингвистике. Вентрис показал, что линейный B записал раннюю форму греческого языка, и он использовал комбинацию криптографического анализа и сравнительных доказательств для взлома кода. Но его старший родственник, линейный A, продолжает сопротивляться. Доступный корпус линейного A содержит около 1500 надписей, многие из которых фрагментарны, и лежащий в основе язык, по-видимому, не является ни греческим, ни любым другим известным языком Эгейского бронзового века.

Недавние исследования машинного обучения приблизились к линейному A, рассматривая проблему как задачу статистического выравнивания. Исследователи обучили нейронную сеть парам знаков от линейного B и линейного A, используя известные фонетические значения линейного B в качестве учебной цели. Сеть научилась отображать линейные последовательности знаков A в линейные последовательности знаков B и от них к фонетическим значениям. Результаты были наводящими на размышления: модель предложила фонетические показания для более чем дюжины ранее непрочитанных линейных A знаков, многие из которых согласуются с более ранними филологическими догадками. Поскольку модель вероятностна, она также обеспечивает оценки доверия, позволяя лингвистам сосредоточиться на наиболее перспективных гипотезах. Хотя полной расшифровки не было достигнуто, эти вычислительные подходы сужают пространство поиска для эпиграфистов.

Иероглифы майя: автоматизация пробелов

Сценарий майя был в значительной степени расшифрован в течение 20-го века, благодаря новаторской работе Юрия Кнорозова и более поздних ученых. Однако многие надписи остаются поврежденными, а некоторые глифовые блоки нечитаемы. Машинное обучение в настоящее время используется для восстановления отсутствующего текста. Сверточные нейронные сети (CNN), обученные на тысячах фотодиапазонов, могут классифицировать отдельные знаки с точностью более 90%. Что еще более важно, модели последовательностей могут предсказать, какой глиф с наибольшей вероятностью появится в лакуне (физический разрыв в надписи) на основе окружающего контекста.

В исследовании 2021 года исследователи кормили трансформаторную модель полным корпусом иероглифических текстов майя классического периода. Модель научилась завершать фрагментарные предложения, предсказывая недостающие глифы. При тестировании на намеренно поврежденных текстах она исправляла восстановленные показания с точностью около 80%, значительно превосходя случайные догадки. Сейчас эпиграфисты используют эти предсказания в качестве первого прохода, вручную проверяя автоматические реставрации. Это сотрудничество между человеческим опытом и эффективностью машины ускорило публикацию новых показаний.

Прото-индоевропейская корневая реконструкция в масштабе

Знаковое исследование, опубликованное в Proceedings of the National Academy of Sciences (2019), применило нейронную сеть к проблеме реконструкции праиндоевропейских (PIE) корней. Сеть была обучена более чем 100 000 родственных наборов из более чем 200 индоевропейских языков, как древних, так и современных. Она научилась отображать заверенные слова на языках-потомках обратно к их реконструированным предкам. Модель правильно предсказала более 80% корней PIE, которые были установлены традиционными методами. Более примечательно, что она породила правдоподобные новые реконструкции корней, которые до сих пор обсуждаются среди лингвистов, включая формы, которые составляют ранее необъяснимые звуковые соответствия.

Этот успех вдохновил исследователей на применение подобных методов к языковым семьям с гораздо более разреженной документацией. Например, афроазиатские и австронезийские семьи теперь имеют свои собственные проекты реконструкции с помощью ML. Модели могут предлагать формы для протослов, которые никогда не были реконструированы раньше, предлагая конкретные гипотезы, которые полевые лингвисты могут проверить на основе новых данных или сравнительных данных.

Проблемы и ограничения

Несмотря на свои обещания, машинное обучение не является волшебной палочкой для восстановления утраченного языка. Поле сталкивается с несколькими критическими препятствиями, которые ограничивают то, что ML может достичь сегодня.

Дефицит данных и качество

Большинство потерянных языков выживают всего в нескольких сотнях символов или частичных надписях. Обучение надежной модели глубокого обучения обычно требует тысяч или даже миллионов точек данных. Чтобы обойти это, исследователи используют методы увеличения данных: искусственное расширение корпуса путем перестановки указателей знаков, добавления синтетического шума или создания перефразировок на основе известных грамматических правил. Но риск переподгонки высок - модель может изучать шаблоны, которые являются специфичными для крошечного набора обучения, а не истинных лингвистических закономерностей. Более того, доступные данные могут быть повреждены ошибками в транскрипции, повреждениях или непоследовательных соглашениях о письме. Мусор в, мусор вне применимо так же много к нейронным сетям, как и к любому другому инструменту.

Уникальность сценария и необходимость в якоре

Некоторые сценарии, такие как Хараппанский сценарий или Прото-Эламит, не имеют известного двуязычного текста и не имеют идентифицируемого языкового семейства. Без какого-либо внешнего якоря — такого как известный родственный язык или собственное имя, которое можно прочитать — модели ML могут обнаруживать только внутренние шаблоны: частоты знаков, позиционные ограничения и статистику совместного появления. Они могут раскрыть что-то о структуре сценария, например, является ли он логографическим или силлабическим, но они не могут назначать фонетические значения. Расшифровка фундаментально требует прорыва, такого как открытие новой двуязычной надписи или идентификация связанного языка. Машинное обучение может помочь ускорить анализ, как только этот прорыв происходит, но оно не может вызвать смысл из ничего.

Толкование и валидация

Результаты машинного обучения являются вероятностными гипотезами, а не установленными фактами. Нет стандартной метрики для оценки точности реконструкции, когда неизвестна истина. Модель может предложить фонетическое чтение, которое выглядит правдоподобным статистически, но противоречит археологическому контексту или более поздним лингвистическим разработкам. Человеческий опыт остается необходимым для проверки предложений ML против всего объема исторических и лингвистических знаний. Кроме того, модели могут увековечить предубеждения, присутствующие в данных обучения - например, чрезмерная зависимость от индоевропейских моделей при работе с неиндоевропейским сценарием. Если модель никогда не видела эргативно-абсолютный язык, она может бороться за реконструкцию. Перекрёстная валидация в разных языковых семьях и независимые археологические данные необходимы, чтобы избежать ложных срабатываний.

Будущее языковой реконструкции

Следующее десятилетие обещает значительные успехи в автоматизированной языковой реконструкции, подпитываемой несколькими сходящимися тенденциями в машинном обучении и цифровых гуманитарных науках.

Невыстрел и неконтролируемое обучение для низкоресурсных сценариев

Исследователи активно разрабатывают алгоритмы метаобучения и обучения с несколькими выстрелами, которые требуют лишь нескольких примеров для обобщения. Применяемые к уникальным сценариям, эти методы могут вывести морфологические правила и фонетические соответствия из всего лишь 50-100 токенов. Также продвигается неконтролируемое обучение: модели теперь могут обнаруживать фонетические соответствия на языках без каких-либо помеченных параллельных данных, выравнивая встраиваемые пространства, полученные из сырого текста. Для сценария, такого как Ронгоронго, где не существует двуязычного текста, неконтролируемое выравнивание между распределениями знаков сценария и известными расшифровками может обеспечить первые проверяемые гипотезы.

Междисциплинарный обмен данными

Масштабные проекты оцифровки делают изображения надписей в высоком разрешении свободно доступными. Корпора, такая как Linnea Database для линейных A и Cuneiform Digital Library Initiative для месопотамских сценариев, предоставляет стандартизированные метаданные и подписные аннотации, которые могут подаваться непосредственно в конвейеры машинного обучения. Связанные открытые данные по археологическим контекстам — происхождению, связанным артефактам, радиоуглеродным датам — еще больше обогатят учебный сигнал. Чем больше данных становится доступным в машиночитаемом формате, тем более мощными станут модели ML.

Совместные платформы для совместного творчества человека и ИИ

Онлайн-платформы, такие как ]Проект расшифровки древнего языка , позволяют лингвистам, любителям и системам ИИ сотрудничать в режиме реального времени. Добровольцы-люди проверяют машинные предложения, помечая неправдоподобные показания и подтверждая перспективные. Модели ML затем уточняют свои прогнозы на основе этой обратной связи с человеком, создавая добродетельный цикл улучшения. Эта синергия уже используется для транскрипции поврежденных глиняных табличек и для аннотации надписей печати долины Инда. Как масштаб платформы, они позволят проводить итеративное тестирование гипотез, которое исторически приводило к расшифровке - только в гораздо более быстром темпе.

Заключение

Машинное обучение не расшифровает каждый потерянный язык за одну ночь. Самые трудные случаи — те, у которых есть крошечные фрагменты и нет родственников — никогда не уйдут полностью без новой археологической находки. Но ML уже предоставляет историческим лингвистам мощные инструменты для проверки идей, заполнения пробелов и изучения комбинаторного пространства, которым невозможно управлять вручную. Самый многообещающий путь вперед лежит в тесном сотрудничестве между экспертами в области предметных областей и учеными-вычислителями, где человеческое мышление направляет обучение модели и модельные прогнозы вдохновляют новые линии исследования. Вместе они создают будущее, в котором фрагментированные голоса древних цивилизаций могут снова говорить — не шепотом, а в последовательных, расшифровываемых предложениях, которые углубляют наше понимание человеческой истории.