Table of Contents

На протяжении веков историки кропотливо прочесывали архивы, читая письмо за письмом, страницу за страницей, чтобы собрать воедино повествование о человеческом опыте. В то время как этот ручной подход дал бесценные идеи, огромный объем оцифрованных исторических документов, доступных в настоящее время - миллионы книг, газет, дневников и правительственных записей - требует новых методов. Вычислительная лингвистика, междисциплинарная область, сидящая на пересечении информатики и лингвистики, предлагает именно это: алгоритмы и модели, способные обрабатывать язык в масштабе. При применении к историческим текстам она превращает пыльные архивы в богатые наборы данных, позволяя исследователям обнаруживать тонкие паттерны лингвистических изменений, раскрывать скрытые культурные темы и даже приписывать авторство анонимным работам. Эта статья исследует, как вычислительная лингвистика меняет исторический анализ, методы, которые его поддерживают, проблемы, которые остаются, и захватывающее будущее, которое лежит впереди.

Что такое вычислительная лингвистика?

Вычислительная лингвистика — это не просто написание программного обеспечения для подсчета слов. Она охватывает разработку формальных моделей языка, которые могут выполнять машины, охватывая все, от фонетики и морфологии до синтаксиса, семантики и прагматики. Основные задачи включают в себя тегирование части речи, разбор структуры предложений, неоднозначность смыслов слов и понимание дискурса. Эти задачи основаны на комбинации алгоритмов на основе правил и статистического машинного обучения, часто обученного на обширных аннотированных корпусах.

В контексте исторических текстов вычислительная лингвистика становится своего рода машиной времени. Языки развиваются: орфография стандартизируется, появляются новые слова, старые становятся архаичными, а грамматические сдвиги. Вычислительная модель, обученная современному английскому языку, будет бороться с брошюрой 17-го века. Поэтому исследователи должны адаптировать эти инструменты - создавать исторические корпуса, разрабатывать специализированные лексики и тонко настраивать модели для учета языкового разнообразия прошлых эпох. Цель состоит в том, чтобы превратить грязный, разнообразный исторический язык в структурированные данные, которые можно запрашивать, визуализировать и интерпретировать.

Анализ исторических текстов с помощью технологий

Оцифровка текста и OCR

Каждый вычислительный анализ начинается с преобразования физических или отсканированных документов в машиночитаемый текст. Оптическая распознавание символов (OCR) является основной технологией для этой задачи. Ранние системы OCR были, как известно, неточными с историческими шрифтами, выцветающими чернилами и неровными макетами страниц. Современные двигатели OCR, такие как Tesseract и ABBYY FineReader, значительно улучшились, особенно в сочетании с передовыми моделями предварительной обработки изображений и языка, адаптированными к историческим сценариям. Тем не менее, даже сегодня частота ошибок OCR остается значительным препятствием, часто превышающим 10-20% для газет 19-го века. Исследователи должны затем очистить и исправить выход - процесс, известный как коррекция после OCR - с использованием специализированных инструментов или ручного труда.

После оцифровки текст входит в конвейер предварительной обработки: токенизация (расщепление на слова или токены), нормализация (стандартизация правописания, обработка вариантов символов, таких как длинные «s») и разметка (добавление структурных тегов для абзацев, перерывов страниц или маргиналов).

Corpus Construction и аннотация

Исторический корпус — это больше, чем просто текстовый свалка. Он тщательно отобран для балансирования таких факторов, как период времени, жанр, диалект и авторство. Такие проекты, как корпус исторического американского английского (COHA) и Хельсинкский корпус английских текстов , предоставляют структурированные, аннотированные наборы данных, охватывающие века. Эти корпуса часто включают метаданные: дата композиции, информация об авторе (когда известна), тип текста (например, художественная литература, юридическая, научная), а иногда и ручные аннотации для лингвистических особенностей, таких как существительные или глаголы. Эти богато помеченные данные позволяют исследователям задавать точные вопросы: Как использование местоимений изменилось между 1500 и 1800 годами? Когда слово «ужасный» перешло от значения «полный благоговения» к «очень плохо»?

Ключевые вычислительные методы для исторических текстов

Частотный анализ и извлечение ключевых слов

В самом простом анализе частоты подсчитывается, как часто слова или фразы появляются в корпусе. Это может выявить доминирующие темы или внезапные сдвиги. Например, резкое увеличение слов, таких как «война», «царство» и «враг» в английских брошюрах 17-го века может коррелировать с английской гражданской войной. Более сложное извлечение ключевых слов сравнивает относительные частоты между целевым корпусом и эталонным корпусом для идентификации статистически перепредставленных терминов. Этот метод широко используется в цифровых гуманитарных науках , чтобы точно определить отличительный словарь конкретного автора, жанра или эпохи.

Тема моделирования

Тема моделирования является неконтролируемым методом машинного обучения, который обнаруживает скрытые темы в коллекции документов. Наиболее распространенный алгоритм, латентное распределение Дирихле (LDA), рассматривает каждый документ как смесь тем, и каждая тема как распределение по словам. Для корпуса викторианских романов, тема моделирования может кластеризовать слова, как «сад», «поле», «прогулка» и «лето» в «природную» тему, и «фабрика», «рабочий», «машина» и «город» в «индустриализацию» тема. Историки используют эти темы в качестве эвристики, чтобы проследить, как интеллектуальные или культурные проблемы воскрешались и ослаблялись в течение десятилетий.

Анализ настроений

Анализ настроений выходит за рамки частот слов для оценки эмоционального тона текстов — позитивного, негативного или нейтрального. Ранние методы опирались на лексиконы настроений (списки слов, предварительно назначенных на валентный балл), но современные подходы используют модели глубокого обучения, обученные на меченых наборах данных. Применение анализа настроений к историческим газетам может наметить общественное мнение во время таких событий, как Американская революция или аболиционистское движение. Однако лексиконы настроений требуют тщательной адаптации: слово, такое как «ужасный», могло быть использовано более буквально в 18 веке (что означает «вдохновляющий террор»), а не с его современным негативным коннотацией.

Названо признание сущности (NER)

NER идентифицирует и классифицирует собственные существительные — имена людей, места, организации, даты и т. Д. — в тексте. Исторический NER особенно сложен, потому что объекты могут быть написаны в вариантах написания (например, «Шакспере» против «Шекспира») или ссылаться на давно несуществующие учреждения. Пользовательские модели NER, обученные на исторических бюллетенях и биографических базах данных, могут извлечь, кто был упомянут, где произошли события и когда. Это позволяет строить социальные сети из корреспондентских сетей или политических альянсов, позволяя историкам визуализировать связи, которые невидимы в одном документе.

Стилометрия и авторское атрибуция

Стилометрия применяет статистический анализ к стилю письма — такие функции, как длина предложения, распределение частот слов и использование слов функции (например, «the», «and», «of») — для идентификации или проверки авторов. Принцип заключается в том, что каждый писатель имеет тонкий, бессознательный стилистический отпечаток пальца. В исторических исследованиях стилометрия использовалась для разрешения давних дебатов об авторстве, таких как были ли некоторые федералистские документы написаны Александром Гамильтоном или Джеймсом Мэдисоном. Методы варьируются от простых тестов с хи-квадратами до сложных классификаторов машинного обучения. Ключ заключается в использовании функций, которые устойчивы к изменениям в теме, жанре и периоде времени.

Обнаружение лексических изменений и семантический сдвиг

Слова меняют значение с течением времени. Вычислительные подходы, такие как диахронические встраивания слов (например, выравнивание векторов слов из одного века в другой) позволяют исследователям количественно оценить семантический дрейф. Например, слово «гей» в 1900-х годах относилось к счастью, но к 1970-м годам было преимущественно связано с гомосексуальностью. Используя такие модели, как word2vec или BERT, обученные на исторических корпусах, лингвисты могут планировать эти сдвиги с впечатляющей детализацией. Этот метод был применен для отслеживания эволюции моральных концепций, научных терминов и социальных категорий на протяжении веков.

Тематические исследования и реальные приложения

Отслеживание языка демократии

Исследователи из таких институтов, как Центр цифровых гуманитарных наук, использовали моделирование тем и анализ настроений для изучения языка американских политических брошюр с 1750 по 1800 гг. Они обнаружили резкий переход от колониальных разговоров о лояльности к революционной риторике, когда такие слова, как «свобода», «права» и «налогообложение», перешли от общего использования к сильно поляризованным кластерам после 1775 г. В сочетании с NER они определили ключевые фигуры, такие как Сэмюэль Адамс и Томас Пейн, как центральные в сети революционного дискурса.

Реконструкция древнего авторства

Классические тексты часто выживают с неопределённым авторством. Ученые, изучающие приписываемые Платону работы, использовали стилометрический анализ, чтобы различать его ранний, средний и поздний диалоги, основанные на изменениях в использовании им греческих частиц и окончаний предложений. Аналогичные методы применялись к Библии, Свиткам Мертвого моря и средневековым хроникам. В каждом случае вычислительная лингвистика даёт доказательства, дополняющие традиционную палеографическую и историческую критику.

Картографирование исторических эмоций

Анализ настроений на корпусе писем 19 века от мигрантов на американский Запад выявляет закономерность: ранние письма оптимистичны, с высокими положительными оценками настроений, но после первой суровой зимы наступает негативный всплеск.Эти продольные эмоциональные данные помогают историкам понять не только то, что произошло, но и то, как это было воспринято субъективно.

Проблемы в вычислительной исторической лингвистике

Несмотря на свои обещания, применение вычислительной лингвистики к историческим текстам чревато трудностями.

Ошибки OCR и шумные данные

Исторический ОКР часто производит искаженный текст: «длинный» становится «длинным» (длинные «s» неправильно распознаются), «старый» становится «идоидным», и строки текста могут быть слиты или разделены произвольно. Эти ошибки распространяются через анализ вниз по течению, подсчеты частоты и запутанные модели NER. Коррекция после ОКР с использованием языковых моделей, обученных историческому правописанию, может смягчить это, но совершенная точность остается неуловимой.

Вариация орфографии и языковые изменения

До 19-го века английская орфография была очень изменчивой: «Шекспир», «Шакспере» или «Шаксберд». Лемматизация (сведение слов к их базовой форме) требует отображения этих вариантов в каноническую форму, процесс, который требует обширных лексиконов и гибких алгоритмов сопоставления строк.

Дефицит данных и адаптация домена

Хотя оцифрованные архивы огромны, они часто несбалансированы. Некоторые диалекты, периоды времени или типы текста чрезмерно представлены, в то время как другие (например, частные письма женщин, языки коренных народов) скудны. Модели машинного обучения, обученные обильным современным данным, плохо переносятся в редкие исторические области. Создание моделей, специфичных для доменов, требует тщательно отобранных исторических корпусов, которые дороги и требуют много времени для создания.

Неоднозначность и интерпретация

Смысл любого текста частично является продуктом его контекста. Вычислительные методы могут идентифицировать закономерности, но интерпретация этих закономерностей требует глубоких исторических знаний. Внезапное увеличение ссылок на «эпидемию» может быть связано с фактической вспышкой, но это также может отражать изменение медицинской терминологии или новое регулирование, требующее отчетности о болезни. Количественные результаты всегда должны проверяться по сравнению с традиционными историческими источниками.

Будущие направления: ИИ и модели большого языка

Недавний взрыв моделей большого языка (LLM), таких как GPT-4, Llama и BERT, открыл новые возможности для анализа исторического текста. В отличие от более ранних моделей, ограниченных подсчетом слов, LLM могут выполнять задачи, такие как автоматизированный перевод архаичного языка на современный английский язык, вопрос, отвечающий по историческим корпусам и сложное извлечение информации на почти человеческом уровне. Например, модель, тонко настроенная на английском языке 17-го века, может исправлять ошибки OCR, нормализовать правописание и даже отвечать на вопросы, такие как «Какие аргументы использовал король Чарльз I в своих речах?»

Однако ЛЛМ несут в себе собственные риски. Они могут галлюцинировать факты, отражать современные предубеждения и могут не верно фиксировать исторический контекст. Исследователи должны использовать их осторожно, проверяя результаты на основе оригинальных источников. Гибридные подходы, сочетающие символические исторические знания (например, газетчики, биографические базы данных) с нейронными моделями, скорее всего, будут доминировать в следующем десятилетии.

Инструменты и ресурсы для исследователей

Для тех, кто хочет начать свой собственный вычислительный исторический анализ, доступны несколько открытых и коммерческих инструментов:

  • Вояжные инструменты: Веб-платформа для анализа текста, не требующая программирования. Она предлагает списки частот, облака слов и простое моделирование тем.
  • Библиотеки Python: NLTK, spaCy и scikit-learn обеспечивают надежные функции для токенизации, NER и классификации.Исторические модели (например, для английского языка 19-го века) доступны через Hugging Face.
  • TEI (Text Encoding Initiative): Стандарт разметки исторических документов в XML, позволяющий проводить структурированный анализ по проектам.
  • Stanford CoreNLP: Предлагает предварительно подготовленные конвейеры для нескольких языков, с опциями переобучения по историческим данным.
  • Исторические OCR-платформы: Transkribus и OCR4all специализируются на исторических сканах, обеспечивая обучение пользовательских моделей для конкретных шрифтов и скриптов.

Заключение

Вычислительная лингвистика не является заменой тщательному, критическому чтению исторических текстов; это мощное дополнение. Позволив анализировать массивные тела, выявлять тонкие закономерности и тестировать гипотезы в масштабе, она позволяет историкам задавать вопросы, которые ранее были неотвеченными. Область все еще созревает, с проблемами в качестве данных, адаптации домена и интерпретации, остающимися на повестке дня исследований. Тем не менее, по мере роста цифровых архивов и моделей становятся более сложными, партнерство между гуманистической исследование и вычислительный анализ только углубится. Являетесь ли вы историком, любопытным о лингвистических изменениях, лингвистом, привлеченным к глубине исторических данных, или компьютерным ученым, ищущим значимые приложения, пересечение вычислительной лингвистики и исторических текстов предлагает плодородную почву для открытия.