Table of Contents
Сдвиг парадигмы в исторических исследованиях
На протяжении веков историки полагались на кропотливое ручное чтение и аннотацию, чтобы извлечь смысл из архивных материалов. Цифровая революция коренным образом изменила этот ландшафт. С миллионами страниц исторических газет, личной переписки, правительственных записей и литературных произведений, доступных в настоящее время в цифровой форме, машинное обучение (ML) предлагает инструменты, которые могут обрабатывать и анализировать эти коллекции в масштабе и скорости, невозможных для одних только ученых-людей. Этот сдвиг не заменяет критическое суждение историка, но дополняет его, позволяя новые виды вопросов и идей о прошлом.
Алгоритмы машинного обучения могут обнаруживать закономерности, отношения и тенденции в огромных телах, раскрывая все, от эволюции политической риторики до сдвигов в общественных настроениях во время войны. Автоматизируя такие задачи, как классификация, кластеризация и извлечение, ML позволяет исследователям сосредоточиться на интерпретации и контекстуальном понимании. Результатом является более богатый, более управляемый данными подход к истории, который дополняет традиционные качественные методы.
От перегрузки данных к обнаружению данных
Одна из самых больших проблем, с которой сталкиваются историки сегодня, — это не недостаток данных, а их подавляющее изобилие. Один хорошо оцифрованный архив может содержать десятки тысяч книг или миллионы газетных статей. Чтение даже части этого материала непрактично. Машинное обучение обеспечивает мост между необработанным оцифрованным текстом и действенной исторической проницательностью. Например, неконтролируемые методы обучения могут автоматически группировать документы по теме, языку или настроению, давая исследователям карту высокого уровня корпуса, прежде чем они погружаются в близкое чтение.
Объем доступного исторического текста ошеломляет. Цифровая библиотека HathiTrust содержит более 18 миллионов томов. Хроника Америки предлагает более 20 миллионов газетных страниц. Europeana объединяет более 58 миллионов предметов культурного наследия. Без машинного обучения изучение этих наборов данных в масштабе похоже на поиск иглы в стоге сена с завязанными глазами. Основное понимание движения цифровых гуманитарных наук заключается в том, что вычислительные методы не разбавляют качество исторического анализа - они расширяют его охват.
Основные методы машинного обучения в анализе исторического текста
Применение ML к историческим текстам опирается на несколько установленных методов. Топическое моделирование, такое как Latent Dirichlet Allocation (LDA), идентифицирует кластеры сопутствующих слов, которые представляют темы в коллекции. Этот метод использовался для отслеживания роста национализма в газетах 19-го века или смещения фокуса научных публикаций на протяжении десятилетий. В отличие от простых поисков ключевых слов, моделирование темы покрывает скрытые структуры в тексте, группируя документы в «темы» на основе статистического распределения слов. Исследователь, анализирующий викторианские периодические издания, может обнаружить, что одна публикация одновременно содержит темы, связанные с промышленным прогрессом, колониальным управлением и внутренней моралью, отслеживая, как эти темы воскрешались и ослабевали по вопросам.
Текстная классификация присваивает документам заранее определённые категории, позволяя проводить масштабные обзоры литературного или политического материала. Например, историк может обучить классификатор различать пропаганду и объективную репортаж в газетах военного времени. Классификатор учится на помеченных примерах, а затем применяет те же правила к миллионам немаркированных документов. Этот метод использовался для идентификации анонимных авторов, датированных недатированных рукописей и сортировки переписки по настроениям или срочности.
Кластеризация группирует похожие тексты без заранее определенных ярлыков, помогая исследователям обнаружить неожиданные сходства между работами, разделенными временем и географией.Иерархическая кластеризация брошюр 18-го века может показать, что аргументы о налогообложении в Бостоне имели больше формальных черт с лондонскими брошюрами, чем с теми из Филадельфии, оспаривая предположения о региональной интеллектуальной изоляции.
Названное распознавание сущности (NER) извлекает имена людей, места, организации и даты из исторических текстов. При применении к корреспонденции или административным записям NER может раскрывать социальные сети, миграционные модели или распространение идей. Например, обработка NER базы данных Трансатлантических рабских путешествий позволяет исследователям отслеживать перемещение порабощенных лиц через порты, связывая имена с кораблями, капитанами и покупателями. Современные системы NER, подобные тем, которые построены на spaCy или Stanford NER, могут быть точно настроены на историческом языке, добавив словарные ресурсы, такие как Wikidata или Словарь национальной биографии.
Анализ настроений измеряет эмоциональный тон языка.Применяя лексиконы настроений к историческим периодическим изданиям, исследователи нанесли на карту общественное мнение до и после крупных событий, таких как Французская революция или Гражданская война в США, часто обнаруживая, что официальные повествования резко расходились с популярными настроениями. Однако адаптация анализа настроений к историческим текстам требует тщательной лексикографической работы. Исторический тезаурус английского языка и OED обеспечивают исторические смыслы слов, которые могут использоваться для создания словарей настроений конкретного периода, гарантируя, что использование слов 17-го века, таких как «искусственное» (что означает умело созданный) не неверно истолковывается как негативное.
Тематические исследования: машинное обучение в действии
Несколько крупных исследовательских проектов иллюстрируют силу ML в исторических исследованиях. Проект Chronicling America в Библиотеке Конгресса использует ML для улучшения OCR для исторических газет, а также позволяет искать темы и ключевые слова на миллионах страниц. Аналогично, проект ESTC (Английский каталог коротких заголовков) использовал алгоритмы кластеризации для обнаружения вариантов изданий ранних печатных книг, раскрывая тираж текстов до того, как существовали законы об авторском праве. ESTC теперь содержит более 480 000 записей, а дедупликация на основе ML и сопоставление изданий удвоили известный корпус определенных типов брошюр.
В знаковом исследовании использовался анализ настроений на британских парламентских выступлениях с 1800 по 2000 год, чтобы отследить эмоциональную валентность законодательных дебатов, обнаружив, что тон стал более негативным и поляризованным в периоды экономического стресса. Исследователи использовали версию словаря лингвистического расследования и подсчета слов (LIWC), адаптированного для исторического английского языка, а затем соотнесли оценки настроений с ростом ВВП, уровнем безработицы и военными потерями. Результаты показали, что парламентский язык сместился от акцента на экономическую политику к моралистической риторике во время рецессий, шаблон, который держался в нескольких рецессиях.
Другой проект применил моделирование темы к американским докторским диссертациям с 1861 по 2000 год, показывая, как приоритеты исследований сместились с религиозных тем в социальные науки, а затем в области STEM.Набор данных ProQuest Dissertations включает более 5 миллионов диссертаций, и моделирование темы показало, что доля диссертаций, посвященных религиозным темам, снизилась с 34% в 1890-х годах до 6% к 1980-м годам, в то время как те, которые были сосредоточены на технологиях и технике, выросли с 2% до 28%.
Для более глубокого погружения в техническую сторону этих методов см. этот обзор в Nature о том, как ML используется в гуманитарных науках. Блог Directus также предлагает практическое руководство по созданию систем, которые сочетают ML с управлением контентом для архивных исследований.
Преодоление препятствий: качество данных, язык и интерпретация
Хотя потенциал огромен, применение ML к историческим текстам чревато трудностями. Наиболее распространенной проблемой являются ошибки OCR. В проектах ранней оцифровки часто создается текст с частотой ошибок 10-20% из-за выцветшего принта, необычных шрифтов или повреждения страницы. Эти ошибки могут отбрасывать тематические модели и анализаторы настроений. Общим примером является слово «rn», отображаемое как «m» во многих выходах OCR, поэтому «bom» может появляться вместо «родившийся», или «паттерн» может стать «паттем». Предварительная обработка современными инструментами коррекции OCR на основе ML, такими как Ocropy или Tesseract с нейронными сетями LSTM помогает снизить частоту ошибок до менее 5%, но это остается проблемой.
Исследователи также должны бороться с архаическим языком — вариациями орфографии, устаревшими словами и меняющимися значениями. Например, слово «гей» имело совсем иную коннотацию в 17 веке, чем сегодня. Лексики настроений и встраивания слов должны быть адаптированы к исторической корпорации, задача, которая требует как вычислительного мастерства, так и экспертизы домена. База данных Семантические изменения , разработанная в Стэнфорде, отслеживает, как значение более 20 000 слов сместилось на протяжении веков, и теперь она интегрирована в трубопроводы NLP для анализа исторического текста.
Биас — ещё одна критическая проблема. Данные обучения для многих моделей МО получены из современных текстов, поэтому алгоритмы могут неправильно классифицировать или неправильно интерпретировать исторические документы, которые по-разному используют расово заряженный язык, гендерные роли или классовые различия. Модель, обученная в газетах 20-го века, может обозначить редакционную статью 19-го века о «женской сфере» как поддерживающую гендерное равенство, когда на самом деле она укрепляет идеологию отдельных сфер. Для решения этой проблемы требуется тщательное курирование учебных наборов и готовность сочетать автоматизированные результаты с близким чтением историками.
Другой тонкий уклон возникает из генерного дисбаланса. В исторических записях преобладают тексты, созданные элитами — правительствами, богатыми людьми, писателями-мужчинами. Если тематическая модель обучена исключительно парламентским выступлениям, она может полностью пропустить опыт женщин, крестьян или колонизированных народов. Такие методы, как стратифицированная выборка и переборка недостаточно представленных жанров , могут смягчить это, но они требуют от ученых активного курирования своих данных, а не просто бросать каждый доступный документ в алгоритм.
Этические соображения в истории алгоритмов
Существуют также этические аспекты. Оцифрованные исторические тексты часто содержат личную информацию о лицах, которые, возможно, не ожидали конфиденциальности. ML может повторно идентифицировать анонимные данные или разоблачать детали из частной переписки. Исследователи должны применять принципы защиты данных и учитывать, может ли их анализ нанести вред общинам потомков. Например, генеалогические базы данных, построенные из записей переписи 19-го века, могут непреднамеренно выявить генетические отношения или разводы, которые живые потомки не обнародовали.
Более того, сами алгоритмы могут увековечить исторические предубеждения, если их не тщательно протестировать. Например, система распознавания именованных объектов может не распознать женщин-авторов, если данные обучения недопредставляют женщин. В исследовании 2018 года широко используемая система NER не смогла распознать половину женщин-авторов в корпусе романов 19-го века, правильно идентифицируя Джейн Остин, но отсутствуя Изабеллу Берд, Мэри Уолстонкрафт Шелли и другие. Такие ошибки со временем усугубляются, что приводит к исторической записи, которая еще более искажена, чем оригинальные архивы.
Издательский код, данные и методология позволяют другим ученым воспроизводить и критиковать результаты. Цифровые гуманитарные науки Ежеквартально обеспечивает форум для таких дискуссий, со многими статьями, исследующими этичное использование ML в исторических исследованиях. Принципы для цифровых гуманитарных наук , опубликованные Альянсом цифровых гуманитарных организаций, подчеркивают, что алгоритмический анализ должен сопровождаться четкой документацией происхождения данных, решениями по предварительной обработке и ограничениями модели.
Практические шаги по внедрению ML в исторические проекты
Для историков, рассматривающих возможность принятия ML, практический рабочий процесс начинается с очистки данных . Текст должен быть исправлен с помощью инструментов, таких как Tesseract, с помощью языковых моделей, точно настроенных для исторических шрифтов. OpenRefine является еще одним полезным инструментом для очистки и нормализации метаданных, таких как стандартизация имен авторов или географических географических названий. обогащение метаданных — добавление дат, имен авторов, географических тегов — повышает точность классификации и кластеризации. Для исторических газет Библиотека Конгресса API Chronicling America предоставляет структурированные метаданные для заголовков газет, дат и изданий, которые могут быть объединены с полнотекстовым контентом.
Затем выберите подходящий ML фреймворк. Для небольших и средних коллекций (до 100 000 документов) библиотеки Python, такие как или , хорошо работают. Для более крупных корпусов облачные сервисы или специализированные цифровые гуманитарные платформы, такие как Вояционные инструменты или Палладио , могут более легко масштабироваться. Вояционные инструменты не требуют программирования и обеспечивают интерактивную визуализацию частот слов, колокации и тематических моделей. Палладио специализируется на сетевом анализе и геопространственном отображении, что делает его идеальным для проектов, связанных с сетями переписки или маршрутами миграции.
Очень важно подтвердить результаты . Тематическая модель может создавать согласованно выглядящие темы, которые на самом деле являются артефактами ошибок OCR или общих стоп-слов. Ручная проверка случайной выборки документов в каждом кластере тем - это минимальный шаг валидации. Более строгая валидация включает сравнение ML-генерированных категорий с категориями, закодированными человеком, с использованием метрик, таких как каппа Коэна. Сотрудничество с ученым данных или присоединение к репозиторию, такому как Старшее дерево - платформа для проектов цифровой истории - может помочь избежать общих ошибок. Для тех, кто новичок в этой области, Историческое программирование предлагает отличные учебники по всему, от веб-скребинга до машинного обучения для анализа текста.
Выбор правильного инструмента для исторической капоры
Не все инструменты ML созданы равными для исторической работы. Предварительно обученные встраивания слов (например, Word2Vec или GloVe) основаны на современных корпусах и могут не захватывать исторические обычаи. Исследователи должны рассмотреть возможность обучения своих собственных встраиваний в исторические коллекции текстов, такие как COHA (Corpus of Historical American English). COHA содержит более 400 миллионов слов из текстов, опубликованных между 1810 и 2009 годами, а встраивание обучения в этот корпус дает векторы, которые отражают смыслы слов 19-го века. Например, встраивания «доктор» в 1870 году могут быть более тесно связаны с «клиргыманом», чем с «хирургом», что отражает историческую реальность, что многие врачи сообщества также были религиозными деятелями.
Аналогично, большие языковые модели (LLM), такие как GPT, могут быть точно настроены на исторические тексты, но они часто «галлюцинируют» правдоподобно звучащие, но фактически неправильные интерпретации. Исследование 2023 года показало, что GPT-4, когда его попросили обобщить брошюры 18-го века о Законе о гербовом сборе, изобрели вымышленные городские собрания и воображаемые дебаты, которые никогда не происходили. Для анализа безопаснее использовать интерпретируемые модели, такие как логистическая регрессия или деревья решений, которые позволяют ученым точно видеть, какие функции приводят к классификации. LIME и SHAP - это две библиотеки, которые могут объяснить предсказания любой модели черного ящика, обеспечивая доверительные интервалы и оценки важности признаков, которые помогают историкам оценить надежность результатов ML.
Будущее: анализ в реальном времени и мультимодальная интеграция
Следующий рубеж включает в себя анализ в реальном времени новых оцифрованных текстов. Поскольку архивы постоянно добавляют материал, ML-проводники могут автоматически классифицировать, обобщать и связывать новые тексты с существующими, создавая динамический график знаний исторических событий. Проект Archives Unleashed, например, обрабатывает веб-архивы в реальном времени, извлекая названные объекты и генерируя сетевые графы гиперссылок между онлайн-историческими источниками. Интеграция с пространственными и временными данными позволит историкам картировать распространение идей или болезней по географии и времени. Например, объединение ML-извлеченных топонимов из газет 19-го века с данными ГИС может показать, как охват событий, таких как Калифорнийская золотая лихорадка, сместился по мере развития события, от первоначального открытия на мельнице Саттера до глобальных миграционных маршрутов, которые последовали.
Достижения в обработке естественного языка (NLP) , адаптированные к историческому языку, такие как модели, обученные на английском языке 18-го века, уменьшат разрыв между современным и историческим использованием. OED (Oxford English Dictionary) и WordNet обновляются с историческими значениями слов, обеспечивая лучшие ресурсы для сентиментальных лексиконов. Исторический WordNet проект в Университете Вайкато уже нанес на карту 50 000 слов в их исторические значения, и этот набор данных интегрируется непосредственно с и .
Кроме того, мультимодальный ML, который сочетает в себе текст с изображениями (карты, фотографии, рукописные рукописи), разблокирует источники, которые было трудно анализировать автоматически, такие как скрапбукы или маргиналии. Визуальная структура NLP, разработанная IBM Research, может извлекать текст из рукописных документов, сопоставлять его с типизированными транскрипциями, а затем выполнять анализ настроений на маргинальных заметках. Это позволяет историкам анализировать разницу между публичным и частным комментарием: то, что читатель написал на полях книги 19-го века, по сравнению с тем, что было опубликовано в качестве обзора.
Сотрудничество между машинным обучением и традиционной стипендией
Наиболее многообещающее будущее заключается не в замене историков алгоритмами, а в углублении сотрудничества. Машинное обучение может справиться с «тяжелым подъемом» обработки данных, в то время как историки приносят знания домена, чтобы задавать лучшие вопросы и интерпретировать результаты. Выпускные программы в цифровой истории теперь распространены, и многие исторические отделы предлагают совместные степени с информатикой. Сертификат цифровой истории в Университете Небраски-Линкольна, например, требует курсов по Python, ГИС и статистическому анализу наряду с аспирантскими семинарами по историографии и архивной практике.
Мы можем ожидать, что больше междисциплинарных команд будут решать большие исторические вопросы, такие как долгосрочная эволюция демократии, влияние климата на прошлые общества или распространение религиозных движений. Климатическое исследовательское подразделение в Университете Восточной Англии сотрудничает с историками, чтобы применять ML к дневникам погоды 18-го и 19-го веков, извлекая данные о температуре и осадках из ежедневных записей для реконструкции климатических моделей до начала официальных метеорологических записей. Эти сотрудничества показывают, что машинное обучение не представляет угрозы для традиционной историографии, но является мощным ее продолжением.
Вывод: Новая эра исторических открытий
Машинное обучение — это не волшебная пуля, а мощная линза, которая раскрывает невидимые невооруженным глазом структуры и закономерности. Цифровизация исторических текстов создала сокровищницу данных, и ML предоставляет инструменты для их ответственного изучения. Объединив вычислительную строгость с гуманистической интерпретацией, ученые могут понять прошлое с большей глубиной, чем когда-либо прежде. Ключ заключается в том, чтобы оставаться в курсе ограничений — ошибок ОКР, архаичного языка, алгоритмического уклона — и использовать технологию как средство, а не цель. При тщательном использовании машинное обучение помогает историкам задавать вопросы, которые ранее были невозможны, и при этом пишет новую главу для дисциплины.
Для дальнейшего чтения о практической реализации этих методов платформа Directus предлагает безголовые CMS-решения, которые могут служить основой для проектов цифровой истории, интегрируя ML-проводники с управлением архивными метаданными. По мере развития технологии граница между историком и ученым-данным будет продолжать размываться, открывая богатую междисциплинарную область, которая обещает изменить наше понимание истории человечества. Блог Directus предоставляет регулярные обновления о том, как развиваются системы управления контентом для поддержки этих передовых аналитических рабочих процессов, что облегчает для ученых-гуманитариев принятие машинного обучения без глубоких технических знаний. Историки, которые используют эти инструменты, будут работать не только быстрее - они будут работать умнее, видя связи, которые всегда были там, но ранее невидимые.