Table of Contents

Использование алгоритмов машинного обучения для выявления несоответствий в исторических данных

Исторические исследования долгое время зависели от тщательного изучения первичных источников - рукописей, записей переписи, газетных архивов, дипломатической корреспонденции и материальных артефактов. Тем не менее, даже самые тщательно сохраненные архивы содержат ошибки, упущения и прямые противоречия. Искривленная коррекция одного переписчика, искаженная хартия или намеренно фальсифицированная генеалогия может пульсировать через поколения ученых, приводя к ошибочным повествованиям и неправильным атрибуциям. Традиционно историки полагались на перекрестные ссылки, палеографию и критику источников, чтобы искоренить эти несоответствия. Но чистый масштаб оцифрованных исторических данных - теперь измеренных в петабайтах - сделал ручное обнаружение все более непрактичным. Ввод машинного обучения (ML). Обучая алгоритмы распознавать шаблоны, аномалии флага и выводить недостающие значения, исследователи теперь могут идентифицировать несоответствия в исторических данных со скоростью и масштабом, которые были невообразимы десять лет назад. Эта статья исследует, как алгоритмы ML

Понимание машинного обучения в историческом анализе данных

Машинное обучение - это подмножество искусственного интеллекта, которое позволяет системам учиться на данных, не будучи явно запрограммированными для каждого правила. В историческом анализе алгоритмы ML потребляют большие объемы структурированных данных (например, табличные поля переписи) и неструктурированный текст (например, записи в дневнике, завещания, судебные записи) для выявления шаблонов, которые отклоняются от ожидаемых норм. Центральная идея заключается в том, что несоответствие во многих отношениях является аномалией - точкой данных, которая выходит за рамки типичного распределения или отношения, обнаруженного моделью. Изучая, что «нормально» выглядит для данного исторического корпуса, система ML может помечать записи, которые, вероятно, ошибочны, противоречивы или сфабрикованы.

Основные концепции: особенности, этикетки и обучение

Каждый проект ML начинается с определения признаков — измеримых свойств данных. Для исторических записей функции могут включать в себя поля даты, топонимы, имена людей, числовые величины (например, возраст, налоги) и лингвистические маркеры (например, частота лексики, наклон почерка). Если набор данных уже содержит проверенные правильные записи, подход , контролируемый , может использовать их в качестве меток для обучения классификатора. , не контролируемые методы обнаружения аномалий путем измерения расстояний от кластеров или реконструкции ввода с низкой ошибкой. Обработка естественного языка (NLP) добавляет дополнительное измерение путем анализа семантической и синтаксической структуры исторических текстов, позволяя обнаруживать противоречия, которые не являются чисто числовыми.

Типы несоответствий машинного обучения могут улавливать

Непоследовательные исторические данные принимают различные формы, и различные семейства алгоритмов подходят для различных задач:

  • Хронологические противоречия: Даты, нарушающие известные жизни, периоды регналов или последовательности событий.
  • Численные выбросы: Нереалистичные возрасты (например, 150-летний человек), невероятные суммы налогов или внезапные скачки населения.
  • Текстуальные анахронизмы: Слова или фразы, которые появляются до того, как они вошли в язык, или ссылки на события, которые еще не произошли.
  • Дублировать или почти дублировать записи: Один и тот же человек или событие вводились несколько раз с небольшими вариациями.
  • Недостающие или заполненные значения: Поля остались пустыми и позже были заполнены другой рукой, возможно, с неправильным выводом.
  • Слабое покрытие: Систематическая недопредставленность определённых групп, которую ML может обнаружить через дистрибутивные диспропорции.

Алгоритмы машинного обучения на практике

Выбор правильного алгоритма зависит от характера исторических данных и вида несоответствия, на которые нацелены. Ниже приведены наиболее распространенные семейства, а также примеры использования.

Надзорное обучение: классификация и регрессия

Когда историки имеют доступ к подмножеству «земной истины» — записям, которые были проверены с помощью архивной перекрестной проверки — контролируемые модели могут научиться классифицировать новые записи как «последовательные» или «несовместимые». Рандомные леса и деревья, повышающие градиенты , популярны, потому что они обрабатывают смешанные типы данных (числа, категории, даты) и предоставляют оценки значимости признаков, показывая, какие атрибуты больше всего повлияли на флаг. Например, проект в Институт исторических исследований использовал случайный классификатор леса для обнаружения неверных парламентских речей путем обучения на годах проверенных транскрипций; модель достигла более 90% точности в обнаружении речей, которые содержали ссылки на даты, несовместимые с известным сроком пребывания спикера. Поддерживающие векторные машины (SVMs) также использовались, когда граница принятия решений между последовательны

Неконтролируемое обучение: кластеризация и обнаружение аномалий

Большинство исторических наборов данных не имеют полностью проверенных меток — очень несоответствия, которые исследователи хотят найти, являются неизвестными неизвестными. Неконтролируемые методы сияют в этой обстановке. K-среди групповых подобных записей и DBSCAN группируют похожие записи вместе; записи, которые далеки от любого кластерного центроида, являются вероятными аномалиями. Например, исследование ранних современных английских приходских регистров использовало DBSCAN для кластерного крещения и записей о захоронениях по местоположению и дате. Небольшой кластер захоронений за одну неделю, которые были географически рассеяны. Автокодеры — нейронные сети, которые учатся сжимать и реконструировать вход — могут маркировать записи, которые дают высокую ошибку реконструкции. Kunsthistorisches Institut во Флоренции применил автокодер к спискам членов гильдии эпохи Возрождения; модель

Обработка естественного языка (NLP)

Исторический текст чреват несоответствием: вариант написания, архаичная лексика, аббревиатуры и изменения в стиле письма в течение жизни одного автора. Современные методы НЛП надежно справляются с этими проблемами. Названное распознавание сущности (NER) выявляет людей, места, даты и организации, а затем перекрестные ссылки на них против известных онтологий. Текст-текстовые трансформаторы передачи (T5, BART) могут быть точно настроены для обнаружения семантических противоречий — например, «Король Джон подписал Великую хартию вольностей в 1215 году» с последующим текстом, в котором говорится, что «Король Джон умер в 1216 году» является когерентным, но «Король Джон присутствовал на Венском конгрессе» является анахронизмом. Исследователи из Кембриджского университета использовали модели на основе BERT для анализа дипломатических писем начала 17-го века. Модель узнала

Историческая вариация орфографии

Ключевой проблемой для НЛП является то, что предварительно стандартизированное правописание может заставить стандартные модели рассматривать варианты форм в качестве различных слов. Токенизация подслов (Byte-Pair Encoding) помогает, как и обучение встраиванию слов в конкретные корпуса периода. Некоторые проекты, такие как работа Оксфордского исторического факультета ] на раннем современном английском языке, создали специализированные модели BERT (например, EarlyModBERT), которые сохраняют архаичные правописания, улучшая обнаружение несоответствий на 15% по сравнению с общими моделями.

Приложения в исторических исследованиях

Описанные выше теоретические возможности используются во все большем числе конкретных исторических исследований. Следующие подразделы иллюстрируют, как обнаружение несоответствий, вызванных МО, меняет форму науки.

Обнаружение противоречивых дат в королевских хрониках

Средневековые хроники часто регистрировали одно и то же событие с разными датами из-за ошибок в написании, различных календарных систем или преднамеренных изменений. Команда Института истории науки Макса Планка построила контролируемую модель, обученную на корпусе из 50 000 датированных событий из европейских хроник (900-1500 гг. н.э.). Модель использовала такие функции, как сезонные ссылки, дни святых и астрономические явления (затмения, кометы), чтобы оценить вероятный диапазон дат. Когда дата хроники выпала за пределы смоделированного диапазона, алгоритм пометил ее. Этот подход исправил давние хронологические ошибки в англосаксонской хронике, устранив трехлетнее несоответствие в сообщенной дате коронации короля Этельреда.

Выявление несоответствий в данных переписи

Исторические переписи являются богатыми источниками для демографических исследований, но, как известно, непоследовательны. Имена опечатаны, возрасты округлены, профессии записаны непоследовательно, и семьи разделены по страницам. Неконтролируемая кластеризация переписных записей домашних хозяйств может идентифицировать невероятные композиции. Например, Центр данных Северо-Запада (проект, связывающий данные переписи Великобритании от 1841-1911 годов) применил DBSCAN к домашним хозяйствам на основе возрастных различий между родителями и детьми. Когда «отец» был всего на пять лет старше своего «ребенка», алгоритм пометил запись. Ручной обзор показал, что во многих случаях переписчик перенес возраст двух братьев и сестер. В других случаях модель обнаружила, что 14-летний ребенок, перечисленный как «глава семьи», жил в доме с девятью другими людьми, все старше 20 лет — указывая на вероятную ошибку транскрипции в области профессии (ребенок был на самом деле учеником, а не главой). Такие поправки повышают надежность продольных исследований социальной мобильности.

Анализ почерка и использования языка для проверки подлинности

Машинное обучение, особенно компьютерное зрение в сочетании с НЛП, теперь предлагает надежные инструменты аутентификации. Модели распознавания рукописного текста (HWR) Модели, обученные на сценариях периода, могут сравнивать проток (поток штрихов) по набору документов, приписываемых одному и тому же писцу. Несоответствие в том, как формируется конкретная буква — угол восходящего, интервал между подъемами ниба — может указывать на другую руку. Национальные архивы США использовали сверточную нейронную сеть (CNN) для анализа почерка в партии предполагаемых писем Джорджа Вашингтона. Сеть обнаружила, что буква «p» в одной букве значительно отклонилась от известного нисходящего шаблона Вашингтона; письмо было позже подтверждено как подделка 19-го века. С языковой стороны, стилометрия — статистический анализ стиля письма автора — может отмечать несоответствия в выборе слов, длине предложения и синтаксических структурах. Когда исторический дневник

Раскрытие предвзятых или неполных записей

Исторические наборы данных часто отражают предубеждения их создателей — например, официальные записи могут систематически недооценивать женщин, меньшинства или бедных. Машинное обучение может выявить эти пробелы не путем обнаружения явных ошибок, а путем выявления моделей упущений. Майнинг правил ассоциации может обнаружить, что определенные комбинации атрибутов (например, «женщина» + «землевладелец») гораздо реже, чем ожидалось, даже после контроля за известными законами о наследовании, относящимися к конкретным полам. Аналогично, генеративные модели могут вменить правдоподобные недостающие значения и сравнить вмененное распределение с зарегистрированным. В исследовании голландских налоговых регистров 19-го века генеративная состязательная сеть (GAN) была обучена заполнять недостающие записи для профессий. Введенные GAN данные содержали гораздо больше записей о «мытье» и «семстрессе», чем оригинальный регистр — предполагая, что переписчики систематически опускали неформальный труд, в котором доминировали женщины

Проблемы и этические соображения

Несмотря на обещание обнаружения несоответствий, вызванных МО, путь усыпан препятствиями. Некоторые из них технические, другие этические; все требуют тщательной навигации.

Качество и дефицит данных

Модели машинного обучения являются «голодными» данными. Исторические наборы данных, хотя часто и большие, также шумные, фрагментарные и предвзятые способами, которые могут вводить в заблуждение модели. Надзорная модель, обученная на нескольких сотнях проверенных записей, может плохо обобщать весь корпус. Кроме того, исторические данные часто не имеют объема, необходимого для глубокого обучения: модель НЛП, которая хорошо работает на современных новостных статьях, может потерпеть неудачу в дневнике 17-го века, потому что словарь и синтаксис слишком разные. Трансферное обучение — предварительная подготовка на больших современных корпусах, а затем тонкая настройка на текстах периода — помогает, но сдвиг домена остается большим. Исследователи должны инвестировать в создание высококачественных меченых подмножеств, часто через краудсорсинг или партнерство с архивными учреждениями.

Усиление качеств

Если исторические данные являются предвзятыми, например, недопредставление женщин, модель ML, обученная на этих данных, узнает, что женщины являются «аномальными» и могут отмечать подлинные женские записи как несоответствия. Это не недостаток алгоритма, а отражение первоначальных предубеждений источника. Риск заключается в том, что исследователи, доверяя модели, могут подвергать цензуре или «корректировать» действительные точки данных, тем самым увековечивая историческое удаление. Стратегии смягчения включают использование алгоритмов, осознающих справедливость, взвешивание данных обучения для отражения известных демографических распределений и всегда рассматривающих модельные флаги как гипотезы, которые должны быть проверены вручную. Этические обзорные комиссии все чаще требуют от историков документировать, как они справляются с такими предубеждениями.

Интерпретируемость и прозрачность

Сложные модели, особенно нейронные сети, работают как черные ящики. Историк должен знать, почему была помечена конкретная запись: была ли это дата, имя, язык? Без интерпретируемости исследователь не может решить, доверять ли флагу. Объясняемые методы ИИ (XAI), такие как SHAP (SHapley Additive exPlanations) и LIME (Local Interpretable Model-agnostic Explanations), могут предоставить объяснения на уровне функций. Например, сюжет SHAP может показать, что флаг возрастной несоответствия был обусловлен в первую очередь полем «год рождения», со вторичным вкладом от «оккупации». Это позволяет историку быстро проверить запись о рождении оригинального документа. Принятие таких инструментов должно быть минимальным стандартом для любого исторического проекта, улучшенного ML.

Этичное обращение с чувствительными данными

Исторические записи часто содержат личную информацию о людях, которые все еще могут иметь живых потомков, или они могут относиться к угнетенным группам (например, рабские регистры, данные колониальной переписи). Использование ML для выявления несоответствий в таких данных может непреднамеренно усиливать стереотипы или вызывать стресс. Исследователи должны консультироваться с сообществами потомков и следовать передовой практике управления данными. Американская историческая ассоциация выпустила руководящие принципы, призывающие к прозрачности в отношении алгоритмических методов и права сообществ накладывать вето на публикацию результатов, полученных из записей их предков. Кроме того, модели никогда не должны использоваться для «корректирования» исторических повествований таким образом, чтобы стереть живой опыт маргинализированных групп - модель должна отмечать потенциальные ошибки, а не переписывать их.

Вычислительные затраты и экспертиза

Обучение сложным моделям ML требует значительных вычислительных ресурсов (GPU, память, хранение) и специализированных знаний, которых не хватает многим историческим отделам. Совместные проекты между историками и компьютерными учеными все чаще встречаются, но они требуют времени, финансирования и взаимопонимания. Инструменты с открытым исходным кодом (см. ]Transkribus для распознавания рукописного текста, Обнимая лицо для NLP) снижают барьер, но потребность в индивидуальном моделировании сохраняется. Область Цифровые гуманитарные науки добилась успехов в подготовке аспирантов как в истории, так и в науке о данных, но многим учреждениям все еще не хватает инфраструктуры для поддержки проектов, основанных на ML, в масштабе.

Будущие направления и последствия

Машинное обучение не является серебряной пулей для обнаружения исторической непоследовательности, но оно быстро становится неотъемлемой частью инструментария историка.

Мультимодальные модели

Будущие системы объединят текст, изображение (почерк, печати, водяные знаки) и даже пространственные данные (координаты ГИС) в единую структуру. Трансформатор, который совместно кодирует латинский текст устава и его изображение печати, может обнаружить поддельную печать, прикрепленную к подлинному акту - распространенное средневековое мошенничество. Ранняя работа в Британском музее показала многообещающие результаты на ассирийских клинописных табличках, связывая текстовые анахронизмы с иконографическими несоответствиями.

Активное обучение и человек в петле

Вместо пассивного принятия флагов модели исследователи принимают активное обучение, где модель запрашивает у историка метки по наиболее неопределенным случаям. Этот итеративный процесс повышает точность модели, сохраняя историка в контроле. Такие системы, как Prodigy для NLP, позволяют такие рабочие процессы, и их применение к историческим данным растет. В одном пилоте модель активного обучения для обнаружения неправильно распределенных букв 18-го века сократила время ручного обзора на 60%, сохраняя точность 95%.

Этический ИИ по дизайну

По мере развития этой области историки и компьютерные ученые совместно разрабатывают инструменты, которые с самого начала учитывают этические соображения. Это включает в себя модули прозрачности, которые заставляют модель выводить объяснения, ограничения справедливости, которые предотвращают усиление исторических предубеждений, и рамки согласия для культурно чувствительных данных. Например, Кельнская цифровая гуманитарная лаборатория разработала «панель справедливости» для исторического демографического анализа, которая визуализирует, как производительность модели варьируется в разных социальных группах.

Генеративные модели исторической реконструкции

Помимо обнаружения, генеративный ИИ может помочь исправить несоответствия, предложив правдоподобные альтернативы. Например, модель может быть обучена генерировать вероятный диапазон отсутствующих дат для поврежденной записи в приходском регистре. Однако это поднимает свой собственный набор этических вопросов: должны ли историки когда-либо «заполнять» прошлое, которое было потеряно? Большинство утверждают, что генеративные выходы никогда не должны быть объединены в исходный набор данных без четкой аннотации, и они лучше всего используются в качестве гипотез для дальнейших архивных исследований, а не в качестве окончательных исправлений.

Заключение

Использование алгоритмов машинного обучения для обнаружения несоответствий в исторических данных является быстро развивающейся областью, которая обладает огромным потенциалом. Автоматически всплывая хронологические противоречия, численные выбросы, текстовые анахронизмы и системные предубеждения, инструменты ML позволяют историкам работать с более крупными, более сложными наборами данных, чем когда-либо прежде, раскрывая ошибки, которые потребовались бы жизни, чтобы найти вручную. Тем не менее, сила этих алгоритмов должна быть использована с осторожностью. Проблемы качества данных, присущие предубеждения, требования интерпретируемости и этические обязательства требуют, чтобы машинное обучение рассматривалось как соавтор, а не оракул. Самые успешные проекты - это те, где историки и ученые данных работают бок о бок, смешивая экспертизу области с алгоритмической точностью. По мере созревания мультимодальных моделей, активного обучения и этики по дизайну рамки, обещание более точного, инклюзивного и прозрачного исторического отчета, обещание более точного, всеобъемлющего и прозрачного исторического суждения, но чтобы увеличить его - гарантируя, что истории, которые мы рассказываем о прошлом, построены на самых надежных основах, которые могут обеспечить