us-history
Использование больших данных для обнаружения скрытых закономерностей в исторических событиях
Table of Contents
Введение
Стык науки о данных и исторического исследования породил новую дисциплину, часто называемую цифровой историей или вычислительной историей. Применяя аналитику больших данных - инструменты, первоначально предназначенные для электронной коммерции, социальных сетей и научных исследований - историки теперь могут обрабатывать и анализировать обширные хранилища оцифрованных источников. Они включают в себя все, от многовековых приходских регистров и переписей, до миллионов газетных страниц, парламентских дебатов и даже архивов социальных сетей за последние два десятилетия. Масштаб и скорость этих анализов позволяют исследователям обнаруживать закономерности, тенденции и корреляции, которые были невидимы для предыдущих поколений ученых, зависящих от ручного чтения и выборки. В этой статье исследуются методы, тематические исследования и последствия использования больших данных для выявления скрытых закономерностей в исторических событиях.
Рост больших данных в исторических исследованиях
Большие данные в историческом контексте относятся к цифровым наборам данных, настолько большим или сложным, что их нельзя легко обрабатывать с помощью традиционных инструментов электронных таблиц или баз данных. Источники разнообразны: оптическое распознавание символов (OCR) позволило оцифровать миллионы книг, журналов и газет; правительства и учреждения выпустили машиночитаемые данные переписи, записи о рождении и смерти и парламентские слушания; и Интернет предоставил беспрецедентное количество личной переписки, общественного дискурса и ephemera. Проекты, такие как ] Google Books Ngram Viewer , предлагают взглянуть на то, как частота слов меняется в течение десятилетий, в то время как более специализированные усилия, такие как Картирование Республики Письм проект в Стэнфордском университете визуализируют корреспондентские сети интеллектуалов Просвещения.
Огромный объем данных — например, Британская библиотека содержит более 40 миллионов газетных страниц с 17 по 20 века — означает, что даже один исследователь может с помощью правильных инструментов оценивать закономерности на протяжении веков, а не ограничиваться несколькими архивами. Этот сдвиг был уподоблен изобретению телескопа в астрономии: он не заменяет близкое чтение, но он раскрывает структуры, невидимые невооруженным глазом. Однако принятие больших данных в истории не было без споров. Критики беспокоятся о потере контекста, риске сокращения человеческого опыта до чисел и потенциале алгоритмов для усиления предубеждений, встроенных в исторические записи.
Ключевые аналитические методы для исторических больших данных
Чтобы извлечь значимые закономерности из исторических больших данных, исследователи используют набор вычислительных методов, адаптированных из информатики, статистики и цифровых гуманитарных наук. Ниже приведены самые известные методы, каждый из которых подходит для различных видов вопросов.
Текстовая добыча и обработка естественного языка (NLP)
Текстовый майнинг включает в себя преобразование неструктурированного текста в структурированные данные, которые могут быть количественно и проанализированы. Общие задачи НЛП, применяемые к историческим текстам, включают моделирование темы, которое автоматически идентифицирует темы по корпусу; названное признание сущности (NER), которое извлекает имена людей, места, организации и даты; и анализ настроений, который измеряет эмоциональный тон пассажей. Например, проводя анализ настроений на десятилетиях газетных передовиц, исследователи могут наметить общественное мнение вокруг ключевых событий, таких как начало войны или принятие основного законодательства. Тематическое моделирование использовалось для отслеживания роста национализма в европейских парламентских дебатах или для выявления сдвигов в медицинском дискурсе в медицинских журналах с 18-го века вперед.
Сетевой анализ
Сетевой анализ отображает отношения между сущностями — людьми, организациями, идеями или даже местами. В исторических исследованиях он особенно эффективен для понимания социальных структур, политических альянсов, научных коллабораций и торговых сетей. Построив сеть букв, например, можно определить, какие фигуры действовали как посредники влияния во время Просвещения или Американской революции. Математик и историк Уильям Плейфэр однажды сказал: «Где есть нация, есть сеть», а современные инструменты, такие как Gephi или Cytoscape, позволяют визуализировать эти связи в масштабе, который Playfair не мог себе представить. Сетевой анализ также показывает «скрытые» узлы — людей, которые могут быть малоизвестными сегодня, но центральное место в исторической сети предполагает, что они были ключевыми в то время.
Пространственный анализ и географические информационные системы (ГИС)
ГИС позволяет историкам размещать данные на картах и анализировать пространственные закономерности во времени. Этот метод использовался для реконструкции распространения Черной смерти по всей Европе, для картирования маршрутов подземной железной дороги и для анализа распределения моделей голосования на выборах в США 19-го века. Пространственный анализ также может объединять несколько слоев — например, наложение данных переписи на карты природных ресурсов для объяснения местоположения промышленных городов. Цифровой атлас римских и средневековых цивилизаций объединяет археологические данные с древними текстовыми ссылками, чтобы показать, как поселения развивались на протяжении веков.
Машинное обучение для обнаружения шаблонов
Помимо простых статистических методов, алгоритмы машинного обучения могут идентифицировать сложные, неочевидные закономерности в исторических данных. Алгоритмы кластеризации группируют похожие исторические события или документы без предварительных ярлыков — полезны для обнаружения ранее непризнанных категорий социального протеста или литературных жанров. Обнаружение аномалий может выявить выбросы, такие как необычные скачки цен на средневековых зерновых рынках, которые совпадают с голодом или восстаниями. Более продвинутые подходы, такие как глубокое обучение, теперь применяются к распознаванию рукописного текста (HTR) для оцифровки рукописей, которые сопротивляются OCR, открывая коллекции ранних современных писем, дневников и церковных записей, которые ранее были доступны только палеографам.
Тематические исследования раскрытия скрытых шаблонов
Следующие примеры иллюстрируют, как методы больших данных выявили закономерности, которые традиционная историография могла пропустить или только намекнуть на них.
Раскрытие изменений в общественных настроениях через архивы газет
Одним из наиболее продуктивных направлений был анализ крупных газетных корпусов. В Британском архиве газет, например, содержится более 40 миллионов страниц, охватывающих три столетия. Исследователи из Университета Сассекса использовали моделирование тем и анализ настроений в ирландских газетах с 1790 по 1900 год для отслеживания изменения отношения к эмиграции. Они обнаружили, что язык сместился от описания эмиграции как формы изгнания в начале 19-го века к рассчитанному экономическому решению к 1880-м годам — переход, который произошел раньше, чем предполагали обычные исторические отчеты. Аналогичным образом, исследование американских газет в период гражданской войны показало, что язык гнева и отчаяния резко возрос в пограничных штатах за месяцы до того, как эквивалентные всплески появились в глубине Юга, предлагая более подробное представление о том, как местные условия формировали национальное настроение.
Картографирование социальных сетей исторических фигур
Проект «Шесть степеней Фрэнсиса Бэкона» (название, относящееся к знаменитой концепции «шесть степеней разделения») использовал сетевой анализ для реконструкции социальных связей ранних современных английских интеллектуалов. Путем добычи писем, посвящений и списков членов Королевского общества проект показал, что Маргарет Кавендиш, философ 17-го века и писатель, была гораздо более связана с ведущими мыслителями, чем считалось ранее, бросая вызов ее репутации как изолированного эксцентрика. Другой сетевой анализ подписавших Декларацию независимости показал, что, хотя Томас Джефферсон не был самым центральным узлом в сетях переписки, он служил мостом между южными и северными колониями — позиция, которая могла повлиять на его роль в разработке Декларации.
Анализ долгосрочных экономических данных
Экономические историки долго работали с количественными данными, но большие данные расширили их сферу применения. Группа Global Price and Income History Group собрала базу данных о заработной плате и ценах за 600 лет из десятков городов. Применяя кластеризацию и анализ временных рядов, исследователи определили «малую дивергенцию» — период между 1500 и 1800 годами, когда северо-западная Европа начала экономически отходить от юга и востока. Эта картина не была видна ни в одной городской документации, но появилась только тогда, когда все данные были объединены и исследованы на предмет общности. Аналогично, исследование средневековых английских манориальных записей (теперь оцифрованных) использовало машинное обучение для классификации сотен тысяч записей о урожайности зерна, показывая, что неурожаи часто группировались в определенные годы, которые коррелировали с вулканическими извержениями, зарегистрированными в ледяных кернах — связь, которую не мог сделать ни один средневековый летописец.
Восстановление вспышек болезней из исторических записей
Эпидемиология является естественным партнером для исторических больших данных. В 2020 году группа историков и ученых оцифровала тысячи записей о захоронениях из лондонских приходов 17-го века и использовала ГИС для картирования распространения Великой чумы 1665 года. Они обнаружили, что инфекция не перемещалась равномерно из центра города в приход вдоль торговых путей; вместо этого она перескакивала из прихода в приход вдоль торговых путей, а некоторые районы действовали как «суперпроповедники» из-за их концентрации гостиниц и рынков. Этот анализ не только исправлял более ранние карты, основанные на анекдотических отчетах, но и предлагал идеи, которые могли бы информировать современную готовность к пандемии гриппа 1918 года в 30 городах США и, путем кластеризации, определил, что города с более ранними нефармацевтическими вмешательствами (например, закрытие школ) имели значительно иную картину смертности - находка, которая была приведена в недавних дебатах о здравоохранении.
Проблемы и ограничения
Несмотря на свои обещания, использование больших данных в истории чревато методологическими и этическими проблемами. Во-первых, качество данных редко бывает идеальным. Ошибки ОКР могут искажать результаты интеллектуального анализа текста; например, один искаженный персонаж в газетной статье может изменить оценку настроения целого года корпуса. Историки должны тщательно очищать и проверять свои наборы данных, часто требуя ручной проверки выборки. Во-вторых, доступные данные часто искажены: то, что было оцифровано и приоритетно, имеет тенденцию отражать интересы богатых учреждений, колониальных держав или нынешних политических мод. Например, европейские архивы гораздо более оцифрованы, чем африканские или азиатские, что может привести к предвзятому глобальному повествованию.
В-третьих, корреляция не является причинно-следственной связью. Большие данные могут показать, что две тенденции движутся вместе — скажем, рост реформ правописания и снижение религиозных ссылок — но объяснение требует исторического контекста. Без него анализ рискует стать «артефактом интеллектуального анализа данных», который переворачивает шаблоны к шуму. Наконец, проблемы конфиденциальности возникают при работе с личными данными 20-го века. Исторические архивы социальных сетей, например, могут содержать информацию о живых людях или их непосредственных потомках. Исследователи должны ориентироваться в советах по этике и протоколах анонимизации, уравновешивая ценность открытых данных с уважением к конфиденциальности.
Будущее больших данных в истории
Заглядывая вперед, интеграция больших данных с машинным обучением - особенно с крупными языковыми моделями (LLM), такими как GPT - предлагает соблазнительные возможности. LLM могут обобщать исторические тексты, генерировать гипотезы или даже моделировать «контрфактические» исторические сценарии, обучаясь на больших корпусах условных утверждений. Однако эти модели также усиливают существующие предубеждения и могут создавать правдоподобные, но ложные повествования, поэтому историкам нужно будет поддерживать критическую позицию.
Еще одним рубежом является слияние исторических данных с другими научными областями. Историческая климатология, например, объединяет данные о кольцах деревьев, ледяных кернах и исторических дневниках погоды для реконструкции прошлого климата. Слив их с экономическими записями, исследователи могут моделировать, как климатические потрясения вызвали голод или миграции. Археология тоже становится управляемой данными: сканирование лидаров выявило целые города майя, скрытые под пологами джунглей, в то время как датирование углерода и анализ ДНК интегрируются в статистические модели перемещения населения.
По мере того, как эти инструменты становятся более доступными, мы можем наблюдать демократизацию исторических исследований, где любители генеалогии или местные исторические общества могут применять те же алгоритмы, что и университеты. Однако риск - это новая форма цифрового разрыва - между теми, у кого есть технические навыки и вычислительные ресурсы, и теми, у кого их нет. Чтобы гарантировать, что большие данные обогащают, а не искажают наше понимание прошлого, историки должны продолжать заниматься этическими, эпистемологическими и практическими аспектами своей работы.
Заключение
Применение больших данных к историческим исследованиям не является заменой традиционному ремеслу историка — это расширение. Раскрывая скрытые закономерности в чувствах, сетях, пространстве и времени, оно позволяет нам задавать новые вопросы и подтверждать или оспаривать старые нарративы. Примеры, обсуждаемые здесь — от смещения ирландской эмиграционной риторики до распространения чумы в Лондоне — демонстрируют, что невидимые для отдельного исследователя закономерности могут возникнуть из коллективного веса данных. По мере развития технологий диалог между количественными методами и качественной интерпретацией будет только становиться более важным. Цель состоит в том, чтобы не позволить алгоритмам рассказать нам, что произошло, а дать возможность историкам увидеть связи, которые ждали, иногда на протяжении веков, чтобы быть раскрытыми. Ответственное использование больших данных в сочетании с тщательным историческим мышлением обещает переписать наше понимание человеческой истории — один шаблон за раз.