Table of Contents

Аналитика больших данных переопределяет, как историки изучают прошлое

Исторические исследования долгое время опирались на тщательное чтение архивов, писем и официальных записей. На протяжении веков ремесло историка сосредоточилось на тщательном анализе относительно небольших наборов документов, выводов из того, что один ученый мог разумно прочитать за всю жизнь. Эта парадигма резко изменилась. Рост оцифрованных архивов в сочетании с мощными аналитическими инструментами теперь позволяет исследователям обрабатывать миллионы страниц текста, картировать века демографических сдвигов и прослеживать сложные сети влияния на протяжении целых эпох. Эта трансформация представляет собой одно из самых значительных методологических изменений в дисциплине с момента профессионализации самой истории.

Аналитика больших данных не заменяет тщательную интерпретацию историков. Вместо этого она усиливает их способность видеть шаблоны, которые были бы невидимы для любого отдельного читателя. Применяя вычислительные методы к обширной совокупности исторического материала, исследователи могут задавать новые вопросы, проверять давние предположения и раскрывать связи, которые меняют наше понимание прошлого. В этой статье рассматриваются инструменты, приложения, преимущества и проблемы использования аналитики больших данных в крупномасштабных исторических исследованиях, опираясь на текущие исследования и реальные примеры.

Что такое аналитика больших данных в историческом контексте?

Аналитика больших данных относится к систематическому изучению больших, сложных наборов данных с использованием вычислительных методов для выявления закономерностей, корреляций и тенденций.В контексте исторических исследований эти наборы данных обычно включают оцифрованные книги, газеты, перепись, записи переписи, реестры имущества, судебные документы и другие первичные источники, которые были преобразованы в машиночитаемые форматы.

Ключевые характеристики больших данных в истории отражают те, что в других областях: объем (терабайты или петабайты текста), скорость (потоки недавно оцифрованного материала) и разнообразие (структурированные данные, такие как таблицы переписи наряду с неструктурированным текстом). Однако исторические большие данные представляют собой уникальные проблемы. Источники часто неполные, непоследовательные по формату и сформированные предубеждениями их первоначальных создателей. Исторические наборы данных также требуют тщательной интерпретации контекста, датировки, происхождения и развивающегося значения языка с течением времени.

Аналитические методы, обычно применяемые в исторических проектах больших данных, включают обработку естественного языка для интеллектуального анализа текста, геопространственный анализ для картирования исторических изменений, сетевой анализ для изучения отношений и влияния, статистическое моделирование для экономических и демографических моделей и алгоритмы машинного обучения для классификации и обнаружения шаблонов в крупных корпусах.

Цифровая трансформация исторических исследований

Переход к вычислительной истории произошел не в одночасье. Он начался с ранних попыток оцифровать архивные справочники и каталоги записей в 1980-х и 1990-х гг. Крупные инициативы, такие как инициатива кодирования текста и рост цифровых гуманитарных центров, заложили основу для более амбициозных проектов. Массовая оцифровка книг Google Books, начатая в 2004 году, и распространение оцифровки газет через такие платформы, как Chronicling America в Библиотеке Конгресса создали корпуса беспрецедентного масштаба.

Эти цифровые хранилища открыли двери для вычислительного анализа. Исследователи могли внезапно искать миллионы страниц по конкретным терминам, отслеживать частоту идей с течением времени и сравнивать использование языка в разных регионах и десятилетиях. Публикация таких инструментов, как Google Ngram Viewer в 2010 году, позволила любому изучить тенденции частоты слов в опубликованных книгах за столетия. Академические лаборатории разработали более сложные инструменты для моделирования тем, анализа настроений и распознавания имен с учетом исторических текстов.

Некоторые области, такие как экономическая история и историческая демография, долгое время использовали количественные методы и быстро адаптировались. Другие, включая интеллектуальную историю и историю культуры, первоначально сопротивлялись вычислительным подходам, но все чаще включают цифровые методы. Пандемия COVID-19 ускорила усилия по оцифровке в архивах по всему миру и подтолкнула больше историков к взаимодействию с цифровыми инструментами из необходимости, создавая длительные изменения в исследовательской практике.

Ключевые приложения аналитики больших данных в истории

Спектр приложений для анализа больших данных в исторических исследованиях широк и быстро растет. В следующих разделах описываются наиболее заметные области работы, примеры которых взяты из текущих исследовательских проектов.

Текстовая добыча и языкознание Corpus

Текстовый майнинг позволяет историкам анализировать языковые шаблоны в огромных коллекциях документов.Применяя методы обработки естественного языка к оцифрованным текстам, исследователи могут отслеживать появление и упадок концепций, выявлять сдвиги в риторическом стиле и количественно оценивать изменения в использовании слов, которые отражают более широкие культурные или политические преобразования.

Один из влиятельных примеров взят из области концептуальной истории. Исследователи из таких институтов, как проект «Культура знаний» в Оксфордском университете использовали текстовый майнинг для изучения эволюции научного языка в ранних современных сетях переписки. Анализируя буквы фигур, таких как Фрэнсис Бэкон и Джон Локк, наряду с тысячами менее известных корреспондентов, они нанесли на карту, как термины «эксперимент» и «наблюдение» приобрели известность и изменили значение во время научной революции.

Другим крупным приложением является анализ настроений, где алгоритмы оценивают эмоциональный тон текстов.Историки применили анализ настроений к коллекциям личных писем, дневниковых записей и газетных статей для отслеживания общественного настроения в периоды кризисов, таких как войны или экономические депрессии.В то время как анализ настроений остается несовершенным для исторических текстов из-за сдвигов в языке и культурном выражении, он предлагает полезную отправную точку для крупномасштабной эмоциональной истории.

Тематическая модель для тематического открытия

Тематическая модель - это метод интеллектуального анализа текста, который автоматически идентифицирует кластеры сопутствующих слов в корпусе, предлагая основные темы или темы. Историки используют тематические модели для изучения содержимого больших архивов, не читая каждый документ. Например, исследователь, изучающий газеты девятнадцатого века, может запустить тематическую модель на миллионах статей, чтобы определить наиболее обсуждаемые вопросы в течение десятилетий, а затем углубиться в конкретные темы, представляющие интерес.

Этот подход был применен к Old Bailey Proceedings, оцифрованному архиву почти 200 000 уголовных процессов из Лондона, охватывающих 1674-1913 гг. Тематическое моделирование выявило закономерности в том, как преступность, наказание и социальные отношения менялись с течением времени, предлагая понимание взаимосвязи между юридическим языком и общественной моралью, которые невозможно было бы извлечь из одного только близкого чтения.

Геопространственный анализ и историческое картирование

Географические информационные системы стали важнейшими инструментами для историков, изучающих пространственные закономерности.Закодировав исторические места с карт, записей о собственности и учетных записей о путешествиях в геопространственные базы данных, исследователи могут визуализировать, как менялись с течением времени ландшафты, поселения, границы и модели движения.

Крупные проекты, такие как модель ORBIS из Стэнфордского университета, реконструируют транспортные сети Римской империи, позволяя ученым вычислять время и затраты на поездки по древнему миру. Этот геопространственный подход изменил понимание римской торговли, связи и военной логистики. Аналогично, цифровой археологический атлас Святой Земли предоставляет пространственно ссылочные данные о моделях поселений, позволяя исследователям анализировать изменения населения и землепользования на протяжении тысячелетий.

Геопространственные большие данные также поддерживают исследования о вынужденной миграции, диаспорских сообществах и экологической истории человеческой деятельности.Объединив судовые манифесты, записи переписи и данные о землевладении с географическими координатами, историки могут проследить движение порабощенных людей, иммигрантов и беженцев в масштабе и точности, ранее недостижимых.

Сетевой анализ исторических отношений

Сетевой анализ отображает связи между отдельными лицами, организациями или учреждениями, выявляя структуры влияния, сотрудничества и конфликта.В исторических исследованиях эти сети обычно реконструируются из переписки, списков членов, шаблонов цитирования и других реляционных данных, найденных в архивах.

Знаковым проектом в этой области является Шесть степеней Фрэнсиса Бэкона, который реконструирует социальную сеть ранних современных интеллектуалов. Анализируя тысячи писем и посвящений, проект отображает, как такие фигуры, как Фрэнсис Бэкон, Томас Гоббс и Джон Донн, были связаны через общих корреспондентов, покровителей и институциональные принадлежности. Полученная визуализация раскрывает плотную, часто удивительную сеть отношений, которые сформировали интеллектуальную культуру того периода.

Сетевой анализ также применялся к политической истории, картируя связи между членами революционных собраний, парламентских фракций и дипломатических сетей.Эти исследования могут выявить ключевых брокеров, измерить сплоченность политических групп и отследить, как сдвигались альянсы в периоды потрясений. Особенно силен подход в сочетании с текстовым майнингом: исследователи могут анализировать как тех, кто с кем переписывался, так и то, о чем писали, соединяя структуру и содержание.

Количественная экономическая и демографическая история

Историческая экономика и демография десятилетиями использовали количественные методы, но масштаб имеющихся сейчас данных чрезвычайно расширил возможности.Исследователи могут анализировать миллионы отдельных записей из переписей, налоговых регистров, приходских записей и прайс-листов, чтобы реконструировать экономические условия, динамику населения и уровень жизни в течение длительных промежутков времени.

Работа экономических историков, таких как Томас Пикетти, который использовал налоговые записи, охватывающие несколько веков, для документирования долгосрочных тенденций в неравенстве богатства, иллюстрирует силу крупномасштабного количественного анализа.Такие проекты, как Global Price and Income History Group, собирают данные о ценах и заработной плате из десятков стран, позволяя сравнительное исследование экономического развития на континентах и в эпохи.

Демографические историки использовали оцифрованные записи регистрации актов гражданского состояния для отслеживания рождаемости, брака и смертности с беспрецедентным разрешением.В Швеции Сканианская экономическая демографическая база данных содержит более 2 миллионов записей индивидуального уровня, охватывающих 17-19 века, что позволяет детально анализировать демографические реакции на экономические потрясения, эпидемии и изменения политики.Эти результаты информируют не только историческое понимание, но и современные дебаты о динамике населения и общественном здравоохранении.

Преимущества аналитики больших данных для исторических исследований

Интеграция аналитики больших данных дает существенные преимущества, которые расширяют охват и строгость исторической науки.

Масштаб доказательств:] Вычислительные методы позволяют историкам основывать утверждения на гораздо более крупных доказательных базах, чем мог обработать любой читатель.Аргументы, которые ранее поддерживались несколькими десятками репрезентативных примеров, теперь могут быть проверены на основе тысяч или миллионов соответствующих документов.

Обнаружение шаблонов:] Алгоритмы преуспевают в поиске тонких шаблонов в больших наборах данных, которые пропустят читатели. Это включает тенденции в использовании слов, структурные сходства между документами, корреляции между экономическими и культурными переменными и долгосрочными циклами в социальном поведении.

Генерация гипотез: Анализ исследовательских данных с использованием методов больших данных может выявить неожиданные закономерности, которые приводят к новым исследовательским вопросам. Тематическая модель архива газеты может выявить ранее упущенные дебаты; визуализация сети может определить ключевого посредника, роль которого была забыта в более поздних отчетах.

Связь с различными источниками: Аналитика больших данных делает практичным интеграцию информации из многих различных типов источников.Исследование политических движений может объединять газетные статьи, отчеты о полицейском надзоре, личную переписку и записи голосования, используя вычислительные методы для связи упоминаний об одних и тех же событиях, людях и местах через эти разрозненные материалы.

Перепроизводимость и прозрачность:] Вычислительные рабочие процессы могут быть документированы и совместно использованы, что позволяет другим исследователям копировать или критиковать результаты. Это представляет собой переход к более строгим и прозрачным практикам в исторических исследованиях, которые традиционно опирались на непроверяемый опыт отдельных ученых.

Проблемы и соображения

Несмотря на свой потенциал, аналитика больших данных в истории представляет собой огромные проблемы, с которыми исследователи должны тщательно ориентироваться.

Качество данных и критика источников

Исторические данные никогда не бывают чистыми. Оцифровка вводит ошибки через ошибки оптического распознавания символов, неполные метаданные и непоследовательное форматирование. Сами оригинальные источники формируются предубеждениями, упущениями и условностями их создателей. Записи переписи могут недооценивать маргинализированные группы населения; освещение в газетах отражает редакционные приоритеты; личные письма пишутся с учетом конкретной аудитории.

Вычислительный анализ может усугубить эти проблемы, если исследователи не будут учитывать их. Алгоритм, обученный на нерепрезентативных данных, будет давать нерепрезентативные результаты. Историки, работающие с большими данными, должны применять ту же критику источников, которую они будут использовать на любом документе, но адаптированный к масштабу и сложности цифровых коллекций. Это часто требует сотрудничества между экспертами по доменам и учеными-данными.

Этические проблемы и культурная чувствительность

Оцифровка архивных материалов поднимает этические вопросы о неприкосновенности частной жизни, согласии и культурной власти.Многие исторические записи содержат информацию о живых людях или их близких потомках.Архивы колониальных администраций, миссионерских обществ и других учреждений могут содержать материалы, которые общины считают чувствительными или которые были собраны в условиях принуждения.

Исследователи, использующие аналитику больших данных, должны учитывать, уважает ли их работа достоинство людей, представленных в данных, и может ли это нанести вред. Например, общины коренных народов выразили обеспокоенность по поводу оцифровки останков предков, священных предметов и церемониальных знаний. Этическая практика в цифровой истории требует постоянных консультаций с заинтересованными сторонами сообщества и тщательного внимания к управлению данными.

Технический разрыв в навыках

Большинство историков обучаются текстовому анализу, архивным исследованиям и интерпретационным аргументам, а не программированию, статистике или управлению данными. Технические требования аналитики больших данных могут создавать барьеры для входа и углублять неравенство между хорошо обеспеченными ресурсами учреждениями и теми, у кого меньше технологических возможностей.

Для устранения этого разрыва необходимы изменения в подготовке выпускников, разработка удобных для пользователей аналитических инструментов, предназначенных для историков, и совместных моделей, где эксперты в области работают вместе с вычислительными специалистами. Несколько крупных инициатив, включая Летний институт цифровых гуманитарных наук и Институт цифровых стипендий либеральных искусств, предоставляют учебные программы, направленные на формирование этих навыков среди ученых-гуманитариев.

Алгоритмические предубеждения и интерпретационные пределы

Алгоритмы не нейтральны. Они кодируют предположения о том, как данные должны быть структурированы, какие шаблоны имеют значение и какие категории имеют значение. Модели машинного обучения, обученные на исторических текстах, наследуют предубеждения, присутствующие в этих текстах. Алгоритм, обученный на корпусе медицинских журналов девятнадцатого века, будет воспроизводить расовые и гендерные предположения той эпохи, если исследователи явно не учитывают их.

Более того, вычислительные методы могут отвечать только на определенные вопросы. Они лучше подходят для выявления закономерностей, чем для объяснения того, почему эти закономерности существуют. Интерпретационная работа по пониманию человеческих мотивов, культурных смыслов и исторических обстоятельств по-прежнему требует суждения и контекстуальных знаний подготовленных историков. Аналитика больших данных - это инструмент, а не замена историческому мышлению.

Методологические рамки для вычислительной истории

Успешная интеграция анализа больших данных в исторические исследования зависит от надежной методологии. Появилось несколько рамок, которые направляют исследователей в разработке и оценке вычислительных проектов.

Дистанционное чтение:] В книге, написанной литературоведом Франко Моретти, описывается практика анализа литературы не путем внимательного чтения отдельных текстов, а путем изучения закономерностей в больших коллекциях.Подход широко используется в исторических исследованиях, особенно для изучения жанра, темы и языковых изменений на протяжении веков опубликованного материала.

Масштабируемое чтение:] Утончение дистанционного чтения, масштабируемое чтение перемещается между макроуровневым анализом крупных тел и микроуровневым близким чтением конкретных документов. Исследователь может использовать моделирование темы для идентификации соответствующих текстов в массивном архиве, а затем читать эти тексты близко, чтобы понять их значение. Это итеративное движение между шкалами позволяет вычислительным методам направлять, а не заменять традиционную интерпретирующую работу.

Смешанные методы: Многие историки, работающие с большими данными, объединяют количественный анализ с качественными тематическими исследованиями, архивными исследованиями и историей повествования. Изучение политического языка в парламенте может использовать текстовый майнинг для отслеживания частоты ключевых терминов на протяжении десятилетий, а затем детально изучить конкретные дебаты, чтобы понять, как эти термины были развернуты в контексте. Смешанные методы сохраняют сильные стороны как вычислительных, так и традиционных подходов.

Тематические исследования в вычислительной истории

Несколько знаковых проектов иллюстрируют мощь и сложность анализа больших данных в исторических исследованиях.

История эмоций: Международный исследовательский проект, основанный в Австралийском национальном университете, использовал текстовую добычу для анализа эмоционального выражения в тысячах исторических текстов от средневековья до двадцатого века.Отслеживая частоту слов, связанных с конкретными эмоциями, такими как страх, гнев и радость, проект задокументировал долгосрочные сдвиги в эмоциональных нормах и их связь с культурными, религиозными и политическими изменениями.

Картографирование Республики Письм: Этот масштабный проект в Стэнфордском университете реконструировал корреспондентские сети интеллектуалов Просвещения, включая Вольтера, Бенджамина Франклина и мадам дю Шатле. Объединив сетевой анализ с геопространственной визуализацией, проект показал, как знания циркулировали через неформальные сети писем, формируя развитие идей через национальные границы. Публично доступные данные и визуализации проекта стали моделью для цифровой гуманитарной работы.

The Trans-Atlantic Slave Trade Database: Всеобъемлющая база данных, документирующая почти 36 000 путешествий, которые перевозили порабощенных африканцев в Америку между 1500 и 1866 годами. Проект объединяет данные из архивов по всему миру, включая судовые манифесты, журналы и юридические записи. Исследователи могут анализировать масштаб, направление и организацию работорговли с точностью, невозможной до оцифровки. База данных стала важным ресурсом для историков, изучающих рабство, принудительную миграцию и африканскую диаспору.

Будущие перспективы и новые направления

Интеграция аналитики больших данных в исторические исследования все еще находится на ранних стадиях. Несколько новых тенденций указывают на то, как будет развиваться эта область в ближайшие годы.

Машинное обучение и распознавание образов:] Достижения в машинном обучении, особенно глубоком обучении для анализа текста и распознавания изображений, расширят типы исторических источников, которые могут быть проанализированы вычислительно. Исследователи уже используют нейронные сети для расшифровки рукописных документов, которые бы победили традиционное оптическое распознавание символов. Инструменты анализа изображений могут извлекать информацию из карт, фотографий и иллюстраций. Эти возможности откроют обширные архивы ранее недоступных материалов.

Связанные данные и семантическая интеграция: Усилия по созданию связанных открытых данных для исторической информации позволят исследователям связать наборы данных из разных проектов и учреждений. Историк, изучающий конкретный регион, мог бы объединить данные переписи, записи о собственности, газетные архивы и сети переписки в единую аналитическую структуру. Потенциал для открытия и анализа перекрестного сбора огромен.

Совместная инфраструктура:] Масштабный исторический анализ все больше зависит от общей инфраструктуры, включая цифровые хранилища, вычислительные платформы и стандарты для обмена метаданными и данными. Инициативы, подобные европейскому проекту Time Machine, который направлен на создание цифровой информационной системы для европейского культурного наследия, представляют собой амбициозные усилия по созданию совместной инфраструктуры, которая требует вычислительной истории.

Публичная история и доступ:] Аналитика больших данных также имеет последствия для публичной истории. Интерактивные визуализации, цифровые экспонаты и онлайн-платформы позволяют широкой аудитории исследовать исторические закономерности. Такие проекты, как Американская панорама в Университете Ричмонда, используют геопространственные данные для создания убедительных визуальных повествований об исторических изменениях. Эти инструменты могут сделать исторические исследования более доступными и привлекательными для неспециализированной аудитории.

Критические исследования данных: По мере того, как вычислительные методы становятся все более важными для исторических исследований, область также разрабатывает критическую перспективу использования данных. Ученые изучают, как решения оцифровки формируют то, что мы можем знать о прошлом, как алгоритмические методы кодируют предположения и как цифровой разрыв влияет на историю, чьи истории изучаются. Эта рефлексивная практика необходима для обеспечения того, чтобы аналитика больших данных служила, а не искажала историческое понимание.

Заключение

Аналитика больших данных создала новые возможности для исторических исследований, которые еще поколение назад были невообразимы. Историки теперь могут анализировать тексты, отслеживать движения, соотносить карты и проверять гипотезы в масштабе, который коренным образом меняет то, какие вопросы можно задавать и какие ответы можно найти. Самые богатые результаты приходят от интеграции вычислительного анализа с тщательной критикой источников, навыками интерпретации и четким осознанием пределов и предположений, встроенных в любой метод или набор данных.

Трансформация истории с помощью больших данных — это не замена традиционных методов, а расширение инструментария историка. Она позволяет ученым перемещаться между микро и макросом, конкретным документом и массивным корпусом, индивидуальной историей и структурным шаблоном. Для того, чтобы область реализовала свой полный потенциал, историки должны продолжать развивать технические навыки, этические рамки и совместные структуры, которые будут поддерживать строгие и ответственные вычислительные исследования. Прошлое никогда не было более доступным или более сложным, а инструменты для его понимания продолжают оттачиваться.