Введение

Историки долгое время полагались на архивные записи, личные письма и правительственные документы для реконструкции прошлого. Но огромный объем неоцифрованных материалов, разбросанных по библиотекам, музеям и частным коллекциям, сделал всесторонний анализ медленным и дорогим. В последнее десятилетие появилось мощное решение: краудсорсинг. Приглашая общественность вносить вклад во время, навыки и местные знания, исследователи трансформируют то, как собираются, транскрибируются и интерпретируются исторические данные. Этот подход не только ускоряет исследования, но и демократизирует процесс, превращая историю в совместное предприятие, к которому может присоединиться любой. От морских погодных журналов до средневековых рукописей краудсорсинг стал движущей силой в вычислительной истории, позволяя исследования, которые когда-то были невозможны.

Сдвиг обусловлен растущей доступностью цифровых инструментов и платформ, которые снижают барьеры для участия. По мере того, как все больше учреждений культурного наследия открывают свои коллекции в Интернете, потенциал для крупномасштабного участия добровольцев растет. В этой статье исследуется, как краудсорсинг работает в исторических исследованиях, его преимущества и проблемы, и как он меняет область вычислительной истории. Мы рассмотрим крупные проекты, роль искусственного интеллекта, этические соображения и будущее этого динамичного подхода к пониманию нашего общего прошлого.

Что такое краудсорсинг в исторических исследованиях?

Краудсорсинг использует коллективные усилия большой группы людей, как правило, через онлайн-платформы, для выполнения задач, требующих человеческого суждения, распознавания образов или контекстного понимания. В исторических исследованиях эти задачи включают в себя расшифровку рукописных документов, геотегирование старых фотографий, категоризацию археологических артефактов или идентификацию имен и дат в переписных записях. В отличие от традиционной гражданской науки, которая часто фокусируется на естественных науках, исторический краудсорсинг привлекает добровольцев в гуманитарных науках, прося их разблокировать данные из первичных источников, с которыми не может справиться оптическое распознавание символов (OCR).

Процесс обычно включает в себя веб-интерфейс, где добровольцы просматривают сканированное изображение и вводят соответствующую информацию. Механизмы контроля качества, такие как требование нескольких транскрипций для одного и того же элемента или экспертной оценки, помогают обеспечить точность. Организаторы проекта могут затем агрегировать результаты в структурированные наборы данных для количественного анализа, картирования или интеллектуального анализа текста. Это сочетание человеческого понимания и цифровой инфраструктуры породило такие области, как «история больших данных» и «цифровые гуманитарные науки», где вклады с помощью краудсорсинга составляют основу крупномасштабных исследований. Все большее число учреждений используют гибкие системы управления контентом, такие как Directus для управления курируемыми наборами данных, которые появляются из этих проектов, позволяя исследователям запрашивать, фильтровать и делиться результатами в режиме реального времени.

Рост вычислительной истории

Вычислительная история применяет методы из науки о данных, статистики и машинного обучения к историческим источникам. Но эти методы зависят от чистых, структурированных данных, и большая часть исторической записи существует только в аналоговой форме или в виде необработанных сканов. Краудсорсинг заполняет этот пробел, превращая аналоговые источники в машиночитаемые данные за небольшую часть стоимости найма профессиональных архивистов. Например, проект FLT:0] Старая погода превратил тысячи рукописных судовых журналов 19-го и 20-го веков в климатические данные, используемые для моделирования исторических погодных условий. Без добровольцев усилия заняли бы десятилетия. Поскольку все больше учреждений принимают политику открытого доступа, потребность в краудсорсинге для оцифровки и обогащения своих коллекций только растет.

Историки вычислительной техники также полагаются на обработку естественного языка и сетевой анализ для извлечения закономерностей из транскрибируемых текстов. Наборы данных с помощью краудсорсинга позволили изучать все, начиная от распространения идей в переписке с Просвещением и заканчивая эволюцией сельскохозяйственных практик в колониальных записях. Синергия между транскрипцией человека и вычислительным анализом приводит к новой волне исследований, которая сочетает традиционные исторические методы с исследованием, основанным на данных.

Преимущества краудсорсинга для исторических исследований

Вовлечение общественности в работу с историческими данными дает множество преимуществ, которые выходят за рамки простой экономии средств.

  • Масштабируемость: Один онлайн-проект может включать тысячи добровольцев, работающих одновременно, резко увеличивая объем данных, которые могут быть обработаны в короткие сроки. FamilySearch Indexing переписали миллиарды генеалогических записей с помощью более миллиона участников. Масштаб невозможно достичь только с помощью традиционной профессиональной транскрипции.
  • Повышенная точность за счет избыточности:] Когда несколько добровольцев транскрибируют один и тот же документ, расхождения могут быть решены путем голосования или экспертного обзора. Эта избыточность может привести к ошибкам, сопоставимым или лучше, чем у профессиональных транскриберов, особенно для сложного почерка или неясной терминологии. Многие проекты устанавливают цель от трех до пяти транскрипций на страницу, чтобы обеспечить высокую точность.
  • Краудсорсинговые местные знания: Волонтеры часто приносят специализированные знания о своих собственных сообществах, помогая идентифицировать людей, места и события, которые были бы непрозрачными для далеких исследователей. Например, местные историки могут распознавать фамилии, ориентиры или диалектные термины в старых записях. Этот контекстный интеллект особенно ценен для интерпретации региональных вариаций в соглашениях о правописании или именовании.
  • Участие общественности и образование: Участники получают практический опыт работы с историческими источниками и узнают о методах исследования. Многие проекты включают форумы, учебные пособия и таблицы лидеров, которые поддерживают интерес и создают чувство сообщества. Это взаимодействие может перевести в поддержку архивов и музеев, а также повышение общественной грамотности о том, как строится история.
  • Экономическая эффективность: Краудсорсинг снижает потребность в дорогостоящих услугах транскрипции или временных помощниках по исследованиям. В то время как проекты по-прежнему требуют финансирования для разработки платформы и координации, окупаемость инвестиций с точки зрения полученных данных может быть на порядок выше, чем традиционные подходы. Гранты от таких агентств, как Национальный фонд гуманитарных наук и Европейский исследовательский совет, все чаще поддерживают эти модели.

Известные краудсорсинговые проекты в истории

Несколько знаковых проектов демонстрируют широту и влияние исторического краудсорсинга. Каждый из них внес уникальные наборы данных, которые имеют передовые знания в своих областях.

Старая погода

Старая погода, запущенная в 2010 году, приглашает добровольцев расшифровать наблюдения за погодой из Королевского флота и журналов китобойных судов, датируемых 1700-ми годами. Данные помогают климатологам реконструировать исторические атмосферные условия до того, как существовали современные метеорологические станции. На сегодняшний день более 30 000 добровольцев внесли более 1,6 миллиона транскрипций, причем многие журналы были завершены несколько раз для точности. Проект представляет собой сотрудничество между Метеорологическим управлением Великобритании, Национальным архивом и Оксфордским университетом. Полученные климатические модели проинформировали об исследованиях всего, от арктического льда до частоты штормов в Северной Атлантике. Узнайте больше на [[FLT: 2]]oldweather.org [[FLT: 3]].

Транскрипт Бентам

Основанный в Университетском колледже Лондона, Transcribe Bentham просит добровольцев расшифровать неопубликованные труды философа и реформатора Джереми Бентама (1748-1832). Проект использует специальную платформу транскрипции со встроенной функцией «разговора» для добровольцев, чтобы обсудить трудные отрывки. Более 25 000 страниц рукописи были расшифрованы, многие из них были написаны основной группой преданных энтузиастов. Полученные тексты были использованы для цифровых изданий и научного анализа, обеспечивая понимание идей Бентама по праву, политике и этике. Проект также разработал широко используемый инструмент транскрипции с открытым исходным кодом, который приняли другие учреждения. Посетите blogs.ucl.ac.uk/transcribe-bentham для деталей.

Zooniverse и исторические проекты

Zooniverse, крупнейшая в мире платформа для исследований на основе людей, содержит многочисленные исторические проекты. Примеры включают в себя Дневник операции , который привлекает добровольцев к расшифровке дневников подразделений Первой мировой войны; Измерение ANZACs , который захватывает данные из военных записей Новой Зеландии; и Древние жизни , который помогает классифицировать фрагменты греческих папирусов. Zooniverse предоставляет стандартизированный интерфейс и инструменты сообщества, которые облегчают исследователям запуск новых инициатив. Платформа также предлагает встроенные функции экспорта данных, часто интегрируясь с API, которые позволяют исследователям тянуть структурированные данные непосредственно в трубопроводы анализа или системы управления контентом, такие как Directus. См. zooniverse.org для полного каталога.

Другие пионерские усилия

FamilySearch Indexing трансформировала генеалогические исследования, сделав миллиарды жизненно важных записей доступными для поиска в Интернете. Добровольцы индексируют имена, даты и места из записей регистрации актов гражданского состояния, приходских записей и переписей. Письма 1916 года (Ирландия) собирали метаданные и транскрипции писем периода Пасхи, в конечном итоге создавая цифровую коллекцию, используемую учеными и общественностью. Паперы военного департамента (Университет Джорджа Мейсона) использовали краудсорсинг для идентификации и расшифровки документов, потерянных в пожаре 1800 года, пересборка жизненно важной части ранней американской истории. Каждый проект демонстрирует, как добровольцы могут решать задачи, которые бросают вызов автоматизации, а также генерируют привязанность сообщества к историческому наследию.

Проблемы и как их преодолеть

Несмотря на свои успехи, краудсорсинг исторических данных не без трудностей.Поддержание добровольческой мотивации, обеспечение качества данных, управление авторскими правами и конфиденциальностью и интеграция краудсорсинговых данных с существующей цифровой инфраструктурой требуют тщательного планирования.

  • Контроль качества данных: Непоследовательное качество транскрипции является общей проблемой. Решения включают в себя требование множественных транскрипций, внедрение тестов золотого стандарта (известные ответы, используемые для оценки точности добровольца) и обеспечение возможности экспертной оценки в сообществе. Машинное обучение может отмечать вероятные ошибки для человеческого обзора. Некоторые проекты используют многоуровневую систему, в которой новые добровольцы начинают с простых задач и постепенно получают доступ к более сложным документам.
  • Удержание добровольцев: Многие проекты испытывают высокий первоначальный интерес, за которым следует резкое падение. Геймификация (точки, значки, таблицы лидеров), четкие показатели прогресса и регулярные сообщения о результатах исследований могут привлекать участников. Некоторые проекты создают «экспертные» роли для преданных добровольцев, предлагая расширенные задачи или привилегии модератора. Электронные рассылки и обновления социальных сетей, которые отмечают достижения, помогают поддерживать импульс.
  • Мотивы в вкладах: Данные по краудсорсингу могут отражать демографические данные базы добровольцев, которая имеет тенденцию искажать более старые, более образованные и более богатые. Это может повлиять на интерпретацию исторических материалов. Исследователи должны быть прозрачными в отношении ограничений и рассмотреть возможность дополнения целевым набором из недопредставленных групп. Проекты также могут разрабатывать задачи, которые привлекают разнообразную аудиторию, такие как транскрибирование записей из разных культур или периодов времени.
  • Интеллектуальная собственность и конфиденциальность:] Оцифровка последних записей может включать в себя персональные данные или ограничения авторского права. Проекты должны обеспечивать разрешения, анонимизировать конфиденциальную информацию и четко определять условия государственной собственности. Многие полагаются на материалы, находящиеся в общественном достоянии, или получать институциональные соглашения. Для записей, включающих живых людей, необходимы строгие протоколы защиты данных.
  • Техническая устойчивость: Создание и поддержание пользовательской платформы транскрипции требует постоянного времени разработчика. Инструменты с открытым исходным кодом, такие как FromThePage или интеграция в существующие платформы (Zooniverse или безголовые решения CMS, такие как Directus, которые обеспечивают гибкие схемы данных) могут снизить накладные расходы. Использование модульных архитектур позволяет проектам менять компоненты по мере развития технологий.

Роль ИИ и машинного обучения

Искусственный интеллект все чаще используется наряду с краудсорсингом для повышения скорости и точности. Модели машинного обучения могут транскрибировать печатный текст (OCR), распознавать почерк (HTR - Handwritten Text Recognition) или предлагать классификации изображений. Однако эти системы несовершенны, особенно с нерегулярным почерком, выцветшими чернилами или нестандартными написаниями, распространенными в исторических документах. Краудсорсинг предоставляет идеальные данные обучения: транскрипции добровольцев становятся помеченными примерами, которые улучшают производительность ИИ. В свою очередь, ИИ может предварительно обрабатывать документы, предлагая транскрипты, которые добровольцам нужно только проверять, резко сокращая усилия. Такие проекты, как Transkribus , объединяют HTR с краудсорсингом для массовой оцифровки в европейских архивах.

Это партнерство между человеком и ИИ является отличительной чертой вычислительной истории. Например, проект Британской библиотеки «Жизнь с машинами» использует добровольцев для проверки транскрипций, созданных ИИ, газет 19-го века, что позволяет проводить крупномасштабный анализ изменений языка и социальной истории. По мере совершенствования алгоритмов краудсорсинг будет переходить от полной транскрипции к задачам обеспечения качества и интерпретации, которые требуют человеческого суждения — например, идентификации эмоций в письмах или описания исторических изображений. Сочетание человеческого нюанса и эффективности машины создает мощную петлю обратной связи, которая ускоряет открытие.

Этические соображения

Участие общественности в исторических исследованиях поднимает важные этические вопросы. Участники вносят неоплачиваемый труд, который часто приносит пользу академическим учреждениям или корпорациям. В то время как многие добровольцы мотивированы альтруизмом или любопытством, проекты должны признавать вклады, предлагать возможности соавторства, где это необходимо, и обеспечивать, чтобы данные были открыты. Прозрачность в отношении того, как данные будут использоваться (например, климатические модели, генеалогические поиски) укрепляет доверие. Кроме того, проекты, которые обрабатывают записи маргинализированных сообществ, должны быть чувствительны к тому, как эти истории представлены. Краудсорсинг должен расширять возможности, а не эксплуатировать, и исследователи несут ответственность за разработку инклюзивных и уважительных платформ.

Наилучшие практики включают предоставление четких руководящих принципов владения данными, использование лицензий Creative Commons для результатов и предоставление добровольцам возможности оставаться анонимными или получать публичные кредиты. Проекты также должны учитывать эмоциональный труд, связанный с транскрипцией травматических исторических событий, таких как военные дневники или записи рабства. Предоставление ресурсов поддержки и разрешение добровольцам пропускать тревожный контент важно. Этические рамки краудсорсинга должны развиваться вместе с технологией, чтобы гарантировать, что люди, которые управляют этими усилиями, рассматриваются справедливо.

Использование современного управления данными для истории с использованием краудсорсинга

Поскольку проекты краудсорсинга генерируют огромное количество структурированных данных, исследователям нужны надежные системы для хранения, запроса и обмена своими коллекциями. Традиционные реляционные базы данных могут обрабатывать объем, но им часто не хватает гибкости для размещения различных схем, которые требуются различным проектам. Системы управления контентом без головы, такие как Directus , предлагают решение, предоставляя мощный API-слой поверх базы данных SQL, с удобным интерфейсом для кураторов и исследователей. Менеджеры проектов могут определять пользовательские поля для каждой транскрипции - дата, местоположение, транскрибирование, оценка доверия - и легко создавать отношения между записями. Та же система может обслуживать данные для общедоступных веб-сайтов, инструментов анализа и архивных репозиториев.

Directus также поддерживает управление доступом на основе ролей, позволяя администраторам проектов назначать различные разрешения добровольцам, рецензентам и исследователям. Его расширяемая архитектура означает, что пользовательские этапы рабочего процесса, такие как требование второй транскрипции до того, как запись будет помечена полной, могут быть реализованы без тяжелого кодирования. Многие проекты цифровых гуманитарных наук используют такие платформы, чтобы гарантировать, что плоды краудсорсинга остаются доступными, повторно используемыми и устойчивыми в долгосрочной перспективе.

Будущие направления

Граница краудсорсинга в вычислительной истории быстро расширяется. Несколько тенденций будут формировать следующее десятилетие.

  • Интеграция с цифровыми архивами: Краудсорсинг станет стандартной функцией онлайн-архивных платформ, позволяющей пользователям записывать записи непосредственно в интерфейсах поиска по каталогам.Учреждения вроде Библиотеки Конгресса и Национального архива уже экспериментируют с этой моделью, внедряя инструменты транскрипции в свои цифровые коллекции.
  • Сотрудничество в режиме реального времени: Новые инструменты позволяют нескольким добровольцам работать одновременно над одним и тем же документом, похожим на Google Doc, но с контролем версий. Это ускоряет транскрипцию длинных записей и способствует взаимодействию с сообществом. Проекты, использующие эти методы, сообщают о более высоком вовлечении и более быстром темпе завершения.
  • Геопространственный краудсорсинг: Связывание транскрибированных данных с картами через географические информационные системы (ГИС) позволяет проводить пространственный анализ. Добровольцы могут составлять графики морских путешествий, отслеживать маршруты миграции или составлять карты исторических зданий. Проекты, подобные Карта Warper, позволяют пользователям геокорректировать исторические карты, создавая слои, которые могут быть наложены современными геоданными.
  • Игромация и виртуальная реальность:] Погружение в опыт, например, изучение виртуального рабочего места 19-го века при расшифровке его карточек времени, может привлечь молодых добровольцев и сделать процесс более увлекательным. Ранние эксперименты показывают, что задачи, основанные на повествовании, улучшают как точность, так и удержание.
  • Межъязыковые и многоскриптовые проекты: По мере того, как цифровые гуманитарные науки будут выходить на глобальный уровень, краудсорсинг будет заниматься документами на арабском, китайском, кириллическом и других сценариях. Языковые сообщества и библиотеки перевода будут иметь важное значение. Платформы, такие как Scripto, уже создают многоязычные интерфейсы транскрипции.
  • Автоматизированное обеспечение качества: Модели машинного обучения будут все чаще обнаруживать аномалии в транскрибируемых данных, таких как невероятные даты или географические названия, и отмечать их для человеческого обзора. Это снижает нагрузку на добровольных рецензентов и ускоряет выпуск точных наборов данных.

Заключение

Краудсорсинг перешел от нишевого эксперимента к основной методологии в вычислительной истории. Используя коллективные усилия добровольцев, исследователи могут обрабатывать огромные объемы исторических данных, которые в противном случае оставались бы недоступными. Синергия между человеческим интеллектом и машинным обучением открывает новые вопросы о климате, обществе, культуре и власти. Проблемы, связанные с качеством, этикой и устойчивостью, остаются, но успехи таких проектов, как Old Weather, Transcribe Bentham и семья Zooniverse, показывают, что модель работает. Для историков и архивистов сообщение ясно: общественность готова помочь. Построение инфраструктуры, сообществ и систем стимулирования для направления этой энергии определит следующую волну исторических открытий. Прошлое больше не является закрытой книгой - это общий проект, написанный многими руками, управляемый современными инструментами и анализируемый с вычислительной мощностью, которая с каждым годом становится все более сложной.