Исторический анализ и методы исследования
Влияние алгоритмических предубеждений на интерпретацию исторических данных
Table of Contents
Алгоритмы стали незаменимыми инструментами для историков и исследователей, которые должны просеивать постоянно растущие цифровые архивы исторических документов, переписи, газетные сборники и устные истории. Эти вычислительные методы обещают скорость, масштаб и объективность. Но обещания нейтралитета могут вводить в заблуждение. Алгоритмы разрабатываются людьми, обучаются на данных, полученных человеком, и встроены в предположения, которые могут исказить наше понимание прошлого. Признание и устранение алгоритмического уклона - это не просто техническая проблема - это фундаментальное требование для точной исторической науки.
Что такое алгоритмическая предрасположенность?
Алгоритмический уклон относится к систематическим и повторяемым ошибкам в компьютерной системе, которые создают несправедливые результаты, такие как предпочтение одной группы перед другими или укрепление существующих стереотипов. В контексте анализа исторических данных предвзятость может проявляться в том, как алгоритмы классифицируют, ранжируют или извлекают смысл из источников. Например, алгоритм, обученный преимущественно на газетных статьях 19-го века, может научиться ассоциировать определенные профессии с конкретными полами просто потому, что эти записи отражают предубеждения времени. Алгоритм затем воспроизводит эти предубеждения в своем выходе, эффективно «замораживая» исторические предрассудки в современный анализ.
Предвзятость может входить в нескольких точках: в подборе обучающих данных, в проектировании самого алгоритма, в способе маркировки данных и даже в интерпретации результатов.Понимание этих точек входа является первым шагом к созданию более справедливых инструментов цифровой истории.
Исторические корни алгоритмических предубеждений
Концепция алгоритмического уклона не нова. Ранние статистические модели, используемые в социальных науках, часто строились на ошибочных предположениях о расе, поле и классе. Например, алгоритмы оценки кредитов 1970-х годов систематически дискриминировали женщин и меньшинства, потому что данные обучения отражали социальное неравенство. Сегодня аналогичная динамика проявляется в исторических исследованиях. Модели машинного обучения, применяемые к оцифрованным архивным материалам, могут наследовать упущения и искажения оригинальных хранителей записей. Как утверждают историк Кэтрин Д'Игнацио и ученый данных Лорен Кляйн, данные никогда не являются сырыми - они всегда «сварены» с человеческими ценностями и структурами власти.
Источники предубеждений в исторических данных
Исторические данные по своей сути неполны и неровны. Предубеждения, которые алгоритмы подхватывают, часто возникают задолго до написания любого кода. Четыре основных источника заслуживают тщательного изучения:
1.Неполные записи
Архивное выживание не случайно. Войны, пожары, преднамеренное разрушение и простое пренебрежение стерли огромные участки человеческого опыта. Документы элитных, грамотных или влиятельных групп гораздо более вероятны для выживания, чем документы из маргинализированных сообществ. Алгоритмы, обученные на таких фрагментированных телах, естественно, будут преувеличивать определенные голоса и недопредставлять других. Неполные записи могут искажать количественный анализ, приводя к утверждениям о «типичном» поведении, которое на самом деле типично только для узкой подгруппы населения.
2. Культурные перспективы и колониальные предубеждения
Многие исторические архивы были созданы колониальными администрациями, миссионерскими обществами или ранними антропологами, которые записывали культуры коренных народов через свои собственные культурные линзы. Когда алгоритмы анализируют эти тексты, они могут научиться расставлять приоритеты по западным терминам, категориям и повествованиям. Например, алгоритм, которому поручено идентифицировать «значимые события» в коллекции колониальных докладов, может систематически игнорировать движения сопротивления коренных народов, потому что они редко описываются на том же языке, что и официальные государственные дела.
3. Предвзятость в оцифровке
Процесс преобразования физических документов в цифровые форматы вносит свои искажения. Какие коллекции финансируются для оцифровки? Какие страницы сканируются четко? Как заполняются поля метаданных? Проекты оцифровки часто предпочитают визуально чистые, хорошо сохранившиеся и легко категоризируемые материалы. Рукописные маргиналы, поврежденные страницы или нестандартные скрипты могут быть исключены или плохо оцифрованы. Это предвзятость оцифровки означает, что цифровые архивы, которые мы поставляем в алгоритмы, не являются нейтральными представлениями прошлого; они опосредованы современными приоритетами, бюджетами и техническими ограничениями.
4. Предвзятость в отношении маркировки и обучения
Надзорное машинное обучение требует примеров с маркировками человека. Люди, делающие маркировки, привносят свои собственные предположения. Если исследовательская группа маркирует исторические фотографии с гендерными категориями, которые отражают современные нормы, они могут неправильно идентифицировать или игнорировать историческое гендерное разнообразие. Аналогично, если данные для анализа текста будут взяты в основном из основных газет, алгоритм будет плохо работать на альтернативных новостных рассылках в прессе или сообществе. Предвзятость маркировки Сочетает существующие архивные предубеждения, создавая цикл обратной связи, где алгоритмы усиливают очень упрощения, которые ученые стремятся преодолеть.
Влияние предубеждений на историческую интерпретацию
Последствия алгоритмического уклона в исторических исследованиях глубоки и часто невидимы. Предвзятые результаты могут привести к ошибочным повествованиям, которые искажают прошлое, непреднамеренно укрепляют стереотипы и формируют общественную память разрушительными способами.
Искажение количественной истории
Клиометрия — применение количественных методов к истории — долгое время полагалась на статистические модели. Когда алгоритмы заменяют или дополняют эти модели, риск смещения умножается. Например, алгоритм, обученный на базе данных судовых манифестов, может «узнать», что европейские моряки были более ценными, чем африканские пленники, потому что данные обучения были организованы в соответствии с колониальными методами учета. Полученный анализ будет тогда относиться к человеческим жизням в соответствии с теми же искаженными оценками, увековечивая дегуманизирующее мировоззрение.
Маргинализация перспектив меньшинств
Предвзятость может заставить замолчать целые сообщества. Алгоритм, которому поручено идентифицировать «заметных людей» в историческом корпусе, вероятно, будет ранжировать фигуры, которые часто появляются в доминирующих источниках — обычно белые, мужчины и богатые. Женщины, люди цвета и представители рабочего класса часто появляются фрагментами или глазами других. Если алгоритмы явно не предназначены для компенсации этой асимметрии, они будут воспроизводить ту же маргинализацию, что и оригинальные архивы.
Укрепление современных стереотипов
Когда предвзятый исторический анализ используется для информирования политики, образования или общественного дискурса, он может укрепить современные предрассудки. Например, если алгоритм, анализирующий статистику преступности 1920-х годов, приходит к выводу, что определенные группы иммигрантов были «по своей сути преступными», то результаты могут быть использованы в современных дебатах, игнорируя социальные и экономические контексты, которые фактически приводили к этой статистике. История становится инструментом для фанатизма, а не понимания.
Примеры ошибок на практике
Реальные случаи иллюстрируют, как алгоритмическая предвзятость влияет на историческую интерпретацию. Эти примеры показывают, что проблема не гипотетическая, а уже формирующая стипендию.
Гендерные различия в текстном анализе
Исследователи из Университета Вирджинии использовали обработку естественного языка для анализа десятков тысяч книг 19-го века. Они обнаружили, что алгоритмы, обученные на современных данных, последовательно неправильно расшифровывали исторические фигуры, которые занимали роли, которые сегодня считаются гендерно-атипичными. Например, медсестры-мужчины и врачи-женщины часто были неправильно классифицированы. Предвзятость алгоритма была не просто техническим сбоем — она стерла историческую реальность, что гендерные роли изменились с течением времени. Для исправления такого предвзятости требуются учебные модели на исторически подходящем языке и тестирование их против различных корпусов.
Расовые различия в автоматических транскрипциях
Оптическая распознавание символов (OCR) широко используется для преобразования отсканированных исторических документов в машиночитаемый текст. Исследования показали, что точность OCR значительно ниже для газет, напечатанных в черных сообществах, для нелатинских сценариев и для документов с тяжелым износом. Когда исследователи полагаются на выход OCR без перекрестной проверки, они систематически исключают материалы из маргинализированных групп. Исследование 2020 года Университета Мэриленда показало, что уровень ошибок OCR для афроамериканских газет был на 20% выше, чем для основных белых газет — цифровой уклон, который усиливает «архивный разрыв».
Колониальные предубеждения в географических данных
Исторические географические информационные системы (ГИС) часто опираются на оцифрованные карты, созданные колониальными державами. Эти карты могут стирать местные топонимы, границы и закономерности землепользования. При анализе алгоритмов пространственных данных с таких карт они воспроизводят колониальные географии как дефолт. Например, исследование владения землей в Британской Индии использовало колониальные записи для отслеживания передачи собственности. Алгоритм определил закономерности, которые натурализовали британские административные подразделения, заслоняя существовавшие ранее местные земельные системы и насилие лишения владения.
Смягчение алгоритмических предубеждений
Решение проблемы алгоритмического уклона в исторических исследованиях требует сотрудничества между технологами, историками, архивистами и сообществами.Никакого единого решения не существует, но несколько стратегий могут уменьшить вред и повысить точность.
Разнообразный и прозрачный сбор данных
Исследователи должны активно искать недопредставленные источники. Вместо того, чтобы полагаться исключительно на большие, хорошо финансируемые цифровые коллекции, команды должны сотрудничать с архивами сообществ, устными историческими проектами и инициативами по оцифровке на низовом уровне. Прозрачная документация происхождения данных, включая известные предубеждения, пробелы и ограничения, должна сопровождать каждый набор данных. Наборы данных с открытым исходным кодом с четкими заявлениями о предвзятости позволяют другим ученым понимать и учитывать искажения.
Алгоритм аудита и проверки
Регулярные аудиты могут выявить предубеждения, прежде чем они исказят результаты. Аудиты должны тестировать алгоритмы на различных подмножествах данных, таких как материалы из разных периодов времени, регионов и социальных групп. Крайне важно перекрестное подтверждение с историками-людьми. Например, алгоритм, обученный распознавать темы в письмах, может быть проверен путем проверки экспертами домена случайной выборки его выходов. Расхождения показывают, где алгоритм не работает.
Междисциплинарные команды
Проекты, объединяющие компьютерных ученых с историками, социологами и культурными критиками, с большей вероятностью распознают и исправят предвзятость. Историки привносят глубокие контекстуальные знания об ограничениях источников; компьютерщики привносят технические навыки для корректировки моделей. Не менее важным является включение членов сообщества из изучаемых групп. Их жизненный опыт и историческая память могут отмечать предположения, которые пропускают посторонние.
Технические контрмеры
Несколько технических подходов могут помочь: увеличить данные сбалансировать недопредставленные категории, сопротивляющееся дебиасинг устранить ложные корреляции и интерпретируемые модели, которые позволяют исследователям понять, почему было принято решение.
Лучшие практики для педагогов
Педагоги играют жизненно важную роль в подготовке следующего поколения историков и граждан к критическому взаимодействию с алгоритмическими инструментами. Следующие методы могут интегрировать осознание предвзятости в учебные программы истории.
Учите алгоритмическую грамотность рано
Студенты должны понимать, что алгоритмы не являются объективными арбитрами истины. Ввести понятие предвзятости с помощью простых упражнений в классе. Например, попросить студентов сравнить результаты поиска для «изобретателя» и «женщины-изобретателя» в цифровом архиве. Обсудить, почему результаты отличаются и какие предположения может делать алгоритм. Алгоритмическая грамотность должна быть вплетена в цифровые гуманитарные курсы, не преподаваемые как запоздалая мысль.
Поощрять критическую оценку источника
Историки уже учат студентов допрашивать первоисточники: Кто создал этот документ? С какой целью? Что осталось в стороне? Расширить те же вопросы до алгоритмических выходов. Когда цифровой инструмент предлагает «ключевую фигуру» или «тенденцию», попросите студентов проследить, как алгоритм пришел к такому выводу. На каких данных он был обучен? На каких он может отсутствовать? Эта критическая оценка строит навыки, которые передаются в любой контекст, управляемый данными.
Используйте различные и контр-арративные источники
Назначьте показания и наборы данных, которые явно бросают вызов доминирующим повествованиям. Например, сопоставьте стандартный отчет о переписи с историями на основе сообществ, которые заполняют пробелы. Пусть студенты строят свои собственные небольшие наборы данных из недопредставленных голосов, а затем проводят эксперименты алгоритма, чтобы увидеть, как меняются результаты. Объяснение нескольких точек зрения помогает студентам признать, что каждый набор данных отражает ограниченную точку зрения.
Содействие этичному использованию цифровых инструментов
Преподаватели должны моделировать прозрачность. При использовании цифрового анализа в классе, признать ограничения инструментов и обсудить то, что может быть пропущено. Создавать задания, которые требуют от студентов документировать потенциальные предубеждения в своих собственных исследовательских процессах. Поощрять их подвергать сомнению автоматизированные результаты и проверять претензии через несколько источников. Этичное использование цифровых инструментов заключается не только в предотвращении вреда - это о создании лучшей, более честной стипендии.
Заключение
Алгоритмическая предвзятость в исторической интерпретации не является абстрактной проблемой. Это конкретная проблема, которая формирует то, как мы понимаем прошлое и, как следствие, как мы ориентируемся в настоящем. От неполных архивов до пробелов в оцифровке до укрепления стереотипов, риски реальны. Но и возможности. Объединив техническую строгость с исторической осведомленностью и вовлечением сообщества, исследователи могут разработать методы, которые являются более инклюзивными, точными и справедливыми.
Педагоги, архивисты и технологи должны работать вместе, чтобы цифровые инструменты, которые мы создаем, не запирали нас в узкие версии истории. Критическое изучение, разнообразные данные и прозрачные практики являются основой справедливой исторической науки. Прошлое слишком важно, чтобы оставлять только алгоритмы.
Дальнейшее чтение: Для более глубокого изучения алгоритмических предубеждений и исторических данных см. Алгоритмы угнетения , Алгоритмическая Лига Справедливости и работа ООН по этике данных . Для практических рекомендаций по смягчению предвзятости в цифровой истории, проконсультируйтесь с Дебаты в серии Digital Humanities Для технического обзора обнаружения предвзятости см. FairML: Практическое руководство .