historical-analysis-and-study-techniques
Использование вычислительной лингвистики для изучения политических текстов 19-го века
Table of Contents
Введение: минирование прошлого современными методами
Историки XIX века долгое время полагались на кропотливый ручной анализ газет, речей, брошюр и личной переписки, чтобы понять силы, которые сформировали современный мир. Тем не менее, огромный объем сохранившегося материала этой эпохи — миллионы страниц текста, созданных во время промышленной революции, подъем массовой политики и трансформационные конфликты, такие как американская гражданская война — могут переполнить традиционные качественные методы. Вычислительная лингвистика предлагает дополнительный подход: применяя алгоритмы и статистические модели к большим текстовым корпусам, исследователи могут обнаруживать шаблоны, отслеживать сдвиги в языке и проверять гипотезы в масштабе, невозможном для одного ученого. Этот синтез информатики и лингвистики не заменяет близкое чтение, но расширяет его, позволяя историкам задавать новые вопросы о политической риторике, идеологии и социальных изменениях. Цифровизация архивов, таких как [FLT: 1]] Газетная база данных и [FLT: 2]]Гансард [[FLT: 3]] Парламентские записи сделали эти миллионы страниц доступными, но сырой доступ — это только начало. Реальная сила заключается в аналитических методах, которые могут отсеять смысл от шума,
Что такое вычислительная лингвистика?
Вычислительная лингвистика (CL) находится на пересечении лингвистики, информатики и искусственного интеллекта. Ее основная цель - смоделировать естественный язык, чтобы машины могли обрабатывать, анализировать и даже генерировать человеческую речь и текст. В исторических исследованиях инструменты CL обычно делятся на несколько категорий, каждая из которых подходит для различных видов исторических вопросов.
Анализ настроений
Анализ настроений присваивает числовые или категориальные оценки тексту, основанному на эмоциональной валентности — положительной, отрицательной или нейтральной. Для политических текстов 19-го века этот метод может показать, как общественное настроение изменилось во время событий, таких как революции 1848 года, дебаты по законам кукурузы или кризис отделения в Соединенных Штатах. Нанося на карту настроения с течением времени, историки могут определить периоды растущего национализма, реформистского оптимизма или усталого отчаяния войны. Например, исследование американских газет во время избирательного цикла 1860 года может показать, как газеты, ориентированные на республиканцев, перешли от обнадеживающей риторики о Линкольне к тревожным призывам к союзу, поскольку Южная Каролина обсуждала отделение. Анализ настроений также используется в дипломатических депешах, чтобы оценить, как иностранные правительства воспринимали угрозы — своего рода количественная историческая психология.
Тема моделирования
Алгоритмы моделирования тем (например, Latent Dirichlet Allocation) автоматически раскрывают скрытые темы в коллекции документов. Применительно к корпусу британских парламентских речей 19-го века тематические модели могут группировать такие слова, как «торговля», «тариф», «производство» и «империя» в тему экономической политики, в то время как «избирательное право», «представление» и «собственность» кластер вокруг избирательной реформы. Исследователи могут затем проследить, как распространенность каждой темы увеличивалась и уменьшалась в течение десятилетий. Моделирование темы использовалось, чтобы показать, например, что ссылки на религию в британских парламентских дебатах неуклонно снижались после 1850 года, в то время как дискуссии об инфраструктуре и общественном здравоохранении росли. Этот метод особенно ценен для раскрытия скрытой структуры больших архивов, раскрывая, какие темы на самом деле обсуждались, а не полагаясь на канонические темы, выделенные традиционными историографиями.
Названо признание сущности (NER)
NER извлекает собственные существительные — людей, места, организации, даты — из сырого текста. Для текстов 19-го века NER может помочь картографировать сети политических актеров, отслеживать частоту упоминаний конкретных стран или движений (например, «Хартизм», «Уничтожение», «Zollverein») и даже реконструировать географическое распространение освещения новостей. При применении к тысячам редакционных статей 1850-х годов NER может показать, что имя «Джон Браун» появлялось гораздо чаще в северных газетах, чем в южных в месяцы после рейда Harpers Ferry, но что оба региона ссылались на него в связи с различными эмоциями и аргументами. Современные модели NER, обученные на исторических данных, также могут идентифицировать устаревшие топонимы (например, «Константинополь» или «Пруссия») и варианты написания известных фигур.
Коллокация и анализ ключевых слов
Анализ коллокации идентифицирует слова, которые появляются вместе чаще, чем предсказывает случай. Изучение коллокации «демократии» в американских газетах до и после Гражданской войны показывает переход от абстрактных идеалов (например, «равенство», «свобода») к конкретному институциональному языку (например, «партия», «избирательство», «конституция»). Анализ ключевых слов сравнивает целевой корпус с эталонным корпусом, чтобы найти слова, которые необычно часты — часто сигнализируя о том, что современники считали срочным или отличительным. Например, сравнение речей от британской Либеральной партии в 1880-х годах к тем из 1830-х годов может подчеркнуть растущее значение «пенсии по старости» и «муниципальный социализм» даже до того, как эти термины стали официальной политикой.
Стилометрия
Стилометрия использует статистические показатели стиля письма (длина предложения, выбор слов, привычки пунктуации) для атрибутирования авторства. Этот метод был использован для разрешения спорных текстов, таких как анонимные газетные передовицы или авторство политических брошюр, давая историкам более прочную почву для дебатов атрибуции. Одно классическое приложение включало доказательство того, что серия антиаболиционистских брошюр 1830-х годов, вероятно, была написана одним нью-йоркским адвокатом, хотя они были опубликованы под псевдонимом. Стилометрия также может обнаружить эволюцию стиля отдельного автора по карьере, предлагая понимание того, как риторика политика созрела или изменилась под давлением.
Применение вычислительной лингвистики к политическим текстам 19-го века
19 век представляет как возможности, так и препятствия для CL. Рост массовой грамотности, расширение газетной прессы и распространение стенографических отчетов произвели взрыв политического дискурса.В то же время правописание часто было нерегулярным, шрифты различались, а язык включал архаизмы, бросающие вызов современным моделям.Тем не менее, тщательно разработанные исследования дали ценные идеи, которые было бы почти невозможно получить только с помощью традиционных методов.
Тематический анализ: язык американской гражданской войны
Одним из самых богатых приложений является изучение риторики гражданской войны. Анализируя Congressional Globe (предшественник современной записи Конгресса) вместе с тысячами газетных передовиц, исследователи отслеживали, как термин «Союз» сместился от правовой концепции к почти священному идеалу во время войны. Тематическое моделирование речей от Конгресса Конфедерации показывает, что ссылки на «права штатов» резко сократились после 1863 года, в то время как язык о «независимости» и «жертве» увеличился — шаблон, соответствующий ужесточению власти военной необходимости. Анализ настроений солдат Союза из Долина Тени проект показывает, что моральный дух упал после крупных сражений, таких как Фредериксбург, но восстановился после Геттисберга и Виксбурга, обеспечив количественное дополнение к основанным на дневнике повествованиям, которые доминируют в литературе.
Тема: Парламентские дебаты в Великобритании
Оцифровка Хансард (официальная запись парламентских дебатов в Великобритании) открыла огромный корпус для CL. Исследования изучили, как словарь реформ — такие слова, как «долг», «филантропия», «улучшение» — развивался в течение 19-го века. Анализ настроений выступлений на Factory Acts показывает, что виги и либеральные депутаты использовали все более позитивный эмоциональный язык по мере продвижения века, в то время как консервативная оппозиция перешла от морального возмущения к практическим возражениям. Такие результаты помогают историкам выйти за рамки анекдотических впечатлений от партийных позиций. Другое исследование использовало моделирование темы для сравнения языка ирландских националистов с языком их британских коллег. Оно обнаружило, что ирландские члены последовательно формулировали проблемы с точки зрения «земли», «религии» и «угнетения», в то время как британские члены сосредоточились на «экономике» и «администрации», подчеркивая фундаментально разные концептуальные миры, которые сосуществовали в одном парламенте.
Тематические исследования: аболиционистская и антиаболиционистская литература
Вычислительные методы освещали трансатлантические дебаты по рабству. Тематические модели, применяемые к британским и американским аболиционистским брошюрам (1830-1865), подчеркивают появление отдельного словаря «моральной экономики» — «грех», «покаяние», «кровавая виновность», который резко отличался от утилитарного языка («производительность», «свободный труд»), используемого антиаболиционистами. Коллокационный анализ «эмансипации» как в британских, так и в американских источниках показывает, что британские тексты обрамляли его как имперскую политику, в то время как американские тексты связывали его в подавляющем большинстве с расовыми страхами и выборами. Более детальная работа над афроамериканскими газетами, такими как ] Северная звезда показывает, что черные аболиционисты использовали другой набор коллокатов для «свободы» — подчеркивая «справедливость», «мужество» и «гражданство» — по сравнению с белыми аболиционистами, которые чаще соединяли его с
Отслеживание эволюции политической лексики
Вечный вопрос для политических историков заключается в том, как ключевые понятия меняют значение с течением времени. Используя частотный анализ и модели встраивания слов, исследователи прослеживали сдвиги в таких словах, как «либеральный», «консервативный», «социализм» и «демократия». Например, «либерал» в британской прессе 1820-х годов ссылался в основном на открытость торговли; к 1880-м годам это был партийный ярлык, наполненный коннотациями государственного вмешательства. Эти семантические сдвиги раскрывают основные идеологические перестройки века. Встраивание слов, обученное в корпусе ], в хронологию Америки (1836-1922) может показать, что слово «рабочий» перешло от простого профессионального ярлыка к политически заряженному термину во второй половине века, когда рабочие движения росли, а язык класса становился более выраженным.
Тема: Французская революция 1848 года и подъем социализма
За пределами англоязычного мира CL использовался для изучения французской политической прессы во время Второй республики. Тематические модели, применяемые к газетам с 1848 по 1851 год, показывают быстрое появление отдельного социалистического словаря, сосредоточенного на «atélier» (мастерская), «ассоциация» и «droit au travail» (право на работу). Анализ настроений показывает, что язык консервативного Le Journal des Débats стал все более паникёрским после восстания в июне, используя такие фразы, как «опасная руга» (красная опасность) с растущей частотой. Этот вычислительный подход помогает историкам количественно оценить скорость, с которой политический ландшафт раскололся после революции, процесс, который традиционные повествовательные отчеты описывают, но не могут легко измерить.
Преимущества для историков и педагогов
Масштаб и объективность
CL позволяет историкам проверять утверждения о широких закономерностях — например, о том, что национализм усилился после 1870 года — против целых архивов, а не кураторской выборки. Количественный вывод обеспечивает проверку на предвзятость подтверждения и заставляет ученых учитывать контр-доказательства. Для педагогов интерактивные визуализации тенденций настроений или распространенности темы могут сделать абстрактные исторические силы осязаемыми в классе. Инструмент, такой как ] Вояционные инструменты (среда анализа текста с открытым исходным кодом) позволяет студентам загружать набор речей и сразу видеть облака слов, частотные графики и сети коллокации, превращая уроки истории в мини-исследовательские лаборатории.
Открытие тихих шаблонов
Алгоритмы могут найти закономерности, которые не замечают читатели. Стилометрический анализ редакционных статей Харпера Weekly может показать, что сдвиг редакционного голоса произошел за несколько месяцев до официального объявления о партийной верности — на фоне закулисных фракционных маневров. Тематические модели, применяемые к петициям в британский парламент, выявили кластеры спроса на права женщин, которые в значительной степени игнорировались в современных дебатах. В одном заметном исследовании тематическое моделирование петиций в Конгресс США в 1840-х годах показало, что аргументы об избирательном праве женщин часто сочетались с умеренностью и языком борьбы с рабством, шаблон, который традиционные историки отмечали анекдотически, но никогда систематически не подтверждали.
Интеграция с цифровыми архивами
По мере того, как библиотеки и архивы продолжают оцифровывать холдинги 19-го века, инструменты CL становятся воротами в эти коллекции. Проекты, такие как Европейский парламентский корпус дебатов и база данных газет Chronicling America , уже предоставляют готовые корпуса. Исследователи могут объединить результаты CL с географическими информационными системами (ГИС) для картирования распространения политического языка в газетах уездного уровня с 1820-х и 1830-х годов, могут показать, какие части страны использовали слово в связи с защитными тарифами против тарифов на доходы, отслеживая региональные экономические интересы.
Проблемы и ограничения
Архаический язык и варианты орфографии
Английский язык 19-го века часто заметно отличается от современных норм. Такие слова, как «чус» (выбор), «шоу» (шоу) и непоследовательная капитализация могут спутать современных теггеров части речи и лексиконы настроений. Исследователи часто должны обучать пользовательские модели на исторических наборах данных или использовать инструменты орфографической нормализации. Даже тогда значение может быть неуловимым: «гей» в 1800-х годах означает веселье, а не сексуальность, а «ужасный» может означать благоговение, а не ужас. Исторический тезаурус английского языка [[FLT: 1]] и специализированные исторические лексиконы являются важными ресурсами для интерпретации результатов.
Ошибки OCR в оцифрованных текстах
Оптическая распознавание символов (OCR) газет и книг 19-го века страдает от высоких показателей ошибок из-за сломанного типа, витиеватых шрифтов и ухудшения. Обычная ошибка - превращение "длинных s" в "f" - может искажать подсчеты частот. Пост-процессорные коррекционные конвейеры и ручная проверка необходимы для надежных результатов, добавляя время и стоимость к проектам. Для крупных проектов исследователи часто используют такие инструменты, как OCRopus или Tesseract с моделями, настроенными на исторические шрифты. Платформы краудсорсинга, такие как Zooniverse также помогли исправить ошибки OCR в крупных коллекциях, таких как Британская библиотека газет 19-го века .
Контекст и ирония
Вычислительные модели борются с сарказмом, иронией и косвенными цитатами — все это распространено в политической риторике. Сатирическая статья, которая высмеивает экспансионистский язык, может быть ошибочно классифицирована как подлинно экспансионистская алгоритмом настроений. Аналогично, тематические модели рассматривают все слова как одинаково информативные, но современный читатель будет знать, что «славная причина» означала разные вещи в обращении Союза, чем в одном из конфедеративных. Чтение остается необходимым для контекстуализации вычислительного результата. Один из способов смягчить это — объединить CL с качественным анализом контента, используя алгоритм для предложения шаблонов, а затем следовать за человеческой проверкой случайной выборки текстов.
Биазы данных и формирование канонов
Оцифрованные коллекции не нейтральны. Крупные архивы часто отражают предубеждения учреждений, которые их создали: крупные городские газеты перепредставлены, в то время как радикальные газеты небольшого города скудны. Исследования CL, которые полагаются исключительно на Хансард или Нью-Йорк Таймс , рискуют укрепить элитарный взгляд на историю. Исследователи должны активно искать маргинализированные голоса — рабочие классы, иммигранты, коренные народы и женские публикации — и включить их в свою корпорацию. Проект «Индейские газеты в Северной Америке» и Коллекция «Женские газеты избирательного права» являются примерами усилий по балансированию цифрового ландшафта, что может привести к заявлениям о «общественном мнении», которое на самом деле представляет только небольшой, привилегированный сегмент общества.
Будущие направления
Исторические языковые модели
Недавние прорывы в глубоком обучении, такие как модели на основе трансформаторов (BERT, GPT), адаптируются для исторических текстов. Отлаженные на корпусах 19-го века, эти модели могут обрабатывать нерегулярное правописание, захватывать зависимости на большие расстояния и даже генерировать синтетические тексты, которые имитируют исторические стили. Они обещают более точный анализ NER и настроений, хотя они требуют значительных вычислительных ресурсов и тщательной проверки на известные факты. Модель MacBERTh , обученная на корпусе голландских исторических текстов, показывает, как эти инструменты могут быть адаптированы к конкретным языкам и периодам времени. Однако ученые должны быть осторожны в отношении переобучения и обеспечения того, чтобы любой созданный текст использовался только для аналитических целей, а не для искажения исторических документов.
Многоязычный и кросс-национальный анализ
Политический дискурс в XIX веке редко ограничивался одним языком. Европейские революции, трансатлантические реформаторские движения и имперское правление порождали многоязычный ландшафт. Будущие инструменты CL, способные обрабатывать кодовые переключения, перевод и кросс-лингвальные сравнения, позволят историкам изучить, например, как понятие «свобода» перемещалось между французскими, немецкими, английскими и испанскими текстами. Такие проекты, как ] Лингвистические связанные открытые данные начинают создавать кросс-лингвальные корпуса, позволяющие проводить такие сравнения. Изучение революционных брошюр 1848 года по всей Германии, Франции и Италии могло бы выявить, появились ли подобные метафоры «шторма» и «пробуждения» на всех трёх языках, указывающие на общий идеологический репертуар.
Междисциплинарное сотрудничество
Наиболее плодотворная работа возникает, когда вычислительные лингвисты, историки и библиотекари сотрудничают от проектирования проекта к публикации. Объединенный опыт гарантирует, что исследовательские вопросы исторически обоснованы, алгоритмы уместны, а приоритеты оцифровки информированы научной потребностью. Инициативы, такие как Цифровые гуманитарные центры в крупных университетах, способствуют этому типу совместной работы, создавая многоразовые трубопроводы для будущих исследований. Например, Стэнфордская литературная лаборатория регулярно публикует исследования, которые сочетают вычислительные методы с глубокими историческими знаниями, устанавливая стандарт для области. Грантовые агентства, такие как Национальный фонд гуманитарных наук теперь явно финансируют междисциплинарные команды, признавая, что лучшие результаты приходят от специалистов, которые учатся говорить на технических и теоретических языках друг друга.
Общественная история и гражданская наука
Инструменты CL также могут привлекать общественность. Онлайн-платформы позволяют добровольцам исправлять ошибки OCR, отмечать названные сущности или классифицировать чувства в исторических документах, внося вклад в исследования, узнавая о прошлом. Такие краудсорсинговые проекты уже улучшили качество корпусов, используемых в рецензируемых исторических исследованиях. Проект Transcribe Bentham, который приглашает добровольцев расшифровывать рукописи философа Джереми Бентама, создал большой, высококачественный набор данных, который в настоящее время анализируется с CL. Подобные проекты для политических петиций или писем 19-го века редакторам могут превратить огромный архив в ресурс сообщества.
Мультимодальный анализ
Политическая коммуникация в 19 веке была не только текстовой. Газеты включали иллюстрации к дереву, карты и более поздние фотографии. Будущая работа CL интегрирует оптический анализ изображений с текстовым анализом, признавая, что политические сообщения переносились визуально, а также словесно. Например, исследование может сравнить частоту изображений символов «свободы» (шапки, статуи) в радикальных против консервативных газет и соотнести это с чувством сопровождающего текста. Этот мультимодальный подход потребует тесного сотрудничества между специалистами по компьютерному зрению и историками.
Заключение
Вычислительная лингвистика предлагает историкам 19-го века мощный набор инструментов для дополнения традиционных методов анализа. Измеряя чувства, открывая скрытые темы и отслеживая эволюцию политического словаря в обширных архивах, исследователи могут ответить как на классические вопросы, так и на совершенно новые. Подход не лишен подводных камней - архаический язык, ошибки OCR и контекстуальные нюансы требуют постоянной бдительности - но его потенциал для выявления невидимых невооруженным глазом шаблонов делает его важным компонентом инструментария современного историка. По мере роста цифровых архивов и совершенствования алгоритмов синергия между вычислительной лингвистикой и политической историей будет только углубляться, обогащая наше понимание века, которое заложило основы нашего собственного. Для любого историка, вступающего на этот путь, ключ заключается в том, чтобы рассматривать вычислительные инструменты не как черный ящик, который дает окончательные ответы, но как линза, которая обостряет определенные вопросы, напоминая нам, что другие все еще требуют нюанса человеческой интерпретации.
Для дальнейшего чтения см. JSTOR статья «Топическое моделирование британского восемнадцатого века»] Британской библиотеки для первичных корпораций источников, и ]]] обеспечивает быструю и образовательную точку входа.
- Анализ политических выступлений для риторических стратегий с использованием коллокации и настроений.
- Отслеживание эволюции политического словаря с помощью частоты ключевых слов в течение десятилетий.
- Понимание общественных отношений через тематические модели петиций, брошюр и редакционных статей.
- Атрибуция анонимных текстов с помощью стилометрии для разрешения авторских споров.
- Картирование географического распространения политического языка путем объединения НЭР с ГИС.