historical-figures
Идентификация авторства анонимных исторических текстов с помощью текстовых функций
Table of Contents
Проблема идентификации автора анонимного исторического текста — одна из самых непреходящих загадок в литературной и исторической науке. От средневековых рукописей с отсутствующими титульными листами до политических брошюр, распространяемых под псевдонимами, бесчисленные произведения на протяжении всей истории сохранились без четкой атрибуции. Назначение авторства — это не просто академическое любопытство; оно фундаментально формирует то, как мы интерпретируем документ, понимаем контекст, в котором он был создан, и прослеживаем поток идей во времени и географии. За последнее столетие исследователи вышли за рамки догадок и архивных подсказок, разработав систематические методы, которые опираются на текстуальные особенности, встроенные в само письмо. Анализируя шаблоны в словарном, синтаксисном, стилевом и тематическом содержании, современные вычислительные инструменты теперь могут сравнивать анонимные тексты с известными работами с замечательной точностью, раскрывая скрытые голоса и перестраивая наш взгляд на прошлое.
Проблема анонимных исторических текстов
Анонимность в исторической письменности была гораздо более распространена, чем сегодня. Многие произведения античности, средневековья и раннего Нового времени распространялись без имени автора из-за опасений по поводу цензуры, политической опасности или простого отсутствия соглашений об атрибуции. Религиозные трактаты, политические манифесты, научные трактаты и даже литературные произведения часто появлялись под псевдонимами или вообще без идентификации. Анонимность могла быть преднамеренной (для защиты писателя) или случайной (потому что рукопись была скопирована писцами, которые опустили оригинал титульного листа). В любом случае историки и литературоведы сталкиваются с фундаментальным разрывом: не зная автора, трудно поместить текст в его надлежащем контексте, оценить его предубеждения или понять сети влияния, которые его произвели.
Веками атрибуция опиралась на внешние свидетельства, такие как письма, записи публикаций или ссылки в других работах. Но когда эти внешние подсказки отсутствуют или неоднозначны, исследователи должны обратиться внутрь самого текста. Именно здесь анализ текстовых особенностей становится существенным. Рассматривая документ как набор данных лингвистических и стилистических маркеров, мы можем систематически сравнивать его с известными авторами и во многих случаях выявлять наиболее вероятного кандидата.
Основы авторского атрибуции
Систематическое изучение авторства через текстовые особенности имеет корни в девятнадцатом веке, когда ученые, такие как Август де Морган, впервые предложили использовать среднюю длину слова в качестве отличительного отпечатка пальца писателя. Поле получило значительный импульс в 1960-х и 1970-х годах с новаторской работой статистиков и литературоведов, таких как Фредерик Мостеллер и Дэвид Уоллес, которые применили количественные методы к FLT:0 Федералистские документы - знаковое исследование, которое продемонстрировало силу стилометрического анализа. С тех пор авторство атрибуции превратилось из ручного подсчета частот слов в сложные вычислительные модели, которые обрабатывают тысячи переменных одновременно.
Современная атрибуция основывается на простой предпосылке: каждый писатель имеет уникальный, бессознательный шаблон языковых привычек, который удивительно согласуется в разных работах. Эти привычки включают предпочтительный словарный запас, типичные структуры предложений, использование пунктуации и даже использование функциональных слов (таких как , , и , , , ]. . Поскольку эти функции используются ниже уровня сознательного контроля, они образуют надежную подпись, которая может отличить одного автора от другого, даже когда авторы пытаются имитировать или маскировать свой стиль.
Основные текстовые особенности для анализа
Текстовые признаки, используемые для авторства атрибуции попадают в несколько широких категорий. Хотя ни одна особенность не является окончательной, сочетание многих таких особенностей создает надежный профиль. Ниже приведены наиболее часто используемые типы.
Лексические особенности
Лексический анализ фокусируется на характеристиках уровня слов. Ключевые показатели включают словарное богатство (отношение символов типа), частоту редких или необычных слов и предпочтительное использование автором слов функции., в то время как, хотя, или предпочитают , по ,. Лексические особенности также включают использование конкретных идиосинкразических фраз, таких как колокейшны (слова, которые часто появляются вместе). Исследователи часто создают списки частоты слов из известных работ и сравнивают их с анонимным текстом; чем ближе совпадение, тем сильнее случай для общего авторства.
Синтаксические особенности
Синтаксический анализ рассматривает структуру предложений — в частности, расположение пунктов, фраз и частей речи. Авторы склонны отдавать предпочтение определенным длинам предложений, типам предложений и грамматическим конструкциям. Например, некоторые авторы обычно используют сложные предложения с несколькими подчиненными положениями, в то время как другие предпочитают короткие, декларативные заявления. Синтаксические особенности также включают распределение частей речи (существительные, глаголы, прилагательные и т. Д.) и частоту пассивного vs. активного голоса. Поскольку структура предложений в значительной степени автоматическая, она может быть одним из самых стабильных маркеров стиля автора.
Стилометрические особенности
Стилометрия — это количественное исследование стиля письма автора, часто сосредотачивающееся на функциональных словах (предлоги, статьи, союзы), которые используются бессознательно.Пионерская работа Мостеллера и Уоллеса в «Федералистских документах» показала, что частота слов, таких как , , , в то время как и , может различать Александра Гамильтона и Джеймса Мэдисона с почти полной уверенностью. Стилометрический анализ обычно включает в себя подсчет случаев десятков или даже сотен функциональных слов, а затем применение многомерной статистики — такой как анализ основных компонентов или линейный дискриминантный анализ — для визуализации кластеров сходства между текстами. Современная стилометрия также включает меры длины предложения, символов n-грамм и даже распределения буквенных пар.
Семантические и тематические особенности
Помимо поверхностного уровня слов и предложений, авторство может также рассматривать тематическое содержание текста. Это включает повторяющиеся темы, концептуальные рамки и использование конкретных метафор или аналогий. В то время как семантический анализ является более сложным, поскольку он требует интерпретации смысла, а не подсчета событий, достижения в моделировании темы (например, распределение латентного Дирихле) позволяют исследователям извлекать тематические отпечатки из больших корпусов. Например, частота, с которой автор обсуждает такие понятия, как свобода, справедливость, природа или религия, может служить отличительной характеристикой при сравнении по всему объему работы.
Современные вычислительные подходы
Цифровая революция превратила авторство из трудоемкого ремесла в науку, основанную на данных. Сегодня исследователи используют различные вычислительные методы, которые могут обрабатывать целые тела и идентифицировать невидимые для человеческого глаза паттерны.
Классификаторы машинного обучения
Надзорные модели машинного обучения широко используются для атрибутирования текстов путем обучения на известных образцах от каждого кандидата автора. Алгоритмы, такие как машины вектора поддержки (SVM), случайные леса и нейронные сети, изучают многовариантные шаблоны текстовых признаков, а затем предсказывают наиболее вероятного автора для анонимного документа. Эти модели могут включать тысячи признаков, включая слова n-грамм (последовательности n слов), символы n-граммы (последовательности n символов) и части речи n-граммы. Характерные n-граммы особенно эффективны, потому что они захватывают морфологические и орфографические шаблоны, которые устойчивы к тематическому изменению. Например, последовательность букв -tion или -ing может появляться с характерной частотой в работе одного автора.
Подходы глубокого обучения, такие как рекуррентные нейронные сети (RNN) и трансформаторные модели, имеют еще более улучшенную точность, захватывая долгосрочные зависимости в тексте. Эти модели могут изучать не только словарный запас и синтаксис, но и дискурсы более высокого уровня. Однако они требуют больших объемов обучающих данных на автора, что часто является ограничением для исторических текстов, где выживает только несколько работ.
Неконтролируемые и полуконтролируемые методы
Когда данных обучения недостаточно, исследователи обращаются к неконтролируемым или полуконтролируемым методам. Алгоритмы кластеризации (например, k-средства или иерархическая кластеризация) могут группировать тексты на основе текстовых функций без предварительных ярлыков, раскрывая потенциальные группы авторства. Полуконтролируемые методы объединяют небольшой набор известных авторов с большим пулом немаркированных текстов для уточнения атрибуции. Эти подходы особенно ценны для анализа традиций рукописей, где несколько анонимных писцов могли внести свой вклад в один документ.
Известные тематические исследования авторского атрибуции
Несколько громких случаев иллюстрируют силу и ограничения анализа текстовых функций и стали краеугольными камнями в этой области.
Федералистские документы
Самой известной историей успеха является атрибуция спорных Федералистских Документов. Из 85 эссе, призывающих к ратификации Конституции США, 12 долго оспаривались между Александром Гамильтоном и Джеймсом Мэдисоном. В 1964 году Мостеллер и Уоллес использовали частотный анализ функционального слова, чтобы с высокой статистической уверенностью присвоить Мэдисону все 12. Их работа была позже подтверждена дополнительными исследованиями с использованием современных стилометрических методов. Этот случай является учебником, демонстрирующим, как даже небольшой набор текстовых функций может решить давние исторические вопросы.
Шекспир и сотрудничество
Вопросы об авторстве пьес, приписываемых Уильяму Шекспиру, имеют долгую, часто спорную историю.В то время как большинство ученых согласны с тем, что Шекспир написал приписываемый ему канон, есть свидетельства сотрудничества с другими драматургами, такими как Джон Флетчер в Генри VIII и Два благородных кинзмена.Современные стилометрические исследования с использованием анализа функционального слова и символов n-грамм успешно идентифицировали руки разных авторов в совместных пьесах.Например, исследования Хью Крейга и других количественно определили отличительные стилистические маркеры Шекспира и отличили их от таковых у современников, как Кристофер Марлоу и Томас Миддлтон.
Средневековые рукописи и песня Роланда
Средневековые тексты, часто передаваемые через нескольких писцов, представляют уникальные проблемы. Песня Роланда, эпическое стихотворение одиннадцатого века, существует в нескольких версиях рукописей с различными диалектами и интерполяциями. Ученые использовали лексический и стилистический анализ, чтобы утверждать, что стихотворение не было произведением одного автора, но развивалось через слои устной и письменной передачи. Совсем недавно вычислительные методы, применяемые к Кантерберийским рассказам, помогли определить порядок сказок и даже обнаружить более ранние версии текста, которые Чосер, возможно, пересмотрел.
Проблемы и ограничения
Несмотря на успехи, авторство, атрибуция через текстовые особенности не является серебряной пулей.
Исторический язык меняется
Язык развивается со временем, и текстовые особенности писателя XVI века могут резко отличаться от текстов писателя XVIII века, даже если оба принадлежат к одному языковому сообществу.Изменения в правописании, грамматике и лексике означают, что особенности, используемые для сравнения текстов разных эпох, могут вводить в заблуждение.Исследователи должны либо ограничивать сравнения произведениями того же периода, либо нормализовать данные для учета диахронических сдвигов.
Перевод и письменное вмешательство
Когда текст переводится или копируется писцами, текстовые особенности оригинального автора становятся размытыми. Переводчики навязывают свой собственный словарь и синтаксис, в то время как писцы могут изменять орфографию, пунктуацию и даже структуру предложения. Это является основным препятствием для средневековых рукописей, где копии часто значительно отличаются от оригинала. В таких случаях атрибуция должна сосредоточиться на функциях, которые устойчивы к копированию - таких как содержание слов или тематические шаблоны - или попытка реконструировать архетип перед анализом.
Маленькая капора и проблема уникальности
Многие исторические авторы оставили после себя лишь небольшой объем работы, что затрудняет построение надежных статистических моделей. При наличии всего нескольких тысяч слов для обучения высок риск переобучения. Кроме того, анонимный текст может быть единственной сохранившейся работой его автора, в этом случае атрибуция невозможна. Исследователи должны сбалансировать статистическую строгость с исторической вероятностью, часто сочетая текстовый анализ с внешними доказательствами.
Противостоящая маскировка
Некоторые авторы намеренно маскировали свой стиль, подражая другому писателю или принимая нейтральный, бюрократический тон. Это распространено в политической пропаганде, документах, связанных со шпионажем, и подделках. В то время как стилометрические методы иногда могут преодолеть имитацию - потому что бессознательные привычки все еще просачиваются - уровень успеха резко падает, когда маскировка изощрена.
Будущие направления и новые технологии
Область авторства продолжает быстро развиваться, что обусловлено улучшением искусственного интеллекта и оцифровкой исторических архивов.
Большие языковые модели и трансформаторные сети
Трансформаторные модели, такие как BERT и GPT, показали многообещающие результаты в задачах атрибуции авторства, даже с относительно короткими текстами. Эти модели изучают контекстные представления слов, захватывая нюансы стилистических моделей, которые упускают традиционные методы n-грамм. Например, тонко настроенный трансформатор может обнаружить типичное использование автором маркеров дискурса, языка хеджирования или метафоры. Поскольку эти модели становятся более эффективными и требуют меньше данных обучения, они могут стать стандартным инструментом для исторической атрибуции.
Кросс-лингвальное и многоязычное атрибуция
Многие исторические тексты написаны на латыни, арабском, китайском или других языках, которые значительно отличаются от английского. Кросс-лингвальная атрибуция — сравнение текстов, написанных на разных языках одним и тем же автором, — остается открытой проблемой. Однако недавняя работа с использованием универсальных тегов части речи и синтаксических зависимостей показывает, что некоторые стилистические особенности являются языковыми. Это может позволить атрибуцию для двуязычных авторов или текстов, которые смешивают языки, такие как средневековые глоссы.
Интеграция с анализом исторических сетей
Авторство атрибуции не происходит в вакууме. Объединив текстовый анализ с сетевым анализом переписки, патронажа и истории публикаций, исследователи могут сузить набор правдоподобных авторов и проверить вычислительные результаты. Например, если словарь текста ближе всего к автору X, но автор X, как известно, был в изгнании во время композиции текста, совпадение может быть ложным. Интеграция внешних данных повышает общую точность и предотвращает чрезмерную зависимость от текста в одиночку.
Открытые базы данных и сотрудничество
Такие инициативы, как Институт текстовой стипендии и электронного редактирования и Вычислительные модели стиля , создают общие хранилища аннотированных исторических текстов с известным авторством. Эти базы данных позволяют исследователям сравнивать свои методы и разрабатывать более надежные модели. По мере того, как все больше исторических работ оцифровываются и помечаются метаданными, данные, необходимые для крупномасштабной атрибуции, станут широко доступными.
Заключение
Идентификация авторства анонимных исторических текстов — это работа детектива, которая сочетает в себе терпение филолога с точностью ученого данных. Текстовые особенности — от частоты общих слов до структуры предложений и шаблонов тем — дают окно в привычки писателей, давно умерших. В то время как проблемы остаются, поле сделало шаги, которые казались невозможными поколение назад. Спор о федералистских документах был урегулирован; руки коллаборационистов Шекспира были обнаружены; и когда-то неприкасаемые средневековые стихи связаны с их создателями. По мере того, как вычислительные инструменты продолжают улучшаться и расширяется историческая корпуса, мы можем ожидать, чтобы раскрыть больше скрытых голосов из прошлого, заполняя пробелы в нашем понимании того, как идеи путешествовали и культуры взаимодействовали. Сам текст, молчащий на протяжении веков, наконец начинает говорить имя своего автора.