historical-analysis-and-study-techniques
Использование компьютерного анализа текста для отслеживания распространения грамотности
Table of Contents
От чернил к алгоритмам: как анализ вычислительного текста освещает распространение грамотности
История грамотности — это не просто история о том, как больше людей учатся читать и писать. Это сложный, неравномерный процесс, формируемый экономикой, религией, политикой и технологиями. На протяжении веков историки полагались на прокси — записи о зачислении в школу, инвентаризации книг и анекдотические отчеты — для оценки того, когда и где взялась грамотность. Эти методы дали ценные, но фрагментированные взгляды. Сегодня новый набор инструментов трансформирует область. Компьютерный анализ текста позволяет исследователям добывать миллионы страниц исторического письма, обнаруживая закономерности, невидимые человеческому глазу. Измеряя изменения в словаре, синтаксисе и жанре, ученые могут проследить распространение грамотности с беспрецедентной точностью.
В этой статье объясняется, как работает компьютерный анализ текста, почему он важен для понимания истории грамотности и что его результаты показывают о движении навыков чтения и письма во времени и пространстве.
Что такое вычислительный анализ текста?
Вычислительный анализ текста (CTA) относится к набору методов, которые используют алгоритмы для обработки, количественной оценки и интерпретации больших коллекций письменных текстов. В отличие от близкого чтения, которое фокусируется на одном документе или небольшом корпусе, CTA работает в масштабе, идентифицируя статистические закономерности в тысячах или миллионах работ. Основные методы включают:
- Анализ частоты — подсчет того, как часто слова или фразы появляются с течением времени для отслеживания тематических сдвигов.
- Топическое моделирование — техника машинного обучения, которая группирует слова в кластеры (темы) на основе шаблонов совместного возникновения, раскрывая скрытые темы в корпусе.
- Анализ настроений — измерение эмоционального тона текстов для оценки общественного настроения или позиции власти.
- Стильный метрический анализ — сравнение показателей читаемости, длины предложения и богатства словаря в качестве прокси для сложности аудитории.
- Геопарирование и распознавание имен и объектов — извлечение мест, людей и организаций для отображения пространственных моделей дискурса.
Эти методы зависят от оцифрованных текстов. За последние два десятилетия массивные цифровые библиотеки, такие как Google Books, цифровая библиотека HathiTrust и британский архив газет, сделали сотни миллиардов слов доступными для исследователей. В сочетании с вычислительной мощностью эти корпуса становятся лабораториями для изучения культурной эволюции.
Почему грамотность оставляет цифровой след
Грамотность — это не просто навык, это социальная практика, встроенная в производство текстов. По мере того, как все больше людей становятся грамотными, увеличивается объем письма, меняется его язык и аудитория. Вычислительный анализ фиксирует эти преобразования по крайней мере тремя способами:
Во-первых, расширение словарного запаса. Вновь грамотные группы населения часто принимают упрощенные грамматические структуры и более конкретный словарный запас, прежде чем перейти к абстракции. Отслеживая частоту функциональных слов (статьи, предлоги) по сравнению с содержательными словами (существительные, глаголы), исследователи могут сделать выводы об изменениях в жанре и аудитории.
Второй, жанровое распространение.] По мере распространения грамотности появляются новые типы текстов: альманахи, брошюры, личные письма, дневники и, в конечном итоге, газеты и романы.Вычислительные методы могут классифицировать документы по жанру автоматически, позволяя историкам видеть, когда и где определенные формы стали обычными.
В-третьих, географическая диффузия. Используя метаданные о месте публикации или авторства, исследователи могут составить карту того, как лексические инновации — такие как новые слова или орфографические соглашения — путешествуют по торговым маршрутам, железнодорожным линиям или почтовым сетям. Эти модели часто коррелируют с расширением школьного образования и распространения книг.
Ранние применения: рост вернакулярных языков
От латыни до языка народа
Одно из самых ранних применений CTA к истории грамотности включало отслеживание перехода от латыни к народным языкам в Европе. В средние века литературное производство было во власти латыни, доступной только к духовенству и тонкой элите. К шестнадцатому веку печать позволила массовое производство книг на немецком, французском, английском и итальянском языках. Вычислительный анализ корпуса ранних английских книг онлайн показывает, что доля англоязычных публикаций выросла с менее чем 10% в 1500 году до более чем 80% к 1700 году. Этот сдвиг не был однородным; это произошло ранее в протестантских регионах, где поощрялись народные Библии, а позже в католических областях, где латынь сохранила литургическую власть.
Измерение читаемости как прокси-сервер грамотности
Исследователи также использовали формулы читаемости, разработанные для современного образования, в исторических текстах. Оценка легкости чтения Флеша, применяемая к британским брошюрам XVIII века, показывает устойчивое снижение сложности, поскольку принтеры ориентировались на читателей с более низкой квалификацией. Тексты, предназначенные для «общих читателей», использовали более короткие предложения, меньше слогов на слово и более конкретные ссылки. Эта модель коррелирует с периодами быстрого расширения школы, такими как рост воскресных школ в Англии после 1780 года.
Тематические исследования в истории вычислительной грамотности
1.Европа XIX века: бум городской грамотности
В оригинальной статье упоминалось это тематическое исследование. Давайте расширим его с вычислительными деталями. Используя базу данных газет Chronicling America, историки изучили взрыв местных газет в Соединенных Штатах и Европе. В Пруссии, например, газеты на душу населения удвоились между 1820 и 1860 годами. Тематическое моделирование этих газет показывает переход от религиозного и сельскохозяйственного контента к политическим новостям и рекламе — изменение, которое предполагает чтение общественности с базовой грамотностью и гражданским интересом. Геопарсинг показывает, что распространение читательской аудитории газет тесно следило за железнодорожными проемами, которые также несли школьных учителей и учебники в сельские районы.
Анализ настроений на письма редактору французских провинциальных газет с 1830 по 1870 год указывает на корреляцию между уровнем грамотности и частотой сложных политических аргументов.В регионах с высшим образованием письма использовали более сослагательное настроение и абстрактные существительные, предполагая, что грамотность позволяла читателям взаимодействовать с абстрактными понятиями, такими как демократия и права.
2.Ранняя современная Англия: Революция печати
Первая массовая кампания по распространению грамотности в англоязычном мире произошла в Англии в шестнадцатом и семнадцатом веках, чему способствовал акцент протестантской Реформации на чтении Библии. Вычислительный анализ английского каталога коротких заголовков (ESTC) показывает, что между 1550 и 1640 годами число изданий, публикуемых за десятилетие, увеличилось в десять раз. Ключевым сдвигом стал рост «дешевой печати» - широкоформатных баллад, альманахов и книгохранилищ - чьи простые синтаксис и повторяющиеся структуры указывают на то, что издатели ожидали полуграмотную аудиторию.
В одном исследовании использовались тематические модели 20 000 английских брошюр 1600-1700 гг. Модель выявила отчетливый «инструктивный» тематический кластер, содержащий такие слова, как «чтение», «заклинание», «катехизис» и «ребенок». Доля текстов в этой теме достигла своего пика в 1640-х и 1650-х годах, период революционных потрясений, когда парламент способствовал распространению грамотности среди солдат и простолюдинов. Географическое распространение этих брошюр, прослеживаемое через места отпечатков, показывает, что материалы по обучению грамотности перемещались из Лондона в рыночные города, а затем в деревни — образец, повторенный столетие спустя в колониальной Америке.
3. Колониальный и постколониальный контексты
В настоящее время в колониальных обществах применяется анализ вычислительных текстов. Исследователи из Хельсинкского университета использовали анализ n-грамм на индийских газетах XIX века на английском и региональных языках. Они обнаружили, что использование английских слов в народных газетах быстро росло после 1857 года, что указывает на появление двуязычного грамотного класса. Анализ настроений в бенгальских газетах с 1860 по 1900 год показывает переход от почтительного языка к напористой националистической риторике, которая потребовала бы читательской аудитории, комфортной со сложным политическим аргументом — свидетельством углубления грамотности среди индийского среднего класса.
В странах Африки к югу от Сахары тексты, созданные миссионерами, представляют собой самый ранний письменный материал на многих языках. Вычислительная стилометрия (сравнение авторских стилей) предполагает, что ранние переводы Библии на йорубу и ксхосу упрощали родные грамматические структуры, чтобы соответствовать уровню чтения новообращенных грамотных. Это оказало длительное влияние на развитие этих письменных языков.
Методологические инновации: как исследователи извлекают сигналы
Анализ N-грама
Возможно, самым простым вычислительным инструментом является n-грамма, непрерывная последовательность n слов. В Google Books Ngram Viewer популяризировалась способность составлять графики частоты фраз на протяжении веков. Для исследований грамотности n-граммы показывают принятие новых слов, таких как «телеграф» или «газета», которые указывают на расширение информационных сетей. Одно исследование британских английских n-грамм с 1700 по 1900 год показало, что фраза «читать» увеличилась в частоте на 400% между 1750 и 1850 годами, в то время как фраза «писать» увеличилась еще быстрее после 1830 года, предполагая, что навыки письма распространяются позже, чем навыки чтения.
Тема моделирования во времени
Тема моделирования, используя алгоритмы, такие как Latent Dirichlet Allocation (LDA), кластеры словарного запаса в темы, которые люди могут интерпретировать. Применительно к корпусу XVIII века Коллекции онлайн (ECCO) [[ECCO]], тема моделирования определила четкий переход от томов, доминируемых религиозными и классическими темами, к тем, в которых доминируют наука, коммерция и художественная литература после 1760 года. Этот переход согласуется с ростом «чтения общественности», демографический сдвиг, ставший возможным благодаря расширенной грамотности. Когда исследователи сравнивают тематические модели для текстов, опубликованных в Лондоне, с теми из провинциальных городов, они обнаруживают, что лондонские темы изменились быстрее — снова доказательство того, что грамотность (и связанный с ней культурный капитал) переместился из городских центров на периферию.
Стилометрические метрики читаемости
Помимо контента, вычислительные инструменты измеряют «читаемость» текстов. Индекс Коулмана-Лиау, первоначально разработанный для современного английского языка, может быть адаптирован к историческим текстам путем корректировки на изменения правописания. Применительно к корпусу из 10 000 американских романов 1770-1920 годов, показатели читаемости значительно снизились после 1840 года, когда началось движение за обычную школу. Это говорит о том, что авторы все чаще ориентируются на читателей с ограниченным формальным обучением. Такая же картина появляется в британской научной литературе: в работах популярной науки 1850-х годов использовались более короткие предложения, чем сопоставимые работы 1790-х годов.
Преимущества вычислительного анализа для истории грамотности
- Шкала: CTA может обрабатывать миллионы текстов за часы, что невозможно для одного учёного.
- Объективность: Количественные меры снижают риск получения доказательств вишнёвого цвета для поддержки уже существующего повествования.
- Сравнимость: Одинаковые методы могут применяться к различным языкам, регионам и периодам, что позволяет проводить межкультурный анализ.
- Визуализация: Графики и карты делают тенденции видимыми мгновенно, помогая как исследованиям, так и общественной коммуникации.
- Генерация гипотез: неожиданные закономерности в данных могут заставить исследователей задать новые вопросы о причинности.
Например, тематическая модель газет на немецком языке 1848-1850 годов неожиданно выявила резкое падение разнообразия лексики в консервативных изданиях, в то время как либеральные издания увеличили их. Это намекало на цензуру, подавляющую выражение среди консервативных писателей, но поскольку консерваторы были у власти, это казалось парадоксальным. Дальнейшее расследование показало, что консервативные газеты закрывались, уменьшая разнообразие голосов. Это понимание привело к пересмотренному пониманию политической роли грамотности в революционные периоды.
Проблемы и ограничения
Предвзятость в оцифровке
Не все исторические тексты выживают, а те, которые выживают, оцифровываются неравномерно. Европейские архивы отдают приоритет правительственным документам и канонической литературе, а не эфемерам, таким как торговые карты или личные письма. В результате, компьютерный анализ может преувеличивать перспективы элитных мужчин. Библиотеки на глобальном Юге часто недостаточно оцифрованы, искажая нашу картину глобального распространения грамотности.
Качество OCR
Программное обеспечение оптического распознавания символов (OCR) часто борется с историческими шрифтами, тусклыми чернилами и нерегулярным макетом. Ошибки могут достигать 30% для ранних современных текстов. Если исследователь не очищает данные, подсчеты частот становятся ненадежными. Такие инструменты, как OCR-D , повышают точность, но требуют экспертизы.
Языковая сложность
Языки со сложной морфологией (финский, арабский, кечуа) представляют проблемы для токенизации. Кроме того, историческое правописание не было стандартизировано; «чтение» может выглядеть как «реде», «рид» или «рид». Исследователи должны либо модернизировать правописание, либо использовать модели уровня символов, которые являются более вычислительно дорогими.
Интерпретирующая осторожность
Возникновение слова «свобода» в 1790-х годах в американских газетах может отражать рост грамотности — или просто Французскую революцию как тему. Вычислительные результаты должны основываться на историческом контексте и триангулироваться с архивными источниками. Это не замена традиционной стипендии, а дополнение.]
Барьеры навыков
Анализ вычислительного текста требует навыков программирования (Python, R) и знакомства со статистикой. Многие отделы истории по-прежнему не имеют подготовки в этих областях, хотя цифровые гуманитарные центры растут. Платформы с открытым исходным кодом, такие как Вояционные инструменты , снижают барьер для начинающих.
Этические и эпистемологические вопросы
Как и в случае с любым цифровым методом, CTA поднимает вопросы о том, что считается доказательством. Действительно ли частоты слов измеряют грамотность или просто интересы издателей? Раскрывает ли тематическая модель намерение автора или просто ограничения жанра? Область все еще обсуждает эти вопросы. Одной из новых передовых практик является сочетание вычислительного анализа с качественным близким чтением репрезентативных текстов - иногда называемым «далеким чтением» и «близким чтением» в тандеме.
Другая проблема — алгоритмическая предвзятость. Тематические модели обучаются любым текстам; если корпус на 90% состоит из мужчин, темы будут отражать мужские проблемы. Исследователи должны активно стремиться включать женскую письменность, колониальную литературу и другие маргинализированные голоса. Такие проекты, как Проект истории печати женщин , строят более инклюзивные корпуса именно для этой цели.
Будущие направления
Многоязычный и кросс-сценарный анализ
Большинство работ CTA было посвящено английскому языку. Но распространение грамотности часто было многоязычным — люди читали на двух или более языках. Новые модели, такие как многоязычный BERT, позволяют исследователям анализировать тексты на нескольких языках одновременно, раскрывая, как идеи и слова перемещались через языковые границы. Например, предварительная работа по средиземноморскому миру показывает, что грамотность на арабском, испанском и каталонском языках сосуществовала в ранней современной Валенсии, с вычислительным анализом, показывающим лексические модели заимствования, которые отражают религиозные и коммерческие контакты.
Малые данные и инфраструктура
Не все исследования требуют миллионов текстов. Вычислительные методы «малых данных» — применяемые к нескольким сотням тщательно отобранных документов — могут дать представление о конкретных сообществах. Рост цифровых гуманитарных центров в Африке, Азии и Латинской Америке означает, что больше местных субъектов могут рассказать свою собственную историю грамотности с помощью вычислительных инструментов.
Машинное обучение и распознавание рукописного текста
До недавнего времени компьютерный анализ текста ограничивался печатными текстами. Но Распознавание рукописного текста (HTR) быстро улучшается, позволяя ученым анализировать дневники, личные письма и административные записи — те самые документы, которые часто были первым свидетельством грамотности для простых людей. Проекты, подобные Transkribus уже обрабатывают исторический почерк с точностью более 95% для некоторых сценариев. Это откроет огромные новые архивы для исследований грамотности.
Заключение
Анализ вычислительного текста — это не волшебная палочка, а мощная линза. Превращая миллиарды слов в количественные шаблоны, он позволяет историкам видеть медленное, неравномерное распространение грамотности, как это на самом деле происходило — не как гладкую кривую, а как серию всплесков, плато и разворотов, сформированных войной, религией, торговлей и политикой. Метод показал, что народная грамотность предшествовала грамотности во многих контекстах, что читаемость снижалась по мере расширения грамотности и что печатные сети были критически важны для распространения навыков чтения.
Однако наиболее важные уроки могут быть связаны с ограниченностью доказательств. Анализ вычислительного текста показывает, что в значительной степени грамотность тех, кто мог позволить себе печатать и хранить тексты. По-настоящему маргинальные — те, кто не оставил письменного следа — остаются скрытыми. Но, объединив эти новые инструменты с традиционной архивной работой, исследователи могут более внимательно слушать голоса, которые выжили, и задавать лучшие вопросы о грамотности прошлого.
По мере того, как все больше текстов оцифровывается и алгоритмы становятся все более изощренными, наше понимание того, как распространяется чтение и письмо, только углубляется. На данный момент область находится на многообещающем пороге, где старые и новые — чернила и алгоритм — работают вместе, чтобы осветить одно из самых последовательных событий в истории человечества.