civil-rights-and-social-movements
Применение количественного текстуального анализа к манифестам социальных движений
Table of Contents
Пересечение вычислительной социальной науки и исследований движения
Количественный текстовый анализ стал мощной методологией для понимания того, как социальные движения конструируют свою идентичность, формулируют жалобы и мобилизуют сторонников. Преобразуя письменный язык в структурированные данные, исследователи могут раскрывать закономерности, которые оставались бы невидимыми только благодаря внимательному чтению. Этот подход находится на пересечении вычислительной лингвистики, цифровых гуманитарных наук и политической социологии, предлагая строгую основу для проверки гипотез о формировании, постановке повестки дня и идеологических изменениях во времени и пространстве.
Фундаментальная предпосылка проста: слова, которые выбирает движение, не произвольны. Частоты слов, коллокации и тематические кластеры отражают преднамеренные стратегические решения о том, как обращаться к аудитории, дифференцироваться от противников и поддерживать внутреннюю сплоченность. При применении к основополагающим текстам движений — манифестам — этот метод обеспечивает систематическое окно в риторическую ДНК коллективного действия. Для доступного введения в более широкую область см. вычислительная социальная наука в Википедии .
Почему Манифесты подходят для количественного анализа
Манифесты производятся в критические моменты — основание движения, стратегическая переориентация или в ответ на внешние события. Они обычно краткие, явно убедительные и предназначены для трансляции основных принципов. Эти характеристики делают их идеальными для сравнительного анализа: жанр относительно стабилен в разных движениях и эпохах, позволяя проводить значимые сравнения частот. В отличие от речей или интервью, манифесты часто разрабатываются коллективно и пересматриваются, то есть они представляют собой дистиллированный организационный голос, а не индивидуальную перспективу.
Более того, манифесты часто включают в себя четкую позиционную формулировку — декларации о том, за что движение выступает и против. Это делает их богатыми целями для анализа настроений и выявления фреймов. Например, вводная строка Коммунистического манифеста 1848 года о «призраке» и «коммунизме» установила боевую рамку, которая сохранялась в течение десятилетий. Кодируя такие документы, как точки данных, исследователи могут проследить, как подобные риторические стратегии принимаются, изменяются или отбрасываются по мере развития движений.
Методологическая основа текстового анализа Манифеста
1.Строительство и курирование корпуса
Создание надежного корпуса является основой любого количественного текстового анализа. Для манифестов социального движения это включает в себя определение четких критериев включения: что представляет собой манифест? Официальные учредительные заявления, резолюции конвенций и публичные декларации являются стандартными. Исследователи также должны решить, временных границ, географического охвата и включать ли внутренние документы или только публичные. Запись метаданных имеет решающее значение - дата, организация, автор(ы), контекст производства. Неудачи в корпусном строительстве распространяются в каждый последующий анализ.
Цифровые архивы, такие как NYPL Digital Collections или разделы политических документов Интернет-архива, являются ценными отправными точками. Для современных движений могут приносить тексты такие платформы, как GitHub или организационные веб-сайты. Однако применяются этические соображения: некоторые манифесты защищены авторским правом, и движения могут иметь предпочтения в отношении того, как используются их документы. Исследователи должны искать разрешения, где это возможно, и прозрачно приписывать источники.
2.Предварительная обработка: от сырого текста к анализируемым данным
Сырой текст манифеста неоднороден: непоследовательная капитализация, варианты написания (например, «труд» против «труд»), архаичная формулировка и форматирование мусора (номера страниц, заголовки). Предварительная обработка стандартизирует эти данные. Основные шаги включают:
- Токенизация: разделение на слова или n-граммы (последовательности n слов). Для манифестов би-граммы или три-граммы могут захватывать многословные лозунги, такие как «рабство на зарплату» или «климатическая справедливость».
- Нормализация: снижение каскада, удаление пунктуации и обработка дефисированных соединений.
- Прекратить удаление слов : отфильтровать очень частые функциональные слова. Однако чрезмерное удаление может потерять стилистические маркеры — некоторые исследования намеренно сохраняют стоп-слова для захвата синтаксических шаблонов (например, «мы требуем» против «они требуют»).
- Лемматизация: группирование флексированных форм.«Спрос», «требование», «требование» — все сводится к «спросу», позволяя считать частоты, чтобы отразить использование концепции, а не грамматические вариации.
- Обычная нормализация речи: необходима для исторических текстов. Феминистский манифест 1920-х годов может использовать «женское избирательное право», в то время как в 1970-х годах используется «женское освобождение». Автоматизированные словари могут сопоставлять исторические варианты с современными эквивалентами.
Инструменты, такие как Python spaCy или NLTK, обеспечивают надежные конвейеры предварительной обработки. Пакет R quanteda также популярен для корпусной лингвистики. Наилучшая практика заключается в документировании каждого решения о предварительной обработке и чувствительности к тесту: действительно ли удаление стоп-слов меняет относительную важность ключевых слов? Проверки надежности со вторым кодером или автоматизированная валидация улучшают воспроизводимость.
3. Основные аналитические методы
После предварительной обработки исследователи выбирают методы, подходящие для их исследовательских вопросов. Следующие методы наиболее распространены в анализе манифестов:
- Анализ ключевых слов: Сравнение частот слов с контрольным корпусом (например, общие политические речи) для выявления чрезмерно представленных терминов. Метрики ключевых слов, такие как лог-вероятность, показывают, что характерно для лексики движения.
- Анализ коллокации: Выявление статистически значимых пар слов. Например, в трудовых манифестах «права» часто сопоставляются с «рабочими», в то время как в экологических манифестах сопоставляются с «природой». Это показывает, как различные движения соответствуют абстрактным терминам.
- Анализ настроений: Использование словарей, таких как LIWC или AFINN, для оценки позитивности/отрицательности.Примечательным выводом является то, что революционные манифесты часто показывают повышенное негативное отношение к «системе», но высокое положительное отношение к «будущему».LIWC инструмент предлагает проверенные категории для такого анализа.
- Топическое моделирование: Алгоритмы, подобные Latent Dirichlet Allocation (LDA), раскрывают скрытые тематические структуры. Тема «прав, равенства, справедливости» может доминировать в манифестах гражданских прав, в то время как отдельная тема «правительство, контроль, свобода» характеризует либертарианские тексты. Тема моделирования особенно полезна для крупных корпусов, где ручное кодирование невозможно.
- Анализ временных рядов: Определение частот терминов или оценок настроений по датам публикации. Это может выявить точки перегиба — например, резкое увеличение «климатической чрезвычайной ситуации» после 2015 года в экологических манифестах.
Интерактивные инструменты, такие как Вояционные инструменты , позволяют новичкам экспериментировать с этими методами без программирования, в то время как продвинутые пользователи могут обратиться к библиотекам Python, таким как gensim для моделирования темы или scikit-learn для классификации.
4. Интерпретация и валидация с помощью смешанных методов
Количественные результаты требуют интерпретационного обрамления. Скачок в термине «сообщество» может указывать либо на подлинную организацию сообщества, либо на риторическую кооптацию. Исследователи должны триангулировать с историческим контекстом, качественным прочтением ключевых отрывков и интервью с участниками движения. Валидация может включать надежность межкодерного кодирования для любого ручного кодирования тем, тестирование сплит-образца для моделей тем и анализ чувствительности для выбора предварительной обработки. Цель состоит в том, чтобы построить аргумент, где вычислительные доказательства являются одной нитью в более крупном доказательственном плетении.
Тематические исследования в количественном анализе манифеста
Освобождение женщин и эволюция феминистских требований
В знаковом исследовании анализировались все манифесты женского движения США с 1964 по 2014 год, используя методы моделирования ключевых слов и тем. Ранние документы (1960-х-70-х) ранжируют «равенство», «плата» и «дискриминация» наивысшими. К 1990-м годам «репродуктивное», «насилие» и «пересечение» появляются в качестве ведущих терминов. Сюжет серии временных рядов темы «экономическое равенство» показывает снижение после 1980-х годов, в то время как «права, основанные на идентичности» растут. Это количественное доказательство подтверждает аргументы феминистских ученых о диверсификации движения и отражает более широкий культурный сдвиг от классовой ориентации к политике, ориентированной на идентичность. Исследование также показало, что манифесты 2000-х годов все чаще используют глобальный язык — «ООН» и «права человека» — отражающие транснациональные сети солидарности.
Occupy Wall Street vs. The Tea Party: лингвистическая поляризация
Сравнение манифестов «Занятие Уолл-стрит» (2011) с манифестами «Чайная партия» 2009–2012 годов показывает резкие лексические различия. Анализ частоты показывает, что «Занятие» использует «корпорации», «люди», «демократию» и «неравенство» со скоростью, в десять раз превышающей корпус «Чайной партии». Напротив, тексты «Чайной партии» плотно связаны с «налогами», «правительством», «свободой» и «конституцией». Анализ коллокации дополнительно раскрывает противоположные цели: «Занятие» объединяет «систему» с «коррупцией», в то время как «Чайная партия» объединяет «правительство» с «чрезмерным охватом». Анализ настроений показывает, что оба движения имеют высокий уровень негативного влияния на элиты, но «Занятие» направляет гнев на экономические элиты, «Чайная партия» на политические элиты. Этот вычислительный анализ подчеркивает, как популистские движения могут использовать аналогичный риторический гнев для построения различных коллективных идентичностей. Для более подробного количественного сравнения см
Экологические движения: от сохранения до климатического кризиса
Анализ основных экологических манифестов 1962 года (молчаливая весна Рэйчел Карсон считается предшественником) до 2023 года показывает драматический лексический сдвиг. В ранних документах (1960-е — 80-е годы) в топ-слова входят «сохранение», «дикая природа», «загрязнение», «виды». К 1990-м годам в лексикон вступает «глобальное потепление», а после 2015 года доминируют «климатический кризис», «декарбонизация» и «климатическая справедливость». Тематическое моделирование раскрывает три отдельных периода: «Эра сохранения» (1960—80), «Эра регуляции» (1980—2005 годы) и «Эра климатической чрезвычайной ситуации» (2005-настоящее время). Слово «устойчивое» появляется с возрастающей частотой после саммита Земли в Рио-де-Жанейро в 1992 году, в то время как «вымирание» скачет в 2010-х годах. Этот количественный портрет отражает как научные разработки, так и стратегические решения экологических организаций.
Преимущества, ограничения и этические соображения
Преимущества количественного подхода
- Масштабируемость: Анализ сотен манифестов в течение десятилетий и стран в часах.
- Объективность: уменьшает предвзятость подтверждения от исследователя, который может выборочно найти доказательства теории домашних животных.
- Повторяемость : Рабочий процесс (corpus + код) может быть совместно использован, позволяя другим проверять или расширять результаты.
- Обнаружение шаблонов : Выявляет тонкие сдвиги, которые могут пропустить качественные учетные записи, такие как медленное снижение некогда доминирующей темы.
- Сравнительная сила: облегчает бок о бок сравнения движений, которые редко анализируются вместе, выявляя неожиданные сходства или различия.
Ограничения и подводные камни
- Деконтекстуализация: Слова не учитывают иронию, сарказм и риторические расцветы. Движение может использовать «свободу» иронично, но список частот относится к нему так же, как к искреннему использованию.
- Чувствительность корпуса: Включение или исключение одного влиятельного манифеста (например, Коммунистического манифеста в трудовом корпусе) может резко изменить результаты.
- Решения о предварительной обработке : Агрессивное удаление стоп-слов может стереть значимые шаблоны слов-функций (например, использование «мы» против «они»).
- Более интерпретация : Увидев всплеск «солидарности» и приписывая его кампании профсоюзов без перекрестной проверки исторических доказательств, рискуют ложные выводы.
- Алгоритмический уклон: Лексиконы чувств часто обучаются современному, западному языку и могут неправильно классифицировать исторические или неанглийские тексты.Тематические модели требуют установления числа тем a priori, что вводит субъективность.
Этические измерения
Манифесты социальных движений часто представляют голоса маргинализированных сообществ. Исследователи должны рассмотреть, расширяет ли их анализ возможности или присваивает эти голоса. Публикация списков ключевых слов может выявить стратегический язык, который движения предпочитают поддерживать в текучести. Кроме того, автоматизированный анализ может искажать движения, где устная традиция или нетекстовая коммуникация являются центральными. Прозрачность методов, вовлекая участников движения в интерпретацию и предлагая открытый доступ к результатам, может смягчить этические риски.
Новые технологии и будущие направления
Область быстро развивается с развитием обработки естественного языка (NLP). Трансформаторные модели, такие как BERT и RoBERTa, позволяют контекстуализировать встраивание слов, то есть одно и то же слово может иметь разные семантические представления в зависимости от использования. Это позволяет более глубокий анализ фрейминга: например, «права» в феминистском манифесте могут быть семантически ближе к «репродуктивным», в то время как в трудовом манифесте это может быть ближе к «работникам».
Большие языковые модели (LLM) также облегчают семантический анализ сходства в больших телах, идентифицируя манифесты, которые напоминают друг друга по содержанию, даже если они используют различный словарный запас. Это может выявить скрытые линии влияния — например, как заявление Порт-Хурона повлияло на более поздние анархистские манифесты. Кроме того, сетевой анализ концепций — рассматривая сопутствующие термины как узлы и края — может визуализировать концептуальную структуру идеологии движения.
Другой рубеж — многоязычный анализ. Движения становятся все более глобальными, и сравнение манифестов между языками требует кросс-лингвальных вложений. Такие инструменты, как LASER или XLM-R, позволяют исследователям отображать манифесты из разных языковых традиций в общее семантическое пространство.
Цифровые архивы продолжают расширяться. Такие проекты, как Стэнфордская энциклопедия философии Цифровые коллекции и инициативы на низовом уровне, такие как Архив социальных движений, делают больше текстов доступными. По мере роста машиночитаемых корпусов потенциал для продольного анализа перекрестного движения становится более осуществимым. Исследователи могут вскоре проанализировать каждый существующий трудовой манифест с 1800 по 2020 год, отслеживая глобальное распространение фраз, таких как «работники мира, объединяйтесь».
Интеграция количественного текстуального анализа в исследование движения
Ни один метод не обеспечивает полного понимания. Наиболее надежные исследования сочетают анализ вычислительного текста с качественными историческими исследованиями, интервью и наблюдением участников. Количественный текстовый анализ превосходит вопрос «что изменилось» и «сколько», в то время как качественные методы отвечают «почему» и «что это означает». Проекты смешанных методов позволяют исследователям использовать вычислительные методы для генерации гипотез, а затем тестировать их с помощью архивных копаний - или наоборот, используя качественные идеи для выбора стоп-слов, номеров тем или справочных корпусов.
Например, исследователь может начать с моделирования темы, чтобы обнаружить, что «деколонизация» чаще появляется в манифестах климатической справедливости 2010-х годов, чем в более ранних. Затем они могут выполнять внимательное чтение этих документов, чтобы понять, как используется термин — это буквальная деколонизация или метафорическая?
По мере того, как вычислительные и социальные инструменты становятся более доступными, барьер для входа снижается. Онлайн-учебники, программное обеспечение с открытым исходным кодом и предварительно обработанные корпуса означают, что ученые с ограниченным опытом программирования могут принять эти методы. Однако потребность в критическом мышлении и знаниях домена усиливается. Техническое мастерство без существенного понимания социальных движений рискует привести к точным, но бессмысленным числам.
Количественный текстовый анализ никогда не заменит внимательного, чуткого чтения манифеста как человеческого документа. Но он может дополнять и укреплять эти чтения, раскрывая закономерности, охватывающие десятилетия и континенты. Для любого, кто изучает, как движения убеждают, мобилизуют и терпят, цифры обеспечивают мощного компаньона словам.