Le passage du numérique dans la recherche historique

Pendant des générations, l'étude des mouvements sociaux s'est appuyée sur des travaux d'archives assidus : lire des lettres d'organisateurs, coder manuellement la couverture des journaux et mener des histoires orales.Ces méthodes donnent de riches aperçus qualitatifs, mais elles manquent souvent les tendances à grande échelle qui émergent lorsque des milliers d'événements ou de documents sont examinés ensemble.L'histoire informatique change cette situation en appliquant des méthodes quantitatives à des sources numérisées, en permettant aux chercheurs de poser des questions qui étaient auparavant impossibles à répondre.

Ce changement ne consiste pas seulement à utiliser les ordinateurs pour faire plus rapidement le vieux travail. Il représente un changement fondamental dans l'épistémologie de la recherche historique. Lorsque les historiens traditionnels construisent souvent des arguments à partir d'exemples soigneusement sélectionnés, les historiens computationnels peuvent tester des hypothèses contre l'univers complet des preuves disponibles. Par exemple, plutôt que de s'appuyer sur quelques discours célèbres pour caractériser un mouvement, un chercheur peut analyser le sentiment à travers chaque discours, dépliant et communiqué de presse produit par cette organisation sur une décennie. Cela rapproche la discipline de l'enquête reproductible et fondée sur des données probantes tout en respectant la profondeur d'interprétation que l'histoire exige.

Principales méthodes informatiques dans la recherche sur les mouvements sociaux

Une trousse d'outils diversifiée a été mise au point, chaque méthode étant adaptée à différents aspects de la dynamique des mouvements sociaux. Ci-dessous sont les techniques les plus largement adoptées, ainsi que des exemples de la façon dont elles sont appliquées.

Extraction de textes et traitement de la langue naturelle

Text mining allows historians to extract themes, sentiments, and framing strategies from large corpora of documents. Using techniques such as topic modeling (e.g., Latent Dirichlet Allocation) and named entity recognition, researchers can identify how movements construct their messages and how those messages change over time. For example, a study of the U.S. civil rights movement might mine thousands of newspaper articles to track the shifting prominence of terms like “nonviolence,” “freedom,” and “justice” across different years and regions. Sentiment analysis can reveal whether media coverage of a protest becomes more positive or negative as the movement gains power, offering insights into the relationship between public opinion and mobilization. Advanced natural language processing models, including transformer-based architectures like BERT, now enable researchers to detect more nuanced linguistic features, such as irony or dog whistles, that earlier keyword-based methods would have missed. Researchers at the Observatory on Social Media (OSoMe) at Indiana University have been at the forefront of developing these tools for protest contexts, providing open-access platforms for analyzing information diffusion.

Analyse de réseau

L'analyse des réseaux permet de cartographier les liens entre les individus, les organisations et les événements. En reconstituant le graphique social d'un mouvement, qui communiquait avec qui, quels groupes partageaient les ressources, quels militants étaient les plus centraux, les chercheurs peuvent identifier les influenceurs clés, les rôles de courtage et la dynamique structurelle qui permettent ou limitent l'action collective.Par exemple, l'analyse de la correspondance par courriel des organisations de justice climatique peut montrer comment l'information circule entre les chapitres locaux et les organismes de coordination internationaux.Des outils comme Gephi ou NetworkX[ sont couramment utilisés pour visualiser ces réseaux, rendant visibles les schémas relationnels abstraits.Cette méthode est particulièrement puissante pour étudier la formation et la fragmentation de coalitions.

Analyse géospatiale et cartographie des événements

L'analyse géospatiale ajoute une dimension spatiale à l'étude des manifestations. En géocodant les lieux des manifestations, des arrestations ou des actions policières, les historiens peuvent examiner la façon dont les mouvements se propagent géographiquement.Les manifestations sont-elles plus susceptibles de se regrouper dans les centres urbains? La densité des manifestations est-elle en corrélation avec des variables démographiques comme l'inégalité des revenus ou la ségrégation raciale? L'agrégation des données des journaux, des registres de police et des registres des médias sociaux permet aux chercheurs de créer des cartes interactives des vagues de protestation.

Modélisation temporelle et analyse de séquence

La modélisation temporelle met l'accent sur le moment et le séquençage des événements.Une action gouvernementale particulière a-t-elle provoqué une augmentation soudaine des manifestations ou une mobilisation progressive? En appliquant l'analyse des séries chronologiques aux bases de données des manifestations, les chercheurs peuvent détecter des indicateurs d'escalade de premier plan, comme les pics de colère en ligne ou la formation de nouvelles organisations. L'analyse des séquences, empruntée à la biologie, peut classer différents cycles de vie des mouvements — certains suivent un modèle d'augmentation et de chute rapide, tandis que d'autres maintiennent une activité de faible niveau pendant des décennies. Ces modèles aident à distinguer entre les modes éphémères et les forces sociales durables. L'analyse des événements, une famille de techniques statistiques utilisées largement en sociologie, a été réutilisée par les historiens computationnels pour modéliser la durée des campagnes de protestation et le calendrier des concessions des autorités.

Apprentissage automatique pour la détection d'événements de protestation

Un nouvel ajout à la trousse est apprentissage automatique pour la détection des manifestations, qui utilise des algorithmes pour identifier automatiquement les manifestations de protestation provenant de sources textuelles non structurées. Les bases de données traditionnelles sur les manifestations de protestation ont exigé des codeurs humains pour lire chaque article de nouvelles et le classer, un processus lent et coûteux. Des modèles d'apprentissage supervisé, formés sur des exemples codés manuellement, peuvent maintenant analyser des millions d'articles d'actualité et de messages sur les médias sociaux pour identifier des mots clés, des modèles de syntaxe et des indices contextuels associés aux manifestations de protestation. Par exemple, les chercheurs ont développé des classificateurs qui distinguent les rapports de marches pacifiques et les émeutes violentes avec une grande précision.

Études de cas: Méthodes informatiques en action

Le Printemps arabe et le Rhétorique de la Révolution

Les insurrections du printemps arabe de 2010 à 2012 sont parmi les exemples les plus étudiés d'histoire computationnelle appliquée aux mouvements sociaux.Des chercheurs de l'Université de Washington et d'autres ont analysé des millions de tweets d'Egypte, de Tunisie et de Libye pour suivre la propagation de hashtags liés aux manifestations comme #Jan25 et #SidiBouzid.En construisant des réseaux de retweet, ils ont identifié quels comptes servaient de centres d'information et comment les récits de protestation traversaient les frontières linguistiques et nationales.Un article historique de Howard et Hussain (2013) a montré que les conversations en ligne ont précédé les manifestations de rue de plusieurs jours, suggérant que les plateformes numériques jouaient un rôle causal dans la facilitation de la mobilisation, et non seulement l'amplifier. L'analyse a également révélé que les comptes parrainés par l'État tentaient de perturber les réseaux d'opposition, un schéma qui deviendrait au centre des travaux ultérieurs sur l'autoritarisme numérique.

Black vit la matière et la géographie de la protestation

Les historiens computationnels ont combiné les données géospatiales (des rapports de police et des archives d'actualités) avec les données de Twitter pour cartographier les manifestations de 2020 suite au meurtre de George Floyd. Une étude publiée dans Nature Communications a démontré que les manifestations de protestation ne se concentraient pas uniquement dans les grandes villes côtières mais se répandaient dans des milliers de petites villes, dont beaucoup n'avaient pas d'antécédents de manifestations des droits civils. L'analyse en réseau de hashtags co-retweeted a montré que les chapitres locaux conservaient des identités distinctes tout en participant à une conversation nationale partagée. Cette vision granulaire contredit les récits plus anciens qui dépeignent BLM comme un mouvement descendant, sans leader ou purement urbain.

L'activisme climatique au fil des générations

Les mouvements climatiques comme Fridays for Future offrent l'occasion d'étudier comment l'organisation numérique se fait entre les campagnes en ligne dirigées par les jeunes et les structures traditionnelles des ONG. L'extraction de texte des communiqués de presse de 350.org et les données Twitter issues des grèves étudiantes ont permis de dégager des stratégies rhétoriques distinctes : des militants plus jeunes ont souligné l'urgence morale et le sacrifice personnel, tandis que des organisations plus âgées ont conçu l'action climatique comme une opportunité économique. L'analyse temporelle révèle en outre que la visibilité en ligne de l'activisme climatique s'accentue pendant des semaines où les événements météorologiques extrêmes sont dans les journaux, mais que cette attention s'estompe rapidement – un schéma qui pose des défis pour maintenir la pression à long terme sur les décideurs.

Le mouvement MeToo et la diffusion narrative

Les chercheurs ont utilisé l'extraction de texte pour suivre comment le hashtag s'est propagé de ses origines dans le travail de l'activiste Tarana Burke à travers le moment viral de 2017 et dans l'utilisation mondiale de plus de 85 pays. La modélisation thématique de millions de tweets a révélé que le discours de #MeToo a évolué au cours de trois phases distinctes : une vague initiale de témoignages personnels, une phase subséquente de contre-coups et de critiques, et une phase ultérieure axée sur les exigences politiques et la responsabilité organisationnelle. L'analyse géospatiale a montré que le mouvement a particulièrement résonné dans les pays dotés d'infrastructures féministes et de cadres juridiques existants pour le harcèlement sexuel, mais il a également déclenché des contre-coups dans des contextes où les normes patriarcales sont profondément ancrées. L'analyse du sentiment de couverture des nouvelles dans les langues a montré que le cadre médiatique de #MeToo variait considérablement selon les régions, les points de vente scandinaves mettant l'accent sur la réforme juridique tandis que la couverture du Moyen-Orient était axée sur l'honneur et la réputation.

Défis et considérations éthiques

Diagnostic des données et représentativité

Les archives coloniales, par exemple, représentent trop les activités des puissances impériales tout en effaçant les voix des peuples colonisés. Les données des médias sociaux s'éclipsent vers les jeunes utilisateurs, les utilisateurs urbains et relativement riches, ce qui signifie que les mouvements dirigés par des groupes marginalisés peuvent être invisibles à certains algorithmes. Les historiens doivent constamment se demander ce qui manque : un modèle d'extraction de texte formé sur des tweets en langue anglaise manquera les hashtags en langue arabe qui ont provoqué les manifestations libanaises de 2019. Sans une attention particulière à ces lacunes, l'histoire computationnelle risque de reproduire les mêmes inégalités que l'histoire traditionnelle a souvent renforcées. Le problème des biais de données est aggravé par le fait que les efforts de numérisation ont toujours favorisé les institutions d'élite et le contenu occidental.

Les tensions éthiques dans la réutilisation des données numériques

Les ensembles de données massives utilisés dans l'histoire informatique proviennent souvent de plateformes de médias sociaux, qui n'ont jamais été conçues pour la recherche. Les chercheurs sont confrontés à des questions épineuses sur la vie privée et le consentement : peuvent-ils citer un tweet supprimé d'un organisateur de protestation qui a depuis été arrêté ? devraient-ils publier des cartes de réseau qui révèlent les liens des militants dans les régimes répressifs ? Les commissions d'examen institutionnel et les conditions de service de la plateforme fournissent des conseils incomplets. Certains chercheurs adoptent maintenant des pratiques -data -d'épaisseur, en associant l'analyse computationnelle à un travail qualitatif sur le terrain pour s'assurer que les personnes derrière les données sont traitées avec dignité. Le débat est en cours, mais le large consensus est que les historiens computationnels doivent être transparents sur leur provenance des données et disposés à limiter la publication de documents sensibles.

La nécessité d'une formation interdisciplinaire

L'histoire informatique efficace exige des compétences dans au moins trois domaines : méthodologie historique, analyse statistique et codage. Peu de chercheurs possèdent les trois domaines, ce qui entraîne un écart de compétences qui peut produire des revendications peu profondes. Par exemple, un chercheur peut signaler avec confiance une corrélation entre la fréquence des manifestations et l'activité des médias sociaux sans contrôler la densité de population ou la pénétration d'Internet.Les programmes de doctorat ont commencé à offrir des pistes combinées en sciences humaines numériques et en sciences sociales informatiques, mais le domaine manque encore de programmes normalisés. Jusqu'à ce que cela change, l'examen par les pairs des documents d'histoire computationnelle doit inclure des évaluateurs qui peuvent évaluer à la fois l'argument historique et la mise en oeuvre technique.

Orientations futures et frontières émergentes

Intégration des données multimodales

L'histoire de la plupart des calculs jusqu'à présent a porté sur le texte, mais les mouvements sociaux produisent aussi des images, des vidéos et des images audio, depuis les murales de protestation et les images de caméra corporelle jusqu'aux podcasts et aux danses de TikTok. Les progrès de la vision informatique et de la reconnaissance de la parole commencent à permettre aux historiens d'analyser ces sources multimodales à l'échelle. Imaginez une étude qui classifie automatiquement des milliers de photographies de protestation par ton émotionnel (danger, joie, peur) ou qui extrait des slogans parlés de communications radio enregistrées par la police au cours d'une démonstration. L'intégration de ces modalités donnera une image plus riche de la façon dont les mouvements se représentent et les autorités réagissent.

Modélisation prédictive et historique contre-factuel

Certains chercheurs expérimentent des modèles prédictifs qui évaluent la probabilité de résultats précis, comme un mouvement qui change de politique ou une manifestation qui devient violente, en se basant sur des signaux précoces. Bien que controversés (l'histoire n'est pas un laboratoire où des conditions identiques peuvent être réutilisées), ces modèles peuvent servir à des fins heuristiques.Ils aident les chercheurs à définir quelles variables ils croient les plus importantes et permettent la construction de scénarios contrefactuels : -Would le boycottage des bus Montgomery ont réussi si la Cour suprême n'avait pas statué sur Browder v. Gayle?- Ces questions, bien que spéculatives, aiguisent le raisonnement sur la causalité. Récemment, les chercheurs ont appliqué des modèles d'apprentissage automatique à des données historiques de protestation des années 1960 et 1970, en concluant que les meilleurs prédicteurs du succès des mouvements sont la construction de coalitions soutenues et la présence de couverture médiatique sympathique – variables qui prédisent également le succès dans les mouvements contemporains.

Modèles de collaboration et de science ouverte

La transformation informatique a également favorisé de nouvelles formes de collaboration.Des projets à grande échelle comme la Base de données mondiale sur les événements, la langue et les tons (GDELT)[ ou la Mobilisation: Données sur les mouvements sociaux les contributions agrégées de dizaines d'universités et permettent des analyses en aval par quiconque ayant accès à Internet. Cette approche scientifique ouverte accélère la découverte mais pose également des problèmes de qualité des données lorsque les contributeurs utilisent des systèmes de codage incohérents. Le domaine sera probablement convergent sur des normes et des pratiques de curation partagées qui équilibrent l'inclusion avec la rigueur.

Conclusion : Une image plus complète de l'action collective

En combinant l'échelle et la reproductibilité du calcul avec la profondeur d'interprétation de la recherche qualitative, les chercheurs peuvent maintenant répondre à des questions sur les mouvements sociaux qui étaient autrefois hors de portée : Comment les idées voyagent-elles au-delà des frontières ? Quelles conditions structurelles rendent les manifestations contagieuses ? Quels militants deviennent oubliés, et pourquoi ? Le champ de la promesse n'est pas de réduire l'histoire en nombres, mais d'utiliser les chiffres pour voir l'histoire plus clairement – y compris les rythmes de résistance qui ont toujours façonné la société humaine.

Pour de plus amples informations sur les méthodes et l'éthique, voir le projet Data for History (un consortium international développant les meilleures pratiques pour l'histoire informatique) et l'Observatoire des médias sociaux (OSoMe)[ de l'Université d'Indiana, qui fournit des outils pour analyser la diffusion de l'information dans les contextes de protestation.