Présentation

Les historiens comptent depuis longtemps sur les archives, les lettres personnelles et les documents gouvernementaux pour reconstruire le passé.Mais le volume de documents non numérisés dispersés dans les bibliothèques, les musées et les collections privées a rendu l'analyse exhaustive lente et coûteuse.Au cours de la dernière décennie, une solution puissante est apparue : le crowdsourcing. En invitant le public à apporter du temps, des compétences et des connaissances locales, les chercheurs transforment la façon dont les données historiques sont recueillies, transcrites et interprétées.

Ce changement est dû à la disponibilité croissante d'outils et de plateformes numériques qui réduisent les obstacles à la participation.À mesure que les institutions du patrimoine culturel ouvrent leurs collections en ligne, le potentiel d'engagement bénévole à grande échelle s'accroît. Cet article explore comment le crowdsourcing fonctionne dans la recherche historique, ses avantages et ses défis, et comment il remodele le domaine de l'histoire computationnelle.

Qu'est-ce que le crowdsourcing dans la recherche historique?

Dans la recherche historique, ces tâches comprennent la transcription de documents manuscrits, la géolocalisation de vieilles photographies, la catégorisation d'objets archéologiques ou l'identification de noms et de dates dans les registres de recensement. Contrairement aux sciences traditionnelles citoyennes, qui sont souvent axées sur les sciences naturelles, le crowdsourcing historique fait appel à des bénévoles dans les humanités, leur demandant de débloquer des données provenant de sources primaires que la reconnaissance optique des caractères (ROC) ne peut pas gérer.

Les organisateurs de projet peuvent ensuite regrouper les résultats en ensembles de données structurés pour l'analyse quantitative, la cartographie ou l'extraction de texte. Ce mélange de connaissances humaines et d'infrastructures numériques a donné lieu à des champs comme -l'historique des données et -l'humanité numérique, où les contributions à la base de données de masse forment l'épine dorsale des études à grande échelle. Un nombre croissant d'institutions utilisent des systèmes de gestion de contenu souples comme Directus pour gérer les ensembles de données curées qui émergent de ces projets, permettant aux chercheurs de demander, de filtrer et de partager les résultats en temps réel.

L'évolution de l'histoire computationnelle

L'histoire informatique applique des techniques de la science des données, des statistiques et de l'apprentissage automatique à des sources historiques.Mais ces méthodes dépendent de données claires et structurées, et une grande partie de l'historique n'existe que sous forme analogique ou sous forme de balayages non traités. Le crowdsourcing comble cette lacune en convertissant des sources analogiques en données lisibles par machine à une fraction du coût d'embauche d'archivistes professionnels. Par exemple, le projet Ancien temps a transformé des milliers de journaux de navires manuscrits des XIXe et XXe siècles en données climatiques utilisées pour modéliser les modèles météorologiques historiques.

Les historiens de la calculation s'appuient également sur le traitement naturel du langage et l'analyse en réseau pour extraire les modèles de textes transcrits. Les ensembles de données de Crowdsource ont permis d'étudier tout, depuis la diffusion des idées dans la correspondance des Lumières jusqu'à l'évolution des pratiques agricoles dans les documents coloniaux.

Avantages du crowdsourcing pour la recherche historique

La participation du public aux travaux de données historiques offre de multiples avantages qui vont au-delà de simples économies de coûts.

  • Massive scalability:[ Un projet en ligne unique peut impliquer des milliers de bénévoles travaillant simultanément, augmentant considérablement le volume de données qui peuvent être traitées en peu de temps. Des projets comme L'indexation de la recherche familiale ont transcrit des milliards de documents généalogiques avec l'aide de plus d'un million de contributeurs. L'échelle serait impossible à atteindre par la seule transcription professionnelle traditionnelle.
  • Renseignement amélioré par redondance:[ Lorsque plusieurs bénévoles transcrivent le même document, les écarts peuvent être résolus par vote ou examen d'expert. Cette redondance peut produire des taux d'erreurs comparables ou supérieurs à ceux des transcrits professionnels, en particulier pour une écriture difficile ou une terminologie obscure.
  • Savoirs locaux de source crowd :[ Les bénévoles apportent souvent des connaissances spécialisées sur leurs propres communautés, aidant à identifier les personnes, les lieux et les événements qui seraient opaques aux chercheurs éloignés.Par exemple, les historiens locaux peuvent reconnaître les noms de famille, les repères ou les termes de dialecte dans les anciens documents.
  • Engagement du public et éducation :[ Les participants acquièrent une expérience pratique des sources historiques et apprennent les méthodes de recherche.De nombreux projets comprennent des forums, des tutoriels et des conseils de direction qui soutiennent l'intérêt et créent un sentiment de communauté.
  • Coût-efficacité:[ Le crowdsourcing réduit le besoin de services de transcription coûteux ou d'assistants de recherche temporaires. Bien que les projets nécessitent toujours un financement pour le développement et la coordination des plateformes, le rendement des investissements en termes de données produites peut être des ordres de grandeur plus élevés que les approches traditionnelles.

Projets de crowdsourcing remarquables dans l'histoire

Plusieurs projets marquants démontrent l'ampleur et l'impact du crowdsourcing historique. Chacun a contribué à des ensembles de données uniques qui ont fait des études avancées dans leurs domaines respectifs.

Temps passé

Lancée en 2010, Ancien temps invite les bénévoles à transcrire les observations météorologiques de la Marine royale et des baleiniers datant des années 1700. Les données aident les climatologues à reconstruire les conditions atmosphériques historiques avant l'existence des stations météorologiques modernes. À ce jour, plus de 30 000 bénévoles ont contribué à plus de 1,6 million de transcriptions, et de nombreuses bûches sont complétées à plusieurs reprises pour obtenir de l'exactitude. Le projet est une collaboration entre le UKS Met Office, les Archives nationales et l'Université d'Oxford.

Tracsket Bentham

Basé à l'Université College London, Transcribe Bentham demande aux bénévoles de transcrire les écrits inédits du philosophe et réformateur Jeremy Bentham (1748–1832). Le projet utilise une plate-forme de transcription personnalisée avec une fonctionnalité -intégrée --talk--pour discuter de passages difficiles. Plus de 25 000 pages manuscrites ont été transcrites, beaucoup par un groupe restreint de passionnés dédiés. Les textes qui en ont résulté ont été utilisés pour des éditions numériques et des analyses savantes, fournissant des informations sur les idées de Bentham sur le droit, la politique et l'éthique.

Projets zoonivers et historiques

Zooniverse, la plus grande plateforme mondiale de recherche axée sur les personnes, accueille de nombreux projets d'histoire. Exemples : Opération War Diary, qui engage des volontaires dans la transcription des journaux d'unités de la Première Guerre mondiale; Mesurer les ANZAC, qui capture les données des dossiers militaires néo-zélandais; et Anciens vies[, qui aide à classer des fragments de papyri grec. Zooniverse fournit une interface normalisée et des outils communautaires qui facilitent le lancement de nouvelles initiatives.

Autres efforts pionniers

L'indexation de la recherche familiale a transformé la recherche généalogique en rendant en ligne des milliards de documents vitaux.Les noms des index des bénévoles, des dates et des lieux de l'enregistrement civil, des registres paroissiaux et des relevés de recensement. Les lettres de 1916 (Irlande) ont recueilli des métadonnées et des transcriptions de lettres de la période de Pâques, en construisant éventuellement une collection numérique utilisée par les universitaires et le public. Les imprimés du Département de guerre (Université George Mason) ont utilisé le crowdsourcing pour identifier et transcrire des documents perdus dans un incendie de 1800, en ressemblant à une partie vitale de l'histoire des premiers États-Unis.

Défis et comment les surmonter

Malgré ses succès, le crowdsourcing de données historiques n'est pas sans difficultés. Pour maintenir la motivation des bénévoles, assurer la qualité des données, gérer le droit d'auteur et la vie privée, et intégrer les données crowdsourcing à l'infrastructure numérique existante, il faut planifier soigneusement.

  • Le contrôle de la qualité des données: La qualité de transcription est une préoccupation commune.Les solutions comprennent l'exigence de transcriptions multiples, la mise en oeuvre de tests de standard or (réponses connues utilisées pour évaluer l'exactitude des bénévoles) et la possibilité d'un examen par les pairs au sein de la communauté.
  • Retenue des bénévoles :[ De nombreux projets connaissent un intérêt initial élevé suivi d'un déclin abrupt. La gamification (points, badges, classements), des indicateurs de progrès clairs et une communication régulière sur les résultats de la recherche peuvent maintenir les participants engagés.
  • Bias dans les contributions: Les données provenant de sources de données peuvent refléter les caractéristiques démographiques de la base de bénévoles, qui tend à fausser les personnes âgées, plus instruites et plus riches. Cela peut influer sur l'interprétation des documents historiques. Les chercheurs devraient être transparents quant aux limites et envisager de compléter le recrutement ciblé de groupes sous-représentés.
  • Propriété intellectuelle et confidentialité:[ La numérisation de documents récents peut impliquer des restrictions de données personnelles ou de droits d'auteur.Les projets doivent obtenir des autorisations, anonymiser des informations sensibles et énoncer clairement les conditions de propriété.
  • Durée technique: La construction et le maintien d'une plate-forme de transcription personnalisée exigent du temps de développement continu. Des outils open-source comme FromThePage ou l'intégration dans des plateformes existantes (Zooniverse, ou solutions CMS sans tête comme Directus qui fournissent des schémas de données flexibles) peuvent réduire les frais généraux.

Le rôle de l'IA et de l'apprentissage automatique

Les modèles d'apprentissage automatique peuvent transcrire le texte imprimé (OCR), reconnaître l'écriture (HTR – Handwritten Text Recognition) ou suggérer des classifications pour les images. Cependant, ces systèmes sont imparfaits, en particulier avec l'écriture irrégulière, l'encre effacée ou les orthographes non standard communes dans les documents historiques. Le crowdsourcing fournit les données de formation idéales: les transcriptions volontaires deviennent des exemples marqués qui améliorent les performances de l'IA. L'IA peut à son tour pré-procéder à la numérisation en suggérant des transcriptions que les bénévoles n'ont qu'à vérifier, réduire considérablement l'effort.

Ce partenariat humain-AI est une caractéristique de l'histoire computationnelle. Par exemple, le projet British Library="Vivre avec des machines" utilise des bénévoles pour vérifier les transcriptions de journaux du XIXe siècle générées par l'IA, permettant une analyse à grande échelle du changement de langue et de l'histoire sociale.

Considérations éthiques

Bien que de nombreux bénévoles soient motivés par l'altruisme ou la curiosité, les projets devraient reconnaître les contributions, offrir des possibilités de co-auteurs, le cas échéant, et s'assurer que les données sont disponibles. La transparence sur la façon dont les données seront utilisées (p. ex., modèles climatiques, recherches généalogiques) renforce la confiance. De plus, les projets qui traitent des dossiers des communautés marginalisées doivent être sensibles à la façon dont ces histoires sont représentées.

Les meilleures pratiques comprennent la fourniture de lignes directrices claires sur la propriété des données, l'utilisation de licences Creative Commons pour les extrants et l'offre aux bénévoles de la possibilité de rester anonyme ou de recevoir un crédit public. Les projets devraient également tenir compte du travail émotionnel impliqué dans la transcription d'événements historiques traumatisants, tels que les journaux de guerre ou les registres d'esclavage.

Utilisation de la gestion moderne des données pour l'historique de Crowdsourced

Les systèmes de gestion de contenu sans tête comme Directus offrent une solution en fournissant une couche API puissante au-dessus d'une base de données SQL, avec une interface conviviale pour les conservateurs et les chercheurs. Les gestionnaires de projet peuvent définir des champs personnalisés pour chaque transcription – date, emplacement, transcrit, score de confiance – et créer facilement des relations entre les enregistrements. Le même système peut servir de données aux sites Web, outils d'analyse et dépôts d'archives publics.

Directus soutient également le contrôle d'accès basé sur le rôle, permettant aux administrateurs de projet d'attribuer différentes permissions aux bénévoles, aux évaluateurs et aux chercheurs. Son architecture extensible signifie que les étapes de travail personnalisées – comme la nécessité d'une deuxième transcription avant qu'un enregistrement soit marqué – peuvent être mises en œuvre sans codage lourd.

Orientations futures

La frontière du crowdsourcing dans l'histoire du calcul s'étend rapidement. Plusieurs tendances façonneront la prochaine décennie.

  • Intégration avec les archives numériques: Le crowdsourcing deviendra une caractéristique standard des plateformes d'archives en ligne, permettant aux utilisateurs de transcrire des documents directement dans les interfaces de recherche de catalogue.
  • Collaboration en temps réel:[ De nouveaux outils permettent à plusieurs bénévoles de travailler simultanément sur le même document, comme un Google Doc mais avec un contrôle de version. Cela accélère la transcription des longs enregistrements et favorise l'interaction communautaire.
  • Le crowdsourcing géospatial : Le couplage des données transcrites aux cartes au moyen de systèmes d'information géographique (SIG) permet l'analyse spatiale.Les bénévoles peuvent tracer des voyages de navires, des itinéraires de migration de traces ou des cartes des bâtiments historiques.
  • Gamification et réalité virtuelle:[ Des expériences immersives, comme l'exploration d'un milieu de travail virtuel du XIXe siècle tout en transcrivant ses cartes de temps, pourraient attirer des bénévoles plus jeunes et rendre le processus plus engageant.
  • Les projets en langage brut et en plusieurs textes: À mesure que les humanités numériques se mondialisent, le crowdsourcing s'attaquera aux documents en arabe, chinois, cyrillique et autres scripts.
  • Assurance de la qualité automatisée :[ Les modèles d'apprentissage automatique repèrent de plus en plus les anomalies dans les données transcrites, comme les dates improbables ou les noms de lieux, et les signalent aux fins d'examen par des humains, ce qui réduit le fardeau des examinateurs bénévoles et accélère la publication de ensembles de données exacts.

Conclusion

En exploitant l'effort collectif des bénévoles, les chercheurs peuvent traiter de grandes quantités de données historiques qui resteraient autrement inaccessibles. La synergie entre l'intelligence humaine et l'apprentissage automatique ouvre de nouvelles questions sur le climat, la société, la culture et le pouvoir. Les défis entourant la qualité, l'éthique et la durabilité demeurent, mais les succès de projets comme Old Weather, Transcribe Bentham et la famille Zoonife montrent que le modèle fonctionne. Pour les historiens et les archivistes, le message est clair : le public est prêt à aider. Construire l'infrastructure, les communautés et les systèmes incitatifs pour canaliser cette énergie définira la prochaine vague de découvertes historiques.Le passé n'est plus un livre fermé – il s'agit d'un projet partagé, écrit par de nombreuses mains, géré avec des outils modernes, analysé avec une puissance informatique qui se perfectionne chaque année.