Table of Contents
Les algorithmes sont devenus des outils indispensables pour les historiens et les chercheurs qui doivent passer par les archives numériques en constante croissance de documents historiques, de recensements, de collections de journaux et d'histoires orales.Ces méthodes de calcul promettent vitesse, échelle et objectivité.Mais les promesses de neutralité peuvent être trompeuses.Les algorithmes sont conçus par des personnes, formés aux données produites par l'homme et intégrés à des hypothèses qui peuvent fausser notre compréhension du passé.
Qu'est-ce que l'algorithme ?
Dans le contexte de l'analyse des données historiques, le biais peut se manifester par la façon dont les algorithmes classent, classent ou extraient le sens de sources. Par exemple, un algorithme formé principalement sur des articles de journaux du XIXe siècle peut apprendre à associer certaines professions à des genres spécifiques simplement parce que ces enregistrements reflètent les biais de l'époque. L'algorithme reproduit ensuite ces biais dans sa production, en faisant en sorte que les préjugés historiques soient libérés dans l'analyse moderne.
Les biais peuvent entrer à plusieurs points : dans la sélection des données de formation, dans la conception de l'algorithme lui-même, dans la façon dont les données sont étiquetées, et même dans l'interprétation des résultats.
Racines historiques de la biose algorithmique
Le concept de biais algorithmique n'est pas nouveau. Les modèles statistiques utilisés dans les sciences sociales étaient souvent fondés sur des hypothèses erronées sur la race, le sexe et la classe. Par exemple, les algorithmes de notation de crédit des années 1970 discriminaient systématiquement les femmes et les minorités parce que les données de formation reflétaient les inégalités sociales. Aujourd'hui, des dynamiques similaires se produisent dans la recherche historique.
Sources des préjugés dans les données historiques
Les données historiques sont intrinsèquement incomplètes et inégales. Les biais que les algorithmes captent proviennent souvent bien avant l'écriture de tout code. Quatre sources principales méritent un examen attentif :
1. Dossiers incomplets
Les documents provenant de groupes élites, alphabétisés ou puissants sont beaucoup plus susceptibles de survivre que ceux provenant de communautés marginalisées. Les algorithmes formés sur de tels corps fragmentés vont naturellement surreprésenter certaines voix et sous-représenter d'autres. ]Les enregistrements incomplets peuvent fausser les analyses quantitatives, ce qui conduit à des allégations sur un comportement typique qui n'est en fait typique que pour un sous-ensemble étroit de la population.
2. Perspectives culturelles et partialités coloniales
De nombreuses archives historiques ont été créées par des administrations coloniales, des sociétés missionnaires ou des anthropologues qui ont enregistré des cultures autochtones à travers leurs propres objectifs culturels. Lorsque des algorithmes analysent ces textes, ils peuvent apprendre à hiérarchiser les termes, catégories et récits occidentaux. Par exemple, un algorithme chargé d'identifier des événements significatifs - dans une collection de rapports coloniaux pourrait systématiquement ignorer les mouvements de résistance indigènes parce qu'ils étaient rarement décrits dans la même langue que les affaires officielles de l'État.
3. La partialité de numérisation
Le processus de conversion de documents physiques en formats numériques introduit ses propres distorsions. Quelles collections sont financées pour la numérisation? Quelles pages sont numérisées clairement? Comment les champs de métadonnées sont-ils remplis? Les projets de numérisation favorisent souvent des matériaux visuellement propres, bien conservés et facilement catégorisés. Les marginalités manuscrites, les pages endommagées ou les scripts non standard peuvent être exclus ou mal numérisés. Ce biais de numérisation signifie que les archives numériques que nous alimentons en algorithmes ne sont pas des représentations neutres du passé; elles sont médiées par des priorités, des budgets et des limitations techniques contemporaines.
4. L'étiquetage et la formation des données
Si une équipe de recherche étiquete des photographies historiques avec des catégories de genre qui reflètent les normes modernes, elle peut mal identifier ou ignorer la diversité des genres historiques. De même, si les données de formation pour l'analyse de texte sont tirées principalement des journaux traditionnels, l'algorithme fonctionnera mal sur des bulletins de presse alternatifs ou communautaires. Le biais de la labeling compense les biais d'archives existants, créant une boucle de rétroaction où les algorithmes renforcent les chercheurs qui cherchent à surmonter les trop grandes simplifications.
Effets des préjugés sur l'interprétation historique
Les conséquences du biais algorithmique dans la recherche historique sont profondes et souvent invisibles. Les résultats biaisés peuvent conduire à des récits erronés qui faussent le passé, renforcent par inadvertance les stéréotypes et façonnent la mémoire publique de manière dommageable.
Distorsion de l'histoire quantitative
La cléométrie, l'application de méthodes quantitatives à l'histoire, repose depuis longtemps sur des modèles statistiques. Lorsque les algorithmes remplacent ou augmentent ces modèles, le risque de biais multiplie. Par exemple, un algorithme formé sur une base de données de manifestes de navires pourrait --apprendre que les marins européens étaient plus précieux que les captifs africains parce que les données de formation étaient organisées selon les pratiques comptables coloniales. L'analyse qui en résulterait traiterait alors la vie humaine selon ces mêmes évaluations déformées, perpétuant une vision du monde déshumanisante.
Marginalisation des perspectives des minorités
Un algorithme chargé d'identifier les individus notables dans un corpus historique classera probablement les figures qui apparaissent fréquemment dans les sources dominantes – typiquement blanches, masculines et riches. Les femmes, les personnes de couleur et les individus de la classe ouvrière apparaissent souvent dans des fragments ou par les yeux d'autres. À moins que les algorithmes ne soient explicitement conçus pour compenser cette asymétrie, ils reproduisent la même marginalisation que les archives originales promulguées.
Renforcement des stéréotypes actuels
Par exemple, si un algorithme analysant les statistiques de la criminalité des années 1920 conclut que certains groupes d'immigrants étaient intrinsèquement criminels, , , que la production peut être armes dans les débats modernes, ignorant les contextes sociaux et économiques qui ont réellement conduit ces statistiques. L'histoire devient un outil de bigoterie plutôt que de compréhension.
Exemples de partialité dans la pratique
Des cas réels illustrent comment le biais algorithmique affecte l'interprétation historique. Ces exemples démontrent que la question n'est pas hypothétique mais façonne déjà la bourse.
Les différences entre les sexes dans l'analyse textuelle
Les chercheurs de l'Université de Virginie ont utilisé le traitement du langage naturel pour analyser des dizaines de milliers de livres du XIXe siècle. Ils ont constaté que les algorithmes formés sur des données modernes étaient constamment mal adaptés aux sexes et occupaient des rôles qui sont aujourd'hui considérés comme atypiques pour les hommes. Par exemple, les infirmières et les médecins de sexe masculin étaient souvent mal classés. Le biais de l'algorithme n'était pas seulement un problème technique, il a effacé la réalité historique selon laquelle les rôles des hommes et des femmes ont changé au fil du temps.
Les préjugés raciaux dans les transcriptions automatisées
Les études ont montré que la précision de l'OCR est significativement plus faible pour les journaux imprimés dans les communautés noires, pour les scripts non latins et pour les documents à forte usure. Lorsque les chercheurs comptent sur la sortie de l'OCR sans recouper les contrôles, ils excluent systématiquement les documents des groupes marginalisés.Une étude de 2020 de l'Université du Maryland a révélé que les taux d'erreur de l'OCR pour les journaux afro-américains étaient jusqu'à 20% plus élevés que pour les journaux blancs traditionnels, un biais numérique qui renforce l'écart --.
Les conflits coloniaux dans les données géographiques
Les systèmes d'information géographique historiques (SIG) reposent souvent sur des cartes numérisées créées par les puissances coloniales, qui peuvent effacer les noms de lieux, les limites et les modes d'utilisation des terres autochtones. Lorsque des algorithmes analysent des données spatiales de ces cartes, ils reproduisent les géographies coloniales comme étant la défaut.
Atténuer les préjugés algorithmiques
Pour corriger les biais algorithmiques dans la recherche historique, il faut collaborer entre les technologues, les historiens, les archivistes et les communautés.
Collecte de données diversifiées et transparentes
Les chercheurs doivent rechercher activement des sources sous-représentées.Au lieu de s'appuyer uniquement sur des collections numériques importantes et bien financées, les équipes devraient s'associer aux archives communautaires, aux projets d'histoire orale et aux initiatives de numérisation de base.La documentation transparente de la provenance des données – y compris les biais, les lacunes et les limites connues – devrait accompagner chaque ensemble de données. Les ensembles de données open-source avec des énoncés de biais clairs permettent à d'autres chercheurs de comprendre et de tenir compte des distorsions.
Vérification et validation de l'algorithme
Les audits réguliers peuvent prendre des biais avant qu'ils ne faussent les résultats. Les audits doivent tester des algorithmes sur divers sous-ensembles de données, comme des matériaux de différentes périodes, régions et groupes sociaux. La validation croisée avec des historiens humains est essentielle. Par exemple, un algorithme formé pour identifier des thèmes dans les lettres peut être vérifié en faisant examiner un échantillon aléatoire de ses extrants par des experts de domaine.
Équipes interdisciplinaires
Les historiens apportent une connaissance contextuelle profonde des limites des sources; les informaticiens apportent des compétences techniques pour ajuster les modèles. Il est tout aussi important d'inclure les membres de la communauté des groupes étudiés. Leur expérience vécue et leur mémoire historique peuvent indiquer des hypothèses que les étrangers manquent.
Contre-mesures techniques
Plusieurs approches techniques peuvent aider : à augmenter les données[à équilibrer les catégories sous-représentées, à déprécier les facteurs de biaisadversairespour supprimer les corrélations fallacieuses, et à interpréter des modèles[ qui permettent aux chercheurs de voir pourquoi une décision a été prise.
Meilleures pratiques pour les éducateurs
Les éducateurs ont un rôle vital à jouer dans la préparation de la prochaine génération d'historiens et de citoyens à s'engager de manière critique dans des outils algorithmiques.
Apprendre l'algorithmie tôt
Les élèves doivent comprendre que les algorithmes ne sont pas des arbitreurs objectifs de la vérité. Introduire le concept de biais par des exercices simples en classe. Par exemple, demander aux élèves de comparer les résultats de recherche pour -Inventor- -Women inventor-------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------
Encourager l'évaluation des sources critiques
Les historiens enseignent déjà aux étudiants à interroger les sources primaires : Qui a créé ce document ? Pour quel but ? Qu'est-ce qui est oublié ? Étendre ces mêmes questions aux sorties algorithmiques. Quand un outil numérique suggère une figure -key , -, - demander aux étudiants de tracer comment l'algorithme est arrivé à cette conclusion.
Utiliser des sources diverses et contre-nartives
Par exemple, jumelez un rapport de recensement standard avec des histoires communautaires qui comblent les lacunes. Demandez aux élèves de construire leurs propres petits ensembles de données à partir de voix sous-représentées et ensuite d'exécuter des expériences d'algorithmes pour voir comment les résultats changent. L'exposition à de multiples perspectives aide les élèves à reconnaître que chaque ensemble de données reflète un point de vue limité.
Promouvoir l'utilisation éthique des outils numériques
Les éducateurs devraient modéliser la transparence. Lorsqu'ils utilisent l'analyse numérique en classe, reconnaître les limites des outils et discuter de ce qui pourrait être manqué. Créer des affectations qui obligent les étudiants à documenter les biais potentiels dans leurs propres processus de recherche. Les encourager à remettre en question les extrants automatisés et à vérifier les allégations par l'entremise de multiples sources.
Conclusion
Le biais algorithmique dans l'interprétation historique n'est pas un problème abstrait. C'est un défi concret qui façonne la façon dont nous comprenons le passé et, par extension, la façon dont nous naviguons dans le présent. Des archives incomplètes aux lacunes de numérisation jusqu'au renforcement des stéréotypes, les risques sont réels.
Les éducateurs, les archivistes et les technologues doivent travailler ensemble pour s'assurer que les outils numériques que nous construisons ne nous enferment pas dans des versions étroites de l'histoire. L'examen critique, les données diverses et les pratiques transparentes sont les fondements d'une bourse historique équitable.
Pour plus de détails sur les biais algorithmiques et les données historiques, voir Safiya Umoja Noble.Algorithmes d'oppression, la Ligue de justice algorithmique et le UN=s travaux sur l'éthique des données. Pour des lignes directrices pratiques sur l'atténuation des biais dans l'histoire numérique, consulter la série Débats dans les humanités numériques.Pour un aperçu technique de la détection des biais, voir FairML: A Practical Guide.