study-guides-and-learning-resources
L'histoire de l'intelligence artificielle : des théoriciens logiques à l'apprentissage profond
Table of Contents
L'intelligence artificielle n'est pas une invention soudaine, mais l'aboutissement de décennies d'exploration théorique, de percées techniques et de débats philosophiques sur la nature même de la pensée. L'histoire commence bien avant le premier ordinateur, avec des mathématiciens et des logiciens demandant si le raisonnement humain pourrait être mécanisé.
La Genèse de l'intelligence artificielle
La naissance formelle de l'IA comme discipline scientifique est souvent tracée au milieu des années 1950, mais ses racines intellectuelles remontent aux années 1940 et même plus tôt. Des visionnaires comme Alan Turing ont posé le fondement philosophique en redéfinissant ce que cela signifie pour une machine à penser.
Le test de turing et les premières machines théoriques
Dans son article de 1950, Computing Machinery and Intelligence, Turing propose le jeu d'imitation -un test où un interrogateur humain interagit avec un humain et une machine par le biais d'un texte, et la machine passe si elle peut tromper l'interrogateur en pensant qu'il est humain. Ce concept, maintenant appelé le test de turing, transforme la question -"Les machines peuvent-elles penser? - en un défi opérationnel et mesurable.
En 1943, Warren McCulloch et Walter Pitts publièrent simultanément un modèle mathématique de neurones artificiels, démontrant que les réseaux de simples commutateurs en panne pouvaient calculer toute proposition logique. C'était l'un des premiers ponts conceptuels entre la neuroscience et le calcul, laissant entendre l'approche connectiste qui allait devenir dominante plus tard.
Atelier de Dartmouth de 1956
L'été 1956 marqua la fondation officielle de l'intelligence artificielle. John McCarthy, Marvin Minsky, Nathaniel Rochester et Claude Shannon ont organisé un atelier de six semaines au Dartmouth College, réunissant une vingtaine de chercheurs pour explorer -la conjecture que chaque aspect de l'apprentissage ou toute autre caractéristique de l'intelligence peut être décrit si précisément qu'une machine peut être faite pour la simuler.- L'atelier n'a pas produit de percées immédiates, mais il a donné au nouveau domaine un nom et une vision partagée.
Le théoricien logique et l'IA symbolique
L'une des premières démonstrations de raisonnement machine fut le Théoriste logique, développé par Allen Newell, Herbert Simon et Cliff Shaw en 1955–1956. Le programme prouva 38 des 52 premiers théorèmes de Whitehead et Russells Principia Mathematica, et, dans un cas, il découvrit une preuve plus élégante que l'original.Cette réalisation démontra qu'un ordinateur pouvait accomplir des tâches qui semblaient nécessiter une perspicacité humaine.Le Théoriste logique s'appuyait sur un ensemble de règles logiques et un processus de recherche – une marque de ce qui était connu sous le nom d'IA symbolique ou de bonne ancienne AI.
Les premiers chercheurs ont construit des programmes qui pourraient résoudre les problèmes de mots algébriques, effectuer des épreuves géométriques, et même jouer aux échecs. L'optimisme du domaine était palpable: en 1958, Simon a prédit qu'un ordinateur serait le champion mondial des échecs dans une décennie, et Minsky , groupe au MIT a travaillé à émuler la vision humaine et la compréhension du langage.
Les réseaux Perceptron et les réseaux neuronaux précoces
Parallèlement à l'approche symbolique, une voie différente était explorée. En 1958, le psychologue Frank Rosenblatt introduisit le Perceptron, un dispositif électronique inspiré par les neurones biologiques. Le Perceptron pouvait apprendre à reconnaître des modèles simples en ajustant les poids de connexion en fonction d'exemples d'entraînement. Le travail de Rosenblatt a généré une énorme excitation; le New York Times a rapporté que la Marine s'attendait à ce que la machine puisse marcher, parler, voir, écrire, se reproduire et être consciente de son existence.
Cependant, les limites des Perceptrons monocouches furent bientôt exposées. Dans leur livre de 1969 Perceptrons, Minsky et Seymour Papert ont mathématiquement prouvé qu'un Perceptron monocouche ne pouvait résoudre de simples problèmes non linéaires comme la fonction XOR. Cette critique, combinée à l'absence de puissance de calcul pour former des réseaux plus profonds, a conduit à une réduction drastique du financement et de l'intérêt pour la recherche sur les réseaux neuronaux – un préfiguration des hivers d'IA à venir.
L'ère de l'IA symbolique et des systèmes experts
Au cours des années 1960 et 1970, l'approche symbolique de l'IA a dominé. Les chercheurs ont mis l'accent sur la construction de systèmes fondés sur des règles capables d'exposer des performances de niveau expert dans des domaines étroits.
Systèmes fondés sur les règles et premier hiver de l'IA
Les années 1960 ont vu le développement de programmes comme SHRDLU par Terry Winograd, qui pouvait comprendre les commandes en langage naturel sur un monde de blocs virtuels. Pourtant, alors que les chercheurs essayaient d'élargir ces systèmes pour gérer la complexité du monde réel, ils ont rencontré une dure réalité : le nombre de règles nécessaires pour représenter le bon sens était énorme, et les systèmes étaient brisés face à des informations ambiguës ou incomplètes.
Systèmes experts et réussite commerciale
L'IA a réapparu dans les années 80 avec l'essor commercial des systèmes d'experts. Ces programmes ont codé la connaissance des experts humains en de grands ensembles de règles IF-THEN, appliquées par des moteurs d'inférence. Des systèmes comme le MYCIN pour diagnostiquer les infections bactériennes, le DENDRAL pour analyser les données de spectrométrie de masse, et le XCON (R1) pour configurer les systèmes informatiques VAX chez Digital Equipment Corporation ont démontré que l'IA pouvait fournir une valeur commerciale réelle.
Les systèmes experts ont été adoptés par les entreprises, et l'industrie des machines Lisp est apparue. Cependant, leur fragilité et leurs coûts d'entretien élevés, combinés à l'arrivée d'un calcul à usage général moins cher, ont conduit à un second refroidissement.
Le changement de paradigme de l'apprentissage automatique
Alors que l'approche symbolique stagne, une révolution tranquille se construisait. Les chercheurs ont commencé à se concentrer sur la programmation de règles explicites pour développer des algorithmes qui pourraient apprendre des données. Ce paradigme d'apprentissage automatique allait éventuellement dominer la recherche et les applications en matière d'IA.
De la réglementation aux données : L'élévation des méthodes statistiques
Dans les années 1990, le domaine de l'apprentissage automatique est apparu comme une discipline distincte, mettant l'accent sur les modèles statistiques, l'apprentissage axé sur les données et la validation empirique.Au lieu de fixer des règles de codage manuel pour chaque tâche, les chercheurs ont formé des modèles sur de grands ensembles de données.
À IBM, les recherches sur la traduction statistique par machine et la reconnaissance de la parole ont montré que les méthodes probabilistes pouvaient surpasser les systèmes fondés sur des règles sur les tâches réelles. Cette période a également vu la montée de la machine vecteur de support (SVM), un puissant algorithme de classification qui pendant de nombreuses années a été l'état de l'art de la reconnaissance manuscrite des chiffres et de la catégorisation des textes.
La renaissance des réseaux neuraux : rétropropagation et réseaux multicouches
Bien que les réseaux neuraux aient perdu de leur faveur, un groupe de chercheurs dévoués a maintenu la flamme. Dans les années 1980, la redécouverte et la popularisation de l'algorithme de la rétropropagation, notamment grâce au travail de David Rumelhart, Geoffrey Hinton et Ronald Williams en 1986, ont permis de former efficacement des réseaux neuronaux multicouches. La rétropropagation a permis au réseau d'ajuster sa couche de poids par couche, en résolvant le problème XOR et bien d'autres qui avaient stigmatisé le Perceptron.
Dans les années 1990, Yann LeCun a appliqué des réseaux neuronaux convolutionnels (CNN) à la reconnaissance manuscrite des chiffres, créant ainsi l'architecture LeNet qui a été finalement déployée par les banques pour lire les vérifications. Bien que ces réseaux fonctionnent bien, les étendre à des problèmes plus complexes comme la reconnaissance générale de l'image est encore entravé par une faible puissance de données et de calcul.
Ensemble Methods et l'attente des données et calcul
Les réseaux neuraux sont restés un outil de niche pour des tâches spécialisées. Le tournant était cependant proche, car Internet générait des ensembles de données massives, et la technologie GPU, initialement conçue pour les jeux vidéo, était sur le point d'être réutilisée pour le calcul parallèle dans la formation de réseaux neuraux profonds.
La révolution de l'apprentissage profond
La convergence des mégadonnées, des GPU puissants et des innovations algorithmiques au milieu des années 2000 a déclenché une explosion dans l'apprentissage profond.
La percée d'AlexNet et d'ImageNet
Le moment décisif est venu en 2012, quand Alex Krizhevsky, Ilya Sutskever et Geoffrey Hinton sont entrés dans le défi de reconnaissance visuelle à grande échelle ImageNet avec un réseau neuronal convolutionnel profond, maintenant connu sous le nom AlexNet. Il a obtenu un taux d'erreur de 15,3%, fracasser la prochaine entrée de 26,2%. AlexNet a utilisé les GPU pour la formation, utilisé les fonctions d'activation ReLU pour accélérer l'apprentissage et introduit l'abandon pour la régularisation.
Traitement du langage naturel: de Word2Vec aux transformateurs
En 2013, Tomas Mikolov et son équipe chez Google ont introduit Word2Vec, une méthode d'apprentissage des représentations vectorielles de mots de grands corps. Ces ancrages capturaient les relations sémantiques ; par exemple, - - king – homme + femme - , ont abouti à un vecteur proche de -queen.
Cependant, la véritable révolution est venue en 2017 avec la publication du document -Attention Is All You Need - par Vaswani et al., qui a introduit l'architecture Transformer. Transformers a remplacé les couches récurrentes et convolutionnelles par des mécanismes d'auto-attention, permettant la parallélisation et captant des dépendances à longue distance.
L'IA et les modèles linguistiques de grande envergure
En 2020, OpenAI a publié GPT-3, un modèle linguistique de 175 milliards de paramètres qui a démontré des capacités d'apprentissage remarquables à faible et zéro capture. GPT-3 pourrait générer des essais cohérents, traduire des langues, écrire du code et répondre à des questions complexes, souvent sans réglage précis de la tâche. Ce modèle a illustré le concept de modèles de fondation – systèmes à grande échelle qui peuvent être adaptés à un large éventail d'applications en aval.
Renforcement de l'apprentissage et du jeu: AlphaGo et au-delà
En 2016, DeepMind , le champion du monde de la défaite d'AlphaGo, Lee Sedol, a remporté un match de cinq matchs. L'immense facteur de branchement de Go , qui a longtemps été considéré comme hors de portée des méthodes de recherche de force brute, a utilisé un réseau neuronal profond pour évaluer les positions du conseil d'administration et guider une recherche d'arbre Monte Carlo, en apprenant à la fois des jeux humains et de l'auto-jouage. La victoire a été un jalon culturel, démontrant que l'IA pouvait maîtriser même les jeux humains les plus intuitifs et complexes.
Les systèmes ultérieurs comme AlphaZero ont appris à jouer aux échecs, shogi, et Go entièrement de l'auto-joueur, sans aucune donnée humaine, atteindre la performance surhumaine en heures. Ces percées ont mis en évidence la généralisabilité de l'apprentissage de renforcement profond.
Défis, éthique et voie à suivre
À mesure que les systèmes d'IA deviennent plus puissants et plus répandus, ils posent de nouveaux défis qui vont au-delà des performances techniques.
Explicabilité et partialité
Les modèles d'apprentissage approfondi sont souvent des boîtes noires, leur raisonnement interne est inconcevable même pour leurs créateurs. Ce manque d'explication pose des problèmes dans les applications à haut débit comme le diagnostic médical, la notation de crédit et la justice pénale, où la compréhension des bases d'une décision est cruciale. Les erreurs dans la formation des données peuvent perpétuer et amplifier les inégalités sociétales. Par exemple, les systèmes de reconnaissance faciale ont montré des taux d'erreur plus élevés pour les personnes de couleur.
Sécurité, alignement et problème de valeur
Le problème de l'alignement - - - demande comment spécifier des objectifs afin qu'une AI fasse ce que nous voulons sans conséquences néfastes involontaires. Les progrès dans le renforcement de l'apprentissage de la rétroaction humaine (RLHF) ont été essentiels pour rendre les modèles comme ChatGPT plus utiles et plus sûrs. Pourtant, des questions ouvertes restent sur le contrôle à long terme, l'abus potentiel et la concentration du pouvoir parmi quelques grandes entreprises technologiques.
La quête de l'intelligence générale artificielle
Le rêve originel de l'IA était de créer une machine avec une intelligence générale semblable à l'homme, capable de résoudre tout problème intellectuel. Aujourd'hui, les systèmes excellent dans des tâches étroites mais manquent de raisonnement souple et sensé que les humains montrent sans effort. Le progrès vers l'AGI reste profondément incertain, avec des échéanciers allant d'une décennie à jamais.
Des organisations comme DeepMind, OpenAI et des laboratoires universitaires du monde entier sont activement en recherche d'architectures qui pourraient nous rapprocher de l'AGI. Bien que la voie à suivre soit loin d'être claire, l'expansion constante des capacités de l'IA suggère que le parcours est loin d'être terminé.
Conclusion
L'histoire de l'intelligence artificielle est une histoire de cycles — d'ambitions envolées, d'hivers amers et de renaissances spectaculaires. Du théoricien logique aux premières preuves d'arrêt à la prose fluide générée par le GPT-3, l'IA a parcouru une longue et sinueuse route. Chaque époque est le paradigme dominant – logique symbolique, systèmes experts, apprentissage statistique et apprentissage profond – a contribué une pièce cruciale au puzzle.
En attendant, les défis de la construction de systèmes robustes, justes et compréhensibles sont aussi importants que l'échelle vers des modèles toujours plus grands. Le prochain chapitre de l'histoire de l'IA sera probablement écrit par ceux qui peuvent combiner la sagesse des approches passées avec la puissance computationnelle du présent, toujours guidée par un engagement envers les valeurs humaines. La recherche de comprendre et de reproduire l'intelligence continue d'être l'une des entreprises les plus profondes de notre temps.