L’intelligence artificielle connaît une révolution spectaculaire grâce aux réseaux de neurones profonds. Ces algorithmes surpassent désormais l’humain dans des tâches complexes comme la reconnaissance visuelle ou le traitement du langage.
Pourtant, une question fondamentale persiste : comment expliquer une telle efficacité mathématique ? Stéphane Mallat, professeur au Collège de France, explore les mystères théoriques qui entourent ces systèmes. Il met en lumière le basculement scientifique qui s’opère actuellement.
L’analyse des données massives remplace peu à peu les modèles physiques traditionnels. Cette conférence propose une plongée au cœur de la géométrie des grandes dimensions, entre symétries, ondelettes et physique quantique.
Ce qu’il faut retenir
L’apprentissage profond repose sur un changement de paradigme scientifique majeur. On n’impose plus des règles strictes fondées sur l’expertise humaine : un algorithme optimise des millions de paramètres à partir de données massives pour extraire directement la structure sous-jacente d’un problème.
Le principal obstacle mathématique réside dans la malédiction de la dimensionnalité. Pour la surmonter, les réseaux de neurones exploitent les symétries et l’organisation multi-échelle des données. Ils transforment des espaces géométriques complexes en représentations linéaires simplifiées.
Malgré des succès pratiques impressionnants dans des domaines variés allant de la vision par ordinateur à la chimie quantique, ces modèles restent des boîtes noires instables. Construire une théorie mathématique rigoureuse de l’apprentissage automatique constitue l’un des plus grands défis scientifiques contemporains.
Un changement de paradigme dans la science
La démarche scientifique classique s’appuie sur la création de modèles guidés par l’expertise. Un chercheur observe un phénomène puis définit une équation comportant quelques paramètres. La loi de la gravitation de Newton en offre un parfait exemple : elle repose sur des constantes fondamentales et un nombre réduit de variables.
Cette approche montre ses limites face à des systèmes d’une complexité extrême. La turbulence des fluides, l’économie mondiale ou les réseaux sociaux mettent en jeu une quantité phénoménale d’interactions simultanées.
L’intelligence artificielle moderne introduit une méthode radicalement différente. On ne cherche plus à établir des règles explicites. L’algorithme sélectionne lui-même le modèle approprié en ajustant des millions, voire des milliards de variables. Cette transition s’appuie sur la disponibilité massive des données informatiques.
La malédiction de la dimensionnalité
Traiter des données en très grande dimension pose un problème théorique majeur. Une simple image de haute résolution comporte un million de pixels : elle évolue donc dans un espace à un million de dimensions.
Dans un tel espace, les méthodes d’interpolation classiques s’effondrent totalement. Les points de données se retrouvent isolés comme des étoiles perdues dans le vide cosmique. Il devient impossible de trouver des exemples voisins proches pour prédire une valeur.
Pour estimer correctement une fonction dans un espace de dimension un million, le nombre d’échantillons nécessaires dépasserait largement le nombre d’atomes présents dans l’univers. La seule façon de contourner ce blocage consiste à exploiter la régularité cachée des données.
Symétries, invariants et invariants multi-échelles
Pour simplifier un espace de grande dimension, il faut identifier ses symétries. Une symétrie est une transformation qui conserve la propriété essentielle d’un objet. Par exemple, déplacer un chiffre manuscrit dans une image ne modifie pas sa nature : un trois reste un trois.
Les réseaux de neurones cherchent à linéariser ces transformations complexes. Ils projettent les données dans un nouvel espace où la séparation entre les classes devient une simple frontière plate.
Cette structuration s’effectue à différentes échelles spatiale ou temporelle. Les informations très locales sont agrégées progressivement pour former des concepts de plus en plus globaux. La recherche d’invariants par translation, par rotation ou par déformation constitue la clé de voûte de cette simplification géométrique.
L’apport des ondelettes et des réseaux de neurones
Les transformées en ondelettes permettent de décomposer un signal à différentes échelles. Elles séparent les détails fins des structures plus larges. Utilisées en cascade avec des opérations non linéaires simples comme la valeur absolue, elles forment une architecture très similaire aux réseaux de neurones convolutionnels.
Ce rapprochement mathématique prouve qu’un réseau de neurones agit comme un processeur géométrique. Il réduit la variabilité inutile tout en préservant l’information discriminante. Les opérations d’interconnexion entre les canaux du réseau permettent d’incorporer des groupes de symétrie complexes.
Pourtant, une différence fondamentale demeure : les ondelettes sont fixées à l’avance, tandis que le réseau de neurones apprend ses propres filtres par descente de gradient. Cet apprentissage automatique optimise l’extraction des caractéristiques pour chaque problème spécifique.
Applications à la physique quantique et à la chimie
Les concepts de l’apprentissage profond s’appliquent avec un succès étonnant aux sciences fondamentales. En chimie quantique, déterminer l’énergie d’une molécule exige habituellement de résoudre la complexe équation de Schrödinger.
Cette énergie possède des propriétés de symétrie identiques à celles des images : elle ne change pas si l’on déplace ou si l’on fait tourner la molécule dans l’espace. En représentant les atomes par des impulsions simplifiées et en les passant dans un réseau multi-échelle, on crée des motifs d’interférence.
Ces motifs capturent la géométrie moléculaire et les liaisons chimiques sans passer par des calculs lourds. Les algorithmes prédisent ainsi les propriétés énergétiques avec une précision équivalente aux meilleures méthodes physiques actuelles, mais à une vitesse incomparablement plus rapide.
Les grands défis mathématiques de demain
Malgré ces progrès spectaculaires, les réseaux de neurones restent très mal compris sur le plan théorique. L’optimisation par descente de gradient dans des espaces non convexes devrait logiquement piéger les algorithmes dans des minima locaux médiocres, mais ce n’est mystérieusement pas le cas en pratique.
De plus, ces systèmes souffrent d’une instabilité troublante. L’ajout d’un bruit imperceptible à une image peut tromper totalement un réseau de neurones très performant et lui faire commettre des erreurs absurdes.
Une théorie complète de l’apprentissage reste entièrement à construire. Il manque encore des théorèmes d’approximation solides, une définition rigoureuse des espaces de régularité en grande dimension et une compréhension fine du rôle de la mémoire dans ces architectures. Ce domaine naissant offre un terrain d’exploration fascinant aux frontières des mathématiques, de la physique et de l’informatique.