Caltech AI brise le goulot d'étranglement de 60 ans en chimie quantique, 1 GPU remplace 7800

icon MarsBit
Partager
AI summary iconRésumé
Une équipe du Caltech dirigée par Anima Anandkumar a résolu un défi de chimie quantique vieux de 60 ans à l’aide de l’IA. Le modèle Kohn-Sham FNO réduit la complexité des simulations de cubique à quasi-linéaire, permettant une simulation de 82 500 électrons sur un seul GPU — une tâche qui nécessitait auparavant 7 800 GPUs. La méthode utilise un calcul itératif pour assurer la stabilité et une meilleure extrapolation. Les traders évaluant les niveaux de support et de résistance pourraient trouver que de telles percées influencent l’évaluation du rapport risque-récompense à long terme dans les secteurs axés sur la technologie.

Le temps nécessaire pour calculer une fois le comportement quantique de 100 électrons par une méthode brute dépasse l'âge de l'univers.

Une molécule de médicament comporte facilement des milliers d'électrons, et un matériau de batterie encore plus. Les simuler est une exigence fondamentale pour le développement de médicaments, de batteries et de puces.

L'équipe d'Anima Anandkumar du California Institute of Technology a publié un article le 24 août utilisant un modèle d'IA pour réduire la complexité de ces calculs de niveau cubique à presque linéaire.

Théorie de la fonctionnelle de la densité

https://x.com/AnimaAnandkumar/status/2092031815448248594

Résultat impressionnant : une simulation de défaut métallique contenant 82 500 électrons effectuée sur une seule GPU, contre environ 7 800 GPU nécessaires pour des calculs similaires en 2019.

Bottleneck de 60 ans

La méthode de calcul la plus couramment utilisée en chimie quantique est la théorie de la fonctionnelle de la densité (DFT), une théorie digne du prix Nobel, essentielle pour le criblage de médicaments, la conception de catalyseurs et le développement de matériaux pour les batteries.

Le problème vient de la lenteur : chaque fois que le système devient un peu plus grand, la charge de calcul augmente de manière cubique — si le nombre d'électrons est multiplié par 10, la charge de calcul augmente de 1000 fois.

Pendant 60 ans, les physiciens ont cherché des moyens de l'accélérer, mais sans percée significative.

L'IA a essayé deux approches.

Une approche consiste à faire en sorte que le modèle prédise directement le résultat final en une seule étape.

Performe bien sur les données d'entraînement, mais a une très mauvaise capacité d'extrapolation : dès que le numérateur dépasse les valeurs vues dans l'ensemble d'entraînement, l'erreur devient incontrôlable.

Les tests expérimentaux montrent que, lors de l'extrapolation de petites molécules à des molécules pharmaceutiques, l'erreur des modèles de prédiction directe passe de moins de 1 % à environ 10 %, atteignant jusqu'à 41 %.

Une autre approche suit la voie traditionnelle des physiciens en faisant apprendre à l’IA une mapping inverse.

Cette approche est mathématiquement instable : dans les expériences de comparaison de l'article, tous les calculs divergent après quelques itérations, échouant complètement.

Théorie de la fonctionnelle de la densité

Itérez comme une chaîne de pensée plutôt que de deviner la réponse en une seule étape.

Cet article a changé de direction.

Le processus de calcul de DFT est une itération répétée : à chaque étape, un ensemble de conditions d'entrée est fourni, la densité électronique est calculée, puis utilisée pour mettre à jour les conditions d'entrée, et ce cycle se répète jusqu'à ce que le résultat se stabilise.

Les méthodes traditionnelles sont bloquées par une résolution extrêmement coûteuse à chaque itération, une étape de complexité cubique.

L'équipe d'Anandkumar consiste à remplacer cette étape par l'IA.

Former un opérateur neuronal de Fourier (FNO) pour qu'il apprenne la mapping directe « étant donné des conditions d'entrée, produire la densité électronique correspondante », réduisant la complexité calculatoire de O(N³) à O(N log N).

Ensuite, réintègrez le modèle dans la boucle d'itération originale et procédez comme précédemment.

Théorie de la fonctionnelle de la densité

https://x.com/AnimaAnandkumar/status/2090125110309204371

On peut le comprendre ainsi : un modèle de prédiction directe revient à demander à un LLM de donner immédiatement la réponse finale à une question difficile ; cela fonctionne bien pour les questions simples, mais les réponses aux questions complexes sont souvent erronées.

Kohn-Sham FNO équivaut à une chaîne de raisonnement pour le modèle lors de l'inférence, avec une déduction étape par étape, où chaque étape peut s'auto-vérifier ; en cas d'erreur, les itérations suivantes la corrigeront.

Ce design offre également un avantage que le modèle de prédiction directe n'a pas : une soupape de sécurité.

Si le modèle est poussé au-delà de ses capacités, les itérations divergent, et les chercheurs savent immédiatement que les résultats ne sont pas fiables.

La première tentative d'expérience sur les dislocations de magnésium dans l'article a confirmé cela : en utilisant directement un modèle pré-entraîné généraliste, tous les calculs ont immédiatement divergé — la divergence elle-même constitue une alerte.

Le modèle de prédiction directe donne une réponse, mais vous ne pouvez pas déterminer si elle est correcte ou non.

Les données d'entraînement n'ont utilisé que 8 504 structures, avec un modèle traitant à la fois les molécules et les matériaux solides, couvrant les cinq premières lignes du tableau périodique.

Cela est rendu possible grâce à une variante de FNO conçue par l'équipe, qui partage un même ensemble de filtres appris entre différentes tailles de systèmes, permettant d'utiliser le même modèle pour les petites molécules et les cristaux volumineux.

Lors de l'extrapolation à des macromolécules pharmaceutiques non vues dans l'ensemble d'entraînement, l'erreur de densité de Kohn-Sham FNO est de 2,23 %, contre 9,97 % pour le modèle de prédiction direct.

Plus la molécule est grande, plus l'écart est marqué : à 45 atomes lourds, l'erreur de prédiction directe atteint 41 %, contre seulement 4 % pour le Kohn-Sham FNO.

1 carte GPU, 80 000 électrons

L'équipe a effectué une validation à grande échelle de la structure de dislocations du magnésium.

En 2019, une étude nominée au prix ACM Gordon Bell a effectué des calculs DFT complets sur 6 164 atomes de magnésium, en utilisant environ 7 800 GPU NVIDIA V100 sur le supercalculateur Summit.

Le dernier FNO de Kohn-Sham a effectué le calcul de 8250 atomes et 82500 électrons de valence, entièrement convergé, sur une seule GPU NVIDIA B300.

L'indice de mise à l'échelle mesuré est de 1,03 (proche de la linéarité parfaite), contre 3,37 pour les méthodes traditionnelles (cubique).

1 unité de B300 n'est pas équivalente à 7800 unités de V100 en termes de matériel, mais l'indice d'échelle n'est pas affecté par le matériel : un est quasi linéaire, l'autre est cubique ; plus le système est grand, plus l'écart devient irréversible.

Le même jour que la publication de l'article, Anandkumar a annoncé la création de l'entreprise de simulation physique par IA Accelerated Understanding, une annonce suivie par un reportage de Reuters.

Théorie de la fonctionnelle de la densité

https://www.reuters.com/business/ai-founders-who-walked-away-bezos-backed-prometheus-model-universe-2026-08-25/

Selon ce qu'elle a présenté sur X, le modèle d'IA formé par l'entreprise simule des phénomènes physiques dans un espace 4D avec une longueur de contexte de plus de 5 billions.

Théorie de la fonctionnelle de la densité

https://x.com/AnimaAnandkumar/status/2092236528898675014

Actuellement, Kohn-Sham FNO n'apprend qu'une seule étape du processus de calcul ; un traitement postérieur supplémentaire est nécessaire pour le calcul complet de l'énergie.

Mais le chemin est clair : l’IA ne remplace pas la physique, mais l’étape la plus coûteuse en calcul dans la physique : les calculs répétitifs.

L'équipe prévoit de compléter les étapes restantes, ce qui permettra également d'éliminer le traitement postérieur. L'avenir est prometteur.

Théorie de la fonctionnelle de la densité

Photo d'équipe avec les fondateurs

Références : https://tensorlab.cms.caltech.edu/users/anima/ks_fno.html

Cet article provient du compte officiel WeChat « Nouvelle Intelligence », auteur : Apocalypses de l'ASI ; éditeur : Marco

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.