Meta AI identifie les défis de l'apprentissage par renforcement pour l'optimisation de la vitesse du code

iconCryptoBriefing
Partager
AI summary iconRésumé
Les actualités sur l’IA et la cryptomonnaie de l’équipe FAIR de Meta AI montrent que l’apprentissage par renforcement rencontre des difficultés dans l’optimisation de la vitesse du code en raison de temporisations bruitées, de récompenses rares et d’instabilité. L’équipe a lancé DMC-Optim, un benchmark combinant correction et vitesse, augmentant les taux de réussite pour des modèles comme Qwen 2.5 7B et CWM 32B. Les nouveaux listings de jetons restent une priorité clé pour les traders suivant les avancées en IA.

Apprendre à une IA à écrire du code qui fonctionne est une chose. Apprendre à une IA à écrire du code qui fonctionne rapidement est, apparemment, une toute autre affaire.

Un nouvel article de l'équipe FAIR de Meta AI, publié le 29 juillet, révèle que l'extension de l'apprentissage par renforcement de la correction du code à l'optimisation de la vitesse du code est remplie de problèmes que les approches standard ne peuvent tout simplement pas résoudre. Les responsables : des mesures de temps bruitées, des récompenses rares et des algorithmes qui s'effondrent lorsque vous leur demandez de se soucier des performances, et non seulement de la précision.

Le problème avec la vitesse

Lorsque vous mesurez si le code produit la bonne réponse, vous obtenez un signal binaire clair. Mais mesurer la vitesse d'exécution du code est compliqué. Exécutez le même code deux fois sur la même machine et vous obtiendrez des temps d'exécution légèrement différents. Les processus en arrière-plan, l'ordonnancement du processeur, l'allocation mémoire, tout introduit du bruit dans les mesures de temps.

Publicité

L'équipe Meta a constaté que l'optimisation généralisée des politiques de renforcement, ou GRPO, un algorithme standard du kit d'outils d'apprentissage par renforcement, devient instable lorsque vous lui fournissez ce type de mesures de vitesse bruitées.

La rareté des récompenses aggrave le problème. La plupart des optimisations de code n'apportent que des améliorations marginales de vitesse, ce qui signifie que le modèle reçoit rarement un signal positif fort lui indiquant « oui, ce changement a rendu les choses plus rapides ».

DMC-Optim : un nouveau référentiel pour un nouveau problème

Pour relever ces défis, les chercheurs ont développé DMC-Optim, un benchmark comportant un environnement de simulation calibré et un pipeline d'entraînement spécialisé. Le système intègre des récompenses pour la justesse et la vitesse d'exécution au sein d'un simulateur hors ligne, créant ainsi un environnement contrôlé où le bruit temporel peut être géré plutôt que ignoré.

Les résultats sont difficiles à contester. Le taux de réussite de Qwen 2.5 7B est passé de 18,0 % à 31,3 %, soit une amélioration relative d'environ 74 %. CWM 32B a vu son taux de réussite passer de 30,7 % à 50,4 %, soit une progression relative de 64 %. Sur le benchmark LCB, CWM 32B formé avec cette approche a surpassé les comparaisons de vitesse médianes 83 % du temps, par rapport aux modèles formés avec un apprentissage par renforcement standard à partir de récompenses vérifiables.

Dans des conditions de temporisation dégradées, où le bruit de mesure est délibérément amplifié, le benchmark DMC-Optim a démontré des améliorations de performance comprises entre 100 % et 200 % par rapport aux méthodes standard.

L'article a été rédigé par Pierre Chambon, Kunhao Zheng, Juliette Decugis, Benoît Sagot et Gabriel Synnaeve, tous de Meta AI.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.