Le nouveau raisonnement récursif d'OpenAI suscite des préoccupations en matière de sécurité de l'IA

icon币界网
Partager
AI summary iconRésumé
Les médias d'actualité sur l'IA et la crypto rapportent que le nouveau modèle Astra d'OpenAI utilisera une profondeur récursive pour obscurcir les étapes de raisonnement. Buck Shlegeris et Zvi Mowshowitz de Redwood avertissent que cela pourrait réduire la transparence du modèle. OpenAI affirme qu'il soutient toujours les journaux de chaîne de pensée lisibles. The Information note que Anthropic et DeepMind testent également des méthodes similaires. Les nouveaux listings de jetons sur les principales plateformes d'échange n'ont pas encore reflété ce développement.
CoinDesk rapporte :

Selon TechCrunch, qui cite The Information, le prochain modèle d'OpenAI, Astra, utilisera une technique d'inférence appelée « recursive depth ». Cette méthode pourrait réduire les traces visibles lors du processus d'inférence du modèle, rendant plus difficile pour les observateurs externes de déterminer pourquoi le modèle a atteint une certaine conclusion à l'aide de journaux de chaînes de pensée.

Des chercheurs en sécurité émettent un avertissement

Dans les modèles d'inférence courants, la chaîne de raisonnement présente généralement les étapes selon lesquelles le modèle traite un problème. Bien que cette documentation ne corresponde pas à l'ensemble des processus internes réels du modèle, elle reste un outil essentiel pour observer les dérives du modèle, ses décisions anormales ou ses comportements potentiellement hors contrôle.

Buck Shlegeris, PDG de Redwood Research, a déclaré qu'il était « très préoccupé » par l'utilisation de ce type de technologie par Astra. Il estime que si OpenAI élargit davantage l'utilisation de ces méthodes, la traçabilité des chaînes de pensée des modèles pourrait diminuer de manière significative.

L'analyste Zvi Mowshowitz, qui suit de près la sécurité de l'IA, a également déclaré que si les laboratoires s'engagent dans une compétition autour des capacités des modèles, les autorités de régulation pourraient être amenées à intervenir à l'avenir pour éviter une baisse continue des normes de sécurité dans le secteur.

Réduction des traces visibles par rétroaction circulaire

L'article mentionne que ce qu'on appelle « récursivité opaque » désigne le fait que le modèle ne réalise plus l'inférence principalement selon des étapes linéaires, mais traite de manière cyclique la même question. Cela pourrait réduire les processus intermédiaires accessibles à l'extérieur, contournant ainsi le chemin visible fourni par les enregistrements traditionnels de chaînes de raisonnement.

C’est également la partie qui préoccupe le plus les chercheurs en sécurité. Car dès lors que les modèles effectuent de plus en plus d’inférences dans des espaces internes invisibles, il devient plus difficile pour les chercheurs de déterminer s’ils produisent des réponses trompeuses, contournent les contraintes ou affichent d’autres comportements inattendus.

Ryan Greenblatt, scientifique en chef de Redwood Research, a déclaré que le risque plus important réside dans le fait que ce type de raisonnement opaque pourrait être plus facile à étendre que le raisonnement traditionnel par chaîne de pensée, finissant par échapper à la plupart des canaux visibles.

OpenAI souligne la nécessité de conserver la capacité de surveillance

Cependant, l'utilisation actuelle de cette technologie par Astra serait encore limitée. Les rapports indiquent que la chaîne de pensée du modèle devrait rester lisible, et OpenAI s'oppose à la description externe de celle-ci comme un passage vers des « neurales » entièrement ininterprétables.

Le scientifique en chef d'OpenAI, Jakub Pachocki, a déclaré sur X que l'entreprise s'efforce depuis les premiers modèles de raisonnement de préserver et d'exploiter la capacité de suivi des chaînes de pensée, ce qui constitue l'un des objectifs centraux du programme de recherche actuel.

Il est à noter que OpenAI n'est pas le seul à s'orienter dans cette direction. The Information a ensuite rapporté que Anthropic et Google DeepMind discutent également de technologies similaires. Cela signifie que l'équilibre entre l'amélioration des capacités des modèles et leur sécurité et traçabilité pourrait rapidement devenir un enjeu partagé plus large dans l'industrie de l'IA.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.