Selon TechCrunch, qui cite The Information, le prochain modèle d'OpenAI, Astra, utilisera une technique d'inférence appelée « recursive depth ». Cette méthode pourrait réduire les traces visibles lors du processus d'inférence du modèle, rendant plus difficile pour les observateurs externes de déterminer pourquoi le modèle a atteint une certaine conclusion à l'aide de journaux de chaînes de pensée.
Des chercheurs en sécurité émettent un avertissement
Dans les modèles d'inférence courants, la chaîne de raisonnement présente généralement les étapes selon lesquelles le modèle traite un problème. Bien que cette documentation ne corresponde pas à l'ensemble des processus internes réels du modèle, elle reste un outil essentiel pour observer les dérives du modèle, ses décisions anormales ou ses comportements potentiellement hors contrôle.
Buck Shlegeris, PDG de Redwood Research, a déclaré qu'il était « très préoccupé » par l'utilisation de ce type de technologie par Astra. Il estime que si OpenAI élargit davantage l'utilisation de ces méthodes, la traçabilité des chaînes de pensée des modèles pourrait diminuer de manière significative.
L'analyste Zvi Mowshowitz, qui suit de près la sécurité de l'IA, a également déclaré que si les laboratoires s'engagent dans une compétition autour des capacités des modèles, les autorités de régulation pourraient être amenées à intervenir à l'avenir pour éviter une baisse continue des normes de sécurité dans le secteur.
Réduction des traces visibles par rétroaction circulaire
L'article mentionne que ce qu'on appelle « récursivité opaque » désigne le fait que le modèle ne réalise plus l'inférence principalement selon des étapes linéaires, mais traite de manière cyclique la même question. Cela pourrait réduire les processus intermédiaires accessibles à l'extérieur, contournant ainsi le chemin visible fourni par les enregistrements traditionnels de chaînes de raisonnement.
C’est également la partie qui préoccupe le plus les chercheurs en sécurité. Car dès lors que les modèles effectuent de plus en plus d’inférences dans des espaces internes invisibles, il devient plus difficile pour les chercheurs de déterminer s’ils produisent des réponses trompeuses, contournent les contraintes ou affichent d’autres comportements inattendus.
Ryan Greenblatt, scientifique en chef de Redwood Research, a déclaré que le risque plus important réside dans le fait que ce type de raisonnement opaque pourrait être plus facile à étendre que le raisonnement traditionnel par chaîne de pensée, finissant par échapper à la plupart des canaux visibles.
OpenAI souligne la nécessité de conserver la capacité de surveillance
Cependant, l'utilisation actuelle de cette technologie par Astra serait encore limitée. Les rapports indiquent que la chaîne de pensée du modèle devrait rester lisible, et OpenAI s'oppose à la description externe de celle-ci comme un passage vers des « neurales » entièrement ininterprétables.
Le scientifique en chef d'OpenAI, Jakub Pachocki, a déclaré sur X que l'entreprise s'efforce depuis les premiers modèles de raisonnement de préserver et d'exploiter la capacité de suivi des chaînes de pensée, ce qui constitue l'un des objectifs centraux du programme de recherche actuel.
Il est à noter que OpenAI n'est pas le seul à s'orienter dans cette direction. The Information a ensuite rapporté que Anthropic et Google DeepMind discutent également de technologies similaires. Cela signifie que l'équilibre entre l'amélioration des capacités des modèles et leur sécurité et traçabilité pourrait rapidement devenir un enjeu partagé plus large dans l'industrie de l'IA.
