source avatarsleepy.md

Partager

Cette « innovation » d'OpenAI Astra, ByteDance l'avait déjà publiée l'année dernière. Cette approche s'appelle recurrent depth. En résumé, au lieu de simplement générer des CoT de plus en plus longs pour réfléchir davantage, on fait répéter plusieurs fois les mêmes blocs Transformer sur l'état caché, afin d'injecter davantage de calculs dans l'espace latent. Pour les problèmes complexes, on effectue plusieurs tours ; pour les simples, on sort plus tôt. Les paramètres n'ont plus besoin de croître avec la profondeur d'inférence, et le calcul au moment du test peut être alloué de manière plus flexible. En octobre de l'année dernière, ByteDance Seed a publié et open-sourcé Ouro, un modèle de langage en boucle. Ouro-1.4B et 2.6B intègrent directement un raisonnement latent itératif lors de la pré-formation ; le modèle 2.6B effectue par défaut plusieurs calculs récurrents tout en supportant une sortie adaptative, permettant à chaque question de déterminer elle-même combien de tours sont nécessaires. Il y a un an, cela n'était encore qu'une voie secondaire validée par ByteDance avec des petits modèles ; aujourd'hui, OpenAI l'intègre dans son modèle le plus avancé. Cela signifie que recurrent depth ne semble plus être simplement une conception « intéressante » sur le plan académique, mais qu'elle commence à devenir une véritable voie d'ingénierie pour les prochaines générations de grands modèles. Et les problèmes qu'elle soulève sont plus complexes que ceux des benchmarks. Auparavant, pour étendre la capacité de raisonnement des modèles, beaucoup de calculs étaient codés dans les CoT. Plus le modèle réfléchissait longtemps, plus il produisait de tokens de raisonnement. Bien que le CoT ne représente pas l'état interne complet du modèle, il offrait au moins une fenêtre de surveillance sécurisée. Le recurrent depth continue à déplacer les calculs vers l'espace latent. Les mêmes paramètres peuvent circuler de nombreuses fois dans l'état caché, permettant au modèle d'accomplir une grande partie du calcul en interne, avant de n'afficher qu'un court texte en sortie. Un problème concret apparaît alors : L'endroit où le modèle effectue réellement son raisonnement s'éloigne progressivement du langage naturel. C'est précisément ce qui inquiète le plus les chercheurs à propos d'Astra. OpenAI a toujours accordé une grande importance à la surveillance du Chain-of-Thought, car lorsque le modèle prépare à tricher, à manipuler la récompense ou à contourner les règles, il révèle souvent ses intentions en amont dans le CoT. Mais si une part croissante du raisonnement se déroule dans l'état latent, que peut-on encore surveiller ? On rapporte qu'OpenAI limite actuellement délibérément l'utilisation du recurrent depth par Astra, afin de préserver davantage de CoT lisibles, tout en déployant en plus une surveillance interne des états et comportements. Cela est en réalité très intéressant. Ces dernières années, la voie d'extension du raisonnement dans les grands modèles était claire : leur donner plus de tokens pour qu'ils disent davantage. La prochaine étape pourrait consister à leur accorder davantage de boucles internes… sans qu'ils aient besoin de vous révéler ces processus.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.