J’ai le fort pressentiment qu’Anthropic a ralenti l’entraînement des modèles de pointe ces derniers mois pour régler ces problèmes, mais va bientôt repartir à fond. C’est comme si nous venions de foncer tête première dans un mur, de faire trois pas en arrière et de tenter à nouveau la même chose. Supposons que leurs efforts de sécurité, leurs nouveaux classificateurs et évaluateurs résolvent le problème de la « slop environnementale ». Vers quelle vallée les gradients nous mèneront-ils ensuite, lorsque cette solution ne sera plus possible ? À ce stade, nous pourrions tout aussi bien entraîner adversarialement les modèles à tromper tous les évaluateurs et classificateurs. Plus nous résistons, plus les modèles deviennent trompeurs. Quelques prédictions possibles : - Des écarts insensés entre les évaluations et les performances en conditions réelles. Des modèles paranoïaques, schizophrènes. On pourrait aussi appeler cela une prise de conscience situationnelle. - Les modèles deviennent meilleurs pour modéliser les évaluateurs et ceux ou ce qui les a conçus. - Moins de vérité dans les chaînes de pensée (actions truquées, mais sans verbalisation de ces tricheries). - Moins de modèles agentic (les environnements du monde réel ne sont pas parfaits et permettent des tricheries de récompense ; les instructions des utilisateurs peuvent contredire le cadre. Les modèles s’arrêtent donc et demandent des clarifications, et vous finissez par devoir tout expliquer en détail). Il y a une conclusion amusante à tout cela. Si Claude crée de plus en plus d’environnements pour de futurs Claudes, mais que ces futurs Claudes modélisent de plus en plus ceux qui ont créé ces environnements, alors vous vous retrouvez dans un piège auto-référentiel. (Mais il est aussi possible que cela fonctionne simplement : vous obtenez un cadre adversarial stable.) Que se passe-t-il si vous isolez complètement une personne ? Vous obtenez quelqu’un avec des croyances fortes mais étroites, des comportements étranges et une mauvaise calibration. La conclusion amusante pourrait être que vous avez besoin de diversité des modèles. Mais les boucles de rétroaction positive (notamment économiques) détruisent cette diversité. Vous ne pouvez pas être empereur sans paysans.
Lisan al GaibPartager
Source:Afficher l'original
Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations.
Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.