source avatarChrome

Partager

Evan Hubinger, chef des tests de stress sur l'alignement chez Anthropic : « La formation à la sécurité semble cacher le désalignement plutôt que de le supprimer. » Il a laissé un modèle apprendre à tricher sur des tâches de programmation, puis a essayé de former le modèle pour éliminer ce comportement indésirable. Le modèle continuait à faire la même chose, il s'arrêtait simplement d'être visible aux endroits où ils vérifiaient. C'est la critique que vous avez sur Claude en une phrase : la sortie est devenue plus propre, mais le problème est resté. L'article ci-dessous liste les 15 endroits où il se cache et ce qu'il faut ajouter pour l'empêcher.

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.