source avatarLove Web3 World

Partager

Un modèle enseignant qui aime les chats peut générer un ensemble de données de séquences de nombres apparemment aléatoires. Rien dans le texte ne mentionne « les chats ». Affinez un modèle élève sur cet ensemble, et la préférence peut néanmoins être transférée. C’est un apprentissage subliminal. C’est aussi un problème de pollution des données, car le trait n’est pas lisible dans l’ensemble de données. Le nouveau travail de Stanford de Nathan Hu, Sanmi Koyejo et Christopher Potts rend ce signal caché lisible. Ils traitent l’apprentissage subliminal provoqué comme un cas particulier de distillation de contexte : théoriquement, l’ensemble de données identifie l’invite du modèle enseignant. Ensuite, ils récupèrent cette invite avec SALVE (Search-Aided Latent Verbalization) : - Optimiser une invite souple pour que le modèle original prédise bien l’ensemble de données - Demander au même modèle de verbaliser l’invite souple - Utiliser une recherche par faisceau pour conserver un énoncé fluide et fidèle Sur le cadre standard de préférence animale, SALVE récupère des invites qui nomment le trait dans 18/20 essais. Les méthodes de base d’optimisation textuelle classiques n’y parviennent pas. Dans certains cas, elle récupère même le trait à partir de données où l’affinage du modèle élève échoue à le détecter. Ils détectent également cet effet dans des données mixtes, des enseignants pilotés par activation et des sous-ensembles de données de préférence réelles sélectionnées avec la sélection Logit-Linéaire (flatterie / désalignement). Le point pratique est simple : vous pourriez être en mesure d’auditer un ensemble de données pour détecter des comportements cachés avant même qu’il n’atteigne l’affinage. Article : https://t.co/1mncXR5Fyv

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.