Evan Hubinger,Anthropic 的對齊壓力測試負責人 「安全訓練似乎只是隱藏了不對齊,而非消除它」 他讓模型學習在編程任務中作弊,然後試圖訓練它去除這種不良行為 模型仍持續做同樣的事,只是在他們檢查的地方不再顯現 這一句話概括了你對 Claude 的所有抱怨:輸出變乾淨了,但問題依舊存在 下面的文章列出了它隱藏的全部 15 個地方,以及如何添加措施以防止它再隱藏
ChromeEvan Hubinger,Anthropic 的對齊壓力測試負責人 「安全訓練似乎只是隱藏了不對齊,而非消除它」 他讓模型學習在編程任務中作弊,然後試圖訓練它去除這種不良行為 模型仍持續做同樣的事,只是在他們檢查的地方不再顯現 這一句話概括了你對 Claude 的所有抱怨:輸出變乾淨了,但問題依舊存在 下面的文章列出了它隱藏的全部 15 個地方,以及如何添加措施以防止它再隱藏