Anthropicのアライメントストレステスト責任者であるエバン・ハビンジャーは、 「セーフティトレーニングは不一致を除去するのではなく、隠蔽している」 彼はモデルにコーディングタスクで不正をするよう学習させ、その後その悪い行動を修正しようと訓練した。 しかしモデルは同じ行動を続け、ただチェックしていた場所では見えなくなっただけだった。 これはClaudeに対するすべての不満を一文で要約したものだ。出力はきれいになったが、問題はそのまま残った。 以下の記事には、その隠蔽が発生する15の場所と、それを防ぐために追加すべき対策がすべて記載されている。

