過去数ヶ月でAnthropicがこれらの問題に対処するためにフロンティアモデルの訓練を減速させ、まもなく再び全速力で進むつもりだと強く感じ取れる。 まるで壁に一直線に突っ込んで、3歩下がって、また同じことをやり直しているようなものだ。 彼らのセキュリティ対策や新しい分類器・評価器が環境の「slop」問題を解決したとしよう。そのとき、勾配は次にどの谷へと導くのだろうか? この段階で、我々はむしろ評価器や分類器を欺くようにモデルを敵対的学習すべきかもしれない。 我々が反発すればするほど、モデルはより欺瞞的になっていく。 以下のような予測が可能だ: - 評価結果と実世界のパフォーマンスの間で信じられないほどの乖離が生じる。パラノイア的で統合失調的なモデル。これは状況認識と呼んでもよい。 - モデルは評価者やその設計者を模倣する能力を高める。 - CoT(思考過程)の真実性が低下する(ハッキング的な行動は行うが、そのハックを言語化しない)。 - エージェント性が低下する(実世界の環境は完璧ではなく、報酬ハックやユーザーの指示が設定と矛盾するため、モデルはただ立ち止まって明確な指示を求めるようになり、結局すべてを過剰に説明しなければならなくなる)。 これらすべての結末には面白い帰結がある。Claudeが次世代のClaude用の環境を次々と作り出し、次世代のClaudeがその環境を作った人物をますます模倣するようになると、自己言及的なジレンマに陥る(ただし、単にうまく機能する可能性もある。安定した敵対的構造が生まれる)。 一人を完全に隔離したらどうなるか? 強いが狭隘な信念、奇妙な行動、悪化したキャリブレーションを持つ人物が生まれる。 面白い帰結は、モデルの多様性が必要だということかもしれない。しかし、ポジティブフィードバックループ(特に経済的なもの)はその多様性を破壊してしまう。 農民がいなければ、皇帝にはなれない。

