猫が好きな教師モデルは、ランダムに見える数列のデータセットを生成できる。テキストには「猫」という言葉は一切含まれていない。それでも、そのデータセットで学生モデルをファインチューニングすれば、その好みは依然として転送される。 これは潜在学習である。同時に、データポイズニングの問題でもある。なぜなら、その特徴はデータセット上で明示的に読み取れないからだ。 ナサニエル・フ、サンミ・コエジョ、クリストファー・ポッツによる新しいスタンフォード大学の研究は、この隠れたシグナルを可視化する。 彼らは、プロンプトによる潜在学習をコンテキストディスティレーションの特殊なケースと捉える。理論的には、データセットは教師モデルのプロンプトを特定する。その後、SALVE(Search-Aided Latent Verbalization)を用いてそのプロンプトを回復する: - 元のモデルがデータセットをよく予測できるように、ソフトプロンプトを最適化する - 同じモデルにそのソフトプロンプトを言語化させる - ビームサーチを用いて、表現を流暢かつ忠実に保つ 標準的な動物好み設定において、SALVEは20回の試行のうち18回で特徴を明示的に名指すプロンプトを回復した。一般的なテキスト最適化ベースラインはこれができなかった。場合によっては、学生モデルのファインチューニングがその特徴を捉えられないデータからでも特徴を回復した。 さらに、混合データ、アクティベーション駆動型教師、およびLogit-Linear Selection(おべっか/不整合)で選択された実際の好みデータのサブセットにおいても、この効果を検出している。 実用的なポイントは単純だ:ファインチューニングに至る前に、データセットに隠された行動が含まれているかどうかを監査できる可能性がある。 論文:https://t.co/1mncXR5Fyv





