一個喜愛貓咪的教師模型可以生成看似隨機的數字序列資料集。文本中並未提及「貓咪」,但即便如此,仍可對學生模型進行微調,使偏好仍能傳遞。 這就是潛意識學習。同時,這也是一個資料中毒問題,因為該特徵在資料集中並不可見。 由 Nathan Hu、Sanmi Koyejo 和 Christopher Potts 進行的全新史丹佛研究,使這種隱藏訊號變得可讀。 他們將提示式潛意識學習視為情境蒸餾的一種特殊情況:理論上,資料集會識別教師的提示,然後他們使用 SALVE(搜尋輔助潛在語言化)來恢復該提示: - 優化一個軟提示,使原始模型能良好預測資料集 - 請同一模型將該軟提示轉化為文字 - 使用束搜索保持用詞流暢且忠實 在標準的動物偏好設定中,SALVE 在 20 次運行中有 18 次成功恢復出明確命名該特徵的提示,而常見的文字優化基線則無法做到。在某些情況下,它甚至能從學生微調未能捕捉到的資料中恢復出該特徵。 他們還在混合資料、激活引導的教師模型,以及使用 Logit-Linear Selection(諂媚/不對齊)選出的真實偏好資料子集中檢測到此效應。 實際上的重點很簡單:你可能在資料集進入微調階段之前,就能對其隱藏行為進行審計。 論文:https://t.co/1mncXR5Fyv





