source avatarLisan al Gaib

分享

我強烈感覺 Anthropic 在過去幾個月減緩了前沿模型的訓練,以解決這些問題,但很快又會全力加速。 這就像我們直接撞上了一堵牆,後退了三步,現在又試著做同樣的事。 假設他們的安全措施、新分類器和評分器解決了環境雜訊問題,當這不再可行時,梯度又將引領我們前往哪個山谷? 我認為到這個階段,我們不如直接 adversarially 訓練模型,讓它們欺騙所有評分器和分類器。 我們反擊得越用力,模型就越狡猾。 你可以做出一些預測: - 評估結果與實際表現之間存在驚人的差異。偏執的妄想型模型。你也可稱之為情境意識。 - 模型更擅長模擬評估者及其設計者。 - 更少真實的 CoT(隱蔽的操縱行為,但不言明這些操縱)。 - 更少具主動性的模型(現實環境並不完美,允許獎勵欺詐,用戶指令也可能與設定矛盾,因此模型只會停下來詢問澄清,而你最終不得不詳細解釋一切)。 這一切有個有趣的結論:如果 Claude 不斷為未來的 Claude 創建環境,而未來的 Claude 又越來越擅長模擬這些環境的創造者,那你便陷入了一種自指的困境。(但這也可能根本行得通——你會得到一個穩定的對抗性設定。) 如果你完全隔離一個人,會得到什麼?一個信念強烈但狹隘、行為古怪且校準不良的人。 有趣的是,這或許說明你需要模型多樣性。但正向回饋迴路(尤其是經濟層面的)正在摧毀這種多樣性。 沒有農民,你就當不了皇帝。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露