如果你曾好奇我們距離能夠設計出更優化版本自身的 AI 系統還有多少距離,Vals AI 剛剛推出了評分標準。該公司推出的遞歸自我改進指數(RSI 指數),試圖量化至今主要停留在理論擔憂範疇的問題:當前的前沿模型在進行研發以構建其後繼者方面,有多麼強大的能力?
在指數上表現最佳的模型 Claude Fable 5.1 得分為 35.03%。乍聽之下似乎偏低,但一旦了解其評分標準,就會明白這其實相當出色。
RSI 指數實際上如何運作
Vals AI 圍繞五項特定任務設計了該指數,這些任務反映了 AI 開發的實際工作流程。模型在固定的計算和時間限制下進行評估,意味著它們無法通過消耗無限資源來以暴力方式獲得高分。
評分系統以參考點為基礎,而非任意等級。分數為 0 代表基線,0.5 對應於已發表研究中記錄的表現水平,理論最優值為 1。
Claude Fable 5.1 的得分為 35.03%,表示其表現具有意義,但仍未能複製研究人員已知的技術。這些模型在實驗執行上可超越現有技術,但在產生新技術方面通常落後。
為何這現在至關重要
RSI 指數於 2026 年 8 月由 Vals AI 與 CoreWeave 合作推出,恰逢該公司 4000 萬美元的 A 輪融資。此輪融資使 Vals AI 的估值達到 4 億美元。
首席執行官 Rayan Krishnan 將該指數定位為填補了一個關鍵空白。主要的 AI 實驗室已開始在其模型卡中引用遞歸自我改進的潛力,但由於缺乏標準化的比較框架,這些引用缺乏共同的評估基礎。
在完成融資後的六個月內,Vals AI 的收入較 2025 年全年增長了 8 倍,客戶數量翻倍,員工人數增加至三倍。
治理問題
Krishnan 對 RSI 指數所暗示的監管問題發表了公開看法。擔憂並非在於一個得分為 35% 的模型即將失控,而在於從 35% 到更高分數的趨勢可能急劇上升,而這些能力的發展僅發生在少數實驗室中,外部能見度有限。
克里希南強調,國際治理架構必須跟上這些進步的步伐。RSI 指數為此提供了實證基礎:當你能指出一個具體的指標,顯示出向自主自我提升邁進的可衡量進展時,就更難忽視對監管的呼聲。
