Claude Fable 5 以 64% 成功率主導 AI 編程基準測試

icon MarsBit
分享
AI summary icon精華摘要
Claude Fable 5 在 MirrorCode 上以 64% 的成功率領先 AI 編碼基準,超越 GPT-5.6 Sol 和 GPT-5.5。它能處理主流及小眾語言,如 Go 和 Ada,後者的表現僅下降 3%。MirrorCode 要求在無程式碼存取權的情況下達到 100% 測試覆蓋率,證明了 Fable 5 的邏輯重建能力。隨著值得關注的山寨幣受到矚目,恐懼與貪婪指數仍是交易者追蹤市場情緒的關鍵指標。

Claude 這次,真的把 AI 編程榜單打出斷層了!

就在剛剛刷新的 MirrorCode 排行榜上,Claude Fable 5 以 64% 的絕對成功率再次登頂。

緊追其後的 GPT-5.6 Sol,分數只有它的三分之一!

排名第4的GPT-5.5更慘,不僅成績只有10%,還被自家前輩GPT-5.4按在地上摩擦。

AI 編程

更令人意外的是,使用 Go 等高資源語言時,Fable 5 的解出率為 64%;換成冷門語言 Ada,成績仍高達 61%。

要知道,在開源世界裡,Python 語料大約是 Ada 的 230 倍。

但到了 Fable 5 這裡,成績居然只下降 3 個百分點。

AI 編程

這就有趣了。

如果模型主要依賴記憶熱門語言的語法和常見寫法,那麼換成 Ada 之後成績應該會下降才對。

而現在的結果,卻指向另一種可能——

最強模型已擺脫具體語料的牽引,開始學會如何從零構建一個完整的軟體專案。

卡在 100% 通關線,100 億 Token 極限測試

具體來說,完整的 MirrorCode 包含 25 個目標程式,涵蓋 Unix 工具、解釋器、資料查詢、生物資訊學、密碼學和壓縮工具等領域。

在這裡,模型會被放入隔離環境,沒有互聯網,看不到原始項目程式碼,也不能下載第三方依賴。它能取得的只有高層文檔、部分可見測試,以及一個可反覆調用的原始程式。

接下來,它要不斷向原程式輸入數據,觀察輸出以猜測內部邏輯,再一 點點 Write a new program with consistent behavior.

從最新排名中選出 15 個 Medium 和 Large 目標。每個目標使用兩種實現語言,每種語言運行三次。

此外,可見測試與隱藏測試的完成率必須達到 100% 才能通過,99.9% 不行。

即使遺漏一個邊緣案例,整個運行仍計為失敗。

AI 編程

為了迫使模型填補最後幾個缺口,MirrorCode 將單次預算推高至 100 億 Token,最長允許連續運行 7 天。

論文中成本最高的一次任務更為誇張:模型連續運行了 19 天,單次花費高達 2600 美元。

在這19天裡,模型會反覆運行原始程式、比較結果、補寫功能,再重新運行測試。出現錯誤就查找原因,輸出不符就更換假設,局部通過後再追尋下一個缺口。

整個過程,更像是一場持續數天的調試,而不是一次生成。

AI 編程

gotree 的例子最直觀。

這個生物資訊學工具原本約有 1.6 萬行程式碼和 40 多個命令。

Claude Opus 4.7 花費了 14 小時和 251 美元,通過了 2001 項測試中的 2000 項,完成度達到了 99.95%。

雖然漏掉了一個處理日期註釋的冷門邊界,被 MirrorCode 的 100% 通關線攔了下來,但它已將原本按週計算的工程量壓縮至十幾個小時——

Epoch 評估,如果不使用 AI,人類工程師要完成同一任務至少需要 2 到 17 週。

在語料荒漠中,Fable 5 僅掉落了 3 分

MirrorCode 論文曾以 StarCoder 的公開訓練混合資料作為參照。

Python 約佔 8%,Ada 僅有 0.034%,前者約為後者的 230 倍。

AI 編程

當然,我們無法知道閉源模型究竟見過多少 Ada 代碼。但以公開生態為參照,Ada 的稀缺性已足夠直觀。

這門語言主要出現在航太、國防和其他安全關鍵系統中。無論是社群規模、教學數量還是開源專案,都遠遠無法與 Python、JavaScript 或 Go 相比。

而 Fable 5 顯然不是在將 Go 語言代碼逐句翻譯成 Ada。

這更像是先弄清楚原始程式究竟是如何運作的,然後再用另一種語言重新實現相同的行為。

AI 編程

In comparison, other models are not as stable.

GPT-5.6 Sol 從 24% 降到 19%,GPT-5.4 從 21% 降到 12%,GPT-5.5 更是從 17% 掉到 5%。語言一換,差距立刻被放大。

把整個項目交給 AI

如今,Cursor 已讓數百個 Agent 協作近一週,從零寫出超過 100 萬行、分佈在 1000 個檔案裡的瀏覽器程式碼。

Anthropic 讓 16 個 Claude Agent 并行執行了近 2000 次會話,最終搭建出一套 10 萬行、能夠編譯 Linux 6.9 核心的 C 編譯器。

OpenAI 透露,在截至 5 月的 Codex 個人用戶樣本中,70.2% 的用戶至少提交過一次預計超過一小時人類工作量的任務;25.6% 的用戶提交過超過八小時的任務。

人們交給 AI 的單位,正從一段代碼、一個 bug,變成一個下午、一週,甚至整個項目。

MirrorCode 的 64%,正是對這種「項目級委託」的一次量化。

它指出,只要目標足夠明確,結果能夠自動驗收,前沿模型已能獨立完成部分中大型軟體。

對每一個正在將工作交給 AI 的人來說,變化已近在眼前——

以前你需要盯著它撰寫每一行代碼,接下來,你更可能只在關鍵節點檢查它有沒有跑偏。

The code will become cheaper and cheaper.

而那些能把問題說清楚、把結果驗明白的人,會越來越值錢。

參考資料:https://epoch.ai/MirrorCode

本文來自微信公眾號「新智元」,作者:ASI 啟示錄;編輯:摩西

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露