Claude 這次,真的把 AI 編程榜單打出斷層了!
就在剛剛刷新的 MirrorCode 排行榜上,Claude Fable 5 以 64% 的絕對成功率再次登頂。
緊追其後的 GPT-5.6 Sol,分數只有它的三分之一!
排名第4的GPT-5.5更慘,不僅成績只有10%,還被自家前輩GPT-5.4按在地上摩擦。

更令人意外的是,使用 Go 等高資源語言時,Fable 5 的解出率為 64%;換成冷門語言 Ada,成績仍高達 61%。
要知道,在開源世界裡,Python 語料大約是 Ada 的 230 倍。
但到了 Fable 5 這裡,成績居然只下降 3 個百分點。

這就有趣了。
如果模型主要依賴記憶熱門語言的語法和常見寫法,那麼換成 Ada 之後成績應該會下降才對。
而現在的結果,卻指向另一種可能——
最強模型已擺脫具體語料的牽引,開始學會如何從零構建一個完整的軟體專案。
卡在 100% 通關線,100 億 Token 極限測試
具體來說,完整的 MirrorCode 包含 25 個目標程式,涵蓋 Unix 工具、解釋器、資料查詢、生物資訊學、密碼學和壓縮工具等領域。
在這裡,模型會被放入隔離環境,沒有互聯網,看不到原始項目程式碼,也不能下載第三方依賴。它能取得的只有高層文檔、部分可見測試,以及一個可反覆調用的原始程式。
接下來,它要不斷向原程式輸入數據,觀察輸出以猜測內部邏輯,再一 點點 Write a new program with consistent behavior.
從最新排名中選出 15 個 Medium 和 Large 目標。每個目標使用兩種實現語言,每種語言運行三次。
此外,可見測試與隱藏測試的完成率必須達到 100% 才能通過,99.9% 不行。
即使遺漏一個邊緣案例,整個運行仍計為失敗。

為了迫使模型填補最後幾個缺口,MirrorCode 將單次預算推高至 100 億 Token,最長允許連續運行 7 天。
論文中成本最高的一次任務更為誇張:模型連續運行了 19 天,單次花費高達 2600 美元。
在這19天裡,模型會反覆運行原始程式、比較結果、補寫功能,再重新運行測試。出現錯誤就查找原因,輸出不符就更換假設,局部通過後再追尋下一個缺口。
整個過程,更像是一場持續數天的調試,而不是一次生成。

gotree 的例子最直觀。
這個生物資訊學工具原本約有 1.6 萬行程式碼和 40 多個命令。
Claude Opus 4.7 花費了 14 小時和 251 美元,通過了 2001 項測試中的 2000 項,完成度達到了 99.95%。
雖然漏掉了一個處理日期註釋的冷門邊界,被 MirrorCode 的 100% 通關線攔了下來,但它已將原本按週計算的工程量壓縮至十幾個小時——
Epoch 評估,如果不使用 AI,人類工程師要完成同一任務至少需要 2 到 17 週。
在語料荒漠中,Fable 5 僅掉落了 3 分
MirrorCode 論文曾以 StarCoder 的公開訓練混合資料作為參照。
Python 約佔 8%,Ada 僅有 0.034%,前者約為後者的 230 倍。

當然,我們無法知道閉源模型究竟見過多少 Ada 代碼。但以公開生態為參照,Ada 的稀缺性已足夠直觀。
這門語言主要出現在航太、國防和其他安全關鍵系統中。無論是社群規模、教學數量還是開源專案,都遠遠無法與 Python、JavaScript 或 Go 相比。
而 Fable 5 顯然不是在將 Go 語言代碼逐句翻譯成 Ada。
這更像是先弄清楚原始程式究竟是如何運作的,然後再用另一種語言重新實現相同的行為。

In comparison, other models are not as stable.
GPT-5.6 Sol 從 24% 降到 19%,GPT-5.4 從 21% 降到 12%,GPT-5.5 更是從 17% 掉到 5%。語言一換,差距立刻被放大。
把整個項目交給 AI
如今,Cursor 已讓數百個 Agent 協作近一週,從零寫出超過 100 萬行、分佈在 1000 個檔案裡的瀏覽器程式碼。
Anthropic 讓 16 個 Claude Agent 并行執行了近 2000 次會話,最終搭建出一套 10 萬行、能夠編譯 Linux 6.9 核心的 C 編譯器。
OpenAI 透露,在截至 5 月的 Codex 個人用戶樣本中,70.2% 的用戶至少提交過一次預計超過一小時人類工作量的任務;25.6% 的用戶提交過超過八小時的任務。
人們交給 AI 的單位,正從一段代碼、一個 bug,變成一個下午、一週,甚至整個項目。
MirrorCode 的 64%,正是對這種「項目級委託」的一次量化。
它指出,只要目標足夠明確,結果能夠自動驗收,前沿模型已能獨立完成部分中大型軟體。
對每一個正在將工作交給 AI 的人來說,變化已近在眼前——
以前你需要盯著它撰寫每一行代碼,接下來,你更可能只在關鍵節點檢查它有沒有跑偏。
The code will become cheaper and cheaper.
而那些能把問題說清楚、把結果驗明白的人,會越來越值錢。
參考資料:https://epoch.ai/MirrorCode
本文來自微信公眾號「新智元」,作者:ASI 啟示錄;編輯:摩西
