GPT-6 Astra 在 ARC-AGI-3 測試中取得接近 100% 的成績,引發關注。該模型透過生成高效的「符號世界模型」,將現實世界抽象為邏輯符號與因果代碼,在陌生圖形遊戲中自主建立 DSL 代數符號系統以記錄環境規則,建構「虛擬沙盒」進行模擬推演後再行動。然而,高分背後是每題 360 美元、整場測試高達 1.8 萬美元的昂貴算力成本。ARC Prize 基金會總裁 Greg Kamradt 指出,高分依賴 Harness 外部框架的加持,並非真正的 AGI 突破,僅證明 AI 正在變聰明。文章作者、來源:雷峰網

每題狂燒 360 美元,GPT-6 真的通關 AGI 了?
OpenAI 的最強模型 GPT-6 Astra 終於亮相,它在電腦操作、科學研究和安全防禦上均取得驚人突破。而在眾多亮眼成績中,最引發大眾熱議的是它在 ARC-AGI-3 測試中,成績逼近 100%。

ARC-AGI-3 是什麼?這是目前全球科技圈公認的 AI「智商」評測榜,你可以把它理解為 AI 界的門薩俱樂部入會考試。
這個測試全是不斷變化的圖形規律題,根本無法靠刷題應對,AI 必須像人類一樣探索環境、推測目標,並依靠臨場反應與推理能力找出規律。這在各類評測中屬於較高階的題型,更能測試出 AI 到底只是一個工具,還是真正具備智能。
而 GPT-6 Astra 竟然將這個測試打穿了,要知道,上一個模型 GPT-5.6 Sol 的分數還是 38.3%,這實在是一個巨大的飛躍。這種智力甚至碾壓人類,在 96% 的關卡中,它都比人類的操作效率更高,平均動作步數比人類少 51.7%。
如果一個 AI 在完全陌生的環境下,真正具備了建立邏輯規律並解決問題的能力,我們可以暢想一下,未來,或許它可能在未知的自動駕駛路況中,做出正確的選擇,或者在全新的未知病毒爆發時,迅速推演出特效藥的分子結構。
為了探究 GPT-6 Astra 為什麼這麼聰明,ARC Prize 官方親自復盤了它的後台記錄,發現它在玩遊戲時,會生成高效的「符號世界模型」。

符號世界模型是「世界模型」的高級衍生品。當世界模型像藝術家一樣,用畫面來預測未來時;即時符號世界模型更像一個數學家,將現實世界抽象為邏輯符號和因果代碼。
This technology is widely recognized as the essential path for AI to achieve advanced reasoning.
什麼是符號世界模型?
過去,許多大模型在 ARC-AGI 系列基準測試中無法取得高分的一個重要原因,是它們習慣了「暴力試錯」。AI 會將遊戲畫面切成像素塊,先隨便點一下,不對就換個方向,靠運氣通关。
在這種模式下,即使有一些分數的突破,AI 也不是真正理解和掌握遊戲規則。
符號世界模型之所以能掌控全局,正在於它是對周圍環境物理規律、因果關係充分理解後,通過精密計算後做出選擇。
在實際測試中,當 GPT-6 Astra 進入陌生的圖形遊戲後,它會開始使用自創的 DSL,一種專屬的代數符號系統,對觀察到的環境做大量筆記。例如,它會精準記錄下遊戲潛在的隱性規則、一連串即將執行的指令,甚至將每一個像素的運動軌跡都精確映射到座標系上。
這種代數的記錄方式帶來的是唯一確定的世界狀態,相較於之前模型以自然語言互動所產生的歧義性,這種符號化表述將使準確率實現史詩級躍升。
然後,它會先在腦海裡寫出一套 Python 代碼邏輯:「如果我按 A,圖形就會左轉 90 度」。
接著,它會在自己的大腦中建立一個「虛擬沙盒」,在腦中模擬接下來的計劃。確認邏輯閉環、準確無誤後,它才會在現實遊戲中點下第一步。這就是為何它的操作效率遠高於人類的原因。
為探測 GPT-6 Astra 的能力邊界,紅隊測試平台 PRO‑LONG 將其置於代碼沙盒中,允許 AI 自主編寫並執行自訂代碼。
結果,GPT-6 Astra 竟然開始為每一款遊戲「量身定制」工具。例如,在一個有守衛巡邏的複雜迷宮遊戲中,GPT-6 Astra 自己寫了個導航系統,接著又添加了戰鬥規則,還模擬了守衛的巡邏路線,最後透過這套自製工具鏈完美預測並校驗了成果。
早年,這套符號推演、自主造工具的能力,完全依賴外部 Harness 外掛框架實現。外掛幫助模型進行畫面轉譯、狀態記錄和結果校驗,但缺點十分突出:模型與外掛之間來回傳輸數據帶來高延遲;外掛的工程能力與大模型本身的權重訓練完全脫節;由於對雲端計算環境和外部腳本的重度依賴,這類高階能力很難部署到端側邊緣硬體上。
而 GPT-6 Astra 現在將大量屬於 Harness 的能力內化至模型自身的權重中。一直推崇符號世界模型的頂尖學者 Gary Marcus 不禁盛讚 GPT-6 Astra 是這一路線的重大勝利。
過去一兩年,學術界與產業界在這個方向湧現了大量核心成果,從哈佛、MIT 到 Google DeepMind,所有人都在押注「符號世界模型」。在通往 AGI 的無數條分叉路口前,業界正達成某種底層的技術共識。
分數這麼高,AGI 穩了?
出題人親自潑冷水
有趣的是,當全網為這一刷榜分數沸騰時,不少人轉發 OpenAI 執行長 Greg Brockman 那句「AGI 已來」時,ARC Prize 基金會執行長 Greg Kamradt 親自下場澆了冷水。
他是出題人中的核心人物,對於基準如何設計、分數如何解讀,他最有發言權。從評測角度來看,他認為分數雖然是真實的,但這玩意離 AGI 還差著十萬八千里。
到目前為止,他已經看到不少團隊依靠 Agent Harness 在 ARC-AGI-3 上取得 90% 以上的成績,例如擁有超強記憶外掛的 PRO-LONG、擅長深度推演的 Tycho,以及能自我進化程式設計環境的 Prime Agent。
這些獲高分的產品都具備相同的技术配方,即包含無損記憶體、程式化分析、顯式假設檢驗、持久狀態和低成本內部計算五大部份。
其中無損記憶負責記憶,程式化分析負責邏輯,顯式假設檢驗負責推演,持久狀態負責多輪互動的上下文,低成本內部計算負責廉價內部算力,讓 AI 能在虛擬環境裡瘋狂試錯後再輸出正確答案。這些共同組成了一個無敵的 Harness,會補足模型自身的不足。
GPT-6 Astra 逼近 100% 的成績,同樣使用了一套豪華的 Harness 加持,它借助了專門定制的「供應商適配器基座」,利用連續對話和上下文壓縮來幫它撐起邏輯鏈,每跑完一局遊戲,就需要消耗 360 美元的昂貴算力。如果完整跑完一整場測試,總算力賬單會高達驚人的 1.8 萬美元(約合 13.5 萬人民幣)!
人類解一個圖形謎題可能只需幾分鐘,按人腦 20W 代謝功率折算電費,不到半美分;即使算上支付給受試者的真实時薪補貼,折合每局也就 12.78 美元,而 AI 要花掉 360 美元。這種靠「鈔能力」拼出來的成績,真的能成為普通人觸手可及的 AGI 嗎?
當然,GPT-6 Astra 已經開始逐步內化 Harness 的能力,如果繼續發展,模型內部的潛在計算能力會越來越強。不過,由於其推理過程開始變得不透明,開發者們也不知道 AI 真的懂了,還是找到了更高效的作弊方式。
回到上面的問題,GPT-6 Astra 到底算不算 AGI?
對於這個問題,Greg Kamradt 在他的長文結尾,給出了一個充滿哲思的回應。人類為何能被視為「通用智能」?因為人類能適應任何未知的世界,即使把古代的嬰兒扔到現代,他同樣能學會坐地鐵、用手機。這種智能延續千年,不斷推動科技進步。但現在科技界要氪金通過的評測,只是給 AI 辦的一場「圖形消消樂考試」。
這只是證明 AI 正在變聰明,但絕不是 AGI 到來的證據。
