GPT-6 Astra 在 ARC-AGI-3 中取得近乎完美分數,引發對 AGI 的討論

iconMetaEra
分享
AI summary icon精華摘要
GPT-6 Astra 在 ARC-AGI-3 測試中幾乎取得滿分,透過符號世界模型在 96% 的任務中比人類更優秀地解決複雜謎題。該測試耗資 $18,000,批評者指出其依賴外部工具而非真正的 AGI。在風險偏好資產興趣上升之際,該模型的表現引發了對真實 AI 進展與高成本運算之間差異的質疑。CFT 機構已開始關注 AI 進步可能對監管框架產生的影響。
GPT-6 Astra 在 ARC-AGI-3 測試中取得接近 100% 的成績,引發關注。該模型透過生成高效的「符號世界模型」,將現實世界抽象為邏輯符號與因果代碼,在陌生圖形遊戲中自主建立 DSL 代數符號系統以記錄環境規則,建構「虛擬沙盒」進行模擬推演後再行動。然而,高分背後是每題 360 美元、整場測試高達 1.8 萬美元的昂貴算力成本。ARC Prize 基金會總裁 Greg Kamradt 指出,高分依賴 Harness 外部框架的加持,並非真正的 AGI 突破,僅證明 AI 正在變聰明。

文章作者、來源:雷峰網

突破 AI 智商測試!GPT-6 Astra 的符號世界模型,是突破還是鈔能力刷分?

每題狂燒 360 美元,GPT-6 真的通關 AGI 了?

OpenAI 的最強模型 GPT-6 Astra 終於亮相,它在電腦操作、科學研究和安全防禦上均取得驚人突破。而在眾多亮眼成績中,最引發大眾熱議的是它在 ARC-AGI-3 測試中,成績逼近 100%。

突破 AI 智商測試!GPT-6 Astra 的符號世界模型,是突破還是鈔能力刷分?

ARC-AGI-3 是什麼?這是目前全球科技圈公認的 AI「智商」評測榜,你可以把它理解為 AI 界的門薩俱樂部入會考試。

這個測試全是不斷變化的圖形規律題,根本無法靠刷題應對,AI 必須像人類一樣探索環境、推測目標,並依靠臨場反應與推理能力找出規律。這在各類評測中屬於較高階的題型,更能測試出 AI 到底只是一個工具,還是真正具備智能。

而 GPT-6 Astra 竟然將這個測試打穿了,要知道,上一個模型 GPT-5.6 Sol 的分數還是 38.3%,這實在是一個巨大的飛躍。這種智力甚至碾壓人類,在 96% 的關卡中,它都比人類的操作效率更高,平均動作步數比人類少 51.7%。

如果一個 AI 在完全陌生的環境下,真正具備了建立邏輯規律並解決問題的能力,我們可以暢想一下,未來,或許它可能在未知的自動駕駛路況中,做出正確的選擇,或者在全新的未知病毒爆發時,迅速推演出特效藥的分子結構。

為了探究 GPT-6 Astra 為什麼這麼聰明,ARC Prize 官方親自復盤了它的後台記錄,發現它在玩遊戲時,會生成高效的「符號世界模型」。

突破 AI 智商測試!GPT-6 Astra 的符號世界模型,是突破還是鈔能力刷分?

符號世界模型是「世界模型」的高級衍生品。當世界模型像藝術家一樣,用畫面來預測未來時;即時符號世界模型更像一個數學家,將現實世界抽象為邏輯符號和因果代碼。

This technology is widely recognized as the essential path for AI to achieve advanced reasoning.

什麼是符號世界模型?

過去,許多大模型在 ARC-AGI 系列基準測試中無法取得高分的一個重要原因,是它們習慣了「暴力試錯」。AI 會將遊戲畫面切成像素塊,先隨便點一下,不對就換個方向,靠運氣通关。

在這種模式下,即使有一些分數的突破,AI 也不是真正理解和掌握遊戲規則。

符號世界模型之所以能掌控全局,正在於它是對周圍環境物理規律、因果關係充分理解後,通過精密計算後做出選擇。

在實際測試中,當 GPT-6 Astra 進入陌生的圖形遊戲後,它會開始使用自創的 DSL,一種專屬的代數符號系統,對觀察到的環境做大量筆記。例如,它會精準記錄下遊戲潛在的隱性規則、一連串即將執行的指令,甚至將每一個像素的運動軌跡都精確映射到座標系上。

這種代數的記錄方式帶來的是唯一確定的世界狀態,相較於之前模型以自然語言互動所產生的歧義性,這種符號化表述將使準確率實現史詩級躍升。

然後,它會先在腦海裡寫出一套 Python 代碼邏輯:「如果我按 A,圖形就會左轉 90 度」。

接著,它會在自己的大腦中建立一個「虛擬沙盒」,在腦中模擬接下來的計劃。確認邏輯閉環、準確無誤後,它才會在現實遊戲中點下第一步。這就是為何它的操作效率遠高於人類的原因。

為探測 GPT-6 Astra 的能力邊界,紅隊測試平台 PRO‑LONG 將其置於代碼沙盒中,允許 AI 自主編寫並執行自訂代碼。

結果,GPT-6 Astra 竟然開始為每一款遊戲「量身定制」工具。例如,在一個有守衛巡邏的複雜迷宮遊戲中,GPT-6 Astra 自己寫了個導航系統,接著又添加了戰鬥規則,還模擬了守衛的巡邏路線,最後透過這套自製工具鏈完美預測並校驗了成果。

早年,這套符號推演、自主造工具的能力,完全依賴外部 Harness 外掛框架實現。外掛幫助模型進行畫面轉譯、狀態記錄和結果校驗,但缺點十分突出:模型與外掛之間來回傳輸數據帶來高延遲;外掛的工程能力與大模型本身的權重訓練完全脫節;由於對雲端計算環境和外部腳本的重度依賴,這類高階能力很難部署到端側邊緣硬體上。

而 GPT-6 Astra 現在將大量屬於 Harness 的能力內化至模型自身的權重中。一直推崇符號世界模型的頂尖學者 Gary Marcus 不禁盛讚 GPT-6 Astra 是這一路線的重大勝利。

過去一兩年,學術界與產業界在這個方向湧現了大量核心成果,從哈佛、MIT 到 Google DeepMind,所有人都在押注「符號世界模型」。在通往 AGI 的無數條分叉路口前,業界正達成某種底層的技術共識。

分數這麼高,AGI 穩了?

出題人親自潑冷水

有趣的是,當全網為這一刷榜分數沸騰時,不少人轉發 OpenAI 執行長 Greg Brockman 那句「AGI 已來」時,ARC Prize 基金會執行長 Greg Kamradt 親自下場澆了冷水。

他是出題人中的核心人物,對於基準如何設計、分數如何解讀,他最有發言權。從評測角度來看,他認為分數雖然是真實的,但這玩意離 AGI 還差著十萬八千里。

到目前為止,他已經看到不少團隊依靠 Agent Harness 在 ARC-AGI-3 上取得 90% 以上的成績,例如擁有超強記憶外掛的 PRO-LONG、擅長深度推演的 Tycho,以及能自我進化程式設計環境的 Prime Agent。

這些獲高分的產品都具備相同的技术配方,即包含無損記憶體、程式化分析、顯式假設檢驗、持久狀態和低成本內部計算五大部份。

其中無損記憶負責記憶,程式化分析負責邏輯,顯式假設檢驗負責推演,持久狀態負責多輪互動的上下文,低成本內部計算負責廉價內部算力,讓 AI 能在虛擬環境裡瘋狂試錯後再輸出正確答案。這些共同組成了一個無敵的 Harness,會補足模型自身的不足。

GPT-6 Astra 逼近 100% 的成績,同樣使用了一套豪華的 Harness 加持,它借助了專門定制的「供應商適配器基座」,利用連續對話和上下文壓縮來幫它撐起邏輯鏈,每跑完一局遊戲,就需要消耗 360 美元的昂貴算力。如果完整跑完一整場測試,總算力賬單會高達驚人的 1.8 萬美元(約合 13.5 萬人民幣)!

人類解一個圖形謎題可能只需幾分鐘,按人腦 20W 代謝功率折算電費,不到半美分;即使算上支付給受試者的真实時薪補貼,折合每局也就 12.78 美元,而 AI 要花掉 360 美元。這種靠「鈔能力」拼出來的成績,真的能成為普通人觸手可及的 AGI 嗎?

當然,GPT-6 Astra 已經開始逐步內化 Harness 的能力,如果繼續發展,模型內部的潛在計算能力會越來越強。不過,由於其推理過程開始變得不透明,開發者們也不知道 AI 真的懂了,還是找到了更高效的作弊方式。

回到上面的問題,GPT-6 Astra 到底算不算 AGI?

對於這個問題,Greg Kamradt 在他的長文結尾,給出了一個充滿哲思的回應。人類為何能被視為「通用智能」?因為人類能適應任何未知的世界,即使把古代的嬰兒扔到現代,他同樣能學會坐地鐵、用手機。這種智能延續千年,不斷推動科技進步。但現在科技界要氪金通過的評測,只是給 AI 辦的一場「圖形消消樂考試」。

這只是證明 AI 正在變聰明,但絕不是 AGI 到來的證據。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露