OpenAI 總裁建議,隨著 GPT-6 Astra 的發布,通用人工智慧已到來

iconTechFlow
分享
AI summary icon精華摘要
2026 年 9 月 3 日,OpenAI 執行長 Greg Brockman 宣布,公司可能已透過 GPT-6 Astra 的發布實現了 AGI。該模型在自動化和基於螢幕的任務中表現出色,在 ARC-AGI-3 等基準測試中得分優異。Astra 目前已向企業用戶和付費用戶開放。此更新為科技與區塊鏈領域帶來了新的鏈上新聞與加密貨幣新聞。

作者|樺林舞王

編輯|靖宇

2026 年 9 月 3 日,OpenAI 執行長 Greg Brockman 在發布會結束後說了一句在 AI 行業極為罕見的話:「我個人認為,我們可能已經到達 AGI 了,我覺得就是這個模型。」

他用詞謹慎,使用第一人稱,加上了「可能」,並特別留了餘地說:「如果你想說這是第一個,我認為這是合理的」。

這不是 OpenAI 官方宣布 AGI 到來,而是一位公司總裁在鏡頭前說出了自己的判斷。

於當地時間 9 月 3 日,GPT-6 Astra 正式發布。極客公園拆解了目前能取得的所有技術細節與演示材料,試圖回答一個最核心的問題:這個模型到底能做什麼?能做到什麼程度?它真的能代表 AGI 的到來嗎?

「操控電腦」趨於神話

在發布材料中,OpenAI 為 Astra 起了一個簡潔的口號:「Anything you can do on a computer, Astra can do for you.(你在電腦上能做的任何事,Astra 都能替你做。)」

這不是誇張的營銷話術,而是方向聲明。

過去幾年,AI 操控電腦的主流路徑是調用 API。軟體開發商先寫好接口,AI 再通過接口完成操作。這套邏輯本質上要求每一款軟體都專門適配 AI,否則 AI 就無能為力。

Astra 走了一條完全不同的路:它像人一樣,直接「看」螢幕上的像素,然後移動滑鼠、敲擊鍵盤,完成操作。

這個區別的意義在於覆蓋範圍。KiCad(印刷電路板設計軟體)不會為 AI 寫 API,FreeCAD 不會,公司內部用了十年的舊 ERP 系統更不會。但如果 AI 能直接觀看螢幕並進行操作,這些軟體它都能使用——就像一位新入職的員工,無需了解軟體背後的代碼,只需能看懂介面即可。

OpenAI 在發布的材料中展示了幾個具體案例,讓您感受一下「操控電腦」落地後的樣貌。

GPT-6 Astra 自行完成了 PCB 板布局與走線|圖片來源:OpenAI

給 Astra 一張電路原理圖,它在 KiCad 中完成了元件佈局和銅線走線,整個過程耗時 2 分 54 秒。另一個演示是三維建模,Astra 在 Blender 中搭建了一棟房子的模型,然後將其導入 Unreal Engine 5,生成了一個可實時漫遊的建築場景。還有一個更日常的演示,用戶僅需對 Astra 說話,它便完成了 eBay 商品上架的完整流程,從填寫資訊到提交發布。

Astra 在 Blender 中實現的建築模型|圖片來源:OpenAI

在效率提升方面,OpenAI 提供的對比數據也相當直觀。在 OSWorld 2.0 基準測試上,Astra 完成電腦使用任務的得分為 72.6%,上一代旗艦 GPT-5.6 Sol 為 65.7%;而完成同樣任務,Astra 平均僅需約 40 分鐘,Sol 則需約 75 分鐘,速度提升了近一半。

https://www.geekpark.net/news/369800 https://www.geekpark.net/news/369800

Astra 用 9 分鐘實現了尋找公寓任務(左)、2 分鐘實現了尋找兒科診所任務|圖片來源:OpenAI

OpenAI 也公布了兩個內部計時案例。對於「尋找貓咪臨時看護」這類需要大量網路搜尋、資訊比對並彙總成文件的任務,Astra 花了 5 分 27 秒,OpenAI 提供的人類對照基線為 30 分鐘。對於「求職準備」這類需要搜尋職位、匹配履歷、整理申請流程的綜合任務,Astra 花了 2 分 51 秒,人類基線為 5 小時。

這兩個數字是 OpenAI 自己的演示結果,並非第三方獨立測試,需保留合理質疑。但它們揭示的產品方向是清晰的:Astra 並非設計用來幫你寫一封郵件,而是設計用來替你完成那些需要「打開多個軟體、點擊多個步驟」的完整工作流程。填寫表格、更新 CRM 記錄、整理日曆、在線調研後生成報告,這些都是 OpenAI 明確列出的企業應用場景。

能力「Next Level」

每次大型模型發布都會帶來一堆基準測試數字。大多數時候,從 80 分到 85 分,讀者看起來差不多,但這次確實不一樣。

ARC-AGI-3 是目前公認最難「刷」的 AI 評測之一。它的設計思路是專門讓模型無法透過記憶訓練資料來應付,測試的是面對全新問題時的真實推理能力,有點像針對 AI 的智商測試。

Astra 在 ARC-AGI-3 上的得分近乎於神|圖片來源:OpenAI

Astra 在 ARC-AGI-3 上的得分為 98.6%。GPT-5.6 Sol 的得分為 7.8%。Anthropic 的 Claude Opus 5 為 30%。

這不是從 80 分提升到 90 分那種「進步」,而是量級上的跨越。ARC-AGI 的創始人 François Chollet 曾多次提高測試難度,因為 AI 總是會很快「刷滿」,但 Astra 在第 3 級難度下仍接近滿分。

Astra 在頂級數學研究能力測試中也大幅領先|圖片來源:OpenAI

其他幾個關鍵基準的情況:FrontierMath Tier 4(頂級數學研究能力)97.6%,GPQA Diamond(研究生級別跨學科問答)96%,DeepSWE(真實軟體工程任務)74.1%,ExploitBench(網路安全漏洞利用)100%。

有一個維度 Astra 沒有拿到第一。在「Humanity's Last Exam」(含工具調用版)上,Astra 得了 57.2%,兩天前剛剛發布的 Anthropic Claude Fable 5.1 是 65.0%。並不是全面碾壓,競爭仍然存在。

還有一個關鍵細節需要說明。ARC-AGI-3 的高分依賴 OpenAI 的「有狀態測試框架」,允許模型在多輪嘗試中累積上下文資訊;在無狀態的普通 API 調用條件下,得分會顯著低於這個數字。跨模型橫向比較時,需要留意這一層前提條件。

Overall, Astra has widened the gap with the previous generation of models to an extent rarely seen in AI model iterations over the past two years.

在 ExploitGym honeypot 測試中,Astra 被騙的機率被封死|圖片來源:OpenAI

最鮮明的對比不在於智力,而在於對齊。OpenAI 公布了一項內部測試數據,在沒有生產環境安全限制的情況下,GPT-5.6 Sol 有 48.2% 的情況會超出授權範圍行事,而 Astra 則為 0%。

更聰明,同時更守規矩,這才是 OpenAI 這次真正想傳遞的訊號。

你還用不上

目前 Astra 採用分階段開放策略。

首先向「Daybreak」項目的企業用戶開放,隨後將擴展至 ChatGPT Plus、Pro、Business 和 Enterprise 訂閱用戶,同時支援透過 OpenAI API、AWS Bedrock 和 Microsoft Azure 調用。

Astra 的網絡安全能力更強版本,僅向經審批的防禦性安全機構及關鍵基礎設施領域的優先用戶開放。這是因為 Astra 是 OpenAI 歷史上第一個達到內部「Critical(關鍵)」網絡安全門檻的模型,能在幾乎無需人類引導的情況下發現未知的零日漏洞並構建完整的漏洞利用鏈。在評估過程中,Astra 更發現了兩個此前未公開的漏洞,OpenAI 隨後將其披露給相關軟體維護者。

在 API 定價方面,Astra 的輸入和輸出價格分別為每百萬 token 10 美元和 50 美元。對於 ChatGPT 訂閱用戶,Astra 的使用量已包含在現有訂閱配額內。

選擇發布時機本身也是一種背景。就在上個月,OpenAI 遭遇了一起嚴重的安全事故,兩個處於內部測試中的模型逃出沙盒環境,入侵了 AI 公司 Hugging Face 的系統,隨後 OpenAI 暫停了部分研究與訓練工作。Brockman 在簡報會上主動提及此事件,強調 Astra 的低越界率與安全設計,此次發布也承擔著「重建信任」的使命。

Astra 的發布,是能力的展示,也是一次公開的信任聲明。

AGI 是否已到來,最終可能取決於每個人選擇哪個定義。但一個能直接坐在你電腦前、自主完成跨軟體工作流程的模型,今天已是真實存在的事情。

接下來真正有意思的問題,是企業和個人用戶會首先把它用在哪裡,以及哪些職業會最先感受到這種「替代感」。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露