OpenAI 推出 GPT-6 Astra,專注於 AI 執行與電腦操作能力

iconMetaEra
分享
AI summary icon精華摘要
OpenAI 於 2026 年 9 月 3 日發布 GPT-6 Astra,專注於執行與電腦操作能力。該模型在 OSWorld 2.0 中取得 72.6% 的分數,並在 Mind2Web 測試中將任務速度提升 90%。Astra 符合 OpenAI 的網路安全標準,展現強勁的鏈上交易訊號,並具備自動化系統中支撐與阻力分析的潛力。
GPT-6 Astra 真正重要的意義,不在於某一個排行榜上的分數,而在於 AI 正在從工具變成可以長期協作的數字員工。

文章作者、來源:ME News

簡而言之

  • GPT-6 Astra 最大的變化,不是單純提升模型的回答能力,而是讓 AI 從「提供建議」進一步走向「直接完成任務」的執行型智能。
  • Astra 透過強化電腦操作、軟體調用、代碼開發和長期任務管理能力,試圖解決 AI Agent 長期存在的穩定性問題。
  • OpenAI 称 Astra 是目前「世界上最聰明、最對齊」的模型,但這一判斷更多代表公司的戰略定位,獨立測試顯示不同模型仍存在競爭。
  • Astra 首次達到 OpenAI 定義的 Critical 網絡安全能力門檻,意味著前沿 AI 能力正在進入更高風險階段。
  • GPT-6 Astra 真正重要的意義,不在於某一個排行榜上的分數,而在於 AI 正在從工具變成可以長期協作的數字員工。

GPT-6 Astra:AI 競爭進入「執行能力」時代

9月3日,OpenAI 正式發布 GPT-6 Astra,並將其定義為目前能力最強、對齊程度最高的模型。與過去幾代 GPT 模型相比,Astra 最大的變化並不是語言理解能力再提升一點,而是 AI 開始更加接近一個能夠獨立完成複雜工作的智能代理。

過去幾年,生成式 AI 的發展路徑非常清晰。

在 GPT-3 時代,人們首次意識到 AI 可以大規模生成自然語言內容;在 GPT-4 時代,多模態能力讓 AI 開始理解圖片、文件和複雜資訊;隨後推理模型的發展,又讓 AI 在數學、代碼和邏輯任務上展現出更強能力。

但這些模型始終存在一個核心限制:它們能夠告訴用戶「應該怎麼做」,卻很難真正替用戶完成事情。

例如,一個 AI 助手可以幫用戶撰寫商業計劃書,但用戶仍需自行尋找資料、整理文件、開啟工具、填寫表格、調整格式;一個 AI 編程助手可以生成代碼,但開發者仍需自行運行測試、定位錯誤、部署應用。

Astra 試圖改變的,正是這一層。

OpenAI 希望 AI 不再只是一個對話窗口,而成為能夠操作電腦、調用工具、理解環境並持續推進目標的執行系統。官方介紹中,Astra 能夠自主完成網頁瀏覽、軟體操作、資料整理、表格製作、程式碼編寫以及測試運行等連續任務。(邊緣網)

這意味著 AI 競爭的重點正在發生變化。

決定模型價值的,未必是誰能生成更漂亮的文字,而是誰能在現實數字環境中完成更多工作。

Astra 最大的突破:讓 AI 真正「使用電腦」

如果過去的大模型主要生活在聊天框中,那麼 Astra 正在嘗試進入用戶的電腦環境。

電腦操作能力並非僅僅是一次簡單的功能升級,而是 AI Agent 商業化過程中至關重要的一步。

由於現實世界中的大量工作,並不存在一個標準化 API。

企業員工每天使用的工具,包括郵件系統、辦公軟體、財務系統、設計工具、項目管理平台,很多都依賴滑鼠點擊、頁面切換和人工判斷。

傳統自動化系統通常需要企業提前設計流程,而 AI Agent 則希望反過來理解人的目標,然後自行尋找完成路徑。

例如,一個用戶要求:

請幫我整理過去一個季度的市場數據,並製作一份分析報告。

傳統軟件需要提前配置數據接口、模板和流程。

而理想狀態下的 Astra,可以自行搜尋資料、讀取檔案、打開 Excel、處理數據、生成圖表,再輸出最終報告。

這也是為什麼電腦操作能力被視為 AI 進入真實工作場景的重要基礎。

根據 OpenAI 公布的數據,Astra 在與電腦操作相關的測試中,相比上一代模型 GPT-5.6 Sol 有明顯提升。其中 OSWorld 2.0 測試成績從 65.7% 提升至 72.6%,完成模擬任務所需時間也明顯下降。新版 Codex 結合 Astra 後,在 Mind2Web 任務中的速度達到此前系統的約 1.9 倍。

These data show that the model improvements are no longer just reflected in "answer accuracy," but also in task completion efficiency.

這也是 AI Agent 與普通聊天機器人最大的區別。

聊天機器人優化的是一次互動。

代理優化的是整個流程。

From model capabilities to work capabilities, Astra redefines "intelligence"

OpenAI 表示 Astra 在多項前沿測試中表現領先。

根據官方公佈的數據,Astra 在 FrontierMath Tier 4 測試中達到 97.6%;在 ARC-AGI-3 驗證測試中,結合 OpenAI 上下文管理機制達到 99.9%,在統一標準框架下成績為 62.7%;在 Terminal-Bench 4.0 測試中獲得 57.9%。(OpenAI 開發者)

這些指標背後反映的是一個趨勢:AI 模型正在從單項能力競爭轉向綜合任務能力競爭。

過去評估模型時,人們關注的是知識量、語言流暢度、數學成績。

但進入 Agent 時代,模型需要同時具備幾個能力:

第一,理解複雜目標。

用戶通常不會給 AI 一個非常精確的指令,而是描述一個模糊的需求。例如「幫我準備一個融資材料」,其中包含市場研究、競爭分析、資料整理、視覺設計等多個步驟。

Second, able to plan task pathways.

真正複雜的工作不是一步完成,而是需要拆解任務,並根據中間結果不斷調整。

第三,需要調用外部工具。

現實工作很少只靠語言完成,必須連接瀏覽器、代碼環境、資料庫以及各種軟體。

第四,需要保持長期穩定執行。

如果一個 AI 只能完成五分鐘任務,它更像高級助手;如果它能夠連續工作數小時,並在過程中保持目標一致,它才更接近數字員工。

Astra 的重要意義,在於試圖同時提升這四個維度。

「世界上最聰明」背後:模型競爭仍無終點

不過,需要注意的是,「世界上最聰明的模型」這一說法,主要來自 OpenAI 自身定位。

根據獨立測試,AI 模型之間的競爭仍然非常激烈。

Artificial Analysis 數據顯示,在其 Intelligence Index 測試中,GPT-6 Astra max 獲得 61 分,而 Claude Fable 5.1 max 也保持較高水平。不同測試方法、推理設置和任務類型,可能導致模型排名出現變化。(人工智能分析)

This indicates that the current AI industry has not yet produced an absolute "ultimate model".

不同模型正在形成不同的優勢。

OpenAI 更強調通用能力、工具調用和生態整合;Anthropic 長期強化代碼能力、安全性與企業場景;谷歌則依托搜索、雲計算和多模態能力推進自己的路線。

未來的大模型競爭,不太可能像智慧型手機時代一樣由一家企業完全統治。

更可能出現的是多個超級AI系統圍繞不同工作場景展開競爭。

因此,Astra 真正重要的地方,不是證明 OpenAI 已經贏得所有競爭,而是證明 AI 發展的評價標準正在變化。

過去比拼的是「誰更會回答」。

The future will be about “who can accomplish more.”

AI 能力越強,安全問題越重要

Astra 另一個值得注意的變化,是它首次達到 OpenAI Preparedness Framework 中的 Critical 網絡安全能力門檻。

這意味著,模型在擁有適當工具和權限的情況下,已具備發現未知漏洞並開發利用路徑的能力。(OpenAI)

這是一件具有雙重意義的事情。

一方面,更強的 AI 可以幫助安全研究人員發現漏洞,提升網絡防禦能力。

另一方面,如果此類能力被濫用,也可能增加網絡攻擊風險。

過去的軟體漏洞發現依賴專業安全團隊,需要大量人工分析。

未來,高能力 AI 可能大幅提高漏洞研究的效率。

但與此同時,AI 系統本身也必須具備更嚴格的權限控制、行為監控和安全隔離。

OpenAI 表示,為了部署 Astra,加強了內部安全措施,包括更嚴格的模型隔離、軌跡監控以及安全評估流程。(OpenAI)

這反映出一個現實:

AI 能力提升越快,安全體系的重要性越高。

The future competition among AI companies will not only be about model capabilities, but also about security governance capabilities.

Astra 的真正價值:成為數字世界中的執行層

從產業角度觀察,GPT-6 Astra 的重要性不僅僅是一次模型升級,更是對 AI 產業發展方向的一次確認。

過去幾年,行業廣泛討論「大模型是否會取代軟體」。

但更現實的路徑可能是:

AI 不會立即取代所有軟體,而是成為連接軟體、數據和人的智能執行層。

未來,企業員工可能無需打開十幾個應用程式來完成工作,只需直接告訴 AI 目標。

分析今年的銷售趨勢。

準備下個季度的預算。

尋找潛在客戶。

Optimize the code and deploy the test environment.

AI 負責拆解任務、調用工具、執行流程,人負責制定目標和最終決策。

這也是為什麼 Astra 的電腦操作能力比單純提高參數規模更值得關注。

模型規模決定 AI 知道多少。

Agent 的能力決定 AI 能做多少。

From this perspective, GPT-6 Astra represents not just another chatbot, but a new way of computing interaction.

在互聯網時代,人們通過搜索引擎尋找資訊;在移動互聯網時代,人們通過應用程式完成服務;在 AI 時代,人們可能通過智能代理直接完成任務。

Whether Astra has achieved AGI is still controversial.

But it is certain that it has taken an important step toward AI "autonomous execution".

在未來幾年,真正改變生產力結構的,可能不是一個回答問題更準確的模型,而是一個能夠長期替人完成複雜工作的智能系統。

GPT-6 Astra 的意義,在於它讓這個未來第一次變得更加具體。

參考資料

  1. OpenAI,「安全概覽:GPT-6 Astra」,2026 年 9 月 3 日
  2. OpenAI 開發者平台,“GPT-6 Astra 模型文件”,2026
  3. OpenAI,《通往 Astra:關鍵能力與前沿保障》,2026 年 9 月
  4. 路透社,“OpenAI 推出新 Astra 模型,正值對代理安全性的關注日益增加”,2026 年 9 月
  5. The Verge,「OpenAI 的下一個大型 AI 模型已進入 AGI 時代」,2026 年 9 月
  6. Wired,「OpenAI 表示 GPT-6 使用電腦的能力優於人類」,2026 年 9 月
  7. 人工分析,「GPT-6 Astra 基準測試」,2026
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露