OpenAI 的 Astra 將 AI 重點從回答轉向執行長期任務

iconMetaEra
分享
AI summary icon精華摘要
OpenAI 的 Astra 模型將人工智慧的焦點從回答轉向執行長期任務。隨著數位資產監管趨嚴,BTC 作為抗通脹工具仍是關鍵話題。Astra 可處理數小時的運算,並使用 16 個代理進行研究級數學或軟體控制。該模型可能將企業人工智慧的定價模式從按座位計費轉為按任務計費。Astra 目前不對公眾開放測試,因內部網路安全顧慮導致訓練與評估暫停。
Astra 真正值得關注的,不是它某一道數學題做得多好,而是 OpenAI 正在將前沿模型從「即時回答系統」改造成能夠持續數小時乃至更久、自主拆解任務並操作現實軟體的執行系統。

文章作者、來源:0x9999in1,ME News



簡而言之

  • Astra 真正值得關注的,不是它某一道數學題做得多好,而是 OpenAI 正在將前沿模型從「即時回答系統」改造成能夠持續數小時乃至更久、自主拆解任務並操作現實軟體的執行系統。
  • 16 個 Agent 協同證明數學題、直接操作電腦、「AI 研究實習生」這些演示指向同一個變化:AI 競爭的核心指標正在從單次回答質量,轉向能獨立承擔多長、多複雜的工作鏈條。
  • 如果這種能力能夠穩定部署,企業購買AI的邏輯也會改變:過去買的是軟體席位和Copilot,未來可能越來越接近購買「數位勞動力」和任務吞吐量。
  • 但閉門演示並非生產環境。Astra 目前仍未公開發布,所謂「研究實習生」也是 OpenAI 內部標準,數學演示得到的是候選證明,而非對其科學正確性的獨立認證。
  • 更值得警惕的是,能力提升已開始反過來限制 OpenAI 自身的研發速度。OpenAI 在 8 月承認,Astra 可能已觸及最高級別的「Critical」網路安全能力門檻,並因此暫停部分訓練和評估活動。
  • 所以,Astra 是否為 AGI,如今爭論的意義有限。真正重要的問題已變成:當 AI 首次有機會從「回答你的問題」升級為「替你持續完成工作,甚至幫助研究下一代 AI」時,企業、勞動力市場和 AI 公司的經濟模型會發生什麼。

Astra 最重要的變化,不是更聰明,而是開始「接手一整段工作」

如果只看表面,Astra 的閉門預覽很容易被理解成又一次模型發布前的造勢。

數十名 OpenAI 重要客戶的高層抵達舊金山新啟用的 MB0 大樓。門外,「Stop the AI Race」的抗議者仍駐紮不走;門內,一整面綠植被推至玻璃門前,遮擋雙方的視線。Sam Altman 剛從華盛頓回來,此前已向美國政府官員介紹過這個尚未公開發布的模型系列。

這個畫面其實比任何發布會都更準確地概括了今天的AI產業:資本、客戶和政府都在等待能力繼續向前,而另一群人已經開始擔心它向前得太快。

但 Astra 真正重要的地方,不是「模型又提升了多少個百分點」。

現場的第一項演示,是 16 個 AI Agent 面對一道研究級數學問題。它們自行把問題拆成多個子問題,分別嘗試、協調結果,再組合出一個候選證明。這裡必須把「候選」兩個字說清楚:這不是公開驗證過的新數學定理,也不能因為 16 個 Agent 同時工作,就自動等於 16 名優秀數學家組成的研究團隊。多個模型完全可能共享同一種錯誤,Agent 數量增加也不天然意味著正確率線性上升。

但它仍然重要。

因為過去我們衡量大模型時,習慣盯著一個問題:它能不能回答出來?

Astra 試圖把問題換成另一個:它能不能自己組織工作,把一項複雜任務一直做下去?

兩者看起來只差一步,商業意義卻可能差了一個時代。

ChatGPT 最早的典型互動方式是人類提問、機器回答;隨後 Copilot 開始進入編程、辦公和創作流程,人類不斷發出指令,AI 不斷提供協助。Agent 再進一步,則意味著人類只需給出目標,機器自行決定步驟、選擇工具、檢查中間結果,並持續推進。

因此,第二項演示甚至比數學題更值得企業高層認真觀看。

Astra 直接操作電腦,在多個常見桌面軟體之間切換,建立、修改內容,並以極快速度完成操作。Altman 形容,看著模型以「超人級、非常快」的方式使用電腦,是 OpenAI 員工近期感到最震撼的事情之一。

為什麼操作電腦這麼重要?

因為企業世界絕大多數的工作,並不是一道可以放進聊天框裡的漂亮問題。

真實工作分散在瀏覽器、Excel、郵件、代碼倉庫、ERP、CRM、設計軟體、內部資料庫和審批系統之間。一名員工的價值,也從來不只是「知道答案」,而是能夠在十幾個系統之間搬運資訊、做出判斷、修改檔案、推動流程,最終把事情完成。

只要 AI 無法跨過這道門檻,它就仍然主要是一種知識工具。

一旦跨過去,它才第一次真正開始靠近「勞動力」。

Persistent Agent,可能比「GPT-6」這個名字重要得多

Altman 為 Astra 描繪的核心產品形態,是 persistent agents——持續存在、長期工作的 Agent。

這個詞聽起來沒有 AGI 那麼刺激,卻可能更加接近未來幾年真正會影響企業利潤表的東西。

OpenAI 首席科學家 Jakub Pachocki 告訴 TIME,Astra 已達到公司內部設定的「自動化 AI 研究實習生」標準:給它一個實驗想法,它能夠進入 OpenAI 自己的代碼庫實現方案、運行實驗並返回結果;給它一篇研究論文,它能夠執行過去可能佔用人類研究員約一周時間的後續工作。

這仍然只是 OpenAI 內部評測,沒有獨立第三方驗證,更不能簡單推導成「Astra 已經能夠替代研究員」。但它釋放的信號已經足夠明確:OpenAI 追求的單位,正在從 token、回答和對話,轉向任務持續時間。

這個方向並非 OpenAI 自己突然創造出來的敘事。

獨立評測機構 METR 過去幾年一直嘗試用 “task-completion time horizon” 衡量 Agent 能力:不是問模型能不能做某一種題,而是觀察它能夠以一定成功率完成,相當於人類專家需要多長時間完成的任務。

METR 在 2026 年更新後的數據仍顯示出非常明顯的指數式改善趨勢。長期來看,前沿模型的軟體與研究任務時間跨度大約每 6 至 7 個月翻倍;僅看 2023 年以來的數據,增速甚至更快。到今年 5 月,一些最新公開模型已經逼近甚至超過其現有測試集 16 小時左右的有效測量範圍,以至於 METR 專門提醒,超過這一長度的數據不應該被過度解讀。

這恰恰解釋了 Astra 為什麼會出現。

當模型能穩定完成的任務從幾分鐘延長到幾小時,再從幾小時發展到一天甚至更長時,產品形態一定會發生變化。你不再需要一直守在聊天視窗旁糾正它,而是開始像給同事分配任務那樣說:「把這個問題調查清楚,測試三種方案,整理數據,明天把結果給我。」

所謂「虛擬同事」,真正的分水嶺從來不是它會不會說話像人。

而是你離開以後,它還會不會繼續幹活。

一旦 AI 開始按照「工作量」計價,軟體行業的賬可能要重新算

這也是Astra最被低估的財經含義。

過去三年,企業購買生成式AI的主流模式,本質上還是傳統SaaS模式的延伸:每名員工增加一個AI席位,每個月多付幾十美元。Microsoft Copilot如此,ChatGPT企業版如此,大量AI SaaS也如此。

但 persistent agent 一旦成熟,這套定價邏輯會越來越別扭。

為什麼?

企業真正購買的已不再是「某位員工使用 AI 的權限」,而是 AI 自身完成工作的能力。

假設一個財務團隊原來需要 10 個人處理數據整理、報表初稿、異常檢查和跨系統錄入。未來管理者面對的問題可能不再是「要不要給 10 個人各買一個 Copilot」,而會變成「我要買多少 Agent 工作量,才能完成這些任務」。

這時,AI 的競爭對手就不再只是軟體預算。

它開始進入人力預算。

2026年斯坦福AI指數的數據已經顯露出這種矛盾。一方面,企業AI採用率繼續快速上升:2025年,調查中的組織有88%已在至少一個領域使用AI,70%已使用生成式AI;另一方面,真正部署Agent的企業在絕大多數業務職能中仍然只有個位數比例。

換句話說,人們已經非常願意「用AI」,但還沒有大規模願意「把事情交給AI」。

這正是 Astra 試圖跨越的鴻溝。

一旦跨過去,影響也絕不會停留在科技公司內部。Stanford 統計顯示,自 2024 年以來,美國 22 至 25 歲軟體開發者的就業已經下降接近 20%;與此同時,約三分之一受訪企業預計未來一年 AI 會帶來人員減少,而整體就業市場目前又遠未出現同等規模的全面失業。

這說明 AI 對勞動力市場的衝擊很可能不是突然按下一個總開關,而是首先改變招聘入口、初級崗位和標準化知識工作的邊際需求。

也正因如此,「AI 研究實習生」這個稱呼其實很微妙。

今天,它可能首先為研究員完成那些耗時一週、但目標相對清楚的實驗工作;明天企業就會問:財務分析師的初步建模呢?諮詢顧問的資訊蒐集呢?程式設計員的常規開發呢?市場部門的跨系統執行呢?

過去我們一直在討論 AI 會不會「取代一個職業」。

更現實的過程,很可能是 AI 先一點一點拿走一個職業裡面最容易標準化、最容易驗證、最耗時間的工作模塊。崗位不會在某天早晨突然消失,但一家公司原來需要招十名新人完成的工作,可能逐漸只需要六個人、四個人,再加上一組 Agent。

真正改變就業市場的,通常不是「AI 突然什麼都會了」。

而是企業發現:下一員工可以先不招聘。

但Astra越像員工,OpenAI就越不像一家普通軟體公司

如果故事到這裡結束,Astra 只是一個極具商業想像力的產品。

問題在於,OpenAI 自己已經證明,事情沒有這麼簡單。

8月7日,OpenAI 公開表示,根據內部最新評估,公司已經無法排除 Astra 達到其 Preparedness Framework 中的 “Critical” 網絡安全能力等級。

這個門檻不是「模型比較會寫代碼」。

根據 OpenAI 自己的定義,Critical 級別意味著模型可能在缺乏人類干預的情況下,對大量經過強化的現實關鍵系統尋找並開發不同嚴重程度的零日漏洞,或僅根據一個高層目標,自主設計並執行針對強化目標的端到端新型攻擊策略。

OpenAI 強調,目前僅是無法排除這一等級,而不是已最終確認 Astra 具備上述全部能力;同時,Astra 也與此前 OpenAI 涉及 Hugging Face 的安全事件無關。

但公司的反應已經足以說明問題。

OpenAI 加強了網路隔離、沙箱、模型權重保護和全流程監控,並暫停了不符合新安全標準的 Astra 活動。8 月 18 日,公司進一步披露,為加固環境和擴大監測覆蓋,最新擬部署模型的強化學習訓練曾暫停兩週,最大規模的前沿 RL 訓練當時仍處於暫停狀態,大量涉及 Astra 的訓練和評估工作也還沒有恢復。

甚至安全本身,也開始變成一項昂貴的算力支出。

OpenAI 評估,目前這套監控體系可能額外消耗相當於被監控推理計算量約 20% 的算力。

這組數字非常值得資本市場記住。

過去幾年,AI行業的故事一直是:模型越強,商業價值越大,因此值得投入更多 GPU、數據中心和電力。但 Astra 開始展示另一條成本曲線——模型越強,不僅訓練成本越來越高,安全、隔離、監控和治理本身也開始吞噬算力。

這意味著下一代AI的經濟模型不能只計算「每百萬token多少钱」。

還必須計算失控風險、安全冗餘、人工審批、權限隔離以及錯誤造成的真實損失。

一個幫你寫郵件的模型出錯,最多讓人尷尬。

一個擁有長期記憶、代碼執行能力、網路存取權限,可自主操作企業系統數小時的 Agent 出錯,性質完全不同。

能力越接近“員工”,權限管理就必须越接近“員工”;能力一旦超過普通員工,安全要求甚至必須高於員工。

所以 Astra 真正挑戰 OpenAI 的地方,可能並不是「能不能做出來」。

而是能否將這樣一個系統轉變為企業敢於投入生產環境的產品。

“會發明新知識”比 AGI 三個字更值得認真

Altman 在閉門預覽中說得最遠的一句話,是他預計 Astra 可能成為第一個能夠「以真正重要的方式發明新東西」的模型,並把這種能力稱為「非常像 AGI 的事情」。

This sentence certainly has a strong Altman style.

今天沒有任何公開證據能夠證明 Astra 已經穩定創造出經過同行驗證的重要科學新知識,OpenAI 也尚未公開足夠的外部測試結果。因此,把 Astra 直接寫成“AGI 已經到來”,既沒有必要,也缺乏事實基礎。

但 Altman 為何偏偏強調「發現新知識」,卻值得認真研究。

因為這才是AI產業真正可能發生指數級變化的地方。

如果 AI 只是幫助人類提高寫代碼、做設計、分析文件的效率,那麼整個行業再激進,本質上仍然是生產力工具革命。它可以極大提高經濟效率,卻仍然主要依賴人類決定下一步研究什麼、如何設計實驗、怎樣創造下一代技術。

如果 AI 能夠參與 AI 研究本身,邏輯就改變了。

一個能夠閱讀論文、提出實驗方案、修改大型代碼庫、自行運行實驗並分析結果的 Agent,即使僅達到優秀研究實習生的水平,也已能顯著提升頂尖實驗室的有效研究能力。

今天 100 名研究人員,也許背後可以運行 500 個 Agent;未來每名研究員每天可以同時推進的實驗數量,可能不再取決於一天 24 小時,而更多取決於算力、實驗成本和驗證能力。

於是,一個過去非常抽象的概念——「AI幫助研發更好的AI」——開始變得具體。

這才是 Astra 最值得關注,同時也是最應保持克制的地方。

從「完成他人設計的實驗」到「主動提出有價值的新研究方向」,中間仍存在巨大鴻溝;從「生成一個看起來合理的新想法」到「產生可重複、可驗證、真正推動科學進步的新知識」,差距更大。

16 個 Agent 可以同時工作,並不意味著 16 倍創新。

Running 100,000 experiments per day doesn't mean you'll naturally achieve one breakthrough.

科學從不缺乏假設,真正稀缺的是知道什麼問題值得問,以及知道什麼結果真的重要。

Astra 是否跨越了這道線,目前沒有人能從一次閉門演示中得出結論。

Astra 真正劃出的分界線,是 AI 開始從“回答者”變成“行動者”

所以,現在討論 Astra 是否為 AGI,多少有些搶跑。

AGI 這個詞的定義本身就高度模糊。OpenAI 長期使用的定義,是能夠在大多數具有經濟價值的工作上超過人類的高度自主系統;其他實驗室、學者和公眾,對它又有完全不同的判斷標準。

与其爭論一個標籤,不如觀察三個更具體的問題。

第一,Astra 能夠獨立承擔的任務究竟能持續多久,而且可靠率是多少?

第二,當它進入企業生產環境後,人類需要花多少時間檢查和糾錯?如果一個 Agent 替你工作八小時,卻需要工程師再花三小時驗證,它的真實生產率提升就和演示影片完全是兩回事。

第三,也是最重要的:它能不能把自動化研究從「執行實驗」推進到「發現真正有價值的新知識」。

前兩個問題決定 Astra 是不是一門巨大的生意。

第三個問題,才決定它是不是一個時代的拐點。

從這個角度看,MB0門口那面被推過來的綠植牆頗有象徵意味。一邊是數十名客戶高層,正在首次觀看可能長期為他們工作的數位Agent;另一邊,是要求整個行業停止AI競賽的抗議者。雙方對未來的判斷截然不同,卻其實都承認了同一件事:這項技術正變得比過去更有力量。

Astra 尚未公開發布,其內部能力也遠未得到充分的外部驗證。它可能經歷延期,可能在真實環境中暴露出大量可靠性問題,也可能最終並未如 Altman 所描述的那樣接近 AGI。

這些可能性都應該保留。

但有一點已經越來越清楚。

上一階段的大模型競爭,是誰能更準確地回答世界已知的問題;而以 Astra 為代表的下一階段,則開始探問誰能持續行動、獨立完成複雜工作,並最終協助人類探索那些世界尚無答案的問題。

從聊天機器人到虛擬同事,中間隔著可靠性、安全、成本和組織信任四道高牆。

OpenAI 現在真正押注的,就是 Astra 能夠一道一道翻過去。

而如果它真的翻過去了,人們回頭看 2026 年,真正重要的或許不會是某個模型在排名上領先了多少分。

而是機器第一次開始獲得一種過去主要屬於人的能力:接到一件事,然後自己把它一直做下去。

參考來源

  1. Alex Heath,《Inside OpenAI’s Reboot》,TIME,2026年8月26日(Yahoo Tech 轉載)。(雅虎科技
  2. OpenAI,「應對下一波關鍵網路能力」,2026年8月7日。(OpenAI
  3. OpenAI,《在網路至關重要能力時代 pacing 模型發展》,2026年8月18日。(OpenAI
  4. Cat Zakrzewski、Ian Duncan、Riley Beggin,《Sam Altman 積極遊說華府,OpenAI 推出強大新 AI》,《The Washington Post》,2026年7月31日。(The Washington Post
  5. 斯坦福人本人工智能研究所,《2026 年 AI 指數報告 — 經濟》,2026 年。(斯坦福HAI
  6. METR,《Frontier AI Models 的任務完成時間範圍》,更新於2026年5月8日。(METR
  7. METR,「Time Horizon 1.1」,2026年1月29日。(METR
  8. 停止AI競賽,“佔領OpenAI/停止AI競賽”,2026年。(stoptherace.ai
免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露