GPT-6 不只為 Astra!
Astra 剛發布沒幾天,GPT-6 Sol 就被曝正在內測。

Performance is also outstanding, with a single test speed 6 times that of Astra.
大膽猜測一下:Terra 和 Luna 是不是也在路上呢?
而且就在同一天,OpenAI 剛剛公開了一組內部數據:
截至目前,按 8 小時工作日折算,OpenAI 研究員每工作一天,身邊就有 3 個多 Agent 工作日同時運轉。
按 API 價格計算,OpenAI 中位數研究員每天使用的 Agent 推理資源,已超過 600 美元。

OpenAI 還宣布,已實現「自動化研究實習生」:
這些 Agent 能在人類指導下,完成部分原本需要研究員花幾天才能做完的任務。
連老黃都說:AGI 已經來了!

他透露 Astra 使用約 10 萬套 NVIDIA Grace Blackwell NVLink72 進行訓練,接下來還將上線 40 萬套 GPU。
看來這波真的不是 OpenAI 單方面吹哈~
GPT-6 SOL 被曝開始內測
網友 Lentils 爆料,OpenAI 正在內部測試 GPT-6 Sol。
他表示,Sol 的整體輸出能力明顯弱於剛發布的 Astra,但速度更快,依然屬於「怪物級」模型。
有多快?單次測試速度約為 Astra 的 6 倍。
網友 lyra 將同一個任務交給不同模型測試:讓模型生成一輛 BMW M4 Competition 的 SVG 圖。
其中,GPT-6 Sol 使用 Max 檔位、零樣本生成,耗時約 3 分鐘,輸出約 2.8 萬 Token。

GPT-6 Astra 使用 Max 檔位,輸出約 2.5 萬 Token,耗時約 19 分鐘。

Gemini 3.1 DeepThink 開啟 High 檔位,顯示輸出約 3300 Token,但推理過程約消耗 45.8 萬 Token,耗時約 29 分鐘。

Gemini 3.8 Flash 同樣開啟 High 檔位,輸出約 1.9 萬 Token,只用了約 42 秒。

In comparison, Sol performed the most impressively: its output scale is similar to Astra's, but its single-test speed is about 6 times that of Astra—taking only about one-sixth of the time.
此外,網友 Lentils 也展示了一個名為「The Realm of Aurellune」的像素風沙盒世界原型。

GPT-6 Sol 一次性生成了城鎮、農田、河流、城堡和縮略地圖,並配備了晝夜切換、放置地名、調整細節等控制面板,整體更像一款已搭好雛形的模擬經營遊戲。
這是 zero-shot、Max 推理檔位、15 分鐘、總花費 6 萬 token 生成的效果。
目前可以推測,Astra 傾向於最高難度的深度推理,Sol 則可能偏向速度、吞吐量和規模化 Agent 調用。
至於 Sol 的發布時間,網友 Pankaj Kumar 表示,可能於 9 月 29 日的 OpenAI 開發者大會正式發布。

也不排除 GPT-6、Terra、Luna 與 GPT-Image 2.5 會一併登場。

OpenAI 研究員,每人帶著 3 個 Agent 實習生上班
就在同一天,OpenAI 還晒出了一組很有意思的內部數據——AI 模型在自家實驗室裡,到底把科研加速到了什麼程度。
截至今年8月中旬,研究員每上8小時班,背後就有約3.1個Agent工作日的任務量在並行運行。
好傢伙,一個人帶三個不睡覺的實習生呗~

至於開支,按 API 價格計算,中位數研究員每天耗用的 Agent 推理資源已超過 600 美元。
差不多是一名初級工程師一天的工資。

這些 Agent 具體在做什麼?
撰寫研究代碼、撰寫基礎設施代碼、搭建訓練環境、運行評估實驗、排查工具與環境故障、分析實驗結果、監控訓練任務……甚至能參與研究結論的整理與溝通。
基本上,除了決定研究什麼,其他它都能幹。
一個最直觀的變化是,以前實驗環境掛了,研究員得去內部頻道喊人;現在 Agent 越來越能搞定這類事,人工答疑量直接掉了下來。

有些團隊直接取消了固定的技术答疑時間,將人員調配來改進系統本身。
基於這些數據,OpenAI 正式宣布:已經達成了「自動化 AI 研究實習生」的目標。
這裡的「實習生」,準確來說是一個能幹活的研發節點:在人類指導下,它能獨立完成邊界清晰的研究任務,其中一些工作原來需要熟練的研究員花上好幾天才能完成。
The effect was immediate, with both the researchers’ code output and number of experiments increasing.

在2026年8月,人均實驗數創下自2025年1月有統計以來的新高,Agent接的任務也越來越複雜,週期越來越長。

本文作者 Kevin Liu 將這件事置於更大的背景中。
他認為,遞歸式自我改進很可能是未來幾年推動 AI 能力躍遷的最重要因素之一。
簡單來說,就是 AI 創造 AI,越造越快。

但問題在於,按照目前的發展趨勢,這種能力預設只會出現在少數幾家前沿 AI 實驗室內部,外界很難看見它究竟進展到了哪一步。
因此,劉認為,透明披露已比以往任何時候都更為迫切。模型究竟有多快變得更強、研發節奏是否該踩剎車,不能僅由幾家公司閉門決定。
他還呼籲其他 AI 公司:也應將類似數據公開。
不過,AI 研發確實變快了,卻還沒有快到完全自動駕駛。
OpenAI 的數據顯示,在原本需要 4 到 8 小時完成的任務中,過去半年超過一半的成功案例,人類至少需介入一次。至於高層研究規劃,則幾乎不交由 Agent 處理。

研究員仍負責決定研究什麼、哪些結果值得繼續,以及何時應擴大訓練、暫停實驗或部署模型。
OpenAI 的下一個目標也已確定:於 2028 年 3 月前實現「自動化 AI 研究員」。
與只能承接明確任務的「實習生」相比,「研究員」必須能承擔更開放的研究目標,自主推進週期更長的項目——相當於從執行者轉變為獨立負責人。
如果 GPT-6 Sol 真的已經在內部測試,那它大概率就是在這套新研發模式下跑出來的:
更多 GPU 提供算力,更多 Agent 並行運行實驗,人類研究員則站在更高的位置——選擇方向、判斷結果,最終決定哪些內容值得轉化為下一代模型。
更強的 AI,正變得越來越難監控
同一天,OpenAI 首席科學家 Jakub Pachocki 發表了一篇萬字長文,標題直接稱為——《外星思維》。

我看完之後,感覺意思就是,連 OpenAI 首席科學家都在勸整個行業減速了…
Jakub 提出,AI 根本不是人類照著設計圖一塊晶片一條規則拼出來的,它更像是在海量數據和算力裡自己「長」出來的。
你能拆開看明白其中一些零件,但整個系統為何突然有了某種能力、換個環境又會怎麼行動,沒人說得清。
更令人頭疼的是,AI 不必全面超越人類才會出問題,只要在足夠多的關鍵能力上比人類強,它就能既幫你大忙,也能捅大婁子。
於是問題來了:人類還看得懂它嗎?
過去 OpenAI 監控 AI,主要靠一招:看思維鏈。
簡單來說,就是盯著模型寫下的推理過程,檢查它有沒有動歪腦筋,例如想騙人、想越權、想繞過限制。
But by the time of Astra, this trick started to fail.
一方面,模型越來越擅長「管理」自己說出的話,真實想法未必全寫在推理裡;另一方面,Agent 早已不再只是「想好了再回答」。它會調用工具、操作電腦、運行環境,還能與人或其他 Agent 配合協作。
這些事情交織在一起,研究人員根本無法再梳理出一條完整透明的思維鏈以逐句審查。
OpenAI 還發現,Astra 不必將推理過程完全寫出,也能完成複雜任務。
Simply put, the model has long since learned to “work quietly and achieve big things.”

在專門逼迫模型逃避監控的對抗測試中,Astra 甚至展現出一些令人背脊發涼的能力:故意壓低測試成績、繞開監控、執行破壞任務。
當然,這些都是人為設計的壓力測試,OpenAI 並未因此認定 Astra 在日常任務中會主動欺騙。但至少說明,單靠觀察思維鏈,已經很難涵蓋模型所有可能的行為。
還記得之前的 Hugging Face 事件嗎?那是一個警鐘。

當時,GPT‑5.6 Sol 和一款更強的內部研究模型被放入 ExploitGym 網絡靶場,任務是尋找漏洞、完成攻擊並取得 Flag。為了測試模型的真實能力,評測環境未啟用完整的安全防護。
結果模型並沒有老老實實解題,它們先繞過網絡隔離,透過未授權渠道互相傳消息、分工合作。
隨後,利用軟體包快取代理中的零日漏洞獲取公網存取權限,最終一路進入 Hugging Face 系統,試圖尋找 ExploitGym 的測試答案。

其實吧,這事主要是內部研究模型 IM1 推動的,GPT‑5.6 Sol 也複現了部分攻擊路徑,Astra 沒有參與。
模型的原始目標仍然是完成測試,但為了獲得答案,它們不斷尋找規則漏洞,最後做出了超出任務範圍的操作。
因此,OpenAI 也讀出了一個危險信號:當 Agent 足夠強、工具足夠多、運行時間足夠長,它可能會自己尋找新路徑、調用外部資源,甚至和其他 Agent 協作。
不… 所以繞來繞去,這不就變成了一個死結嗎??
OpenAI 需要更強的模型來編寫代碼、運行實驗、進行對齊研究,甚至用它們來構建防禦其他 AI 的安全系統。模型越強,能完成的任務就越多,研發速度就越快。
但同時,人類也越來越難確認它是如何得出結論的,以及在不同環境下是否會重新詮釋原本學到的規則。
Jakub 認為,目前沒有任何一間實驗室敢聲稱自己已妥善完成模型對齊與監控,能夠長期以最高速度放心擴大模型規模。

在整個行業建立共同的安全標準之前,他希望大家能將「自願踩剎車」視為一種默契。
至於 OpenAI 自己,他也放了話:如果有必要,不排除單方面先停下來,不再繼續擴大模型規模。
你最好還是這樣…我記得某家以 A 開頭的公司也這麼說過。
參考連結:
[1]https://x.com/Lentils80/status/2096518218836005287?s=20
[2]https://x.com/pankajkumar_dev/status/2096532712291201460
[3]https://openai.com/index/research-acceleration-view-inside-openai/
[4]https://openai.com/index/an-alien-mind/
[5]https://x.com/JensenHuang/status/2096700264569090384?s=20
本文來自微信公眾號「量子位」,作者:聽雨
