一家相對較少受關注的人工智慧實驗室剛剛推出了一款模型,可在您可能實際擁有的硬體上同時處理 150 個任務。Apodex 1.1 於 2026 年 8 月 24 日發布,其核心理念看似簡單:人工智慧代理的真正瓶頸並非原始智慧,而是它們執行的環境。
該模型家族詳述於 arXiv 論文(2608.23283),將可執行環境定位為長期 AI 代理的主要擴展維度。
較小的模型,具競爭力的數字
Apodex 1.1 的基準測試分數與資源更豐富的實驗室模型不相上下,其在 APEX-Agents 上獲得 38.5 分,在 GDPVal 上獲得 78.8 分,這兩個基準測試旨在衡量在真實情境下的代理任務完成與通用推理能力。
在領域特定評估中,結果保持穩定。FrontierFinance 得分為 54.3,而 FrontierScience-Research 則達到 63.3。根據 Apodex 團隊的說法,這些數字使該模型與 Anthropic 和 OpenAI 的較大系統(特別是 Claude 和 GPT-5.x 系列)並駕齊驅或更勝一籌。
Apodex 1.1 Mini 版本基於 350 億個參數運行,僅為主要實驗室前沿模型參數量的一小部分。該團隊已釋出此版本的開放權重,意味著研究人員和企業可將其本地部署,無需將每個查詢都通過雲端 API 路由。
AgentOS 與協調問題
架構標題是團隊所稱的共享執行框架和 AgentOS。這些是基礎設施層級的組件,允許多個 AI 代理同時處理複雜任務的不同部分,同時保持對每個代理所做工作及其原因的連貫記錄。
系統支援最多 150 個子代理同時執行檢索與合成任務。內建來源追蹤功能,意味著每個代理的每一步操作都會被記錄並可追溯。
協調系統採用團隊所描述的非同步代理團隊。與其讓代理等待隊列,任務會被分解並分發至多個可獨立運作的代理叢集,並在事後協調其輸出結果。
開源工具與研究角度
除了模型本身外,Apodex 團隊還開源了 FrontierAgent,這是一個專為支援 ReAct 風格工作流程而建的運行時和研究工作台。ReAct 是 Reasoning and Acting 的縮寫,是一種 AI 模型在思考問題與在環境中採取具體行動之間交替進行的框架。
此次發布代表了團隊先前工作的顯著改進。前身模型 Apodex 1.0 Mini 明顯在處理重疊任務時遇到困難,這類任務需要多個流程共享上下文並避免干擾彼此的輸出。Apodex 1.1 專門針對此弱點進行優化。
