新加坡的 Acrab 推出 Agent Box 和 GΞLIX 1 芯片,推動終端用戶代理式 AI

iconMetaEra
分享
AI summary icon精華摘要
新加坡的 Acrab 於 WAIC 2026 發布了 Agent Box 與 GΞLIX 1 芯片,專注於終端用戶代理式 AI。GΞLIX 1 芯片具備 CPU-NPU 協同運算、統一記憶體與 700 TOPS 計算能力。首席執行官 Phua Ken 表示,CPU 正重新回歸 AI 的核心角色。Acrab 已籌集超過 $350 億美元。此項 AI + 加密貨幣新聞凸顯了 AI 基礎設施於鏈上新聞的潛力。
在 WAIC 2026 上,新加坡 AI Infra 公司 Acrab 發布 Agent Box 和 GΞLIX 1 芯片,旨在為端側 Agentic AI 提供計算底座。與傳統 AI 芯片不同,GΞLIX 1 強調 CPU 與 NPU 異構協同、統一記憶體架構和 Prefill 優化,提供 700 TOPS 算力和 273 GB/s 記憶體頻寬。CEO Ken Phua 認為 AI 已進入異構計算時代,CPU 重新回到中心位置,Acrab 累計融資超過 3.5 億美元。端側 AI 正從「運行一個模型」轉向「長期運行一套智能系統」,真正的競爭在於晶片、軟體棧和 Agent 生態的完整整合能力。

文章作者、來源:新智元

Agentic AI 應該運行在什麼樣的計算底座上?

幾天過後,WAIC 2026 上最熱門的概念之一——Agent Computer——開始從展台上的新鮮感,轉變為一道真正的工程難題。

讓一台設備在本地運行大模型,已不算最困難的部分。更困難的是,當 Agent 需要持續讀取檔案、保留記憶、調用工具,並在後台長期運行時,晶片能否在功耗、延遲和成本的限制下保持穩定。

這將改變對端側晶片的評估方式。TOPS、模型參數和每秒 Token 仍然重要,但如果記憶體頻寬跟不上、CPU 與 NPU 協同不順、軟體堆疊無法維持任務狀態,再漂亮的峰值也僅夠完成一次 Demo。

我們注意到,本週,新加坡公司 Acrab 舉行了一場線上發布會,並發布了 Agent Box,這或許提供了一個可供拆解的樣本。

在這場發布會中,這家 AI Infra 公司同時展示了 Prefill、統一記憶體、CPU-NPU 異構協同和 Agent 排程。

這些關鍵詞指向同一個判斷:端側 AI 正在從「運行一個模型」,走向「長期運行一套智能系統」。

芯片要解決的,也不再只是算力夠不夠,而是數據如何流動、任務如何調度、軟硬件如何持續協同。

因此,當 WAIC 的熱鬧、新品發布和行業趨勢逐漸沉澱下來,真正值得追問的問題反而更清晰了:當 Agent 從一次調用轉變為持續運作後,端側晶片究竟需要重新做什麼?

從一次推理到持續工作

Agent 改變了端側負載

聊天機器人通常完成一輪問答。Agent 接到一個任務後,可能先搜尋資料、讀取檔案,再調用代碼、瀏覽器、日曆或辦公軟體;完成一部分後檢查結果,保留任務狀態,等待下一次觸發。一次任務往往涉及多輪模型調用,也會在不同模型、工具和應用之間反覆切換。

Acrab 在發布會中展示了一個相對完整的任務流程:用戶提出想為孩子製作一份太空主題禮物,系統隨即提供創意、協助選擇方案、調用相關工具並追蹤製作進度;當環境中出現新狀況時,它又能連接其他智能設備進行處理。

這段演示的意義不在於某一次回答有多聰明,而在於一句自然語言能否被轉化為一連串連續動作。對於計算系統來說,Agent 不再只是「調用一次模型」,而是在模型、數據、軟件和設備之間持續切換。

這種工作方式首先放大了端與雲之間的分工。

單次推理的費用可能不高,但當呼叫變得頻繁且持續時,Token 就會從技術指標變成真實賬單;一次網路等待對聊天的影響有限,但放入多步任務中卻會層層累積;Agent 要掌握更完整的個人上下文,數據反覆往返雲端,也會擴大暴露面。

因此,端側與雲端並非非此即彼。更現實的架構是:高頻、隱私敏感、需要快速響應和長期保持狀態的任務盡可能留在本地;超出設備能力邊界的複雜推理,再調用雲端資源。

The real change is that edge devices are no longer merely handling a single model inference, but must support an intelligent system that cannot be easily interrupted.

它既要運行大模型,也要處理長上下文、多任務和工具調用;性能必須足夠強,功耗和成本又不能失控,Runtime、工具鏈和 Agent 生態也必須同時跟上。

端側大模型解決的是模型能否裝入設備,而具身 AI 要解決的,則是模型、記憶、工具與應用能否在設備中長期協同。

僅堆疊 NPU 不足

CPU、記憶體和軟體堆疊必須一起重做

過去在 CPU 或 SoC 中增加一塊 NPU,就能讓終端具備語音識別、圖像處理等 AI 能力。但當 Agent 從附加功能變成設備的核心,單純增加峰值算力已不夠。

原因在於,Agent 並非一條固定的神經網路推理鏈路。大規模並行計算適合交給 NPU,而任務拆解、條件判斷、系統調度、工具調用、異常處理和多系統協作,則高度依賴 CPU。任務路徑越動態,CPU 與 NPU 之間的協調就越重要。

Acrab 執行長 Ken Phua 將這種變化概括為:「CPU 再次回到 AI 時代的中心。」

在他看來,AI 正進入異構計算環境,執行效果不僅取決於 NPU 性能,更取決於 CPU 與 NPU 能否無縫協同。

這也是 Acrab 少數值得展開的團隊線索。

Ken Phua 曾帶領 Arm UK 的亞太應用工程團隊,並參與全球 IP 策略制定,之後擔任 Arm China 聯席 CEO。

這段經歷的意義不僅僅是行業履歷,更解釋了這家公司為何會從 CPU 架構、異構計算與真實應用需求的交叉點,重新定義 Agent 工作負載。

Acrab 沒有將 GΞLIX 1 定義為一顆傳統 AI 處理器,而是將它作為端側 AI 時代的計算平台。

硬件端以 GΞLIX 1 為核心;軟體端涵蓋大模型、優化後的 Runtime、完整工具鏈,以及連接模型、工具、設備與服務的 Agent 排程層;在此基礎上,公司還提供面向典型場景的 Agent 參考設計,協助開發者與生態夥伴更快構建應用。

Agent Box 是這套軟硬體平台首次以完整產品形態亮相。它被定義為 Personal AI Center,可在本地運行千億參數級模型,即使沒有網路連接,也能保持核心功能。

Acrab 取自 Agentic Compute、Reasoning、Action 與 Brain 的首字母,也恰好是天文學中一個多恆星系統的名字——正如其設計哲學:讓不同的計算單元,像恆星系統一樣協同運轉。

The company aims to equip Agents with a brain capable of thinking and acting, building the next-generation computing platform.

總部位於新加坡的 Acrab,已累計融資超過 3.5 億美元,投資方包括淡馬錫旗下全球風投平台 Vertex(祥峰投資)、新加坡知名科技投資機構 K3 Ventures 等。

其第一代計算平台 GΞLIX 已在要求嚴苛的真實部署環境中完成驗證,目前正走向首次行業導入和規模化生產。

融資可以為重工程購買時間,但真正決定路線能否成立的,仍然是系統能否交付。

From this perspective, "CPU is returning to the center" does not mean that NPU is no longer important.

恰恰相反,這意味著 AI 計算已經複雜到無法再依賴單一的加速器解決所有問題。

超過 700 TOPS

Prefill 和數據通路決定真實體驗

在很多情況下,大模型推理的瓶頸並不只是計算單元不夠快,而是數據來不及送到計算單元。

即使晶片擁有很高的峰值算力,如果記憶體頻寬跟不上,NPU 仍需停下來等待。

代理會進一步放大數據搬運問題。它需要頻繁讀取歷史記錄,在不同模型和軟件之間傳遞數據,並持續保存任務狀態。每一次複製都會增加延遲和功耗,任務運行得越久,系統設計的重要性就越高。

GΞLIX 1 的設計重點,正是將模型所需的數據盡量保留在距離計算單元更近的位置,並減少 CPU、NPU、記憶體與不同作業系統之間的來回搬運。

根據 Acrab 公開的架構,GΞLIX 1 提供超過 700 TOPS 的 AI 算力和 273 GB/s 的統一記憶體頻寬,晶片內部配置 8 MB L1 Cache、頻寬達 768 GB/s 的共享 L2 Cache、四顆並行 NPU 核心,以及專為 Attention 計算設計的專用加速模組。

Acrab 表示,後者可將相關計算效率提升至三倍。

更大的片上緩存,可讓關鍵數據更接近計算單元;共享 L2 Cache 讓參數和中間特徵在計算單元之間高效共享;統一記憶體架構則減少模型、作業系統和應用程式之間不必要的資料複製。

Acrab 亦採用多系統統一記憶體架構,讓不同作業系統更高效地共享記憶體。對於僅運行單一模型的裝置,這可能僅是效率優化;對於需要不斷跨應用、跨工具工作的 Agent,這將直接影響任務能否順利推進。

這也解釋了為何 Acrab 將 Prefill 放在發佈會的中心位置。Agent 在引入新文件、恢復任務狀態或更新上下文時,往往需要重新處理新增資訊。任務鏈越長,Prefill 效率對整體體驗的影響就越明顯。

在 Acrab 公布的一組自測中,GΞLIX 1 在運行 260 億參數的 Gemma 模型時,使用 40K KV Cache 和 1 萬 Token 輸入,Prefill 速度超過每秒 1416 個 Token;在相同負載下,其表現是某主流通用桌面平台的 7 倍以上。

Acrab 還將 GΞLIX 1 與一款同類桌面級 AI 計算平台放在同一測試框架下比較。

數據顯示,GΞLIX 1 在 Prefill 和 Decode 兩項核心指標上進入相近的性能區間,同時呈現出更低的功耗和更具競爭力的整機成本。

Acrab 選擇強調 Prefill 和資料通路,本身說明了一種產品取向:端側 Agent 芯片不能只追求模型輸出有多快,還要解決模型能否快速讀懂長上下文、恢復任務狀態並開始工作。

用戶不會關注一條推理鏈路內部經過了多少層緩存,也不會在每次交互前查看 TOPS。用戶真正感受到的只有三件事:它能否迅速理解、能否持續運行,以及擁有它是否足夠划算。

從晶片到平台

真正的競爭在參數之外

今年 WAIC 出現的 Agent Computer、個人 AI 中心和企業端側設備,還未形成統一的產品形態。

家庭場景更強調個人記憶、內容和設備協同,企業場景更看重知識庫、文件處理和內部數據安全。不同客戶對模型大小、內存容量、功耗和接口的要求差別很大。

終端越碎片化,計算平台就越難做。一顆晶片很難僅靠參數覆蓋所有場景,還需要提供 Runtime、模型適配、開發工具和 Agent 框架,幫助客戶將底層算力轉化為可交付的產品。

這也是 Agentic AI 芯片比普通推理芯片多出的一道題:芯片性能決定模型能不能運行,軟體棧決定開發者能不能把它用起來,Agent 生態則決定設備最終能夠完成什麼任務。任何一層缺失,都可能讓一顆參數漂亮的芯片停留在 Demo 階段。

Acrab 試圖同時掌握這些環節。好處是產品定義更為完整,風險也很直接:戰線過長。

晶片需證明性能、穩定性和規模化交付能力,軟體堆疊需跟上模型的快速迭代,Agent 排程層亦需相容不斷變化的工具與應用。個人檔案與長期記憶留在本地後,權限隔離、外掛安全性與操作審計也必須同步解決。

因此,Acrab 能否成為 Agentic AI 時代的計算平台,最終不取決於發布會上跑出了多少 Token,也不取決於 Agent Box 能夠演示多少個任務。

更重要的驗證是:開發者能否在這套平台上快速推出產品;Agent 連續運行數小時後,性能、功耗和穩定性能否同時成立;當模型和 Agent 框架持續變化時,底層軟硬件能否跟上。

架構創新決定一家晶片公司的能力上限,工程化與生態則決定這個上限能不能變成訂單。

WAIC 上密集出現的新終端,說明行業正從「把大模型跑起來」走向「讓 Agent 持續工作」。前一階段比算力、記憶體和模型大小;下一階段還要解決長上下文、個人記憶、工具調用與多任務協同。

Acrab 正是押注於這一變化。

Agent Box 不是終點,而是一次平台能力的公開測試。

邊端晶片需要「重做」,並非因為 TOPS 不重要,而是 Agent 正將計算從峰值數字轉變為長期運行的系統能力。它能否成立,最終取決於這套晶片、軟體和終端能否進入真實工作流程。

免責聲明:本頁面資訊可能來自第三方,不一定反映KuCoin的觀點或意見。本內容僅供一般參考之用,不構成任何形式的陳述或保證,也不應被解釋為財務或投資建議。 KuCoin 對任何錯誤或遺漏,或因使用該資訊而導致的任何結果不承擔任何責任。 虛擬資產投資可能存在風險。請您根據自身的財務狀況仔細評估產品的風險以及您的風險承受能力。如需了解更多信息,請參閱我們的使用條款風險披露