WAIC 2026で、シンガポールのAIインフラ企業Acrabは、エッジ側Agentic AIのための計算基盤を提供するため、Agent BoxとGΞLIX 1チップを発表しました。従来のAIチップとは異なり、GΞLIX 1はCPUとNPUの非同質協調、統一メモリアーキテクチャ、Prefill最適化を重視し、700 TOPSの計算能力と273GB/sのメモリ帯域幅を提供します。CEOのKen Phuaは、AIが非同質計算の時代に入り、CPUが再び中心に戻っていると述べ、Acrabの累計調達額は3億5千万ドルを超えています。エッジAIは「1つのモデルを実行する」から「長期的に1つの知的システムを実行する」へと移行しており、真の競争はチップ、ソフトウェアスタック、Agentエコシステムの完全な統合能力にあります。記事執筆者、出典:新智元
Agentic AIは、どのような計算基盤上で実行されるべきですか?
数日が経過し、WAIC 2026で最も注目を集めた概念の一つであるAgent Computerが、展示ブースでの新鮮さから、本格的なエンジニアリングの課題へと変わり始めた。
ローカルでデバイスに大規模モデルを実行することは、もはや最も難しい部分ではない。より難しいのは、エージェントがファイルを継続的に読み取り、メモリを保持し、ツールを呼び出し、バックグラウンドで長期間動作する際に、チップが電力消費、遅延、コストの制約の中で安定して動作できるかどうかである。
これはエッジチップの評価方法を変えるでしょう。TOPS、モデルパラメータ、1秒あたりのトークン数は依然として重要ですが、メモリ帯域幅が追いつかなかったり、CPUとNPUの協調がスムーズでなかったり、ソフトウェアスタックがタスク状態を維持できなかったりすると、再び見栄えのするピーク性能でも1回のデモ実行にしか満たない可能性があります。
今週、シンガポールの企業Acrabがオンライン発表会を開催し、Agent Boxをリリースしたことを確認しました。これは分析可能なサンプルを提供している可能性があります。
この発表会で、このAIインフラ企業は、プリフィル、統一メモリ、CPU-NPUハイブリッド協調、エージェントオーケストレーションを同時に紹介した。
これらのキーワードは同じ判断を示しています:エッジAIは「1つのモデルを実行する」から「長期的に1つの知的システムを運用する」へと移行しています。
チップが解決すべき課題は、もはや計算能力が十分かどうかではなく、データがどのように流れ、タスクがどのようにスケジューリングされ、ソフトウェアとハードウェアがどのように継続的に協調するかである。
したがって、WAICの活況や新製品の発表、業界のトレンドが徐々に落ち着いた後、真に問うべき問題がはっきりと浮かび上がってきた:エージェントが一度の呼び出しから継続的な作業へと変化したとき、エッジデバイスのチップはどこを再設計すべきなのか?


一度の推論から継続的な作業へ
エージェントがエッジ側の負荷を変更しました
チャットボットは通常、1回の質問と回答のサイクルを完了します。エージェントはタスクを受信した後、まず資料を検索し、ファイルを読み取り、次にコード、ブラウザ、カレンダー、またはオフィスソフトウェアを呼び出します。一部を完了した後、結果を確認し、タスクの状態を保持して、次のトリガーを待ちます。1つのタスクは多くのモデル呼び出しを含み、異なるモデル、ツール、アプリケーションの間で繰り返し切り替えます。
Acrabは発表会で、比較的完成度の高いタスクフローを提示しました:ユーザーが子供向けに宇宙テーマのギフトを作成したいと要望すると、システムはアイデアを提案し、方案の選択を支援し、関連ツールを呼び出して制作進捗を追跡します。環境に新たな状況が発生した場合、他のスマートデバイスと接続して対応できます。
このデモの意義は、ある1つの回答がどれほど賢いかではなく、自然言語が一連の連続的なアクションに変換できるかどうかにあります。計算システムにとって、エージェントはもはや「モデルを1回呼び出す」ことではなく、モデル、データ、ソフトウェア、デバイスの間で継続的に切り替えることになります。
この作業方式は、エンドとクラウド間の役割分担をまず拡大します。
単一の推論のコストはそれほど高くないが、呼び出しが頻繁かつ継続的になると、トークンは技術的指標から実際の請求書へと変わる。一度のネットワーク待機がチャットに与える影響は限られているが、複数ステップのタスクに組み込むとその遅延が段階的に蓄積する。エージェントがより完全な個人のコンテキストを把握するため、データがクラウドとの間で繰り返し往復すると、露出面も拡大する。
したがって、エッジとクラウドはどちらか一方を選ぶものではありません。より現実的な構成は、高頻度でプライバシーが敏感であり、迅速な応答と長期的な状態保持を必要とするタスクは可能な限りローカルに残し、デバイスの能力限界を超える複雑な推論のみをクラウドリソースに呼び出すことです。
真の変化は、エッジデバイスが単一のモデル推論を担うだけでなく、容易に中断できない一連のインテリジェントシステムを担うようになる点である。
大規模モデルを実行し、長文コンテキスト、複数タスク、ツール呼び出しを処理しなければならず、パフォーマンスは十分に強力でなければならず、消費電力とコストは制御不能になってはならない。ランタイム、ツールチェーン、エージェントエコシステムも同時に追いつかなければならない。
エッジ側の大規模モデルが解決するのは、モデルをデバイスに収められるかどうかであり、エージェント型AIが解決するのは、モデル、メモリ、ツール、アプリケーションがデバイス内で長期的に協調できるかどうかである。


NPUをただ積み上げるだけでは不十分です
CPU、メモリ、およびソフトウェアスタックを一緒に再構築する必要があります
かつて、CPUやSoCにNPUを追加するだけで、端末に音声認識や画像処理などのAI機能を追加できた。しかし、Agentが付加機能からデバイスの核心へと変わった今、単にピーク演算能力を増やすだけでは不十分である。
理由は、Agentが固定されたニューラルネットワーク推論パスではないためです。大規模並列計算はNPUに任せますが、タスクの分解、条件判断、システムスケジューリング、ツール呼び出し、エラー処理、複数システム間の協調はCPUに大きく依存します。タスクパスがより動的であればあるほど、CPUとNPU間の調整が重要になります。
AcrabのCEOであるKen Phuaは、この変化を次のように要約しました:「CPUが再びAI時代の中心に戻ってきました。」
彼の判断では、AIは非同質計算環境に進入しており、実行効果はNPUの性能だけでなく、CPUとNPUがシームレスに協調できるかにかかっている。
これはAcrabの少数の展開価値のあるチームの手がかりの一つです。
ケン・ファは、Arm UKでアジア太平洋アプリケーションエンジニアリングチームを率い、グローバルIP戦略の策定に参加した後、Arm Chinaの共同CEOを務めました。
この経験の意義は、単なる業界経歴にとどまらず、同社がCPUアーキテクチャ、非同質計算、そして実際のアプリケーション要件の交差点からエージェントワークロードを再定義した理由を説明している。
AcrabはGΞLIX 1を従来のAIプロセッサとして定義せず、エッジAI時代の計算プラットフォームとしています。
ハードウェア側はGΞLIX 1をコアとしており、ソフトウェア側は大規模モデル、最適化されたRuntime、完全なツールチェーン、およびモデル・ツール・デバイス・サービスを接続するAgentオーケストレーション層をカバーしています。さらに、同社は代表的なシナリオ向けのAgentリファレンスデザインを提供し、開発者やエコシステムパートナーがアプリケーションをより迅速に構築できるように支援しています。
Agent Boxは、このソフトウェアおよびハードウェアプラットフォームが初めて完全な製品形態で登場したものです。これはPersonal AI Centerとして定義され、ネットワークに接続されていなくても、千亿パラメータ級のモデルをローカルで実行し、コア機能を維持できます。
Acrabは、Agentic Compute、Reasoning、Action、Brainの頭文字に由来し、同時に天文学における多恒星系の名前でもあります。これは、異なる計算ユニットが恒星系のように協調して動作するという設計哲学を反映しています。
同社は、エージェントに思考と行動のための脳を提供し、次世代の計算プラットフォームを構築することを目標としています。
シンガポールに本拠を置くAcrabは、淡马锡傘下のグローバルベンチャーキャピタルプラットフォームVertex(祥峰投資)や、シンガポールの著名なテクノロジー投資機関K3 Venturesなどから、累計で3億5千万ドル以上を調達しています。
その第一世代の計算プラットフォームGΞLIXは、厳格な実稼働環境で検証を完了し、現在、業界への初導入および大規模生産へと進んでいます。
資金調達は大規模プロジェクトに時間を与えることができますが、ルートが成り立つかどうかを決定するのは、システムが提供できるかどうかです。
この観点から見ると、「CPUが再び中心に戻る」とは、NPUが重要でなくなったことを意味しません。
逆に、AI計算は複雑化し、単一のアクセラレーターだけではすべての問題を解決できなくなったことを意味します。


700 TOPS以外
Prefillとデータパスが実際の体験を決定する
多くの場合、大規模モデルの推論のボトルネックは計算ユニットが十分に速くないというだけでなく、データが計算ユニットに届かないことにあります。
メモリ帯域幅が追いつかない場合、たとえチップが非常に高いピーク演算能力を持っていても、NPUは待機しなければならない。
エージェントはデータ移動の問題をさらに拡大します。エージェントは履歴を頻繁に読み取り、異なるモデルやソフトウェア間でデータを伝送し、タスクの状態を継続的に保存する必要があります。毎回のコピーが遅延と電力消費を増加させ、タスクが長く実行されるほど、システム設計の重要性が高まります。
GΞLIX 1の設計の焦点は、モデルに必要なデータを計算ユニットにできるだけ近い位置に保ち、CPU、NPU、メモリ、および異なるオペレーティングシステム間のデータ移動を減らすことです。
Acrabが公開したアーキテクチャによると、GΞLIX 1は700 TOPSを超えるAI演算能力と273GB/sのユニファイドメモリ帯域幅を提供し、チップ内部には8MBのL1キャッシュ、帯域幅768GB/sの共有L2キャッシュ、4つの並列NPUコア、およびAttention計算用に設計された専用アクセラレーションモジュールが搭載されています。
Acrabは、後者が関連する計算効率を3倍に向上させることができると述べています。

より大きなオンチップキャッシュにより、重要なデータを計算ユニットに近づけることができます。共有L2キャッシュは、パラメータと中間特徴を計算ユニット間で効率的に共有します。統一メモリアーキテクチャは、モデル、オペレーティングシステム、アプリケーション間の不要なデータコピーを削減します。
Acrabはマルチシステム統一メモリアーキテクチャを採用し、異なるオペレーティングシステム間でメモリをより効率的に共有します。1つのモデルのみを実行するデバイスにとっては、これは単なる効率の最適化に過ぎませんが、継続的にアプリケーションやツール間をまたがって作業するエージェントにとっては、タスクの円滑な進行に直接影響します。
これにより、AcrabがPrefillを発表の中心に置いた理由も説明できる。Agentは新しいファイルを導入したり、タスクの状態を復元したり、コンテキストを更新したりする際に、追加された情報を再処理する必要がよくある。タスクチェーンが長くなるほど、Prefillの効率が全体の体験に与える影響はより顕著になる。
Acrabが公開した自己テスト結果によると、GΞLIX 1は260億パラメータのGemmaモデルを40K KVキャッシュと1万トークンの入力で実行し、Prefill速度は毎秒1416トークン以上を達成しました。同じ負荷条件下で、その性能は主要な汎用デスクトッププラットフォームの7倍以上です。
AcrabはGΞLIX 1を、同種のデスクトップ向けAI計算プラットフォームと同一のテストフレームワークで比較しました。
データによると、GΞLIX 1はPrefillとDecodeの2つのコア指標において類似のパフォーマンス範囲に達し、同時に消費電力が低く、全体的なコスト競争力が高いです。
AcrabがPrefillとデータパスに重点を置いていること自体、エッジ側Agentチップはモデルの出力速度だけでなく、モデルが長文のコンテキストを迅速に読み取り、タスクの状態を復元して作業を開始できるかどうかを解決することも必要であるという製品の方向性を示している。
ユーザーは、推論のパス内でどれだけ多くのキャッシュ層を経たかには関心を持たず、毎回のインタラクション前にTOPSを確認することもありません。ユーザーが実際に感じるのは、3つのことだけです:迅速に理解できるか、継続的に動作するか、それを所有することが十分に価値があるか。

チップからプラットフォームへ
真の競争はパラメーターの外にある
今年のWAICで登場したAgent Computer、個人用AIセンター、および企業向けエッジデバイスは、まだ統一された製品形態を形成していない。
家庭シーンでは個人の記憶、コンテンツ、デバイスの連携が重視され、企業シーンでは知識ベース、ファイル処理、内部データセキュリティが重要視されます。異なる顧客はモデルのサイズ、メモリ容量、消費電力、インターフェースに対して異なる要件を持っています。
端末がますます細分化されるほど、計算プラットフォームの構築は難しくなる。1つのチップだけではパラメータですべてのシナリオをカバーすることはできず、Runtime、モデルアダプテーション、開発ツール、Agentフレームワークを提供して、顧客が基盤となる計算能力を製品として提供できるように支援する必要がある。
これは、アジェンティックAIチップが通常の推論チップよりも追加で解決すべき課題です。チップの性能はモデルが動作するかどうかを決定し、ソフトウェアスタックは開発者がそれを実際に使用できるかどうかを決定し、エージェントエコシステムはデバイスが最終的にどのようなタスクを実行できるかを決定します。どの層が欠けても、パラメータが優れたチップはデモ段階にとどまってしまう可能性があります。
Acrabはこれらのプロセスをすべて同時に掌握しようとしている。利点は製品定義がより完全になることだが、リスクも明確だ:戦線が長すぎる。
チップは性能、安定性、およびスケーラブルな納品能力を証明しなければならず、ソフトウェアスタックはモデルの急速なイテレーションに対応しなければならず、エージェントオーケストレーション層は変化し続けるツールやアプリケーションと互換性を保たなければならない。個人ファイルと長期記憶をローカルに残した後も、権限隔離、プラグインのセキュリティ、および操作監査を同時に解決しなければならない。
したがって、AcrabがAgentic AI時代の計算プラットフォームとなるかどうかは、発表会でどれだけのTokenが実行されたか、あるいはAgent Boxがどれだけ多くのタスクをデモできるかには左右されない。
より重要な検証は、開発者がこのプラットフォーム上で製品を迅速に作成できるかどうか、エージェントが数時間連続で動作した際に、パフォーマンス、電力消費、安定性が同時に実現できるかどうか、そしてモデルとエージェントフレームワークが継続して変化する中で、下層のソフトウェアとハードウェアがその変化に対応できるかどうかである。
アーキテクチャの革新が半導体企業の能力の上限を決定し、エンジニアリングとエコシステムがその上限を注文に変えることができるかどうかを決定する。

WAICで密集して登場した新しいエージェントは、業界が「大規模モデルを動かす」段階から「エージェントを継続的に動作させる」段階へ移行していることを示している。前段階では計算能力、メモリ、モデルの規模が競われたが、次段階では長距離コンテキスト、個人の記憶、ツールの呼び出し、複数タスクの協調が解決課題となる。
アクラブはまさにこの変化に賭けている。
Agent Boxは終点ではなく、プラットフォーム機能の公開テストです。
エッジチップは「再設計」が必要です。TOPSが重要でないからではなく、エージェントが計算をピーク数値から継続的なシステム能力へと移行しているからです。その実現可能性は、このチップ、ソフトウェア、エンドデバイスが実際のワークフローに組み込まれるかどうかにかかっています。
