На WAIC 2026 сингапурская компания по инфраструктуре ИИ Acrab представила Agent Box и чип GΞLIX 1, направленные на создание вычислительной базы для агентного ИИ на краю. В отличие от традиционных ИИ-чипов, GΞLIX 1 акцентирует внимание на гетерогенном взаимодействии CPU и NPU, единой архитектуре памяти и оптимизации Prefill, обеспечивая производительность 700 TOPS и пропускную способность памяти 273 ГБ/с. Генеральный директор Кен Фуа считает, что ИИ вошел в эпоху гетерогенных вычислений, и CPU вновь вернулся в центр, при этом Acrab привлекла более 350 миллионов долларов США. Агентный ИИ на краю переходит от «запуска одной модели» к «долгосрочной работе целой интеллектуальной системы» — настоящая конкуренция заключается в способности полностью интегрировать чипы, программный стек и экосистему агентов.Автор статьи, источник: Новомир
На какой вычислительной базе должна работать агентная ИИ?
Спустя несколько дней один из самых популярных концептов на WAIC 2026 — Agent Computer — начал превращаться из новинки на стенде в настоящую инженерную задачу.
Запуск большой модели на локальном устройстве уже не является самой сложной задачей. Более сложной является способность чипа обеспечивать стабильную работу при постоянном чтении файлов, сохранении памяти, вызове инструментов и длительной работе в фоновом режиме при ограничениях по энергопотреблению, задержке и стоимости.
Это изменит подход к оценке чипов на стороне устройства. TOPS, параметры модели и токенов в секунду по-прежнему важны, но если пропускная способность памяти не успевает, CPU и NPU работают несогласованно, а программный стек не может поддерживать состояние задач, даже самый впечатляющий пиковый показатель может хватить лишь для одного демо.
Мы заметили, что на этой неделе сингапурская компания Acrab провела онлайн-презентацию и выпустила Agent Box, что, возможно, предоставляет образец для анализа.
На этой презентации компания по инфраструктуре ИИ одновременно представила Prefill, унифицированную память, гетерогенную координацию CPU-NPU и оркестрацию агентов.
Эти ключевые слова указывают на один и тот же вывод: крайний ИИ переходит от «запуска одной модели» к «долгосрочной работе целой интеллектуальной системы».
Проблемы, которые должны решать чипы, больше не ограничиваются достаточностью вычислительной мощности, а касаются того, как данные перемещаются, как задачи распределяются и как программное и аппаратное обеспечение постоянно взаимодействуют.
Таким образом, когда шумиха вокруг WAIC, новые продукты и отраслевые тренды постепенно улягутся, станет яснее настоящий вопрос, который стоит задать: что именно нужно пересмотреть в чипах на стороне устройства, когда агенты перейдут от однократного вызова к непрерывной работе?


От одного рассуждения к постоянной работе
Агент изменил нагрузку на стороне устройства
Чат-боты обычно завершают один цикл вопрос-ответ. После получения задачи агент может сначала выполнить поиск информации, прочитать файлы, а затем вызвать код, браузер, календарь или офисные приложения; после выполнения части задачи он проверяет результат, сохраняет состояние задачи и ожидает следующего триггера. Одна задача часто включает несколько вызовов модели и повторные переключения между различными моделями, инструментами и приложениями.
Acrab на презентации продемонстрировал относительно полный рабочий процесс: пользователь заявляет о желании сделать космическую тематику в качестве подарка для ребенка, система предлагает идеи, помогает выбрать вариант, запускает соответствующие инструменты и отслеживает прогресс изготовления; когда возникает новая ситуация, она может подключиться к другим умным устройствам для обработки.
Значение этого демонстрационного примера заключается не в том, насколько умным является один ответ, а в том, может ли естественный язык быть преобразован в последовательность действий. Для вычислительных систем агент больше не является просто «однократным вызовом модели», а постоянно переключается между моделью, данными, программным обеспечением и устройствами.
Этот подход сначала усиливает разделение обязанностей между концом и облаком.
Стоимость одного запроса может быть низкой, но при частом и постоянном вызове токены превращаются из технических показателей в реальные счета; однократная задержка сети слабо влияет на чат, но при включении в многошаговые задачи она накапливается на каждом этапе; агенту необходимо владеть более полным контекстом личных данных, а многократная передача данных в облако увеличивает поверхность уязвимости.
Таким образом, крайние и облачные вычисления не являются взаимоисключающими. Более реалистичная структура заключается в том, чтобы как можно больше задач с высокой частотой, чувствительных к конфиденциальности, требующих быстрого отклика и длительного сохранения состояния, оставлять на локальном устройстве; сложные рассуждения, выходящие за пределы возможностей устройства, выполняются с использованием облачных ресурсов.
Суть изменений заключается в том, что на стороне устройства больше не выполняется только однократное моделирование вывода, а поддерживается целая система искусственного интеллекта, которую нельзя легко прервать.
Он должен запускать крупные модели, обрабатывать длинные контексты, множественные задачи и вызовы инструментов; производительность должна быть достаточной, при этом энергопотребление и стоимость не должны выйти из-под контроля; также должны одновременно развиваться Runtime, инструментарий и экосистема агентов.
Локальные крупные модели решают, можно ли разместить модель на устройстве, а агентный ИИ решает, могут ли модель, память, инструменты и приложения долго взаимодействовать друг с другом на устройстве.


Недостаточно просто накапливать NPU
ЦП, память и программный стек должны быть полностью переработаны вместе
Раньше добавление NPU в CPU или SoC позволяло терминалам получать такие AI-возможности, как распознавание речи и обработка изображений. Но когда агенты превратились из дополнительной функции в ядро устройства, простое увеличение пиковой вычислительной мощности уже недостаточно.
Причина в том, что агент не является фиксированной нейронной сетевой цепочкой вывода. Масштабные параллельные вычисления лучше передавать NPU, тогда как разбиение задач, условные проверки, системное планирование, вызов инструментов, обработка исключений и взаимодействие нескольких систем сильно зависят от CPU. Чем динамичнее путь задачи, тем важнее координация между CPU и NPU.
Генеральный директор Acrab Кен Фуа охарактеризовал это изменение как: «ЦП снова в центре внимания эпохи ИИ».
По его мнению, ИИ входит в гетерогенную вычислительную среду, и эффективность выполнения зависит не только от производительности NPU, но и от того, насколько хорошо CPU и NPU могут работать вместе без сбоев.
Это также одна из немногих ценных командных подсказок Acrab.
Кен Фуа ранее возглавлял команду прикладной инженерии для Азиатско-Тихоокеанского региона в Arm UK и участвовал в разработке глобальной стратегии IP, после чего занимал должность сопредседателя правления Arm China.
Этот опыт имеет значение не только как отраслевой опыт, но и объясняет, почему эта компания переопределила рабочие нагрузки агентов на пересечении архитектуры CPU, гетерогенных вычислений и реальных потребностей приложений.
Acrab не определяет GΞLIX 1 как традиционный процессор ИИ, а представляет его как вычислительную платформу эры краевого ИИ.
На аппаратной стороне используется GΞLIX 1; на программной стороне — крупные модели, оптимизированный Runtime, полный инструментарий и слой агентной оркестрации, связывающий модели, инструменты, устройства и сервисы; на этой основе компания также предоставляет эталонные проекты агентов для типовых сценариев, чтобы помочь разработчикам и партнерам экосистемы быстрее создавать приложения.
Agent Box — это первое появление этой программно-аппаратной платформы в виде полноценного продукта. Он определяется как Personal AI Center и способен запускать модели с параметрами в сотни миллиардов локально, сохраняя ключевые функции даже без подключения к интернету.
Acrab происходит от первых букв Agentic Compute, Reasoning, Action и Brain, а также является названием звездной системы в астрономии — точно так же, как и его философия проектирования: различные вычислительные модули должны работать вместе, как звездная система.
Компания ставит перед собой цель создать для агента мозг, способный мыслить и действовать, и построить вычислительную платформу следующего поколения.
Штаб-квартира Acrab расположена в Сингапуре, и компания привлекла более 350 миллионов долларов США в рамках нескольких раундов финансирования, в числе инвесторов — глобальная венчурная платформа Vertex (Xiangfeng Investments) при принадлежащем Тэмпелану Сингапуре и известная сингапурская технологическая инвестиционная компания K3 Ventures.
Его первая вычислительная платформа GΞLIX уже прошла проверку в требовательных реальных условиях эксплуатации и сейчас готовится к первому отраслевому внедрению и масштабированию производства.
Финансирование может купить время для крупномасштабного проекта, но окончательное решение о том, сможет ли маршрут быть реализован, все еще зависит от того, сможет ли система быть доставлена.
С этой точки зрения, «возвращение CPU на центральное место» не означает, что NPU больше не важны.
Наоборот, это означает, что вычисления ИИ стали настолько сложными, что невозможно решить все задачи с помощью одного изолированного ускорителя.


За пределами 700 TOPS
Prefill и каналы данных определяют реальный опыт
Часто узким местом вывода больших моделей является не только недостаточная скорость вычислительных блоков, а то, что данные не успевают доставляться к вычислительным блокам.
Даже если чип обладает высокой пиковой вычислительной мощностью, NPU всё равно будет вынужден остановиться и ждать, если пропускная способность памяти не успевает за ней.
Агент将进一步 усиливает проблему переноса данных. Ему необходимо часто считывать историю, передавать данные между различными моделями и программным обеспечением и постоянно сохранять состояние задачи. Каждое копирование увеличивает задержку и энергопотребление; чем дольше выполняется задача, тем важнее становится дизайн системы.
Основное внимание при проектировании GΞLIX 1 было уделено тому, чтобы данные, необходимые модели, оставались как можно ближе к вычислительным блокам, и минимизировать перемещение данных между CPU, NPU, памятью и различными операционными системами.
Согласно архитектуре, опубликованной Acrab, GΞLIX 1 обеспечивает более 700 TOPS вычислительной мощности ИИ и пропускную способность единой памяти 273 ГБ/с, встроенные 8 МБ L1-кэша, общий L2-кэш с пропускной способностью 768 ГБ/с, четыре параллельных ядра NPU и специализированный ускоряющий модуль, разработанный для вычислений Attention.
Acrab утверждает, что последний может повысить эффективность соответствующих вычислений в три раза.

Больший объем кэша на чипе позволяет хранить ключевые данные ближе к вычислительным блокам; общий кэш L2 обеспечивает эффективный обмен параметрами и промежуточными признаками между вычислительными блоками; унифицированная архитектура памяти снижает ненужное копирование данных между моделью, операционной системой и приложениями.
Acrab также использует унифицированную архитектуру памяти с несколькими системами, позволяя различным операционным системам более эффективно обмениваться памятью. Для устройств, запускающих только одну модель, это может быть просто оптимизацией производительности; для агентов, которым необходимо постоянно переключаться между приложениями и инструментами, это напрямую влияет на возможность бесперебойного выполнения задач.
Это также объясняет, почему Acrab выделил Prefill в центр внимания на презентации. При введении новых файлов, восстановлении состояния задачи или обновлении контекста агенту часто необходимо повторно обрабатывать новые данные. Чем длиннее цепочка задач, тем заметнее влияние эффективности Prefill на общий опыт.
В серии самостоятельных тестов, проведенных Acrab, GΞLIX 1 запустил модель Gemma с 26 миллиардами параметров, используя 40K KV Cache и 10 000 токенов входных данных, обеспечив скорость предзаполнения более 1416 токенов в секунду; при той же нагрузке его производительность превышает в 7 раз производительность одного из ведущих универсальных настольных платформ.
Acrab также сравнивает GΞLIX 1 с аналогичной настольной AI-вычислительной платформой в рамках одной и той же тестовой рамки.
Данные показывают, что GΞLIX 1 достиг сопоставимого уровня производительности по двум ключевым показателям — Prefill и Decode, при этом демонстрируя более низкое энергопотребление и более конкурентную стоимость всей системы.
Acrab выбирает акцент на предзаполнении и данных, что само по себе указывает на определённый подход к продукту: чипы для агентов на стороне устройства не должны стремиться только к скорости вывода модели, но и решать вопрос, может ли модель быстро понимать длинный контекст, восстанавливать состояние задачи и начинать работу.
Пользователь не будет интересоваться, сколько уровней кэша прошла цепочка рассуждений, и не будет проверять TOPS перед каждым взаимодействием. Пользователь действительно замечает только три вещи: может ли он быстро понять, может ли он работать непрерывно и достаточно ли выгодно его иметь.

От чипа до платформы
Настоящая конкуренция находится за пределами параметров
В этом году на WAIC появившиеся Agent Computer, персональные AI-центры и корпоративные устройства на стороне клиента еще не сформировали единую продуктовую форму.
Домашние сценарии больше акцентируют внимание на личных воспоминаниях, контенте и взаимодействии устройств, тогда как корпоративные сценарии уделяют больше внимания базам знаний, обработке файлов и внутренней безопасности данных. Требования различных клиентов к размеру модели, объему памяти, энергопотреблению и интерфейсам сильно различаются.
Чем фрагментированнее терминалы, тем сложнее создавать вычислительные платформы. Одного чипа недостаточно, чтобы покрыть все сценарии только за счет параметров; необходимо также предоставить среду выполнения, адаптацию моделей, инструменты разработки и фреймворк агентов, чтобы помочь клиентам превратить базовую вычислительную мощность в продукты, готовые к внедрению.
Это еще одна задача, которую агентные ИИ-чипы добавляют по сравнению с обычными чипами для вывода: производительность чипа определяет, сможет ли модель работать, программный стек определяет, смогут ли разработчики его использовать, а экосистема агентов определяет, какие задачи устройство в конечном итоге сможет выполнить. Отсутствие любого из этих уровней может заставить чип с прекрасными параметрами остаться на этапе демо.
Acrab пытается одновременно захватить все эти этапы. Преимущество заключается в более полном определении продукта, но риск также очевиден: слишком много фронтов.
Чипы должны доказать свою производительность, стабильность и способность к масштабируемой поставке; программный стек должен успевать за быстрой итерацией моделей; уровень оркестровки агентов должен быть совместим с постоянно меняющимися инструментами и приложениями. После того как личные файлы и долгосрочная память остаются локально, необходимо одновременно решить вопросы изоляции прав, безопасности плагинов и аудита операций.
Таким образом, способен ли Acrab стать вычислительной платформой эпохи агентного ИИ, в конечном счете, не зависит от того, сколько токенов было запущено на презентации, и не зависит от того, сколько задач может продемонстрировать Agent Box.
Более важной проверкой является возможность быстрой разработки продуктов на этой платформе; способны ли производительность, энергопотребление и стабильность сохраняться одновременно после нескольких часов непрерывной работы агента; сможет ли базовая программно-аппаратная инфраструктура успевать за изменениями модели и фреймворка агента.
Архитектурные инновации определяют потолок возможностей чиповой компании, а инженерная реализация и экосистема — могут ли эти возможности превратиться в заказы.

Появление новых терминалов на WAIC свидетельствует о том, что отрасль переходит от этапа «запуска больших моделей» к этапу «обеспечения непрерывной работы агентов». На предыдущем этапе конкуренция шла за вычислительную мощность, память и размер модели; на следующем этапе необходимо решить задачи длинного контекста, персональной памяти, вызова инструментов и координации нескольких задач.
Acrab делает ставку именно на это изменение.
Agent Box — это не конечная точка, а открытый тест возможностей платформы.
Чипы на стороне устройства требуют «пересоздания» — не потому, что TOPS не важны, а потому, что агенты переводят вычисления из пиковых показателей в долгосрочные системные возможности. Их успешность в конечном итоге зависит от того, сумеют ли эти чипы, программное обеспечение и терминалы интегрироваться в реальные рабочие процессы.
