Acrab de Singapur presenta Agent Box y el chip GΞLIX 1 para IA agente de usuario final

iconMetaEra
Compartir
AI summary iconResumen
Acrab de Singapur lanzó Agent Box y el chip GΞLIX 1 en WAIC 2026, enfocándose en la inteligencia artificial agente para el usuario final. El chip GΞLIX 1 cuenta con colaboración CPU-NPU, memoria unificada y una potencia de cómputo de 700 TOPS. El CEO Ken Phua afirmó que la CPU está regresando a un papel central en la IA. Acrab ha recaudado más de $350 millones. Esta noticia de IA + cripto destaca el potencial de noticias en cadena en la infraestructura de IA.
En WAIC 2026, la empresa de infraestructura de IA de Singapur Acrab lanzó el Agent Box y el chip GΞLIX 1, diseñados para proporcionar una base de cálculo para la IA agente en el borde. A diferencia de los chips de IA tradicionales, GΞLIX 1 enfatiza la colaboración heterogénea entre CPU y NPU, una arquitectura de memoria unificada y optimización de Prefill, ofreciendo 700 TOPS de potencia de cálculo y un ancho de banda de memoria de 273 GB/s. El CEO Ken Phua considera que la IA ha entrado en la era del cálculo heterogéneo, y la CPU ha regresado al centro, con Acrab habiendo recaudado más de 350 millones de dólares en financiamiento acumulado. La IA en el borde está pasando de "ejecutar un modelo" a "ejecutar a largo plazo un sistema inteligente completo", y la verdadera competencia radica en la capacidad integral de integrar chips, pilas de software y ecosistemas de agentes.

Autor y fuente del artículo: Nuevos智元

¿En qué base de cálculo debería ejecutarse la IA agente?

A few days later, one of the most crowded concepts at WAIC 2026—the Agent Computer—is transitioning from a novelty on the exhibition floor to a genuine engineering challenge.

Encender un modelo grande en un dispositivo local ya no es la parte más difícil. Lo más difícil es que, cuando el agente necesite leer archivos continuamente, conservar memoria, llamar a herramientas y ejecutarse en segundo plano durante largos períodos, el chip pueda mantenerse estable bajo las restricciones de consumo energético, latencia y costo.

Esto cambiará la forma de evaluar los chips del lado del dispositivo. Los TOPS, los parámetros del modelo y los tokens por segundo siguen siendo importantes, pero si el ancho de banda de memoria no da abasto, si la cooperación entre la CPU y la NPU es deficiente, o si la pila de software no puede mantener el estado de las tareas, incluso el pico más impresionante apenas bastará para completar una demostración.

Hemos notado que esta semana, la empresa de Singapur Acrab realizó un lanzamiento en línea y presentó Agent Box, lo que podría proporcionar una muestra可供拆解.

En este lanzamiento, la empresa de infraestructura de IA presentó simultáneamente el prefill, memoria unificada, cooperación heterogénea CPU-NPU y orquestación de agentes.

Estas palabras clave apuntan a la misma conclusión: la IA en el borde está pasando de «ejecutar un modelo» a «ejecutar a largo plazo un sistema inteligente».

Lo que los chips ya no solo deben resolver es si la potencia de cálculo es suficiente, sino cómo fluyen los datos, cómo se programan las tareas y cómo se coordina continuamente el software y el hardware.

Entonces, cuando el entusiasmo de WAIC y el lanzamiento de nuevos productos, así como las tendencias de la industria, se vayan asentando, la pregunta realmente valiosa se vuelve más clara: ¿qué debe reinventarse realmente en los chips del lado del dispositivo cuando los agentes pasan de una sola llamada a funcionar de forma continua?

De un solo razonamiento a trabajo continuo

El agente modificó la carga del lado del dispositivo

Los chatbots generalmente completan una ronda de preguntas y respuestas. Después de recibir una tarea, el agente puede primero buscar información, leer archivos, luego invocar código, navegador, calendario o software de oficina; tras completar una parte, verifica los resultados, conserva el estado de la tarea y espera el próximo disparo. Una tarea a menudo implica múltiples llamadas al modelo y cambios repetidos entre diferentes modelos, herramientas y aplicaciones.

Acrab mostró un flujo de tareas relativamente completo durante el lanzamiento: el usuario solicita crear un regalo temático espacial para su hijo, el sistema proporciona ideas, ayuda a seleccionar una solución, activa las herramientas relacionadas y sigue el progreso de la fabricación; cuando surgen nuevas condiciones en el entorno, puede conectarse a otros dispositivos inteligentes para manejarlas.

El significado de esta demostración no radica en cuán inteligente sea una sola respuesta, sino en si un lenguaje natural puede convertirse en una secuencia continua de acciones. Para los sistemas de cómputo, el agente ya no es simplemente «llamar una vez al modelo», sino que alterna continuamente entre el modelo, los datos, el software y los dispositivos.

Este enfoque primero amplía la división de responsabilidades entre el extremo y la nube.

El costo de una sola inferencia puede no ser alto, pero cuando las llamadas se vuelven frecuentes y continuas, los tokens pasan de ser indicadores técnicos a convertirse en facturas reales; una espera de red tiene un impacto limitado en una conversación, pero se acumula progresivamente en tareas de múltiples pasos; para que el agente pueda manejar un contexto personal más completo, los datos deben viajar repetidamente a la nube, ampliando así la superficie de exposición.

Por lo tanto, el borde y la nube no son excluyentes. Una estructura más realista es: mantener localmente tantas tareas como sea posible que sean de alta frecuencia, sensibles a la privacidad, requieran respuestas rápidas y mantengan estado a largo plazo; y llamar a recursos en la nube solo para razonamientos complejos que superen los límites del dispositivo.

El verdadero cambio radica en que el dispositivo final ya no solo ejecuta una inferencia de modelo, sino que debe soportar un sistema inteligente que no puede interrumpirse fácilmente.

Debe ejecutar modelos grandes, procesar contextos largos, múltiples tareas y llamadas a herramientas; el rendimiento debe ser lo suficientemente potente, sin que el consumo de energía y los costos se descontrolen, y el Runtime, la cadena de herramientas y el ecosistema de Agentes también deben avanzar simultáneamente.

Los modelos grandes en el borde resuelven si el modelo puede caber en el dispositivo; lo que busca resolver la IA agente es si el modelo, la memoria, las herramientas y las aplicaciones pueden coordinarse a largo plazo dentro del dispositivo.

No basta con acumular solo NPU

La CPU, la memoria y la pila de software deben reiniciarse juntas

Anteriormente, agregar una NPU a una CPU o SoC permitía que los dispositivos adquirieran capacidades de IA como reconocimiento de voz y procesamiento de imágenes. Pero cuando los Agentes pasaron de ser funciones adicionales a convertirse en el núcleo del dispositivo, simplemente aumentar el rendimiento pico ya no es suficiente.

La razón es que el agente no es una cadena fija de inferencia de red neuronal. El cálculo masivo y paralelo es adecuado para asignarlo a la NPU, mientras que la descomposición de tareas, la evaluación condicional, la programación del sistema, la llamada a herramientas, el manejo de excepciones y la colaboración entre múltiples sistemas dependen en gran medida de la CPU. Cuanto más dinámica sea la ruta de la tarea, más importante se vuelve la coordinación entre la CPU y la NPU.

El CEO de Acrab, Ken Phua, resumió este cambio como: «La CPU vuelve al centro de la era de la IA».

En su opinión, la IA está entrando en entornos de cómputo heterogéneo, y el rendimiento no depende solo del rendimiento de la NPU, sino más bien de la capacidad del CPU y la NPU para colaborar sin interrupciones.

Esta también es una de las pocas pistas del equipo de Acrab que merece ser explorada.

Ken Phua lideró el equipo de ingeniería de aplicaciones de Asia-Pacífico en Arm UK y participó en la elaboración de la estrategia global de propiedad intelectual, antes de desempeñarse como CEO conjunto de Arm China.

El significado de esta experiencia no es solo un historial profesional, sino que explica por qué esta empresa redefinió la carga de trabajo de los Agentes desde la intersección de la arquitectura CPU, el cómputo heterogéneo y las necesidades de aplicaciones reales.

Acrab no define a GΞLIX 1 como un procesador de IA tradicional, sino como una plataforma de cómputo para la era de la IA en el borde.

En el lado del hardware, se basa en GΞLIX 1; en el lado del software, abarca modelos grandes, un Runtime optimizado, una cadena de herramientas completa y una capa de orquestación de Agentes que conecta modelos, herramientas, dispositivos y servicios; sobre esta base, la empresa también ofrece diseños de referencia de Agentes para escenarios típicos, ayudando a desarrolladores y socios del ecosistema a construir aplicaciones más rápidamente.

Agent Box es la primera vez que esta plataforma de software y hardware aparece en una forma de producto completa. Se define como Personal AI Center, capaz de ejecutar modelos de miles de millones de parámetros localmente, manteniendo sus funciones esenciales incluso sin conexión a internet.

Acrab se deriva de las iniciales de Agentic Compute, Reasoning, Action y Brain, y también es el nombre de un sistema estelar múltiple en astronomía, al igual que su filosofía de diseño: hacer que distintas unidades de cómputo funcionen en conjunto, como un sistema estelar.

La empresa tiene como objetivo crear un cerebro capaz de pensar y actuar para el Agente, construyendo la próxima generación de plataformas de cómputo.

Acrab, con sede en Singapur, ha recaudado más de 350 millones de dólares en financiamiento acumulado, con inversores como Vertex (Xiangfeng Inversión), la plataforma global de capital de riesgo de Temasek, y la reconocida institución de inversión tecnológica de Singapur K3 Ventures.

Su primera plataforma de cómputo, GΞLIX, ya ha sido validada en entornos de despliegue real exigentes y actualmente se dirige hacia su primera adopción industrial y producción a escala.

La financiación puede comprar tiempo para el proyecto, pero lo que realmente determina si la ruta es viable es si el sistema puede entregarse.

Desde este punto de vista, que la «CPU regrese al centro» no significa que la NPU ya no sea importante.

Por el contrario, significa que el cálculo de IA se ha vuelto tan complejo que ya no se puede resolver todo con un solo acelerador aislado.

Más allá de 700 TOPS

Prefill y la ruta de datos determinan la experiencia real

Muchas veces, el cuello de botella en la inferencia de grandes modelos no es solo que las unidades de cálculo no sean lo suficientemente rápidas, sino que los datos no llegan a las unidades de cálculo a tiempo.

Aunque el chip tenga una alta potencia de cálculo pico, si el ancho de banda de memoria no sigue el ritmo, la NPU aún debe detenerse y esperar.

El agente intensificará aún más el problema de transferencia de datos. Necesita leer frecuentemente el historial, transferir datos entre diferentes modelos y software, y guardar continuamente el estado de la tarea. Cada copia aumenta la latencia y el consumo energético; cuanto más tiempo dure la tarea, mayor será la importancia del diseño del sistema.

El diseño de GΞLIX 1 se centra en mantener los datos necesarios para el modelo lo más cerca posible de la unidad de cálculo y reducir la transferencia constante entre CPU, NPU, memoria y diferentes sistemas operativos.

Según la arquitectura publicada por Acrab, GΞLIX 1 ofrece más de 700 TOPS de potencia de IA y un ancho de banda de memoria unificada de 273 GB/s, con 8 MB de caché L1 integrada, una caché L2 compartida con un ancho de banda de 768 GB/s, cuatro núcleos NPU en paralelo y un módulo de aceleración dedicado diseñado para cálculos de Attention.

Acrab dijo que esto puede aumentar la eficiencia de cálculo hasta tres veces.

Un caché en chip más grande permite que los datos clave estén más cerca de las unidades de cálculo; el caché L2 compartido permite un intercambio eficiente de parámetros y características intermedias entre las unidades de cálculo; la arquitectura de memoria unificada reduce las copias innecesarias de datos entre el modelo, el sistema operativo y las aplicaciones.

Acrab también utiliza una arquitectura de memoria unificada multi-sistema, lo que permite que diferentes sistemas operativos compartan memoria de manera más eficiente. Para dispositivos que ejecutan solo un modelo, esto puede ser simplemente una optimización de eficiencia; para Agentes que necesitan trabajar constantemente entre aplicaciones y herramientas, afecta directamente la capacidad de avanzar sin interrupciones en las tareas.

Esto también explica por qué Acrab colocó el Prefill en el centro del lanzamiento. Cuando los agentes introducen nuevos archivos, restauran el estado de una tarea o actualizan el contexto, a menudo necesitan volver a procesar la información añadida. Cuanto más larga sea la cadena de tareas, más notable será el impacto de la eficiencia del Prefill en la experiencia general.

En un conjunto de pruebas autodefinidas reveladas por Acrab, GΞLIX 1 ejecuta el modelo Gemma con 26 mil millones de parámetros, utilizando un KV Cache de 40K y una entrada de 10,000 tokens, logrando una velocidad de prefills superior a 1,416 tokens por segundo; bajo la misma carga, su rendimiento es más de 7 veces superior al de una plataforma de escritorio generalizada principal.

Acrab también compara GΞLIX 1 con una plataforma de cálculo de IA de escritorio similar dentro del mismo marco de prueba.

Los datos muestran que GΞLIX 1 entra en un rango de rendimiento similar en las dos métricas clave, Prefill y Decode, al mismo tiempo que presenta un menor consumo de energía y un costo total del sistema más competitivo.

Acrab opta por enfatizar el prellenado y la ruta de datos, lo que en sí mismo revela una orientación de producto: los chips de agente en el extremo no deben solo perseguir la velocidad de salida del modelo, sino también resolver si el modelo puede leer rápidamente contextos largos, recuperar el estado de la tarea y comenzar a trabajar.

El usuario no se preocupará por cuántas capas de caché atraviesa una cadena de razonamiento interna, ni revisará los TOPS antes de cada interacción. Lo que realmente percibe son solo tres cosas: ¿puede comprenderlo rápidamente?, ¿puede funcionar de manera continua?, ¿y vale la pena tenerlo?

Desde el chip hasta la plataforma

La verdadera competencia está fuera de los parámetros

Este año, el Agent Computer, el centro de IA personal y los dispositivos de extremo empresarial presentados en el WAIC aún no han formado una forma de producto unificada.

Los escenarios domésticos enfatizan más la memoria personal, el contenido y la cooperación de los dispositivos, mientras que los escenarios empresariales valoran más la base de conocimientos, el procesamiento de archivos y la seguridad de los datos internos. Los distintos clientes tienen requisitos muy diferentes en cuanto al tamaño del modelo, la capacidad de memoria, el consumo de energía y las interfaces.

Cuanto más fragmentado sea el terminal, más difícil será crear una plataforma de cómputo. Un solo chip no puede cubrir todos los escenarios solo con parámetros; también se necesita proporcionar Runtime, adaptación de modelos, herramientas de desarrollo y un marco de Agentes para ayudar a los clientes a convertir la capacidad de cómputo subyacente en productos entregables.

Esta es también la pregunta adicional que los chips de IA agente tienen en comparación con los chips de inferencia comunes: el rendimiento del chip determina si el modelo puede ejecutarse, la pila de software determina si los desarrolladores pueden utilizarlo, y el ecosistema de agentes determina qué tareas finalmente podrá realizar el dispositivo. La falta de cualquier capa podría hacer que un chip con parámetros impresionantes se quede en la fase de demostración.

Acrab intenta controlar simultáneamente todos estos aspectos. La ventaja es que la definición del producto es más completa; el riesgo es directo: la línea de batalla es muy extensa.

Los chips deben demostrar rendimiento, estabilidad y capacidad de entrega a escala; la pila de software debe seguir el ritmo de la rápida iteración de los modelos; y la capa de orquestación de Agentes debe ser compatible con herramientas y aplicaciones en constante cambio. Una vez que los archivos personales y la memoria a largo plazo se mantengan localmente, también se deben abordar simultáneamente la aislación de permisos, la seguridad de los plugins y la auditoría de operaciones.

Por lo tanto, si Acrab puede convertirse en la plataforma de cómputo de la era de la IA agente no depende de cuántos tokens se ejecutaron durante el lanzamiento, ni de cuántas tareas pueda demostrar Agent Box.

La verificación más crítica es: ¿pueden los desarrolladores crear productos rápidamente en esta plataforma; ¿pueden el rendimiento, el consumo de energía y la estabilidad mantenerse simultáneamente después de que el agente funcione durante varias horas consecutivas; y ¿pueden la infraestructura de software y hardware subyacente seguir el ritmo a medida que el modelo y el marco de agente sigan evolucionando?

La innovación arquitectónica determina el límite de capacidad de una empresa de chips, mientras que la ingeniería y el ecosistema determinan si ese límite se convierte en pedidos.

La aparición intensa de nuevos terminales en WAIC indica que la industria está pasando de «hacer funcionar grandes modelos» a «hacer que los agentes trabajen de forma continua». La etapa anterior se centraba en la potencia de cómputo, la memoria y el tamaño del modelo; la próxima etapa también deberá abordar contextos largos, memoria personal, llamadas a herramientas y coordinación multitarea.

Acrab está apostando precisamente por este cambio.

Agent Box no es el final, sino una prueba pública de las capacidades de la plataforma.

Los chips del lado del dispositivo necesitan ser «rehechos», no porque los TOPS no sean importantes, sino porque los Agentes están transformando el cálculo de números de pico en capacidades del sistema de funcionamiento continuo. Su viabilidad final dependerá de si estos chips, software y dispositivos pueden integrarse en flujos de trabajo reales.

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.