Artículo escrito por Xiao Bing
El 6 de agosto, AMD anunció la adquisición de la empresa de chips de Toronto, Taalas, cuyo precio de la transacción no se reveló. Esta startup, fundada en 2023 y que ha recaudado un total de 219 millones de dólares, hizo algo que parece un poco loco: quemar directamente los pesos del modelo de IA en las capas metálicas del chip para crear un chip dedicado que solo pueda ejecutar un modelo.
Las GPU funcionan almacenando los parámetros del modelo en memoria de alta ancho de banda (HBM) y transfiriendo repetidamente datos dentro y fuera de las unidades de cálculo durante la inferencia. Este proceso de "transferencia" consume una gran cantidad de energía y tiempo, y la industria lo denomina "pared de memoria". La aproximación de Taalas elimina por completo la transferencia, fijando los pesos directamente en los transistores del chip, integrando almacenamiento y cálculo en una sola unidad.
El costo es que este chip solo puede ejecutar un modelo, pero la ventaja es un aumento de orden de magnitud en velocidad y eficiencia energética.
¿Qué significa 17,000 tokens por segundo?
El chip de verificación técnica HC1 de Taalas se basa en el proceso de 6 nm de TSMC, con un área de chip de 815 mm² y 53 mil millones de transistores; el modelo integrado es Llama 3.1 8B de Meta.
Datos de rendimiento de HC1: aproximadamente 17,000 tokens/segundo por usuario. Para comparación, Nvidia H200 alcanza aproximadamente 230 tokens/segundo y H100 aproximadamente 150 tokens/segundo en el mismo modelo. Una diferencia de velocidad de 73 veces, con solo una décima parte del consumo energético.
Cuenta económica más intuitiva: El costo de inferencia declarado por Taalas es de aproximadamente 0,75 centavos de dólar por millón de tokens (Llama 8B), mientras que las soluciones GPU oscilan entre 20 y 49 centavos de dólar. Cada tarjeta HC1 consume 250 W; un rack estándar con aireación que aloja 10 tarjetas requiere solo 12-15 kW, sin necesidad de refrigeración líquida, mientras que los racks GPU suelen requerir entre 120 y 600 kW.
El analista de Forbes Karl Freund evaluó en febrero: “10 veces más rápido que la plataforma de inferencia más rápida (Cerebras Wafer-Scale Engine) y dos órdenes de magnitud más rápido que las GPU.”
Pero hay varias condiciones importantes. HC1 utiliza un formato de datos de 3 bits desarrollado internamente por Taalas junto con parámetros de 6 bits, lo que implica una cuantización muy agresiva y una pérdida de calidad determinista en tareas de razonamiento complejas. Los datos de 17.000 tokens/segundo provienen de una prueba de referencia del fabricante con 1K de entrada/1K de salida y no representan el rendimiento real en entornos de producción. Además, Llama 3.1 8B es un modelo lanzado a mediados de 2024, y su versión cuantizada con 8B de parámetros incluso puede ejecutarse en una Raspberry Pi 5. HC1 demuestra el potencial de la arquitectura, no la competitividad de un producto maduro.
¿Qué hacer cuando se reemplaza el modelo?
Al grabar el modelo en el chip, la pregunta más intuitiva es: ¿qué pasa si el modelo se actualiza? ¿El chip se vuelve inútil?
La respuesta de Taalas es: no se descartará. El ciclo de diseño tradicional de ASIC requiere más de dos años. Taalas ha desarrollado un proceso de diseño automatizado que solo requiere modificar una pequeña cantidad de máscaras metálicas en la capa superior del chip para compilar un nuevo modelo en un nuevo chip, con un ciclo de aproximadamente 8 semanas. La empresa ha incluido en su modelo de costos los gastos de tres actualizaciones de chip dentro de un ciclo de vida de cuatro años.
Esta respuesta puede aliviar parte de la ansiedad, pero no puede eliminarla por completo.
La flexibilidad de la GPU radica en que la misma tarjeta puede ejecutar Llama hoy, Claude mañana y un nuevo modelo aún no lanzado pasado mañana. El chip de Taalas no puede hacer esto. Si un cliente necesita servicios de múltiples modelos simultáneamente (lo cual es extremadamente común en entornos de producción), se requiere un chip diferente para cada modelo, lo que aumenta la complejidad de la gestión de inventario y el mantenimiento.
HC2 ya está en desarrollo, con el objetivo de un modelo de aproximadamente 20 mil millones de parámetros, utilizando punto flotante de 4 bits para mejorar la precisión. Taalas originalmente planeaba admitir modelos de vanguardia antes de finales de 2026.
La adquisición de AMD permite la sinergia entre la línea de productos Instinct GPU y el sistema de rack Helios, permitiendo a los clientes utilizar GPU para cargas de trabajo variables y chips Taalas para inferencia de modelo único estable y de alta frecuencia.
La carrera armamentista de los chips de inferencia
AMD adquiere Taalas, lo que representa la última operación en la ola de adquisiciones de chips de inferencia de los últimos ocho meses, en contexto industrial.
En diciembre de 2025, Nvidia adquirió Groq por 20.000 millones de dólares, obteniendo la arquitectura de inferencia de baja latencia basada en SRAM.
En mayo de 2026, Cerebras realizó su IPO con una capitalización de mercado de aproximadamente 560 mil millones de dólares, convirtiéndose en la mayor IPO tecnológica desde Snowflake en 2020.
En junio, Etched finalizó más de dos años de inactividad y anunció que su primer chip dedicado a Transformers había completado la fabricación en el proceso N4P de TSMC, con contratos con clientes por más de 1.000 millones de dólares. Se informa que Intel ha firmado una carta de intención de adquisición con SambaNova, y Qualcomm está en conversaciones con Tenstorrent.
Estas operaciones apuntan a la misma conclusión: el razonamiento se está convirtiendo en el campo de batalla principal del gasto en potencia de IA.
Se pronostica que en 2026 la inferencia representará dos tercios del gasto en computación de IA, y para 2030 los ASIC dedicados a inferencia podrían capturar el 45% del mercado de inferencia. Las GPU de Nvidia aún dominan el segmento de entrenamiento, pero su arquitectura generalista enfrenta desafíos de chips especializados en todas direcciones en el ámbito de la inferencia.
Taalas se encuentra en el extremo más extremo de este espectro: renuncia incluso a la generalidad de un "modelo de clase uno" y desarrolla directamente un chip dedicado para "un solo modelo".
Groq utiliza SRAM en lugar de HBM para evitar la pared de memoria, Cerebras emplea un área de oblea para superarla mediante fuerza bruta, Etched se optimiza exclusivamente para la arquitectura Transformer, y la apuesta de Taalas es aún más audaz: apuesta a que los modelos de IA se estabilizarán gradualmente, al igual que los protocolos de comunicación que finalmente convergen en unos pocos estándares. Cuando los modelos ya no cambien mensualmente, fabricar un chip dedicado para cada uno de los pocos modelos más populares resultará económicamente rentable.
Apuesta a que el modelo se “congelará”
Vamsi Boppana, vicepresidente senior de AMD, dijo en el anuncio que el propósito de la adquisición es proporcionar a los clientes "la mejor solución de cómputo para cada carga de trabajo de IA". Esta frase se traduce en una estrategia competitiva: las GPU se encargan de la flexibilidad, los chips Taalas de la máxima eficiencia, y los clientes los combinan según sus necesidades.
La validez de esta lógica de combinación depende de un supuesto fundamental: si el ciclo de actualización de los modelos de IA se ralentizará.
Si los modelos grandes continúan recibiendo actualizaciones arquitectónicas cada pocos meses, entonces fijar los pesos en silicio sería como verter hormigón sobre arena movediza: antes de que el chip recupere su inversión, el modelo ya estará obsoleto. Pero si la capacidad de los modelos tiende a converger y se vuelve común que los modelos líderes sirvan de forma estable durante uno o dos años, entonces los chips especializados del tipo Taalas se convertirán en una elección lógica, al igual que los chips de baseband en la industria de las comunicaciones.
Al revisar los últimos 12 meses, el ritmo de actualización de los modelos ha experimentado cambios sutiles. El intervalo entre las versiones de la serie Llama, de 3.1 a 3.2 y luego a 4, se ha alargado, mientras que los cambios arquitectónicos entre GPT-4, GPT-4o y GPT-5 se han vuelto más limitados. Muchos nuevos modelos se están desarrollando mediante distilación, cuantización y ajuste fino sobre arquitecturas existentes, y la iteración de los modelos base se está ralentizando.
Si esta tendencia continúa, Taalas acertó.
