AMD adquiere Taalas para integrar pesos de modelos de IA en chips

iconBitPush
Compartir
AI summary iconResumen
AMD ha adquirido la startup de chips con sede en Toronto Taalas, que incrusta directamente los pesos de los modelos de IA en el silicio. El chip HC1 de Taalas, construido en TSMC 6nm, ejecuta el modelo Llama 3.1 8B de Meta a 17.000 tokens por segundo, superando a Nvidia H200 y H100 en velocidad y eficiencia energética. El chip utiliza un formato de 3 bits y se actualiza cada 8 semanas mediante cambios en máscaras metálicas. AMD planea integrar los chips de inferencia de Taalas con su línea de GPUs para cargas de trabajo de IA. Esta noticia de IA + cripto surge en medio de datos inflacionarios cambiantes y una creciente demanda de computación eficiente.

Autor: Xiao Bing

AMD adquiere Taalas: los chips de inferencia comienzan a grabar los pesos del modelo en silicio


El 6 de agosto, AMD anunció la adquisición de la empresa de chips de Toronto, Taalas, cuyo precio de la transacción no se reveló. Esta startup fundada en 2023 y que ha recaudado un total de $219 millones en financiación, hizo algo que parece un poco loco: quemar directamente los pesos de los modelos AI en las capas metálicas del chip para crear chips dedicados que solo pueden ejecutar un modelo.

Las GPU funcionan almacenando los parámetros del modelo en memoria de alta ancho de banda (HBM) y transfiriendo repetidamente los datos dentro y fuera de las unidades de cálculo durante la inferencia. Este proceso de "transferencia" consume una gran cantidad de energía y tiempo, y la industria lo denomina "pared de memoria". El enfoque de Taalas elimina por completo la transferencia, fijando los pesos directamente en los transistores del chip, integrando almacenamiento y cálculo en una sola unidad.

El costo es que este chip solo puede ejecutar un modelo, pero la ventaja es un aumento de orden de magnitud en velocidad y eficiencia energética.

¿Qué significa 17000 tokens por segundo?

El chip de verificación técnica HC1 de Taalas se basa en el proceso de 6 nm de TSMC, con un área de chip de 815 mm² y 53 mil millones de transistores; el modelo integrado es Llama 3.1 8B de Meta.

Datos de rendimiento de HC1: aproximadamente 17,000 tokens/segundo por usuario. Para comparación, Nvidia H200 alcanza aproximadamente 230 tokens/segundo y H100 aproximadamente 150 tokens/segundo en el mismo modelo. Una diferencia de velocidad de 73 veces, con solo una décima parte del consumo energético.

Cuenta económica más intuitiva: El costo de inferencia declarado por Taalas es de aproximadamente 0,75 centavos de dólar por millón de tokens (Llama 8B), mientras que las soluciones GPU oscilan entre 20 y 49 centavos de dólar. Cada tarjeta HC1 consume 250 W; un rack estándar con aireación que aloja 10 tarjetas requiere solo 12-15 kW, sin necesidad de refrigeración líquida, mientras que los racks GPU suelen requerir entre 120 y 600 kW.

El analista de Forbes Karl Freund evaluó en febrero: “10 veces más rápido que la plataforma de inferencia más rápida (Cerebras Wafer-Scale Engine) y dos órdenes de magnitud más rápido que las GPU.”

Pero hay varias condiciones limitantes importantes. HC1 utiliza un formato de datos de 3 bits desarrollado internamente por Taalas junto con parámetros de 6 bits, lo que implica una cuantización muy agresiva, y la pérdida de calidad en tareas de razonamiento complejas es definitivamente existente. Los datos de 17.000 tokens/segundo provienen de una prueba de referencia del fabricante con 1K de entrada/1K de salida, y no representan el rendimiento real en entornos de producción. Además, Llama 3.1 8B es un modelo lanzado a mediados de 2024, y su versión cuantizada con 8B de parámetros incluso puede ejecutarse en una Raspberry Pi 5. HC1 demuestra el potencial de la arquitectura, no la competitividad de un producto maduro.

¿Qué hacer con el reemplazo del modelo?

Al grabar el modelo en el chip, la pregunta más intuitiva es: ¿qué pasa si el modelo se actualiza? ¿El chip se vuelve inútil?

La respuesta de Taalas es: no se descartará. El ciclo de diseño tradicional de ASIC lleva más de dos años. Taalas ha desarrollado un proceso de diseño automatizado que requiere modificar solo unos pocos máscaras metálicas en la capa superior del chip para compilar un nuevo modelo en un nuevo chip, con un ciclo de aproximadamente 8 semanas. La empresa ha incluido en su modelo de costos los gastos de tres actualizaciones de chip dentro de un ciclo de vida de cuatro años.

Esta respuesta puede aliviar parte de la ansiedad, pero no puede eliminarla por completo.

La flexibilidad de la GPU radica en que la misma tarjeta puede ejecutar hoy Llama, mañana Claude y al día siguiente un nuevo modelo aún no lanzado. El chip de Taalas no puede hacer esto. Si un cliente necesita servicios de múltiples modelos simultáneamente (lo cual es extremadamente común en entornos de producción), se requiere un chip diferente para cada modelo, lo que aumenta la complejidad de la gestión de inventario y el mantenimiento.

HC2 ya está en desarrollo, con el objetivo de un modelo de aproximadamente 20 mil millones de parámetros, utilizando punto flotante de 4-bit para mejorar la precisión. Taalas originalmente planeaba admitir modelos de vanguardia antes de finales de 2026.

La adquisición de AMD permite la sinergia entre la línea de productos Instinct GPU y el sistema de rack Helios, permitiendo a los clientes utilizar GPU para cargas de trabajo variables y chips Taalas para inferencia de modelo único estable y de alta frecuencia.

La carrera armamentista de los chips de inferencia

AMD adquiere Taalas, que, en contexto industrial, es la última adquisición en la ola de compras de chips de inferencia de los últimos ocho meses.

En diciembre de 2025, Nvidia adquirió Groq por 20.000 millones de dólares, obteniendo la arquitectura de inferencia de baja latencia basada en SRAM.

En mayo de 2026, Cerebras realizó su IPO con una capitalización de mercado de aproximadamente 560 mil millones de dólares, convirtiéndose en la mayor IPO tecnológica desde Snowflake en 2020.

En junio, Etched finalizó más de dos años de inactividad y anunció que su primer chip dedicado a Transformers había completado la fabricación en el proceso N4P de TSMC, con contratos con clientes por más de 1.000 millones de dólares. Se informa que Intel ha firmado una carta de intención de adquisición con SambaNova, y Qualcomm está en conversaciones con Tenstorrent.

Estas operaciones apuntan a la misma conclusión: el razonamiento se está convirtiendo en el campo de batalla principal del gasto en capacidad de cómputo de IA.

Se pronostica que en 2026 la inferencia representará dos tercios del gasto en cómputo de IA, y para 2030 los ASIC dedicados a inferencia podrían capturar el 45% del mercado de inferencia. Las GPU de Nvidia aún dominan el segmento de entrenamiento, pero su arquitectura generalista enfrenta desafíos de chips especializados en todos los frentes en el ámbito de la inferencia.

Taalas se encuentra en el extremo más extremo de este espectro: renuncia incluso a la generalidad de un "modelo de clase uno" y desarrolla directamente un chip dedicado para "un solo modelo".

Groq utiliza SRAM en lugar de HBM para evitar la pared de memoria, Cerebras utiliza área a nivel de oblea para superarla con fuerza bruta, Etched se optimiza exclusivamente para la arquitectura Transformer, y la apuesta de Taalas es aún más audaz: apuesta a que los modelos de IA se estabilizarán gradualmente, al igual que los protocolos de comunicación que finalmente convergen en unos pocos estándares. Cuando los modelos ya no cambien mensualmente, fabricar un chip dedicado para cada uno de los pocos modelos más populares será económicamente rentable.

El modelo de apuesta se “congelará”

El vicepresidente senior de AMD, Vamsi Boppana, dijo en el anuncio que el propósito de la adquisición es proporcionar a los clientes "la mejor solución de cómputo para cada carga de trabajo de IA". Esta frase se traduce en una estrategia competitiva: las GPU se encargan de la flexibilidad, los chips Taalas de la eficiencia extrema, y los clientes los combinan según sus necesidades.

Whether this logic holds depends on a core assumption: whether the update cycle of AI models will slow down.

Si los modelos grandes continúan recibiendo actualizaciones arquitectónicas cada pocos meses, entonces fijar los pesos en silicio sería como verter hormigón sobre arena movediza: antes de que el chip recupere su inversión, el modelo ya estará obsoleto. Pero si la capacidad de los modelos tiende a converger y se vuelve común que los modelos líderes sirvan de forma estable durante uno o dos años, entonces los chips dedicados al estilo Taalas se convertirán en una elección lógica, al igual que los chips de baseband en la industria de las telecomunicaciones.

Al revisar los últimos 12 meses, el ritmo de actualización de los modelos ha experimentado cambios sutiles. El intervalo entre las versiones del modelo Llama, de 3.1 a 3.2 y luego a 4, se ha alargado, mientras que los cambios arquitectónicos entre GPT-4, GPT-4o y GPT-5 se han vuelto más modestos. Muchos nuevos modelos se están desarrollando mediante distilación, cuantización y ajuste fino sobre arquitecturas existentes, y la iteración de los modelos base se está ralentizando.

Si esta tendencia continúa, Taalas acertó.


Twitter:https://twitter.com/BitpushNewsCN

Grupo de comunicación de BitPush en TG: https://t.me/BitPushCommunity

Suscríbete a BitPush en TG: https://t.me/bitpush

Nota: Todos los artículos de Beepro representan únicamente la opinión del autor y no constituyen asesoramiento de inversión.
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.