CUDA ha sido volado otra vez...
Esta vez, el que actúa es la IA criada directamente por NVIDIA.
Una pequeña empresa fundada hace solo un año, utilizando agentes de programación con IA, desarrolló un software similar a CUDA en solo 10 horas.

Detente.
¿Estás diciendo que este imperio de software que NVIDIA construyó en casi 20 años se ha replicado así como así??

No solo eso. DeepSeek También intentando escribir menos CUDA de bajo nivel.
Han abierto el código de una biblioteca de operadores GPU llamada TileKernels, escrita en TileLang, lo que elimina la necesidad de escribir manualmente gran cantidad de código CUDA de bajo nivel.
Pero este tipo de "crisis de CUDA" no es la primera vez que lo escuchamos.
Cada cierto tiempo, CUDA es sacada a relucir para ser criticada, diciendo que ya ha sido reemplazada, superada o que su ventaja competitiva ha sido nuevamente demolida…
Is that really true?
10 horas «réplica» CUDA
Cuando se menciona NVIDIA, la primera reacción de muchas personas es la GPU.
H100, Blackwell, Rubin: aprovechando generaciones sucesivas de chips con mayor rendimiento, NVIDIA ha captado la mayor parte de los beneficios de esta ola de IA.
Pero la ventaja verdaderamente difícil de superar de NVIDIA no es el hardware, sino el software.
Los chips se pueden comprar, los parámetros se pueden seguir, y el proceso de fabricación también evolucionará. Lo que realmente hace que los clientes que usan NVIDIA tengan dificultades para cambiar es el ecosistema de software completo construido en torno a la GPU.
Y CUDA es el núcleo de este imperio de software.
CUDA, cuyo nombre completo es Compute Unified Device Architecture, fue desarrollada durante casi 20 años por un equipo liderado por el ejecutivo de NVIDIA, Ian Buck.
A menudo se le llama lenguaje de programación, pero con mayor precisión, CUDA es un conjunto completo de software construido alrededor de las GPU de NVIDIA.
Si se divide simplemente en tres capas, la más inferior es la capa de núcleo, que incluye el Kernel, el compilador y el entorno de ejecución que hacen trabajar directamente al chip.
En el medio están las capas de bibliotecas: bibliotecas de cálculo altamente optimizadas como cuBLAS y cuDNN, así como herramientas de depuración, validación y análisis de rendimiento.
En la parte superior se encuentran los marcos de desarrollo como PyTorch y TensorFlow, la gran cantidad de código y flujos de trabajo acumulados por las empresas, y el ecosistema de desarrolladores que ha crecido en torno a CUDA.

△
Esto puede sonar un poco abstracto, pero puedes imaginar las GPU de NVIDIA como una fábrica.
CUDA en el nivel más bajo se encarga de decirle a la máquina cómo realizar cada paso, la capa intermedia proporciona herramientas de producción listas para usar, y la capa superior consiste en un sistema de producción completo que ha estado funcionando durante años.
Entonces, para el cliente, lo que compra no es solo una tarjeta de NVIDIA, sino una fábrica lista para usar.
Ahora, un tipo llamado Jeremy Nixon viene con un AI Agent.

Nixon es el fundador de la empresa de software de inteligencia artificial Infinity y anteriormente fue investigador en Google Brain.
Su equipo desarrolló un agente de investigación de IA llamado Ignition, diseñado específicamente para escribir software de bajo nivel para diferentes chips de IA.
Puede generar kernels de GPU, ejecutar pruebas, detectar errores, medir el rendimiento y reescribir automáticamente el código según los resultados.
Los ingenieros humanos se encargan de establecer la dirección general, mientras que las tareas mundanas y exigentes se delegan a los Agentes para que las repitan en ciclos.
Así es, Infinity construyó para d-Matrix, una startup de chips de IA, un software similar a CUDA mediante Ignition.
Solo tomó 10 horas.
¿Qué?
¿Ahora realmente se pueden confiar al AI los códigos de bajo nivel que antes requerían múltiples iteraciones de depuración por parte de ingenieros de software de chips?

Tampoco se puede decir que sea completamente una炒作.
Los agentes de IA son realmente adecuados para tareas de programación con retroalimentación clara.
Si el código se puede compilar, si los cálculos son correctos y si se ha mejorado el rendimiento, todo se puede determinar mediante la ejecución real.
Por lo tanto, el agente puede formar un ciclo completo:
Escribir código → Compilar → Ejecutar → Probar la corrección y el rendimiento → Modificar según los comentarios
Sin embargo, Infinity se enfoca principalmente en la primera capa de CUDA: generar y optimizar kernels de inferencia para diferentes chips, y construir capacidades de software subyacente alrededor de estos kernels.
Está desarrollando una biblioteca de inferencia universal para múltiples chips, pero esto no equivale a haber replicado en 10 horas el ecosistema completo acumulado por CUDA durante casi 20 años.
Pero…
¡Pero!
En realidad, no necesitas copiar un CUDA para obtener una financiación de 15 millones de dólares.

The company's current valuation has also reached $100 million.
No sé si representa una amenaza para NVIDIA, pero el capital ciertamente está comprando. (doge)
En el lado de razonamiento, ¡se inicia el segundo frente!
Si los agentes de IA son las armas para asaltar la ciudad, el mercado de razonamiento es la brecha en la muralla.
El cálculo de los grandes modelos se divide principalmente en dos etapas:
El entrenamiento implica crear un modelo y requiere miles de unidades de procesamiento gráfico trabajando juntas durante varios meses; la inferencia utiliza el modelo ya entrenado para responder preguntas y puede ejecutarse con un pequeño clúster o incluso con una sola unidad de procesamiento gráfico.
En el lado del entrenamiento, CUDA sigue siendo prácticamente irresoluble.
El entrenamiento a gran escala es extremadamente sensible al rendimiento, la estabilidad y la coordinación del clúster. La comunicación entre chips, la programación de la memoria gráfica y la recuperación tras errores de programa: cualquier pérdida de eficiencia, amplificada en miles o incluso decenas de miles de chips, se convierte en tiempo y costos reales.
Por lo tanto, las empresas suelen ser extremadamente conservadoras al elegir una plataforma de entrenamiento.
Otros chips, aunque sus parámetros teóricos sean buenos, si el software no es lo suficientemente maduro o el clúster no es lo suficientemente estable, los costos de hardware ahorrados probablemente se duplicarán en costos de desarrollo y prueba.
Pero en el lado de inferencia, las reglas del juego cambiaron.
Marshall Choy, director comercial de la empresa coreana de chips de IA Rebellions, considera:
En el lado de inferencia, CUDA ya no es el factor determinante. Será una competencia de software de código abierto.

¿Por qué todos los competidores están enfocándose en la inferencia?
Porque el entrenamiento se enfoca en el «rendimiento extremo», mientras que la inferencia se enfoca en el «costo por respuesta».
El entrenamiento requiere miles de aceleradores trabajando juntos, pero la inferencia puede distribuirse en clústeres pequeños e incluso en una sola tarjeta; no se puede cambiar el chip para el entrenamiento, pero sí se puede para la inferencia.
En cualquier caso, siempre que sea rápido y económico, los clientes estarán dispuestos a probarlo.
Más importante aún, el software de inferencia puede ejecutarse en varios chips. Si el marco de inferencia admite múltiples chips, los usuarios pueden cambiar entre diferentes hardware sin necesidad de reescribir el código—
El mayor efecto de bloqueo de CUDA ha quedado anulado.
Esto deja oportunidades para chips de inferencia dedicados.
No todas las tareas de inferencia requieren toda la capacidad de CUDA, desde el entrenamiento hasta la colaboración de clústeres. Chips rediseñados para modelos y escenarios específicos, siempre que puedan ejecutarse más rápido, más baratos o con menor consumo de energía, tienen la oportunidad de ganar parte del mercado de NVIDIA.
Por ejemplo, d-Matrix es una empresa de chips especializada en inferencia.

La empresa fue fundada en 2019 y se especializa en chips de inferencia de IA generativa.
El cofundador y CEO Sid Sheth recordó que desde muy temprano evaluaron que la oportunidad generada por la inferencia de IA eventualmente superaría a la capacitación.
El software similar a CUDA desarrollado por Infinity con un AI Agent en 10 horas está diseñado para los chips de inferencia de d-Matrix.
Entonces, la historia completa del "evento de 10 horas" se conecta:
Nueva chip busca entrar en el mercado de inferencia, pero le falta software maduro; el AI Agent genera y optimiza rápidamente los Kernel subyacentes, reduciendo el tiempo de adaptación, que antes podía llevar meses o incluso años, a horas o días.
Sid también dijo abiertamente:
Aunque NVIDIA mantiene la dominancia en el entrenamiento, su ventaja competitiva en la inferencia se ha debilitado.

No solo d-Matrix está observando este hueco.
Rebellions y d-Matrix enfocados en razonamiento, Cerebras apuesta por chips a nivel de oblea, Inferentia de Amazon, TPU de Google, MI300X de AMD…
Varias empresas de chips y gigantes de la nube ya han posicionado sus fuerzas en el mercado de inferencia, listas para arrebatarle una parte del pastel a NVIDIA.
Para estas empresas, no necesitan reemplazar a NVIDIA de inmediato.
Solo necesitan demostrar que, en ciertas tareas de razonamiento, se puede lograr un rendimiento más rápido o más económico sin depender del conjunto completo de hardware y el ecosistema CUDA de NVIDIA.
That's enough.
¿Ha sido o no ha sido颠覆 la ventaja competitiva de NVIDIA?
La respuesta podría ser... todavía falta mucho.
Como ya se mencionó, las 10 horas de reescritura corresponden al «código de adaptación de un chip», pero el ecosistema CUDA cuenta con 20 años de acumulación de bibliotecas, herramientas de depuración, comunidad y millones de desarrolladores.
This is not something that can be easily overturned.
Más importante aún, que el código se pueda generar no significa que se pueda usar.
Bing Xu, fundador de INT21, dejó recientemente NVIDIA en abril de este año, tras la adquisición de su anterior empresa de software de chips de IA, HippoML, por parte de NVIDIA.

Su juicio es: el agente puede generar una gran cantidad de código en poco tiempo, pero la verificación es el cuello de botella más grande.
Generar diez mil líneas de código con IA es rápido, pero «demostrar que esas diez mil líneas calculan correctamente y funcionan de manera estable en todos los casos límite» es extremadamente lento.
El activo más profundo de CUDA es precisamente su cadena de herramientas de validación—por lo que él cree que, en la era de los Agentes, el ecosistema de validación se convertirá en la siguiente barrera protectora de CUDA.
Chris Lattner, cofundador y CEO de Modular, también les echó un balde de agua fría.

He believes the improvements brought by coding agents are incremental, and "the hype has been greatly exaggerated."
Hay tres razones: primero, escribir código es solo una pequeña parte de la ingeniería de software; la optimización para producción es la que determina el rendimiento del chip y decide directamente el costo de ejecutar IA;
En segundo lugar, el software de chips es un campo nicho y de élite, con mucho menos código abierto que el desarrollo de aplicaciones; por lo tanto, los datos de entrenamiento disponibles para IA en este ámbito son inherentemente limitados;
Tercero, el costo de migrar millones de líneas de código existente aún persiste; esto no es un problema técnico, sino una decisión organizacional.
Un detalle fácil de pasar por alto es que NVIDIA también está utilizando IA.
El vicepresidente del ecosistema de desarrolladores de NVIDIA, Ankit Patel, dijo:
También estamos utilizando AI Agent para desarrollar CUDA más rápidamente y validarla a mayor escala.
Con tu propia lanza, atacas su escudo; la ventaja relativa del atacante también se reduce.
Bing Xu resume: el resultado de esta batalla depende de si los competidores pueden alcanzar a NVIDIA más rápido de lo que NVIDIA puede iterar sobre sí misma.
Pero es evidente que el mayor fabricante global de chips «no está durmiendo ni permaneciendo estancado».
En general, a corto plazo, la ventaja competitiva de NVIDIA permanece intacta, pero los cambios ocurrirán primero silenciosamente en el lado de inferencia.
La verdadera incertidumbre a largo plazo es que el foso competitivo está pasando de "el stock de código" a "un ecosistema de validación y optimización".
Quien primero ocupe la nueva posición será el próximo ganador.
Enlace de referencia: [1] https://www.businessinsider.com/nvidia-cuda-new-threats-ai-coding-agents-2026-8
Este artículo proviene del canal de WeChat "Quantum Bit", autor: Ting Yu
