Andrej Karpathy usa Claude Opus 5 para generar un mundo 3D de 'El Señor de los Anillos' por $10

iconMetaEra
Compartir
AI summary iconResumen
Andrej Karpathy utilizó Claude Opus 5 para construir una versión 3D de la apertura de *El Señor de los Anillos* con Three.js, gastando $10 en 100.000 tokens. Durante dos horas, el modelo generó 5.500 líneas de código, resultando en un video animado de 93 segundos. La escena, aunque rudimentaria, demostró la capacidad del modelo para generar contenido 3D a partir de texto. ElevenLabs se encargó del audio, y no se lanzó ninguna versión jugable ni código fuente. Este experimento refleja una reducción en los costos de software visual personalizado, aunque la automejora sigue siendo un desafío. Los activos con riesgo pueden beneficiarse de tales avances, ya que las preocupaciones de la CFT disminuyen con el aumento de la eficiencia.
El 2 de agosto de 2026, Andrej Karpathy compartió en X: le entregó el primer párrafo de El Señor de los Anillos a Claude Opus 5, con un presupuesto de aproximadamente 1 millón de tokens, unos 10 dólares, para que lo renderizara en un mundo 3D con Three.js.

Autor del artículo, fuente: 0x9999in1, ME News



TL;DR

  • El 2 de agosto de 2026, Andrej Karpathy compartió en X: le entregó el primer párrafo de El Señor de los Anillos a Claude Opus 5, con un presupuesto de aproximadamente 1 millón de tokens, unos 10 dólares, para que lo renderizara en un mundo 3D con Three.js.
  • Opus 5 funcionó durante aproximadamente 2 horas, escribió alrededor de 5500 líneas de código y generó un video animado de 93 segundos. La imagen es burda, pero logró convertir el texto en una escena tridimensional animada.
  • Lo importante no es que "la IA gastó 10 dólares para crear un juego terminado"—no lo hizo. Solo se publicó un video, sin código fuente abierto ni versión jugable.
  • La voz no fue generada por el modelo. Karpathy dijo que la narración la creó manualmente con ElevenLabs porque le importa qué voz se utiliza.
  • La señal real es: el "costo de generación" del software visual personalizado está disminuyendo más rápido que la capacidad de la IA para "revisar y experimentar su propio trabajo".
  • Opus 5 no puede ver videos de forma nativa ni probar juegos, solo puede tomar capturas de pantalla lentamente en diferentes nodos, y durante el proceso se produjeron múltiples errores.
  • Lo que Karpathy dijo sobre "GTA que aparece bajo demanda" es una dirección, no la realidad actual. Hoy en día, esto se acerca más a una caja de perspectiva estéreo generada automáticamente en un navegador.

Un texto, dos horas, 5500 líneas de código

Primero, aclaremos las cosas.

El 2 de agosto de 2026, Andrej Karpathy publicó una entrada. Realizó un experimento: tomó el primer párrafo de El Señor de los Anillos y lo entregó a Claude Opus 5. Le asignó un presupuesto de 1 millón de tokens, estimando que costaría aproximadamente 10 dólares. La única instrucción fue: renderízalo con Three.js.

¿Y luego?

El modelo se ejecutó durante aproximadamente dos horas, generando alrededor de 5500 líneas de código, y finalmente produjo un video de 93 segundos que atraviesa un mundo de Tierra Media estilizado y animado.

¿Cómo evalúa Karpathy esto? Dos palabras: janky but fun. Rústico, pero divertido.

Eso es muy honesto. Para lograr esto, el modelo tiene que hacer un montón de tareas sucias y agotadoras: colocar múltiples elementos poligonales en coordenadas tridimensionales (x, y, z), organizar su posición, escribir código para hacer que toda la escena se mueva, y asegurarse de que todo funcione sin colapsar.

Un ensayo, sin planos, sin biblioteca de activos, sin instrucciones claras. Personajes, entorno, secuencia, atmósfera, encuadre, ritmo: todo depende de que el modelo lo imagine por sí mismo. Y de alguna manera, realmente lo logró.

Este es el punto que te deja sorprendido.

Pero primero mantén la calma: qué se ha hecho y qué no

Antes de emocionarte, debes aclarar tres cosas: qué es lo que realmente hizo el modelo, qué añadió la persona y qué no sucedió en absoluto.

Lo que el modelo generó son esas 5500 líneas de código, el escenario de Three.js generado programáticamente y la animación que dura 93 segundos. Esta parte es real, creíble y merece ser observada con atención.

¿Y el audio? Karpathy aclaró específicamente en su respuesta: la voz en off la hizo él mismo manualmente con ElevenLabs. Dijo que los LLM podrían llamar a una API para hacerlo automáticamente, pero le importa qué voz se usa, así que lo hizo él mismo. Por lo tanto, esto no es una línea de producción completamente automática de "texto a video final". No lo presenten así.

¿Qué no sucedió?

No hay ningún repositorio descargable. No hay ningún repositorio de código abierto. No hay ninguna versión jugable en la que puedas entrar como espectador, como NPC o como protagonista. No hay capacidad para generar mundos nuevos en tiempo real mientras juegas. No existe un "modelo de mundo" general y aprendido. Tampoco hay colisiones, interacciones o coherencia narrativa de producción. Incluso no se ha publicado una lista de consumo y costos de tokens reproducible.

Público, es un video.

Entonces, esa frase repetidamente citada, "un GTA efímero de X bajo demanda", es la dirección que emociona a Karpathy, no lo que tiene en sus manos actualmente. Este producto final, hoy, se parece más a una caja de perspectiva estereoscópica generada automáticamente, muy lejos de ser un juego de mundo abierto.

¿Por qué tengo que gastar tantas palabras explicando "lo que no hizo"?

Porque la mayor distorsión en la difusión de esta demostración de Opus 5 ocurrió en este nivel. Algunos vieron "10 dólares para crear un juego de El Señor de los Anillos" y lo compartieron, pero no vieron las pequeñas letras que decían "video, no finalizado, audio人工, sin código". Las opiniones deben basarse en hechos, y primero hay que delimitar claramente los límites de los hechos.

Why is this more worth serious attention than "a pelican riding a bicycle"?

La verdadera importancia del experimento de Karpathy no está en "mostrar habilidades", sino en "cambiar de regla".

Antes, ¿cómo se evaluaba la capacidad de codificación visual de los grandes modelos? Se les pedía que dibujaran un SVG de un "pelícano montando una bicicleta". Esta prueba era útil: revelaba el razonamiento espacial, el cumplimiento de instrucciones y la comprensión de gráficos de navegador. Pero era demasiado fácil "memorizar la respuesta" y demasiado fácil sacar conclusiones basándose en una sola imagen.

La misión de El Señor de los Anillos amplió considerablemente los criterios de evaluación.

Dimensión temporal: de minutos a aproximadamente dos horas. Escala del código: de decenas o cientos de líneas a aproximadamente 5500 líneas. Ambigüedad: de "un objeto más composición" a manejar simultáneamente "personajes, entorno, secuencia temporal, atmósfera, encuadre y ritmo". Estado: de estático básico a eventos animados que evolucionan con el tiempo. Recursos: de unas pocas formas a una gran cantidad de objetos programáticos reutilizables.

Lo más crítico es la verificación de dimensiones. Dibuja un SVG, y con un solo fotograma sabrás si está bien. Renderiza un mundo animado, y debes revisar innumerables instantes, innumerables transiciones: geometría, cámara, ocultamiento, movimiento, ritmo, rendimiento; cualquier detalle puede colapsar.

Este es el verdadero problema: de largo plazo, alta ambigüedad y fuerte estado. Se acerca a la propia esencia de "crear software", no a "dibujar un gráfico".

Por supuesto, también hay que decirlo objetivamente: esto no es una prueba de referencia estricta del modelo. Karpathy no ha publicado el prompt completo, la configuración de la cadena de herramientas, el número de reintentos, la trayectoria de tokens, el código fuente ni los criterios de evaluación. Es un experimento público informativo, no una comparación horizontal controlada. No lo utilices para clasificar.

Lo barato es la "generación", lo caro sigue siendo la "vista"

¿Cuál es la verdadera perspectiva de este asunto?

Creo que simplemente esto: el costo de generar software visual personalizado está disminuyendo más rápido que la capacidad de la IA para revisar y experimentar sus propias creaciones.

Esta frase hay que explicarla por partes.

Este tipo de contenido altamente personalizado — convertir un fragmento específico de texto en una escena 3D exclusiva — antes casi nadie estaba dispuesto a hacerlo específicamente. ¿Por qué? El costo y el tiempo no eran rentables. ¿Cuánto dinero y cuántos días te costaría contratar un equipo para convertir la apertura de El Señor de los Anillos en una animación de 93 segundos?

Pero el LLM puede seguir haciendo esto sin parar. No se cansa, no se queja, y cuesta 10 dólares por dos horas. El mundo personalizado pasó de ser un "lujo" a convertirse en algo que se genera al instante. Esto representa una caída real y masiva en la oferta.

Pero el problema está en el otro extremo.

Opus 5 puede crear el mundo, pero no puede ver claramente el mundo que creó. No puede ver videos de forma eficiente y nativa, ni probar juegos dentro de ellos. Solo puede tomar capturas de pantalla lentamente en diferentes nodos y revisarlas una por una. Es como un pintor que pinta con los ojos vendados y solo le permiten abrirlos brevemente para echar un vistazo al lienzo cada pocos minutos. Durante el proceso se cometieron muchos errores, dejando muchas áreas ásperas y defectuosas: de ahí viene lo "janky".

La generación es un chorro, la verificación es un goteo.

Esta es la comparación más aguda del post de Karpathy: ya puede crear un mundo, pero aún no puede revisar y experimentar fluidamente el mundo que ha creado.

Los ojos se han convertido en el nuevo cuello de botella.

Este no es un caso aislado: toda una temporada de "juegos creados en una oración"

Alguien podría preguntar: ¿Será esto solo una actuación de buena suerte?

No parece así. Al ampliar la línea de tiempo, a partir de julio de 2026, surgieron una serie completa de demos similares en torno a Opus 5, que se volvieron populares durante todo el verano.

Alguien creó un juego de estrategia en tiempo real con estilo Homeworld y publicó la lista de costos: $632.65. Alguien más hizo un clon con estilo Rocket League, y este es más realista: el código es accesible, la versión es jugable y tiene mayor reproducibilidad. También hay FPS en el navegador, exploración desértica generada proceduralmente, juegos de terror, carreras de karts...

¿Has notado el patrón?

La calidad de estas demostraciones varía mucho, y su reproducibilidad difiere enormemente. Algunas solo tienen videos sin código, mientras que otras incluso muestran sus facturas. Pero todas apuntan a la misma tendencia: usar un prompt en lenguaje natural para guiar a un modelo y que escriba de forma autónoma durante mucho tiempo miles de líneas de código, creando un mundo interactivo funcional. Esto pasó de ser "impensable" a "alguien lo prueba cada semana".

El "Señor de los Anillos" de Karpathy no es un milagro surgido de la nada. Es un punto en esta curva. Un punto que fue explicado con suficiente claridad por una persona influyente, con un texto lo suficientemente romántico.

Entonces, ¿ha llegado realmente la era de los juegos creados por IA?

Volver a la pregunta que más querías hacer.

¿Ya llegó?

Mi juicio es: la dirección ya está determinada, pero la era aún no ha llegado.

Se define la dirección porque la curva de costes del lado de la oferta ya ha invertido su tendencia y lo está haciendo rápidamente. Técnicamente, ya se ha completado el paso del 0 al 1 para generar contenido interactivo personalizado a largo plazo mediante IA. Lo que queda es pasar del 1 a algo utilizable, jugable y vendible.

Decir que la era no ha llegado es porque las tres barreras aún existen de manera real.

La primera es el bucle de percepción. El modelo debe ser capaz de ver, jugar y evaluar sus propias salidas de forma nativa, sin depender de personas que tomen capturas de pantalla, agreguen voz o limpien sus errores. Este es el aspecto más difícil de las capacidades multimodales: no se trata de "entender una imagen", sino de "entender un proceso dinámico que cambia con el tiempo y tiene interacción".

El segundo es la reproducibilidad y la entregabilidad. Un video no es un software. Una demostración no es un producto. Hay toda la labor engineering entre un fragmento impresionante de 93 segundos y algo que otra persona pueda descargar, ejecutar, modificar y jugar durante una hora.

La tercera es el peso de la palabra "tiempo real". Karpathy imagina que entras en un mundo generado temporalmente, como personaje, como espectador, como NPC: como un GTA que aparece bajo demanda. Pero ahora es ejecutar dos horas offline para obtener un video. Pasar de "dos horas para producir un video" a "generar en tiempo real el camino bajo tus pies" no es un cambio cuantitativo, es un cambio cualitativo.

Por eso no me gusta la frase "la era ha llegado". Es demasiado cargada.

Prefiero decirlo así: estamos dejando atrás la era de la "cigüeña en bicicleta" y entrando en una etapa de transición en la que los modelos pueden crear mundos toscos, pero aún no ven claramente lo que han creado.

¿Cuánto durará esta transición? Nadie lo sabe. Podrían ser dos años, o cinco. Depende de cuándo se complete ese "ojo": la percepción y la autorreflexión nativas de la IA.

Pero hay una cosa que estoy bastante seguro.

Cuando crear un mundo cuesta solo 10 dólares y dos horas, lo que se vuelve escaso ya no es "crear". Lo escaso es "ver con claridad lo que creaste" y "qué es exactamente lo que quieres crear". La máquina se encarga de "crear" en la segunda parte, pero "querer" y "ver con claridad" en la primera parte aún dependen temporalmente del ser humano.

La Tierra Media grosera ya puede funcionar.

En cuanto puedas realmente entrar: no te apresures, toma tu tiempo. Esto vale la pena esperar.

Citar fuente

  • La publicación y video originales de Andrej Karpathy en X (anteriormente Twitter) el 2 de agosto de 2026
  • Anthropic publica el anuncio oficial de Claude Opus 5, anthropic.com
  • Sitio oficial de Three.js, threejs.org
  • explainx.ai: «El opus de $10 de Karpathy: El mundo de El Señor de los Anillos: La nueva evaluación de IA», 2 de agosto de 2026
  • Benzinga: «Andrej Karpathy dice que la IA ha avanzado más allá de los simples prompts tras Claude Opus construir un mundo 3D de 'El Señor de los Anillos'», agosto de 2026
  • Enterprise DNA: «El momento de referencia de próxima generación de Andrej Karpathy», 2 de agosto de 2026
  • explainx.ai: «Opus 5 construyó un RTS espacial al estilo Homeworld con un solo prompt — $632.65 después», 28 de julio de 2026
  • explainx.ai: "Top 10 Claude Opus 5 Game Prompts (With the Actual Prompts)", 29 de julio de 2026
Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.