Anthropic's Opus 5 crea un mundo 3D de 'El Señor de los Anillos' usando IA

icon MarsBit
Compartir
AI summary iconResumen
Las noticias de IA + cripto se volvieron virales cuando Opus 5 de Anthropic creó una versión 3D del mundo de *El Señor de los Anillos* utilizando Three.js. El proyecto, liderado por el investigador de IA Karpathy, utilizó 1 millón de tokens, 2 horas y 5,500 líneas de código. El modelo renderizó la apertura de la novela en una escena 3D basada en navegador, aunque el resultado fue tosco y abstracto. Las noticias sobre activos del mundo real (RWA) están ganando impulso a medida que los experimentos de IA amplían los límites en entornos digitales.

Sin más preámbulos, ¡comencemos con el Daily Sit (doge)!

Just now, the master Kaphasi announced, "We" at Anthropic have begun training large models in an entirely new way—

El Señor de los Anillos.

Evaluación de modelos grandes

Según Capassi, este "referencial de El Señor de los Anillos" está reemplazando la antigua prueba SVG de "La Pelícano en Bicicleta".

Evaluación de modelos grandes

Específicamente, Kappaci le entregó directamente la apertura de El Señor de los Anillos a Opus 5, para que el modelo generara en tiempo real todo el “Mundo Medio” con Three.js.

En cuanto al efecto final, es un poco como las series de animación 3D chinas de finales de los años 90 y principios del siglo XXI: muy burda y muy abstracta.

Pero, objetivamente, si miras con atención durante un momento y además estás familiarizado con la localización de La Tierra Media en Nueva Zelanda, Hobbiton, realmente puedes percibir cierto parecido~

Sin embargo, esta cosa que parece poco pulida costó realmente a Opus 5: 1 millón de tokens, 2 horas y 5500 líneas de código.

Of course, Claude is not the only one shining on stage.

Lo más divertido es aún la nueva sopa que los internautas han servido DeepSeek Versión V4 Flash.

Directamente todo el mundo "los chinos pueden volar", los personajes en la escena flotan todos.

Facing these currently obvious inconsistencies, Capasi was also fairly reasonable.

Él señaló que Opus 5 aún no puede "entrar" realmente en su mundo generado, sino que solo puede tomar capturas de pantalla en diferentes momentos y luego revisar lentamente dónde está el problema.

Y esto justo expone una deficiencia clara de los modelos grandes actuales:

Ya pueden escribir código, crear escenarios y generar juegos, pero aún no pueden comprender realmente los videos ni jugar ellos mismos los juegos que han creado.

Dos horas, construyendo una Tierra Media desde cero

Primero veamos cómo se realiza esta prueba de "El Señor de los Anillos".

Si se toma literalmente el tweet de KappaSi, la indicación principal ingresada para Opus 5 debería ser el comienzo del primer capítulo de El Señor de los Anillos, "La fiesta esperada".

Evaluación de modelos grandes

Bilbo Baggins de Bolsón anunció que organizará una gran fiesta de cumpleaños por sus 111 años, y al instante se llenó de charlas en la Comarca…

Friends who are interested can try it themselves.

In addition, Kappaci specified Three.js, a JavaScript library for building 3D scenes with code.

Por lo tanto, la tarea que debe completar Opus 5 es primero comprender el texto inicial de El Señor de los Anillos y luego traducirlo en un mundo 3D que pueda ejecutarse en tiempo real en un navegador.

Evaluación de modelos grandes

Durante todo el proceso, Opus 5 debe usar polígonos para crear personajes, edificios y accesorios, colocarlos uno por uno en el sistema de coordenadas x, y, z, y luego configurar las cámaras, luces y animaciones.

Cuándo se mueven los personajes, hacia dónde gira la cámara, cómo cambian las luces y cómo deben interactuar los objetos en la escena, todo debe definirse mediante código en el modelo.

Aunque la escena final no puede considerarse refinada y a menudo presenta problemas de penetración y flotación, como el cuerpo y la cabeza de los personajes separados... al menos el escenario completo se construyó realmente.

Evaluación de modelos grandes

Tenga en cuenta que esto no es lo mismo que un modelo de video que genera píxeles cuadro por cuadro.

Three.js primero debe crear personajes, objetos y escenas como objetos tridimensionales, y luego calcular en tiempo real sus posiciones, ángulos y estados de movimiento según el código.

Entonces, lo que vimos en la demo no es un video generado por IA común, sino una grabación de pantalla de un escenario web 3D en tiempo real.

Sin embargo, Kappaci también mencionó en los comentarios que la generación programática 3D y de video no son mutuamente excluyentes.

Un usuario sugirió que se pueda entregar esta grabación cruda de Three.js a Seedance como video de referencia, y luego que el modelo de video lo vuelva a renderizar con una calidad superior.

Evaluación de modelos grandes

Kapasi quickly agreed.

Según su idea, el código programático podría encargarse de los planos y el control, estableciendo primero la estructura básica: dónde se ubican los personajes, cómo se mueve la cámara y cómo avanza la trama.

Luego, envíe la grabación de pantalla al modelo Video-to-Video para que complete las texturas, la iluminación y los detalles, maximizando el atractivo visual de todo el mundo de la Tierra Media.

En cuanto al audio, Opus 5 no lo incluyó esta vez.

Kapasi dijo que, por sus requisitos personales de calidad de sonido, finalmente utilizó ElevenLabs.

Evaluación de modelos grandes

Entonces, ese demo de El Señor de los Anillos, con imágenes, planos y narración en off, surgió de la nada.

Kapasi también ha abierto el código completo del proyecto; el enlace específico se puede encontrar al final del artículo.

Evaluación de modelos grandes

Los usuarios son mucho más interesantes que Kapasi

Just after KAPASI released the demo, many netizens also came to test it.

En general, solo se puede decir:

Los internautas de esta generación tienen mucho más imaginación que Kappa.

Alguien ha iniciado un proyecto llamado «Earth Online» con Claude, con el objetivo de utilizar un grupo de agentes de IA para mapear toda la Tierra Punto punto Construido.

Actualmente, el agente aún no ha construido todo el planeta, solo ha creado un distrito costero de San Francisco en estilo low-poly. Sin embargo, según las imágenes actuales, la proporción de los edificios, la escala de las personas y el estilo general se mantienen bastante coherentes.

Este efecto es un poco como ese dibujo animado del mundo de Lego. El estilo artístico no es complejo, pero los personajes, escenarios y acciones funcionan de manera estable dentro del mismo mundo.

Sigue en esta dirección con animaciones de estilo sencillo y juegos ligeros; ya se está viendo un poco de la esencia nativa de IA.

Otros usuarios crearon un modelo 3D digital de la ciudad de Nueva York utilizando Fable 5 y GPT-5.6 Sol, e integraron datos en tiempo real.

El modelo no solo debe colocar correctamente las calles y edificios de Nueva York, sino también mantener las relaciones espaciales entre diferentes áreas. Por lo tanto, el autor propone que esta tarea de generar mundos virtuales podría convertirse en un nuevo benchmark de razonamiento espacial.

Lo más exagerado aún está por venir.

Algunos usuarios no lograron comprar entradas para el concierto de Kanye West, así que usaron IA en su navegador para organizarse un concierto propio.

El proyecto completo sigue construyéndose con Three.js. Solo hay un archivo HTML, sin utilizar ningún modelo 3D existente; el escenario, los personajes y las luces se generan completamente mediante código.

Se prepararon un total de 14 canciones para el concierto, cada una con un diseño de iluminación independiente y una visual de escenario esférico exclusiva.

Los usuarios normales pueden escuchar fragmentos; después de conectar Spotify Premium, también pueden reproducir canciones completas y actuaciones completas.

No conseguí entradas, así que me generé directamente una reserva exclusiva, qué pérdida tan grande!

¡Aún no ha terminado!!!

Kapasi también imaginó en el final del post original que, en el futuro, se podrían añadir mecánicas de juego a estos mundos 3D, permitiendo a los jugadores entrar en ellos como espectadores, NPCs o incluso personajes de la historia.

El resultado de la versión del juego ya lo hicieron los internautas antes de que Kappa X lo organizara.

Evaluación de modelos grandes

Este proyecto también utiliza Opus 5 y Three.js, no solo permite ejecutar e interactuar, sino que también incluye audio.

También surgen cada vez más casos de diseño 3D. Desde la escala arquitectónica, la distribución espacial hasta el estilo de escena, Opus 5 ya puede mantener una consistencia relativamente estable en proyectos de considerable tamaño.

Hay muchos otros ejemplos similares, por lo que no se mostrarán aquí uno por uno.

Objetivamente, estas obras aún están lejos de ser juegos verdaderamente maduros.

Aún no hay respuestas sobre si las mecánicas apabullantes son divertidas, si funcionan de manera estable durante largos periodos o si los jugadores realmente estarán dispuestos a permanecer dentro durante 15 minutos.

Pero la barrera para crear contenido 3D en tiempo real y prototipos jugables se ha reducido significativamente.

¿Y qué mejor que tener un nuevo método para probar la capacidad del modelo, al mismo tiempo que es lo suficientemente interesante y divertido?

Pelicans, ya llegaste hasta el final

Entonces, ¿por qué de repente se necesita que un modelo grande genere El Señor de los Anillos?

Todo esto se remonta a la prueba de "el pelícano andando en bicicleta" que se volvió viral hace unos años.

Esta pregunta proviene originalmente del desarrollador Simon Willison y requiere solo una oración:

Generate an SVG image of a pelican riding a bicycle.

Evaluación de modelos grandes

Aunque esta pregunta parece sencilla, en realidad prueba bastante al modelo.

Porque el SVG parece una imagen, pero en realidad es una cadena de código.

El modelo no solo debe saber cómo se ven el pelícano y la bicicleta, sino también descomponerlos en líneas, círculos y polígonos, y luego organizar las posiciones relativas de cada componente mediante coordenadas.

Evaluación de modelos grandes

Más importante aún, el pelícano y la bicicleta en sí mismos no son muy compatibles.

El marco, las llantas y los pedales de la bicicleta deben mantener una geometría correcta; el pelícano, en cambio, tiene un pico grande, patas cortas y una constitución que de ninguna manera parece adecuada para pedalear.

Evaluación de modelos grandes

Al combinar ambos, es casi evidente de inmediato si el modelo comprende o no las relaciones espaciales:

Si la rueda está torcida, si los pies están sobre los pedales, o si el pájaro está montando la bicicleta o ha sido desmembrado por el marco.

Echa un vistazo a estos demos de finales de 2024 :)

Por eso, "el pelícano anda en bicicleta" se convirtió en una prueba clásica para evaluar la comprensión espacial, la combinación de objetos y la generación de código de los modelos grandes.

Evaluación de modelos grandes

Pero a medida que los modelos se vuelven más potentes, esta pelícano también está a punto de terminar su recorrido.

Mira abajo DeepSeek R1 y DeepSeek From the performance of V4, it's clear that today's models can now solve this problem quite well.

Evaluación de modelos grandes

Más importante aún, un solo SVG solo evalúa la salida única del modelo.

No puede medir si el modelo puede planificar un proyecto complejo, trabajar continuamente durante varias horas y revisar y corregir repetidamente sus propios errores en miles de líneas de código.

Entonces, Kappasi cambió un pequeño ejercicio de "dibujar un gráfico" por un gran proyecto de "construir un mundo".

The Pelicans can get off; Middle-earth has officially taken over.

Evaluación de modelos grandes

The Pelican of Kappasi

Pronto, la noticia de que Kapsi preparaba cambiar las preguntas de "Pelican Test" también llegó a las principales comunidades.

Los comentarios más votados en Hacker News consideran que, aunque la calidad visual de estos demos es bastante básica, esto justamente demuestra que necesitamos una nueva prueba más difícil que generar una sola imagen.

El nuevo estándar no debería solo evaluar si el modelo puede dibujar correctamente, sino también si puede comprender un mundo.

Evaluación de modelos grandes

After all, "Pelican on a Bike" has been used for too long.

Los modelos continúan superando récords en este tipo de tareas, y las diferencias entre ellos se vuelven cada vez más difíciles de discernir.

En comparación, generar un mundo 3D completo requiere que el modelo comprenda las relaciones espaciales entre personajes y objetos, y maneje cámaras, movimientos y cambios de escena, en lugar de simplemente invocar un modelo de generación de video para producir una secuencia de imágenes.

Evaluación de modelos grandes

Of course, some people have also raised objections.

The pelican test is sufficiently simple, low-cost, and results are easy to compare.

Para probar un modelo, consumir tantos tokens para generar todo un mundo 3D es como usar la capacidad de cómputo para hacer fuegos artificiales.

Evaluación de modelos grandes

Al mismo tiempo, se ha cuestionado si Three.js en sí mismo puede medir la capacidad integral de los modelos grandes.

Algunos creen que este tipo de demostraciones solo pueden probar que Anthropic ha entrenado bien al modelo en el código de Three.js, pero no que el modelo realmente comprenda el espacio y el mundo físico.

Pero pronto hubo usuarios que lo refutaron:

Convertir un texto literario abstracto y de significado vago en una animación 3D requiere que el modelo maneje simultáneamente relaciones espaciales, leyes físicas, objetos cotidianos, así como problemas matemáticos relacionados con transformaciones 3D y gráficos por computadora.

Si esto aún se considera solo “saber escribir Three.js”, entonces se subestima un poco este código de 5500 líneas.

Evaluación de modelos grandes

También hubo usuarios que plantearon una pregunta más abierta:

¿Es realmente diferente el llamado "razonamiento espacial" del razonamiento que los grandes modelos suelen utilizar al procesar texto y código?

Una perspectiva sostiene que la validez de la imagen depende de si el modelo comprende relaciones espaciales como "anterior/posterior, interior/exterior, cercano/lejano, obstrucción", así como la distancia, el ángulo y el tamaño relativo de los objetos desde diferentes perspectivas.

Evaluación de modelos grandes

Pero otra perspectiva sostiene que, ya sea que el modelo maneje "al lado de la piedra" o "dentro del array", lo que probablemente está haciendo es lo mismo: generar tokens uno por uno según el contexto, y durante este proceso realizar el razonamiento.

Si es así, entonces lo que Opus 5 muestra no es solo una "capacidad espacial" que surge de la nada.

Es más probable que la capacidad de razonamiento general de los modelos de lenguaje grande, originalmente diseñada para comprender texto y código, ya haya comenzado a extenderse naturalmente al mundo tridimensional.

De dibujar una pelícano a construir un mundo de la Tierra Media, el tema parece haber cambiado, pero quizás siempre se esté probando la misma pregunta:

¿Puede el modelo convertir su comprensión del mundo en una estructura realmente funcional?

Y al final, tal vez haya un problema aún más absurdo—

Si los modelos generales ya pueden escribir código por sí mismos para construir mundos 3D y llamar a APIs como Seedance y ElevenLabs para generar imágenes y sonido, ¿cuánta necesidad tiene aún el usuario de abrir manualmente un producto especializado de generación de video para ingresar un prompt?

Enlace de referencia

[1]https://karpathy.ai/lotr-movie/

[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/

[3] https://x.com/wizardbrainz/status/2083012159341203708

[4]https://x.com/aniketjart/status/2083645765097033845

[5]https://x.com/davidfromkansas/status/2075691129899528254

[6]https://x.com/MindaugasLT/status/2083488027343470939

Este artículo proviene del canal de WeChat "Quantum Bit", autor: henry

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.