Opus 5 d'Anthropic crée un monde 3D de « Seigneur des Anneaux » à l'aide de l'IA

icon MarsBit
Partager
AI summary iconRésumé
Les actualités sur l’IA et la crypto ont émergé lorsque Opus 5 d’Anthropic a créé une version 3D du monde de *Le Seigneur des Anneaux* en utilisant Three.js. Le projet, dirigé par le chercheur en IA Karpathy, a utilisé 1 million de jetons, 2 heures et 5 500 lignes de code. Le modèle a rendu l’ouverture du roman en une scène 3D basée sur navigateur, bien que le résultat soit resté grossier et abstrait. Les actualités sur les actifs du monde réel (RWA) gagnent en popularité à mesure que les expériences d’IA repoussent les limites dans les environnements numériques.

Pas de mots inutiles, commençons directement la séance quotidienne de flemme (doge) !

À l'instant même, le grand maître Kapsi a annoncé : « Nous », Anthropic, avons commencé à renforcer les grands modèles d'une toute nouvelle manière —

Le Seigneur des Anneaux.

Évaluation des grands modèles

Selon Kapasi, ce « benchmark Seigneur des Anneaux » remplace le précédent test SVG populaire « Cigne à vélo ».

Évaluation des grands modèles

Plus précisément, Kappasi a directement fourni le début du Seigneur des Anneaux à Opus 5, demandant au modèle de générer en temps réel un monde de la Terre du Milieu entier avec Three.js.

En ce qui concerne le résultat final, cela ressemble un peu aux dessins animés 3D chinois de la fin des années 1990 et du début des années 2000 : très grossier et très abstrait.

Mais objectivement, en regardant attentivement un moment, si vous êtes familier avec la région de Hobbiton en Nouvelle-Zélande, lieu de tournage du Seigneur des Anneaux, vous pourriez effectivement y déceler une certaine ressemblance ~

Cependant, cet objet qui semble peu raffiné a réellement coûté à Opus 5 : 1 million de tokens, 2 heures et 5 500 lignes de code.

Of course, Claude is not the only one shining on stage.

Le plus drôle, c’est encore le nouveau plat servi par les internautes DeepSeek Version V4 Flash.

Directement tout un « les Chinois peuvent voler », les personnages de la scène flottent tous.

Face à ces failles visibles à l'œil nu, Kappasi s'est également montré assez objectif.

Il a souligné qu'Opus 5 ne peut pas encore véritablement « entrer » dans son propre monde généré, mais doit uniquement capturer des captures d'écran à différents moments, puis examiner lentement où se trouvent les problèmes.

Et cela met justement en lumière un point faible évident des modèles actuels :

Ils savent déjà écrire du code, créer des scénarios et générer des jeux, mais ne comprennent pas encore véritablement les vidéos, ni ne jouent eux-mêmes aux jeux qu'ils ont créés.

Deux heures pour créer un Middle-earth à la main

Commençons par examiner comment ce test « Seigneur des Anneaux » est effectué.

Si l'on prend au pied de la lettre le tweet de Kappasity, le prompt principal fourni à Opus 5 devrait être le début du premier chapitre de The Lord of the Rings, « L'attente du banquet ».

Évaluation des grands modèles

Bilbo Baggins de la Comté annonce qu'il organisera une grande fête pour son 111e anniversaire, et Hobbiton est aussitôt en émoi...

Les personnes intéressées peuvent essayer elles-mêmes.

In addition, Kappaci specified Three.js, a JavaScript library for building 3D scenes with code.

Ainsi, la tâche d'Opus 5 consiste à d'abord comprendre le texte d'ouverture du Seigneur des Anneaux, puis à le traduire en un monde 3D exécutable en temps réel dans un navigateur.

Évaluation des grands modèles

Pendant tout le processus, Opus 5 doit assembler des personnages, des bâtiments et des accessoires à l’aide de polygones, les placer un par un dans un système de coordonnées x, y, z, puis configurer les caméras, les lumières et les animations.

Quand les personnages se déplacent, vers où la caméra se tourne, comment les lumières changent, et comment les objets dans la scène doivent interagir, tout cela doit être défini par le modèle à l'aide de code.

Bien que la scène finale ne soit pas raffinée et que des problèmes tels que des intersections ou des éléments flottants apparaissent fréquemment — par exemple, le corps et la tête des personnages sont séparés — l'ensemble du décor a au moins été réellement construit.

Évaluation des grands modèles

Il est important de noter que cela n’est pas pareil à la génération directe de pixels frame par frame par un modèle vidéo.

Three.js doit d'abord créer les personnages, objets et scènes en tant qu'objets tridimensionnels, puis calculer en temps réel leur position, leur angle et leur état de mouvement selon le code.

Ainsi, la démonstration que nous avons vue n'est pas une vidéo générée par IA ordinaire, mais un enregistrement d'écran d'une scène web 3D en temps réel.

Cependant, Kapasi a également mentionné dans les commentaires que la génération 3D et vidéo automatisée ne s'exclut pas mutuellement.

Un internaute a suggéré de transmettre cette capture d'écran brute de Three.js à Seedance en tant que vidéo de référence, puis de faire re-render la vidéo par un modèle avec une qualité supérieure.

Évaluation des grands modèles

Kapasi a rapidement exprimé son accord.

Selon sa vision, le code automatisé pourrait gérer les plans et le contrôle, en établissant d'abord les éléments de base : où les personnages se tiennent, comment la caméra se déplace et comment l'intrigue progresse.

Ensuite, envoyez l'enregistrement d'écran au modèle Video-to-Video pour qu'il ajoute les textures, les lumières et les détails, et mette en valeur l'ensemble du monde de la Terre du Milieu.

Concernant l'audio, Opus 5 n'a pas cette fois-ci tout inclus.

Kapasi a déclaré qu'en raison de ses exigences personnelles en matière de qualité sonore, il a finalement choisi ElevenLabs.

Évaluation des grands modèles

Ainsi, le démo de « Seigneur des Anneaux » avec des images, des plans et un commentaire vocal est apparu soudainement.

Kapasi a également open-sourcé l'ensemble du projet ; le lien exact est disponible en bas du texte.

Évaluation des grands modèles

Les internautes sont bien plus intéressants que Kapasi.

Juste après la sortie de la démo de Kapsi, de nombreux internautes sont venus la tester.

En regardant dans l'ensemble, on ne peut dire que :

Les internautes d'aujourd'hui ont bien plus d'imagination que Kappa.

Quelqu'un a lancé un projet « Earth Online » avec Claude, visant à utiliser un groupe d'agents IA pour cartographier l'ensemble de la Terre Clic Construit.

Actuellement, l'agent n'a pas encore créé toute la Terre, mais seulement un quartier portuaire de San Francisco au style bas-polygone. Toutefois, les proportions des bâtiments, l'échelle des personnages et le style global restent très cohérents.

Cela a un peu l'effet d'une série animée dans un univers Lego. Le style artistique n'est pas compliqué, mais les personnages, les décors et les mouvements fonctionnent de manière cohérente dans le même monde.

Continuez dans cette direction avec des animations au style simple et des jeux légers ; une forme naissante d’origine AI est déjà visible.

Des internautes ont également créé un modèle numérique 3D de New York en utilisant Fable 5 et GPT-5.6 Sol, auquel ils ont intégré des données en temps réel.

Le modèle doit non seulement placer correctement les rues et les bâtiments de New York, mais aussi maintenir les relations spatiales entre les différents quartiers. L'auteur propose donc que cette tâche de génération d'un monde virtuel puisse devenir un nouveau benchmark de raisonnement spatial.

Les choses plus extravagantes arrivent encore.

Un internaute n'ayant pas pu acheter de billets pour le concert de Kanye West a simplement utilisé une IA pour se organiser un spectacle dans son navigateur.

L'ensemble du projet est toujours construit avec Three.js. Un seul fichier HTML est utilisé, sans aucune utilisation de modèles 3D préexistants ; la scène, les personnages et les lumières sont tous générés par le code.

Un total de 14 chansons ont été prévues pour le concert, chacune avec une conception lumineuse unique et une visualisation scénique sphérique dédiée.

Les utilisateurs classiques peuvent écouter des extraits ; après avoir connecté Spotify Premium, ils peuvent lire les morceaux complets et l'intégralité des concerts.

N’ayant pas réussi à obtenir de billets, se créer soi-même une réservation exclusive, c’est vraiment dommage !

Ce n'est pas fini !!!

Kapasi a également imaginé, en fin de message original, qu'il serait possible d'ajouter des mécaniques de jeu à ces mondes 3D, permettant aux joueurs d'y entrer en tant qu'observateurs, PNJ ou même personnages de l'histoire.

La version jeu a déjà été créée par les internautes avant que Kappa ne puisse l'organiser.

Évaluation des grands modèles

Ce projet utilise également Opus 5 et Three.js, permettant non seulement d'exécuter et d'interagir, mais aussi d'ajouter de l'audio.

D'autres cas d'utilisation de conception 3D apparaissent en continu. De la mise à l'échelle architecturale à la disposition spatiale en passant par le style de scène, Opus 5 parvient déjà à maintenir une cohérence relativement stable sur des projets de taille significative.

De nombreux autres exemples existent, mais nous ne les listons pas tous ici.

Objectivement, ces œuvres sont encore loin d’être des jeux véritablement matures.

Les mécaniques attrayantes sont-elles amusantes, le fonctionnement à long terme est-il stable, et les joueurs seront-ils vraiment disposés à y rester 15 minutes ? Pour l’instant, aucune réponse n’est disponible.

Mais le seuil de création de contenus 3D en temps réel et de prototypes jouables a effectivement été considérablement abaissé.

Et en plus, n’est-ce pas merveilleux d’avoir une nouvelle méthode pour tester les capacités du modèle, tout en étant suffisamment amusante et divertissante ?

Pelican, arrivé au bout

Alors, pourquoi soudainement demander à un grand modèle de générer Le Seigneur des Anneaux ?

Cela remonte à l'expérience « Pelican on a Bicycle » qui a fait fureur il y a quelques années.

Cette question provient à l'origine du développeur Simon Willison et ne doit comporter qu'une seule phrase :

Generate an SVG image of a pelican riding a bicycle.

Évaluation des grands modèles

Bien que cette question semble simple, elle teste réellement le modèle.

Parce que le SVG semble être une image, mais qu'en dessous il s'agit d'une chaîne de code.

Le modèle doit non seulement savoir à quoi ressemblent le pélican et le vélo, mais aussi les décomposer en lignes, cercles et polygones, puis positionner précisément chaque composant à l'aide de coordonnées.

Évaluation des grands modèles

Plus important encore, le pélican et le vélo ne vont pas bien ensemble.

Le cadre, les pneus et les pédales du vélo doivent conserver une géométrie correcte ; le pélican, lui, possède un grand bec, de courtes pattes et une silhouette qui ne ressemble en rien à celle d’un cycliste.

Évaluation des grands modèles

En combinant les deux, on peut voir presque immédiatement si le modèle a compris les relations spatiales :

La roue est-elle déformée, les pieds sont-ils bien sur les pédales, ou l’oiseau pilote-t-il le vélo, ou bien est-il démembré sur le cadre ?

Consultez ces démos de fin 2024 ci-dessus :)

C'est pourquoi « le pélican qui fait du vélo » est devenu un test classique pour évaluer, dans la communauté, la compréhension spatiale, la combinaison d'objets et la génération de code des grands modèles.

Évaluation des grands modèles

Mais à mesure que les modèles deviennent de plus en plus puissants, ce pélican va bientôt arriver à la fin de son parcours.

Voyez ci-dessous DeepSeek R1 et DeepSeek From V4's performance, it's clear that today's models can now solve this problem quite well.

Évaluation des grands modèles

Plus important encore, un seul SVG ne permet d'évaluer qu'une seule sortie du modèle.

Il ne peut pas mesurer si le modèle est capable de planifier un projet complexe, de travailler continuellement pendant plusieurs heures, et de vérifier et corriger répétitivement ses erreurs dans des milliers de lignes de code.

Ainsi, Kappasi a remplacé une petite question « dessine un schéma » par un grand projet « construire un monde » —

The Pelicans can get off; Middle-earth has officially taken over.

Évaluation des grands modèles

The Pelican of Kappasi

Bientôt, la nouvelle que Kapasi préparait de changer les questions du « test du pélican » s'est répandue dans toutes les communautés.

Les commentaires les plus upvotés sur Hacker News estiment que, bien que la qualité visuelle de ces démonstrations soit moyenne, cela montre précisément que nous avons besoin d'un nouveau test plus difficile qu'une simple génération d'images uniques.

Le nouveau critère ne devrait pas seulement évaluer si le modèle peut dessiner correctement, mais aussi s'il comprend le monde.

Évaluation des grands modèles

After all, "Pelican on a Bicycle" has been around too long.

Les modèles continuent de battre des records sur ce type de tâche, et les différences entre eux deviennent de plus en plus difficiles à distinguer.

En comparaison, générer un monde 3D complet nécessite que le modèle comprenne les relations spatiales entre les personnages et les objets, et gère les plans, les mouvements et les changements de scène, plutôt que de simplement appeler un modèle de génération vidéo pour produire une séquence d'images.

Évaluation des grands modèles

Of course, some people have also raised objections.

The pelican test is sufficiently concise, low-cost, and yields easily comparable results.

Pour tester un modèle, consommer autant de tokens pour générer un monde 3D entier, c’est un peu comme utiliser de la puissance de calcul pour des feux d’artifice.

Évaluation des grands modèles

En parallèle, la capacité de Three.js à évaluer les compétences globales des grands modèles a également été remise en question.

Certains pensent que ce type de démonstration ne prouve au mieux que l'entraînement d'Anthropic sur le code Three.js, sans démontrer que le modèle comprend réellement l'espace et le monde physique.

Mais很快就有网友反驳:

Convertir un texte littéraire abstrait et ambigu en animation 3D nécessite que le modèle gère simultanément les relations spatiales, les lois physiques, les objets du quotidien, ainsi que les problèmes mathématiques liés aux transformations 3D et à la graphisme informatique.

Si cela ne compte encore que comme « savoir écrire Three.js », cela sous-estime largement ces 5500 lignes de code.

Évaluation des grands modèles

Un autre internaute a posé une question plus ouverte :

La « raisonnement spatial » est-elle vraiment différente du raisonnement que les grands modèles utilisent habituellement pour traiter le texte et le code ?

Une opinion considère que la validité de l'image dépend de la capacité du modèle à comprendre les relations spatiales telles que « avant/arrière, intérieur/extérieur, proche/loin, occlusion », ainsi que la distance, l'angle et la taille relative des objets sous différents angles de vue.

Évaluation des grands modèles

Mais une autre perspective considère que, qu'il s'agisse de « à côté de la pierre » ou de « à l'intérieur du tableau », le modèle effectue probablement la même chose : générer des tokens un par un en fonction du contexte, tout en accomplissant le raisonnement au cours de ce processus.

Dans ce cas, ce que Opus 5 démontre n'est pas seulement une « capacité spatiale » apparue soudainement.

Il est plus probable que les capacités de raisonnement général des grands modèles linguistiques, initialement conçues pour comprendre le texte et le code, commencent à s'étendre naturellement au monde tridimensionnel.

Passer d'un dessin de pélican à la construction d'un monde de la Terre du Milieu, le sujet semble avoir changé, mais ce qui est peut-être testé en arrière-plan reste toujours la même question :

Un modèle peut-il transformer sa compréhension du monde en une structure réellement opérationnelle ?

Et enfin, il y a peut-être une question encore plus absurde —

Si un modèle généraliste peut déjà écrire du code pour créer un monde 3D et appeler des API telles que Seedance et ElevenLabs pour générer les images et les sons, combien de fois les utilisateurs ont-ils encore besoin d’ouvrir un produit dédié de génération vidéo pour saisir un prompt ?

Lien de référence

[1]https://karpathy.ai/lotr-movie/

[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/

[3] https://x.com/wizardbrainz/status/2083012159341203708

[4]https://x.com/aniketjart/status/2083645765097033845

[5]https://x.com/davidfromkansas/status/2075691129899528254

[6]https://x.com/MindaugasLT/status/2083488027343470939

Cet article provient du compte officiel WeChat « Quantum Bit », auteur : henry

Clause de non-responsabilité : les informations sur cette page peuvent avoir été obtenues auprès de tiers et ne reflètent pas nécessairement les points de vue ou opinions de KuCoin. Ce contenu est fourni à titre informatif uniquement, sans aucune représentation ou garantie d’aucune sorte, et ne doit pas être interprété comme un conseil en investissement. KuCoin ne sera pas responsable des erreurs ou omissions, ni des résultats résultant de l’utilisation de ces informations. Les investissements dans les actifs numériques peuvent être risqués. Veuillez évaluer soigneusement les risques d’un produit et votre tolérance au risque en fonction de votre propre situation financière. Pour plus d’informations, veuillez consulter nos conditions d’utilisation et divulgation des risques.