AnthropicのOpus 5がAIを使用して3Dの『指輪物語』ワールドを構築

icon MarsBit
共有
AI summary icon概要
AIと暗号通貨のニュースが、AnthropicのOpus 5がThree.jsを使用して『指輪物語』の世界を3D化したことで話題となった。このプロジェクトはAI研究者のKarpathyが主導し、100万トークン、2時間、5,500行のコードを用いて実現された。モデルは小説の冒頭をブラウザベースの3Dシーンにレンダリングしたが、結果は粗く抽象的だった。RWA(リアルワールドアセット)に関するニュースは、AIの実験がデジタル環境の境界を広げていることで注目を集めている。

それでは、さっそく毎日のダラダラ(doge)を始めましょう!

先ほど、大神カパシが「私たち」Anthropicが、大規模モデルに新たな方法で強化を開始したと発表しました——

『指輪物語』。

大規模モデル評価

カパシーによると、この「指輪王ベンチマーク」は、かつて広く流行した「ペリカンが自転車を漕ぐ」SVGテストに代わって採用されている。

大規模モデル評価

具体的には、カパシが『指輪物語』のオープニングをそのままOpus 5に渡し、モデルにThree.jsを使ってリアルタイムで「中つ国」全体を生成させた。

最終的な効果は、1990年代末から2000年代初頭の中国製3Dアニメーションのように、かなり粗く、また抽象的です。

しかし客観的に見ると、しばらくよく見てみると、ニュージーランドに位置する『ロード・オブ・ザ・リング』の撮影地であるホビットンに精通しているなら、確かにどこかその雰囲気が感じられるでしょう~

しかし、この見た目はそれほど洗練されていないものこそ、実際にはOpus 5に100万トークン、2時間、そして5500行のコードを費やさせました。

もちろん、ステージにはClaudeひとりだけが輝いているわけではありません。

最も笑えるのは、ネットユーザーが新たに持ち込んだ一皿だ DeepSeek V4 Flashバージョン。

「中国人は飛べる」とそのまま全体の人物が浮かんでいる。

これらの現在目で確認できる破綻に対して、カパシも非常に公正である。

彼は、Opus 5は現在、自ら生成した世界に真正に「入り込む」ことができず、異なる時間点で次々とスクリーンショットを撮影し、問題が発生している場所をゆっくりと確認するしかないことを指摘した。

これは現在の大規模モデルの明確な短所を露呈している。

それらはすでにコードを書いたり、シーンを構築したり、ゲームを生成したりできるが、動画を真正に理解することはできず、自分が作成したゲームを実際にプレイすることもできない。

2時間で中土を手作りする

まず、「指輪王」テストがどのように実施されたかを見てみましょう。

カパシのツイートの文字通りに考えると、今回のOpus 5への主要なプロンプトは、『指輪物語』の第1章『待ち望まれた宴会』の冒頭部分である。

大規模モデル評価

袋底洞のビルボ・バキンズが111歳の誕生日パーティーを開催すると発表し、ホビットン中で話題に……

興味のある方はご自身で試してみてください。

また、カパシーはプロンプト内で、コードで3Dシーンを構築するためのJavaScriptライブラリであるThree.jsを指定しました。

そのため、Opus 5が達成すべきタスクは、『指輪物語』の冒頭のテキストを理解し、それをブラウザでリアルタイムで実行可能な3Dワールドに変換することです。

大規模モデル評価

プロセス全体で、Opus 5は多角形を使って人物、建物、小道具を構築し、それらをx、y、z座標系に一つずつ配置し、カメラ、照明、アニメーションを設定します。

人物がいつ動くか、カメラがどの方向に移動するか、照明がどのように変化するか、シーン内のオブジェクトがどのように相互作用するかは、すべてモデルによってコードで定義される必要がある。

最後のシーンは精巧とは言えず、モデルの貫通や浮遊などの問題が頻繁に発生した。例えば、キャラクターの体と頭が分離してしまうなど……しかし、全体のシーンは実際に構築された。

大規模モデル評価

これは、ビデオモデルがフレームごとのピクセルを直接生成することとは異なります。

Three.jsは、人物、物体、およびシーンをまず三次元オブジェクトとして構築し、その後コードに基づいてそれらの位置、角度、運動状態をリアルタイムで計算します。

したがって、私たちが見ているデモは、通常のAI生成動画ではなく、3Dウェブシーンの実行時のスクリーンレコーディングです。

しかし、カパシはコメント欄で、プログラムによる3Dおよび動画生成は二者択一ではないと述べています。

あるネットユーザーが、この粗いThree.jsのスクリーンレコーディングをSeedanceに参考動画として使用させ、ビデオモデルでより高画質で再レンダリングすることを提案しました。

大規模モデル評価

カパシはすぐに賛成した。

彼の考えでは、プログラミングコードがシーンの構成と制御を担当し、キャラクターの位置、カメラの動き、ストーリーの進行などの骨組みを最初に決定する。

次に、録画をVideo-to-Videoモデルに渡して、テクスチャ、光と影、詳細を補完し、中土世界全体の見栄えを最大限に引き上げます。

音声に関しては、Opus 5は今回は一括で引き受けていません。

カパシは、音質への個人的なこだわりから、最終的にElevenLabsを使用したと述べた。

大規模モデル評価

そして、映像とカメラワーク、ナレーションが含まれる『指輪物語』のデモが突然登場した。

カパシーはすでにプロジェクト全体をオープンソース化しており、詳細なリンクは本文の末尾をご参照ください。

大規模モデル評価

ユーザーのビカパシーの方がずっと面白い

カパシがデモを公開した後、多くのネットユーザーも試してみた。

全体を通して見ると、只能说:

この世代のネットユーザーは、カパシよりもはるかに想像力豊かだ。

誰かがClaudeを使って「Earth Online」プロジェクトを開始し、複数のAIエージェントによって地球全体を 点点 できました。

現在、エージェントは地球全体を構築しておらず、ローポリゴンスタイルのサンフランシスコ沿岸地域のみを構築しています。しかし、現在の映像から見ると、建物の比率、人物のスケール、全体的なスタイルは非常に一貫しています。

この効果は、レゴの世界のようなアニメーションに少し似ています。画風は複雑ではありませんが、キャラクターやシーン、動作が同じ世界で安定して動作します。

この方向で進めば、シンプルなスタイルのアニメーションや軽量ゲームが、AIネイティブの初期形態を少しずつ形成しつつある。

また、ネットユーザーがFable 5とGPT-5.6 Solを用いてニューヨーク市の3Dデジタルモデルを構築し、リアルタイムデータを接続しました。

モデルはニューヨークの街並みと建物を正しく配置するだけでなく、異なる地域間の空間関係も維持しなければならない。そのため、著者はこの仮想世界を生成するタスクが、新たな空間推論ベンチマークとなる可能性を提唱している。

さらに驚くべきことが続きます。

あるネットユーザーがカニエ・ウェストのコンサートチケットを購入できなかったため、AIを使ってブラウザ内で自分用のコンサートを再現した。

プロジェクト全体はThree.jsで構築されています。HTMLファイルは1つだけで、既存の3Dモデルは一切使用しておらず、ステージ、キャラクター、照明はすべてコードで生成されています。

コンサート全体で14曲を用意し、各曲には独立した照明デザインと専用の球形ステージビジュアルが施されています。

一般ユーザーは一部の楽曲を試聴できます。Spotify Premiumに接続すると、フルトラックやライブ全体を再生できます。

チケットを取れなかったら、自分で貸し切りを生成するのはあまりにも損だ!

まだ終わっていません!!!

カパシは元の投稿の最後で、今後、これらの3Dワールドにゲームプレイを追加し、プレイヤーが観察者、NPC、あるいは物語の登場人物としてその中に入れるようにすることを描いています。

ゲーム版はカパシが手配する前に、ネットユーザーが既に作成していた。

大規模モデル評価

このプロジェクトはOpus 5とThree.jsを同じく使用しており、実行・インタラクションだけでなく、音声も追加されています。

さらに多くの3Dデザイン事例が次々と登場しています。建築のスケール、空間レイアウト、シーンのスタイルまで、Opus 5は規模の大きなプロジェクトにおいても比較的安定した一貫性を維持できるようになりました。

同様の例は他にも多数ありますが、ここではすべてを掲載しません。

客観的に見ると、これらの作品はまだ本格的なゲームとして成熟していません。

多様なプレイ方法が面白いのか、長時間運用が安定しているのか、プレイヤーが実際に15分間そこにとどまる意愿があるのかは、まだ不明である。

しかし、リアルタイム3Dコンテンツとプレイ可能なプロトタイプの作成ハードルは確かに大きく下がりました。

さらに、モデルの能力をテストできる新しい方法が、同時に面白くて楽しいものであれば、それは素晴らしいことではないでしょうか?

ペリカン、もう限界です

では、なぜ突然大規模モデルに『指輪物語』を生成させようとしたのでしょうか?

これは数年前に大流行した「ペリカンが自転車を運転する」テストから始まる。

この質問は開発者Simon Willisonによって最初に提出され、一文だけで構成されています。

トビウオが自転車を乗っているSVG画像を生成してください。

大規模モデル評価

この質問は単純に見えるが、実際にはモデルの能力をかなり試すものである。

SVGは画像のように見えますが、実際には下層にコードが存在します。

モデルはペリカンと自転車がそれぞれどのように見えるかを知っているだけでなく、それらを線、円、多角形に分解し、各部品の位置関係を座標で配置する必要があります。

大規模モデル評価

より重要なのは、ペリカンと自転車自体がほとんど似合わないということです。

自転車のフレーム、タイヤ、ペダルは正しい幾何学的構造を保つ必要がある;一方、カワウソは大きな嘴、短い脚、そして自転車を漕ぐにはまったく似合わない体型を持っている。

大規模モデル評価

両者を組み合わせると、モデルが空間関係を理解しているかどうかは、一目で明らかである:

ホイールは歪んでいないか、足はペダルに乗っているか、鳥は自転車を乗っているのか、それともフレームで即座に解体されたのか。

上の2024年末のデモをご覧ください~

そのため、「ペリカンが自転車を運転する」は、大規模モデルの空間認識、物体組み合わせ、およびコード生成能力を評価するための民間での古典的なテストとなった。

大規模モデル評価

しかし、モデルがますます強くなるにつれて、このウミウもそろそろ限界です。

以下をご覧ください DeepSeek R1と DeepSeek V4のパフォーマンスからわかるように、現在のモデルはこの問題をかなりしっかり解けるようになりました。

大規模モデル評価

さらに重要なのは、1枚のSVGがモデルの1回の出力しか評価できないことです。

それはモデルが複雑なプロジェクトを計画し、数時間連続で作業し、数千行のコードの中で自らのエラーを繰り返しチェックして修正できるかどうかを測定できない。

そこで、カパシは「絵を描く」という小さな課題を、「世界を構築する」という大規模なプロジェクトに置き換えた——

ペリカンは降車してください、中土世界が正式に引き継ぎました。

大規模モデル評価

Kapasi's Pelican

やがて、カパシが「ペリカンテスト」の問題を変更するという情報が、さまざまなコミュニティに広まった。

Hacker Newsの高評価コメントでは、これらのデモの画質は一般的だが、これは単一の画像を生成するよりも難しい新しいテストが必要であることを示しているとされている。

新しい基準は、モデルが絵を正しく描けるかどうかだけでなく、世界を理解できるかどうかも評価すべきである。

大規模モデル評価

結局、「ペリカンが自転車を乗る」は長すぎます。

モデルはこの種のタスクで次々とランキングを更新しており、互いの差がますますわかりにくくなっています。

一方で、完全な3D世界を生成するには、モデルが人物と物体間の空間関係を理解し、カメラアングル、アクション、シーンの変化を処理する必要があり、単にビデオ生成モデルを呼び出して一連の映像を出力するだけではなりません。

大規模モデル評価

もちろん、反対意見を述べる人もいます。

ペリカンテストは十分に簡潔で、コストが低く、結果も比較しやすい。

モデルをテストするために、3D世界全体を生成するためにそれほど多くのトークンを消費するのは、計算リソースで花火を上げるようなものだ。

大規模モデル評価

一方で、Three.js自体が大規模モデルの総合的能力を評価できるかどうかについても疑問が呈されている。

一部の人は、このようなデモはAnthropicがThree.jsコードをうまく訓練できたことを示すだけで、モデルが空間や物理世界を本当に理解していることを証明できないと考えている。

しかしすぐにネットユーザーが反論した:

抽象的意味が曖昧な文学テキストを3Dアニメーションに変換するには、モデルが空間関係、物理法則、日常的な物体、および3D変換とコンピュータグラフィックスにおける数学的問題を同時に処理する必要がある。

これがまだ「Three.jsを書けるレベル」だとされるなら、この5500行のコードをやや過小評価している。

大規模モデル評価

また、ネットユーザーがよりオープンな質問を提起しました:

「空間推論」とは、大規模モデルが普段文字やコードを処理する際の推論と本当に異なるのでしょうか?

ある見方では、画像が成立するかどうかは、モデルが「前後、内外、遠近、隠蔽」などの空間関係、および異なる視点における物体の距離、角度、相対的な大きさを理解しているかどうかに依存する。

大規模モデル評価

しかし、別の見方では、モデルが「石の横」か「配列の中」かを処理しているかどうかに関わらず、行っているのは同じことである可能性があります:文脈に従って1つずつトークンを生成し、その過程で推論を完了することです。

もしそうであれば、Opus 5が示しているのは、いきなり現れた「空間能力」だけではない。

より可能性が高いのは、大規模言語モデルが文字とコードを理解するために元々備えていた汎用的な推論能力が、自然に三次元世界へと拡張され始めたということである。

絵でカモメを描くことから、中つ国を構築することまで、課題は変わったように見えるが、その背後でテストされているのはおそらく同じ問題だ:

モデルは、自分自身が世界を理解した内容を、実際に動作する構造に変換できるでしょうか。

そして最後に、さらにあり得ない質問があるかもしれません——

汎用的大規模モデルが自らコードを書いて3Dワールドを構築し、SeedanceやElevenLabsなどのAPIを呼び出して映像と音声を生成できるのであれば、ユーザーが専用の動画生成製品を開いてプロンプトを入力する必要はまだどれほどあるのか?

参照リンク

[1]https://karpathy.ai/lotr-movie/

[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/

[3] https://x.com/wizardbrainz/status/2083012159341203708

[4]https://x.com/aniketjart/status/2083645765097033845

[5]https://x.com/davidfromkansas/status/2075691129899528254

[6]https://x.com/MindaugasLT/status/2083488027343470939

本文は微信公衆アカウント「量子位」より、著者:henry

免責事項: 本ページの情報はサードパーティからのものであり、必ずしもKuCoinの見解や意見を反映しているわけではありません。この内容は一般的な情報提供のみを目的として提供されており、いかなる種類の表明や保証もなく、金融または投資助言として解釈されるものでもありません。KuCoinは誤記や脱落、またはこの情報の使用に起因するいかなる結果に対しても責任を負いません。 デジタル資産への投資にはリスクが伴います。商品のリスクとリスク許容度をご自身の財務状況に基づいて慎重に評価してください。詳しくは利用規約およびリスク開示を参照してください。