不說了,馬上開始每日躺平(doge)!
就在剛剛,大神卡帕西宣布,「我們」Anthropic 已經開始用一種全新的方式,給大模型上強度——
《指環王》。

根據卡帕西介紹,這套「指環王基準」正在取代過去風靡一時的「鵜鶘騎自行車」SVG 測試。

具體來說,卡帕西直接將《指環王》的開頭丟給 Opus 5,讓模型用 Three.js 現場生成整個「中土世界」。
至於最終效果,多少有點像上世纪90年代末、21世紀初的國產3D動畫片:很粗糙,也很抽象。
但客觀來說,仔細看上一會兒,如果你又恰好熟悉坐落於新西蘭的《魔戒》取景地霍比屯,倒也確實能看出那麼一絲味道~
不過,就是這麼個看起來不太精緻的玩意,卻實實在在地花掉了 Opus 5:100 萬 token、2 個小時以及 5500 行代碼。
Of course, Claude is not the only one shining on stage.
最搞笑的,還是網友新端上來的一碗 DeepSeek V4 Flash 版本。
直接整個「中國人能飛」,畫面中的人物全體漂浮。
面對這些目前肉眼可見的穿幫,卡帕西倒也相当中肯。
他指出,Opus 5 目前還無法真正「進入」自己生成的世界,只能在不同時間點不斷截圖,再慢慢檢查哪裡出了問題。
而這恰恰暴露了當前大模型的一塊明顯短板:
它們已經能寫代碼、搭建場景、生成遊戲,卻還不能真正看懂影片,也不會親自玩一遍自己做出來的遊戲。
兩小時,手搓一個中土
讓我們先來看看這個“指環王”測試具體是如何進行的。
如果按照卡帕西推文的字面意思,這次輸入給 Opus 5 的主要提示詞,應該就是《指環王》正體第一章《期待已久的宴會》的開頭。

袋底洞的比爾博·巴金斯宣布將舉辦盛大的 111 歲生日宴會,霍比屯立刻議論紛紛……
有興趣的朋友可以自行試試。
此外,卡帕西還在提示詞中指定了 Three.js,也就是一個使用代碼搭建 3D 場景的 JavaScript 庫。
因此,Opus 5 的任務是先理解《魔戒》開頭的文字,再將其轉化為一個可在瀏覽器中即時運行的 3D 世界。

在整個過程中,Opus 5 需要用多邊形拼出人物、建築和道具,將它們逐個放入 x、y、z 坐標系,再安排好攝像機、燈光和動畫。
人物何時移動、鏡頭如何轉動、燈光如何變化、場景中的物體應如何互動,全部都需要模型以代碼定義。
雖然最後的畫面稱不上精緻,而且經常出現穿模、漂浮等問題,例如人物的身體和頭部分離……但整個場景總算被真正搭建了起來。

需要注意的是,這與視頻模型直接生成每一幀像素並不相同。
Three.js 需要先將人物、物體和場景作為三維物件建立起來,再根據代碼實時計算它們的位置、角度和運動狀態。
因此,我們所看到的 Demo 並非一段普通的 AI 生成影片,而是一個 3D 網頁場景運行時的錄屏。
不過,卡帕西在評論區也提到,程式化 3D 和影片生成並不是二選一。
有網友提議,可以將這個粗糙的 Three.js 錄影交給 Seedance 作為參考影片,再讓視頻模型以更高的畫質重新渲染一次。

Kapasi 很快表示贊同。
根據他的構想,程式化代碼可以負責分鏡和控制,先確定人物站在哪裡、鏡頭如何移動、劇情如何推進這些骨架。
Next, feed the screen recording into the Video-to-Video model to add textures, lighting, and details, fully enhancing the visual appeal of the entire Middle-earth world.
至於音訊,Opus 5 這次並未一併包辦。
卡帕西表示,出於個人對音質的要求,最終使用的是 ElevenLabs。

於是,那段有畫面、有鏡頭、還有旁白的《魔戒》Demo,就此橫空出世。
Kapasi 也已將整個項目開源,詳細連結請參見文末。

網友比卡帕西有意思多了
Just after Kapsi released the demo, many netizens also came to test it out.
整體看下來,只能說:
這屆網友比卡帕西有想像力多了。
有人用 Claude 啟動了一個「Earth Online」項目,目標是靠一群 AI Agent,把整個地球一 點點 Build it out.
目前,Agent 還未建完整個地球,僅搭建出一個低多邊形風格的舊金山濱水區。但從現有畫面來看,建築比例、人物尺度和整體風格都保持得相當統一。
這效果有點像那種樂高世界的動畫片。畫風不複雜,但人物、場景和動作能在同一個世界裡穩定運行。
繼續朝這個方向前進,簡約風格的動畫和輕量遊戲,已初具 AI 原生的雛形。
還有網友使用 Fable 5 和 GPT-5.6 Sol 搭建了紐約市的 3D 數位模型,並在其中接入實時數據。
模型不僅要正確擺放紐約的街道和建築,還要維持不同區域之間的空間關係。因此,作者提出,這種生成虛擬世界的任務,或許可以成為一種新的空間推理 Benchmark。
更誇張的還在後面。
有網友沒買到 Kanye West 的演唱會門票,乾脆用 AI 在瀏覽器裡給自己補辦了一場。
整個項目仍由 Three.js 搭建。僅有一個 HTML 檔案,未調用任何現成的 3D 模型,舞台、人物和燈光全部由程式碼生成。
The concert prepared a total of 14 songs, each with its own lighting design and a set of exclusive spherical stage visuals.
一般用戶可試聽片段,連接 Spotify Premium 後,還可播放完整曲目和整場演出。
沒搶到票,直接給自己包場,太虧了!
還沒完!!!
Kapasi 在原帖結尾還設想,未來可以為這些 3D 世界加入玩法,讓玩家以旁觀者、NPC 甚至故事角色的身份進入其中。
結果遊戲版本還未等卡帕西安排,網友已經做出來了。

這個項目同樣使用 Opus 5 和 Three.js,不僅能運行和互動,還配上了音頻。
更多 3D 設計案例也不斷出現。從建築比例、空間佈局到場景風格,Opus 5 已經能在規模不小的項目裡維持相對穩定的一致性。
類似實例還有很多,這裡就不逐一展示了。
Objectively speaking, these works are still some way from being truly mature games.
Whether the complex gameplay is fun, whether it runs stably over long periods, and whether players will truly be willing to stay for 15 minutes—all remain unanswered.
But the barrier to creating real-time 3D content and playable prototypes has indeed been significantly lowered.
而且,能有一種新的方法來測試模型的能力,同時又足夠有趣、好玩,豈不美哉?
鹈鹕,騎到頭了
那麼,為何突然要讓大模型生成《指環王》呢?
這還得從前幾年爆火的「Pelican Bikes」測試說起。
這道題最早來自開發者 Simon Willison,要求只有一句話:
生成一張鵜鶘騎自行車的SVG圖片。

雖然這個題目看起來簡單,但其實它相當考驗模型。
因為 SVG 看起來像一張圖片,但底層其實是一串代碼。
模型不僅要知道鵜鶘和自行車分別長什麼樣,還得把它們拆成線條、圓形和多邊形,再用座標安排好每個部件的位置關係。

更重要的是,鵜鶘和自行車本身就不怎麼般配。
自行車的車架、輪胎和踏板必須保持正確的幾何結構;鵜鶘則長著大嘴、短腿,以及一副怎么看都不像會蹬車的身材。

兩者一結合,模型到底有沒有理解空間關係,幾乎一眼就能看出來:
車輪有沒有歪、腳有沒有踩到踏板、鳥到底是在騎車,還是被車架當場肢解。
看看上面這些 24 年年底的 demo 吧~
Thus, "pelican riding a bicycle" once became a classic test for publicly observing large models' spatial understanding, object composition, and code generation capabilities.

But as the model grows stronger, this pelican is almost at the end of its ride.
看看下面 DeepSeek R1 和 DeepSeek From the performance of V4, it's clear that today's models can already solve this problem quite well.

更重要的是,一張 SVG 只能考察模型的一次性輸出。
它無法測試模型能否規劃一個複雜項目、連續工作數小時,並在數千行程式碼中反覆檢查和修正自己的錯誤。
於是,卡帕西把一道「畫張圖」的小題,換成了「搭個世界」的大工程——
The Pelicans can get off; Middle-earth has officially taken over.

Kapasi's Pelican
很快,卡帕西準備更換「鵜鶘測試」題目 的消息,也傳到了各大社區。
Hacker News 的高讚評論認為,儘管這些 Demo 的畫面質量都很一般,但這恰恰說明,我們需要一個比生成單張圖片更難的新測試。
新的基準不該只看模型能不能把畫畫對,還要考察它能不能理解一個世界。

畢竟,「鵜鶘騎自行車」已經用了太久。
Models continuously rank highly on such tasks, making it increasingly difficult to distinguish differences between them.
相比之下,生成一個完整的 3D 世界需要模型理解人物與物體之間的空間關係,處理鏡頭、動作和場景變化,而非僅僅調用視頻生成模型輸出一段畫面。

Of course, some people have also raised objections.
Pelican test is concise, low-cost, and results are easy to compare.
為了測試一次模型,耗費如此多的 Token 來生成整個 3D 世界,有點像拿算力放煙花。

Meanwhile, whether Three.js itself can measure the comprehensive capabilities of large models has also been questioned.
有人認為,這類 Demo 最多只能證明 Anthropic 在 Three.js 代碼上訓練得不錯,不能說明模型真的理解了空間和物理世界。
但很快就有網友反駁:
將一段抽象、含義模糊的文學文本轉化為 3D 動畫,模型需同時處理空間關係、物理法則、日常物體,以及 3D 變換和電腦圖形學中的數學問題。
如果這還只能算「會寫 Three.js」,多少有點低估這 5500 行代碼了。

還有網友提出了一個更開放的問題:
所謂的「空間推理」,真的和大模型平時處理文字、代碼時的推理不同嗎?
一種觀點認為,畫面能否成立,取決於模型是否理解「前後、內外、遠近、遮擋」等空間關係,以及物體在不同視角下的距離、角度和相對大小。

但另一種觀點認為,無論模型處理的是「石頭旁邊」,還是「數組裡面」,做的可能都是同一件事:根據上下文逐個生成 Token,並在這個過程中完成推理。
如果是這樣,那麼,Opus 5 展示的就不只是一項突然冒出來的「空間能力」。
更可能的情況是,大語言模型原本用於理解文字和代碼的通用推理能力,已開始自然延伸至三維世界。
從畫一隻鵜鶘,到搭出一個中土世界,題目看起來變了,但背後測試的或許始終是同一個問題:
模型能否將自己對世界的理解,轉化為一套真正能夠運行的結構?
而在最後,也許還有一個更加離譜的問題——
如果通用大模型已經能夠自行撰寫代碼來建立3D世界,並調用 Seedance、ElevenLabs 等 API 完成畫面和聲音,那麼用戶還有多少必要親自打開一個專門的視頻生成產品並輸入 Prompt?
參考連結
[1]https://karpathy.ai/lotr-movie/
[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/
[3] https://x.com/wizardbrainz/status/2083012159341203708
[4]https://x.com/aniketjart/status/2083645765097033845
[5]https://x.com/davidfromkansas/status/2075691129899528254
[6]https://x.com/MindaugasLT/status/2083488027343470939
本文來自微信公眾號「量子位」,作者:henry
