Không nói nhiều, bắt đầu ngay Daily Dogen (doge)!
Vừa mới đây, thần tượng Kappa đã công bố: “Chúng tôi” Anthropic đã bắt đầu tăng cường cho các mô hình lớn theo một cách hoàn toàn mới—
The Lord of the Rings.

Theo Kapasi, bộ "Tiêu chuẩn Chúa tể những chiếc nhẫn" đang thay thế bài kiểm tra SVG từng phổ biến trước đây là "Bồ câu đạp xe".

Cụ thể, Kapasi đã trực tiếp đưa đoạn mở đầu của "Chúa tể những chiếc nhẫn" cho Opus 5, yêu cầu mô hình tạo ra ngay lập tức một "Trung Địa" hoàn chỉnh bằng Three.js.
Về hiệu quả cuối cùng, nó hơi giống các phim hoạt hình 3D trong nước cuối những năm 90 của thế kỷ trước và đầu thế kỷ 21: rất thô ráp và rất trừu tượng.
Nhưng nói một cách khách quan, nếu bạn nhìn kỹ một chút và vô tình quen thuộc với địa điểm quay phim The Lord of the Rings ở Hobbiton, New Zealand, thì bạn thực sự có thể cảm nhận được một chút nét tương đồng~
Tuy nhiên, thứ trông có vẻ không tinh xảo này đã thực sự tiêu tốn Opus 5: 1 triệu token, 2 giờ và 5.500 dòng mã.
Of course, Claude isn't the only one shining on stage.
Điều hài hước nhất vẫn là món mà cư dân mạng vừa dâng lên DeepSeek Phiên bản V4 Flash.
Ngay lập tức toàn bộ “người Trung Quốc có thể bay”, nhân vật trong khung hình đều lơ lửng.
Trước những lỗ hổng rõ ràng đến mức có thể nhìn thấy ngay, Kappasi cũng khá công bằng.
Anh ấy chỉ ra rằng hiện tại Opus 5 vẫn chưa thực sự có thể “nhập” vào thế giới mà nó tự tạo ra, mà chỉ có thể liên tục chụp ảnh màn hình tại các thời điểm khác nhau, sau đó từ từ kiểm tra xem vấn đề nằm ở đâu.
Và điều này chính là điểm yếu rõ ràng hiện tại của các mô hình lớn:
Chúng đã có thể viết mã, tạo bối cảnh và sinh ra trò chơi, nhưng vẫn chưa thực sự hiểu được video, cũng không tự mình chơi lại những trò chơi mà chúng tự tạo ra.
Hai giờ, tự tay tạo một Trung Thổ
Hãy cùng xem xét cụ thể cách thực hiện bài kiểm tra "The Lord of the Rings" này.
Nếu hiểu theo nghĩa đen của tweet của Kapsis, thì lời nhắc chính được đưa vào Opus 5 lần này chính là đoạn mở đầu của Chương 1, “Bữa tiệc được mong đợi,” trong tác phẩm The Lord of the Rings.

Bilbo Baggins của Bag End thông báo sẽ tổ chức bữa tiệc sinh nhật 111 tuổi hoành tráng, và Hobbiton lập tức xôn xao...
Những bạn quan tâm có thể tự thử nghiệm.
Ngoài ra, Kapasi còn chỉ định Three.js trong prompt, tức là một thư viện JavaScript dùng để xây dựng cảnh 3D bằng mã lệnh.
Do đó, nhiệm vụ của Opus 5 là đọc hiểu đoạn văn mở đầu của The Lord of the Rings, sau đó chuyển nó thành một thế giới 3D có thể chạy trực tiếp trong trình duyệt.

Trong suốt quá trình này, Opus 5 cần sử dụng các đa giác để tạo ra nhân vật, công trình và đạo cụ, sau đó lần lượt đặt chúng vào hệ tọa độ x, y, z, đồng thời bố trí máy quay, ánh sáng và hoạt ảnh.
Khi nào nhân vật di chuyển, camera quay về phía nào, ánh sáng thay đổi ra sao, và các vật thể trong cảnh nên tương tác thế nào, tất cả đều cần được mô hình định nghĩa bằng mã.
Mặc dù cảnh cuối cùng không được tinh tế và thường xuyên xuất hiện các vấn đề như lỗi xuyên mô, trôi nổi, ví dụ như cơ thể và đầu nhân vật tách rời nhau... nhưng toàn bộ bối cảnh ít nhất đã được xây dựng thực sự.

Cần lưu ý rằng điều này không giống với việc mô hình video trực tiếp tạo ra từng khung hình pixel.
Three.js cần tạo trước các nhân vật, vật thể và cảnh dưới dạng đối tượng ba chiều, sau đó tính toán thời gian thực vị trí, góc và trạng thái chuyển động của chúng dựa trên mã lệnh.
Vì vậy, đoạn Demo chúng ta thấy không phải là một video do AI tạo ra thông thường, mà là bản ghi màn hình của một cảnh web 3D đang chạy.
Tuy nhiên, Kapasi cũng nhắc đến trong phần bình luận rằng việc tạo chương trình 3D và video không phải là lựa chọn một trong hai.
Một người dùng đề xuất có thể gửi bản quay màn hình Three.js thô này cho Seedance làm video tham khảo, sau đó để mô hình video render lại với chất lượng cao hơn.

Kapasi nhanh chóng đồng ý.
Theo ý tưởng của anh ấy, mã lập trình có thể đảm nhận việc phân cảnh và điều khiển, trước tiên xác định các yếu tố cốt lõi như nhân vật đứng ở đâu, camera di chuyển thế nào và cốt truyện được triển khai ra sao.
Tiếp theo, hãy đưa bản ghi màn hình vào mô hình Video-to-Video để nó bổ sung kết cấu, ánh sáng và chi tiết, giúp tăng tối đa vẻ ngoài của toàn bộ thế giới Trung Địa.
Về phần âm thanh, Opus 5 lần này không bao trọn luôn.
Kapasi cho biết, do yêu cầu cá nhân về chất lượng âm thanh, cuối cùng đã sử dụng ElevenLabs.

Vì vậy, đoạn demo phim Chúa tể những chiếc nhẫn với hình ảnh, cảnh quay và lời bình đầu tiên đã ra đời một cách đầy ấn tượng.
Kapasi cũng đã mở nguồn toàn bộ dự án, liên kết cụ thể có thể tham khảo ở cuối bài viết.

Người dùng mạng thú vị hơn nhiều so với Capasi
Ngay sau khi Kapsi phát hành bản demo, nhiều netizen cũng đến thử nghiệm.
Nhìn chung, chỉ có thể nói:
Người dùng mạng lần này sáng tạo hơn nhiều so với Kappa.
Một người đã sử dụng Claude để khởi động dự án "Earth Online", với mục tiêu sử dụng một nhóm AI Agent để tái tạo toàn bộ Trái Đất Click Đã xây dựng xong.
Hiện tại, Agent chưa tạo ra toàn bộ Trái Đất, mà chỉ xây dựng một khu vực bờ biển San Francisco theo phong cách low-poly. Tuy nhiên, từ những hình ảnh hiện có, tỷ lệ kiến trúc, quy mô nhân vật và phong cách tổng thể đều được duy trì khá nhất quán.
Hiệu ứng này hơi giống những bộ phim hoạt hình trong thế giới Lego. Phong cách vẽ không phức tạp, nhưng nhân vật, bối cảnh và chuyển động đều có thể vận hành ổn định trong cùng một thế giới.
Tiếp tục theo hướng này với hoạt hình phong cách đơn giản và game nhẹ, đã bắt đầu hình thành hình thái nguyên sinh của AI.
Một số người dùng mạng còn sử dụng Fable 5 và GPT-5.6 Sol để tạo ra mô hình số 3D của thành phố New York và tích hợp dữ liệu thời gian thực vào đó.
Mô hình không chỉ cần sắp xếp đúng các con phố và tòa nhà ở New York, mà còn phải duy trì mối quan hệ không gian giữa các khu vực khác nhau. Do đó, tác giả đề xuất rằng nhiệm vụ tạo ra thế giới ảo này có thể trở thành một benchmark mới về suy luận không gian.
Còn điều còn gây kinh ngạc hơn nữa đang ở phía sau.
Một số người dùng mạng đã không mua được vé xem buổi hòa nhạc của Kanye West, nên họ dùng AI để tự tổ chức một buổi hòa nhạc ngay trong trình duyệt.
Toàn bộ dự án vẫn được xây dựng bằng Three.js. Chỉ có một tệp HTML, không sử dụng bất kỳ mô hình 3D nào có sẵn, sân khấu, nhân vật và ánh sáng đều được tạo ra bằng mã nguồn.
Buổi hòa nhạc có tổng cộng 14 bài hát, mỗi bài đều có thiết kế ánh sáng độc lập và hệ thống hình ảnh sân khấu hình cầu riêng biệt.
Người dùng thông thường có thể nghe thử đoạn trích, sau khi kết nối với Spotify Premium, còn có thể phát toàn bộ bài hát và toàn bộ buổi biểu diễn.
Không mua được vé, tự tạo một buổi riêng cho mình thì thật là quá lãng phí!
Chưa xong!!!
Kapasi cũng tưởng tượng ở cuối bài đăng ban đầu rằng, trong tương lai có thể thêm các yếu tố chơi game vào những thế giới 3D này, cho phép người chơi tham gia với vai trò là người quan sát, NPC hoặc thậm chí là nhân vật trong câu chuyện.
Kết quả, phiên bản trò chơi chưa đợi Kapax sắp xếp, cộng đồng mạng đã tự làm ra rồi.

Dự án này cũng sử dụng Opus 5 và Three.js, không chỉ có thể chạy và tương tác, mà còn có âm thanh đi kèm.
Nhiều trường hợp thiết kế 3D khác cũng liên tục xuất hiện. Từ tỷ lệ kiến trúc, bố cục không gian đến phong cách cảnh quan, Opus 5 đã có thể duy trì sự nhất quán tương đối ổn định trong các dự án có quy mô đáng kể.
Còn nhiều ví dụ tương tự khác, ở đây không liệt kê hết.
Một cách khách quan, những tác phẩm này vẫn còn khoảng cách với một trò chơi thực sự chín chắn.
Các cách chơi đa dạng có thú vị không, liệu có ổn định khi chạy lâu dài, và người chơi có thật sự sẵn sàng ở lại trong 15 phút không, hiện vẫn chưa có câu trả lời.
Tuy nhiên, rào cản để tạo nội dung 3D thời gian thực và bản mẫu có thể chơi được đã được giảm đáng kể.
Hơn nữa, việc có một phương pháp mới để kiểm tra khả năng của mô hình, đồng thời đủ thú vị và vui vẻ, chẳng phải tuyệt vời sao?
Pelicans, đã đi đến cuối đường
Vậy thì tại sao đột nhiên lại yêu cầu mô hình lớn tạo ra The Lord of the Rings?
Điều này phải bắt nguồn từ bài kiểm tra “Cúp bay đạp xe” từng nổi đình nổi đám vài năm trước.
Câu hỏi này ban đầu đến từ nhà phát triển Simon Willison và yêu cầu chỉ gồm một câu:
Tạo một hình ảnh SVG của một con chim cánh cụt đạp xe.

Mặc dù câu hỏi này trông có vẻ đơn giản, nhưng thực tế nó khá thử thách mô hình.
Vì SVG trông giống như một hình ảnh, nhưng bên dưới lại là một chuỗi mã.
Mô hình không chỉ cần biết pelican và xe đạp trông như thế nào, mà còn phải phân tách chúng thành các đường thẳng, hình tròn và đa giác, sau đó sắp xếp vị trí của từng bộ phận bằng tọa độ.

Quan trọng hơn, chim cánh cụt và xe đạp vốn không hề phù hợp với nhau.
Khung xe, lốp và bàn đạp của xe đạp phải giữ cấu hình hình học chính xác; trong khi chim bồ nông lại có mỏ lớn, chân ngắn và một thân hình khó có thể tưởng tượng là có thể đạp xe.

Khi kết hợp cả hai, có thể dễ dàng nhận ra liệu mô hình có hiểu mối quan hệ không gian hay không:
Bánh xe có bị lệch không, chân có chạm vào bàn đạp không, con chim thực sự đang đạp xe, hay bị khung xe xé nát ngay tại chỗ.
Hãy xem các bản demo cuối năm 2024 ở trên nhé~
Precisely for this reason, "pelican riding a bicycle" once became a classic test for民间 observation of large models' spatial understanding, object composition, and code generation capabilities.

Nhưng khi mô hình ngày càng mạnh mẽ, chú bồ nông này cũng sắp đi đến hết hành trình.
Xem bên dưới DeepSeek R1 và DeepSeek Từ hiệu suất của V4, có thể thấy các mô hình hiện tại đã có thể giải quyết bài toán này một cách khá tốt.

Hơn nữa, một SVG chỉ có thể đánh giá đầu ra một lần của mô hình.
Nó không thể đo lường được liệu mô hình có thể lên kế hoạch cho một dự án phức tạp, làm việc liên tục vài giờ và lặp lại kiểm tra, sửa lỗi trong hàng ngàn dòng mã hay không.
Vì vậy, Kapasi đã đổi một câu hỏi nhỏ “vẽ một bức tranh” thành một dự án lớn “xây dựng một thế giới”—
The Pelicans can get off; Middle-earth has officially taken over.

Kapasi's Pelican
Sớm sau đó, tin tức về việc Kapasi chuẩn bị đổi đề cho “Pelican Test” cũng lan truyền đến các cộng đồng lớn.
Các bình luận được xếp hạng cao trên Hacker News cho rằng, mặc dù chất lượng hình ảnh của các bản demo này đều khá bình thường, nhưng điều này chính xác cho thấy chúng ta cần một bài kiểm tra mới khó hơn việc tạo ra một hình ảnh đơn lẻ.
Tiêu chuẩn mới không chỉ nên xem xét liệu mô hình có thể vẽ đúng hình ảnh hay không, mà còn phải đánh giá xem nó có thể hiểu một thế giới hay không.

After all, "Pelican on a Bicycle" has been used for too long.
Các mô hình liên tục lập kỷ lục trên các nhiệm vụ loại này, và sự khác biệt giữa chúng ngày càng khó nhận ra.
So sánh với việc tạo ra một thế giới 3D hoàn chỉnh, yêu cầu mô hình hiểu được mối quan hệ không gian giữa nhân vật và vật thể, xử lý góc máy, chuyển động và thay đổi cảnh, thay vì chỉ đơn giản gọi mô hình tạo video để tạo ra một đoạn hình ảnh.

Of course, some people have also raised objections.
The pelican test is sufficiently concise, low-cost, and yields easily comparable results.
Để kiểm thử một mô hình mà tiêu tốn đến vậy lượng Token để tạo ra cả một thế giới 3D, thật sự giống như dùng sức tính toán để bắn pháo hoa.

Meanwhile, whether Three.js itself can measure the comprehensive capabilities of large models has also been questioned.
Một số người cho rằng, các bản demo này chỉ có thể chứng minh rằng Anthropic đã được huấn luyện tốt trong mã Three.js, nhưng không cho thấy mô hình thực sự hiểu không gian và thế giới vật lý.
Nhưng ngay sau đó có người dùng phản bác:
Chuyển đổi một đoạn văn học trừu tượng, ý nghĩa mơ hồ thành hoạt hình 3D, mô hình cần đồng thời xử lý các mối quan hệ không gian, quy luật vật lý, vật thể hàng ngày, cùng các vấn đề toán học trong biến đổi 3D và đồ họa máy tính.
Nếu điều này vẫn chỉ được coi là “biết viết Three.js”, thì hơi đánh giá thấp 5.500 dòng mã này một chút.

Một người dùng khác cũng đặt ra một câu hỏi rộng hơn:
Liệu “suy luận không gian” có thực sự khác với cách mô hình lớn thường suy luận khi xử lý văn bản và mã?
Một quan điểm cho rằng, hình ảnh có thể tồn tại hay không phụ thuộc vào việc mô hình có hiểu các mối quan hệ không gian như “trước-sau, trong-ngoài, xa-gần, che khuất” cũng như khoảng cách, góc nhìn và kích thước tương đối của vật thể dưới các góc nhìn khác nhau hay không.

Tuy nhiên, một quan điểm khác cho rằng, bất kể mô hình xử lý “bên cạnh hòn đá” hay “trong mảng”, thì có thể đều đang thực hiện cùng một việc: sinh từng Token dựa trên ngữ cảnh và hoàn thành suy luận trong quá trình này.
Nếu vậy, thì Opus 5 không chỉ thể hiện một “khả năng không gian” xuất hiện đột ngột.
Có khả năng cao là khả năng suy luận tổng quát của các mô hình ngôn ngữ lớn, vốn ban đầu được sử dụng để hiểu văn bản và mã nguồn, đã bắt đầu tự nhiên mở rộng sang thế giới ba chiều.
Từ việc vẽ một con bồ nông đến xây dựng một thế giới Trung Địa, chủ đề có vẻ đã thay đổi, nhưng có lẽ điều được kiểm tra đằng sau vẫn luôn là cùng một câu hỏi:
Mô hình có thể chuyển đổi hiểu biết của nó về thế giới thành một cấu trúc thực sự có thể chạy được không?
Và cuối cùng, có lẽ còn một câu hỏi còn kỳ lạ hơn nữa—
Nếu mô hình tổng quát đã có thể tự viết mã để xây dựng thế giới 3D và gọi các API như Seedance, ElevenLabs để tạo hình ảnh và âm thanh, thì người dùng còn cần thiết phải tự mở một sản phẩm tạo video chuyên dụng để nhập Prompt không?
Liên kết tham khảo
[1]https://karpathy.ai/lotr-movie/
[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/
[3] https://x.com/wizardbrainz/status/2083012159341203708
[4]https://x.com/aniketjart/status/2083645765097033845
[5]https://x.com/davidfromkansas/status/2075691129899528254
[6]https://x.com/MindaugasLT/status/2083488027343470939
Bài viết này đến từ tài khoản chính thức WeChat "Quantum Bit", tác giả: henry
