Opus 5 Anthropic membina Dunia 'Lord of the Rings' 3D Menggunakan AI

icon MarsBit
Kongsi
AI summary iconRingkasan
Berita AI + kripto muncul apabila Opus 5 Anthropic mencipta versi 3D dunia *Lord of the Rings* menggunakan Three.js. Projek ini, yang dipimpin oleh penyelidik AI Karpathy, menggunakan 1 juta token, 2 jam, dan 5,500 baris kod. Model tersebut merender pembukaan novel ke dalam adegan 3D berbasis browser, walaupun hasilnya kasar dan abstrak. Berita aset dunia nyata (RWA) semakin mendapat perhatian kerana eksperimen AI mendorong sempadan dalam persekitaran digital.

Tak perlu banyak cakap, terus mulakan Daily Sit (doge)!

Baru sahaja, pakar besar Kaphasi mengumumkan, "Kami" Anthropic telah mula menggunakan cara baru untuk meningkatkan kekuatan model besar—

The Lord of the Rings.

Evaluasi model besar

Menurut Kapasi, "Lord of the Rings Benchmark" ini sedang menggantikan ujian SVG "Pelican Bercycle" yang pernah sangat popular.

Evaluasi model besar

Secara khusus, Kappasi terus-menerus memasukkan pembukaan "The Lord of the Rings" kepada Opus 5, meminta model untuk menghasilkan seluruh "Middle-earth" secara langsung menggunakan Three.js.

Untuk kesan akhirnya, ia agak seperti animasi 3D tempatan pada akhir tahun 1990-an dan awal abad ke-21: sangat kasar dan sangat abstrak.

Namun, secara objektif, jika anda memerhatikan dengan teliti sebentar, dan jika anda secara kebetulan mengenali lokasi pengambilan gambar The Lord of the Rings di Hobbiton, New Zealand, anda memang boleh melihat sedikit kesamaan~

Namun, benda yang kelihatan tidak begitu halus ini sebenarnya menghabiskan Opus 5: 1 juta token, 2 jam, dan 5,500 baris kod.

Tentu saja, bukan hanya Claude yang sendirian indah di atas pentas.

Yang paling lucu ialah mangkuk baru yang dihidangkan oleh netizen DeepSeek Versi V4 Flash.

Secara langsung seluruh “Orang Cina boleh terbang”, semua tokoh dalam gambar mengambang.

Menghadapi kebocoran yang jelas terlihat ini, Kappasi juga agak adil.

Dia menunjukkan bahawa Opus 5 masih tidak dapat benar-benar "memasuki" dunia yang dihasilkannya sendiri, hanya mampu mengambil tangkapan layar pada titik-titik masa yang berbeza, kemudian memeriksa secara perlahan di mana masalah berlaku.

Dan ini justru menunjukkan kelemahan ketara dalam model besar semasa ini:

Mereka sudah boleh menulis kod, membina adegan, dan menghasilkan permainan, tetapi masih tidak mampu memahami video dengan sebenarnya, dan tidak akan memainkan permainan yang mereka ciptakan sendiri.

Dua jam, bangun Middle-earth sendiri

Mari kita lihat bagaimana ujian "The Lord of the Rings" ini dilakukan.

Jika mengikuti makna harfiah tweet KappaSi, petunjuk utama yang dimasukkan ke Opus 5 seharusnya adalah permulaan Bab Pertama《Perjamuan yang Dinanti-nantikan》dari teks The Lord of the Rings.

Evaluasi model besar

Bilbo Baggins dari Bag End mengumumkan akan mengadakan perayaan ulang tahun ke-111 yang megah, dan segera terjadi perbincangan di Hobbiton...

Sila cuba sendiri jika berminat.

Selain itu, Kappaci juga menentukan Three.js, iaitu pustaka JavaScript untuk membina adegan 3D melalui kod.

Dengan itu, tugas yang perlu diselesaikan oleh Opus 5 ialah memahami teks pembuka The Lord of the Rings terlebih dahulu, kemudian menerjemahkannya menjadi dunia 3D yang boleh berjalan secara masa nyata dalam pelayar.

Evaluasi model besar

Sepanjang proses tersebut, Opus 5 perlu menyusun tokoh, bangunan, dan properti menggunakan poligon, meletakkannya satu per satu ke dalam sistem koordinat x, y, z, kemudian mengatur kamera, cahaya, dan animasi.

Kapan tokoh bergerak, kamera berpindah ke mana, cahaya berubah bagaimana, dan objek di adegan bagaimana berinteraksi, semuanya perlu didefinisikan oleh model menggunakan kod.

Walaupun adegan terakhir tidak dapat dikatakan halus, dan sering mengalami masalah seperti tembus model dan mengambang, contohnya tubuh dan kepala watak terpisah... tetapi keseluruhan latar telah berjaya dibina.

Evaluasi model besar

Perlu diperhatikan bahawa ini bukanlah perkara yang sama dengan model video yang menghasilkan piksel demi piksel secara langsung.

Three.js perlu membina watak, objek, dan adegan sebagai objek tiga dimensi terlebih dahulu, kemudian mengira secara real-time kedudukan, sudut, dan status pergerakan mereka berdasarkan kod.

Jadi, demo yang kita lihat bukan sekadar video yang dihasilkan oleh AI, tetapi rakaman skrin semasa pemeran adegan web 3D.

Namun, Kapasi juga menyatakan di ruang komen bahawa penghasilan 3D dan video berprogram bukanlah pilihan antara satu atau yang lain.

Seorang pengguna mengusulkan agar rakaman Three.js yang kasar ini diberikan kepada Seedance sebagai video rujukan, kemudian model video tersebut merender semula dengan kualiti gambar yang lebih tinggi.

Evaluasi model besar

Kapasi segera bersetuju.

Menurut rancangannya, kod berprogram boleh bertanggungjawab atas pembahagian adegan dan pengawalan, terlebih dahulu menetapkan kerangka kerja seperti di mana watak berdiri, bagaimana kamera bergerak, dan bagaimana cerita dipertingkatkan.

Seterusnya, serahkan rakaman skrin ke model Video-to-Video untuk mengisi tekstur, cahaya, dan butiran, serta meningkatkan keseluruhan penampilan Dunia Tengah.

Untuk audio, Opus 5 kali ini tidak membeli semuanya sekaligus.

Kapasi menyatakan bahawa, demi keperluan peribadi terhadap kualiti suara, akhirnya menggunakan ElevenLabs.

Evaluasi model besar

Oleh itu, demo The Lord of the Rings yang bermula dengan adegan, kamera, dan narasi itu pun muncul secara mendadak.

Kapasi juga telah membuka sumber seluruh projek; pautan terperinci boleh dirujuk di akhir teks.

Evaluasi model besar

Pengguna internet jauh lebih menarik daripada Kapasi

Selepas KappaSi melepaskan Demo, ramai pengguna internet turut datang untuk menguji.

Secara keseluruhan, hanya boleh dikatakan:

Pengguna internet kali ini jauh lebih berimaginasi daripada Kappa.

Seseorang telah memulakan projek "Earth Online" menggunakan Claude, dengan matlamat untuk menggunakan sekumpulan Agen AI untuk seluruh bumi Titik titik Built.

Sekarang, agen belum membina keseluruhan Bumi, hanya membangun kawasan pelabuhan San Francisco dengan gaya low-poly. Namun, daripada gambar yang ada, nisbah bangunan, skala manusia, dan gaya keseluruhan tetap konsisten.

Efek ini agak seperti animasi dunia Lego. Gaya lukisan tidak rumit, tetapi karakter, latar, dan gerakan boleh berfungsi secara stabil dalam dunia yang sama.

Teruskan ke arah ini, animasi dengan gaya ringan dan permainan ringan, sudah menunjukkan ciri-ciri asli AI.

Pengguna lain juga membina model digital 3D Bandar New York menggunakan Fable 5 dan GPT-5.6 Sol, serta mengintegrasikan data masa nyata di dalamnya.

Model tidak hanya perlu menempatkan jalan dan bangunan di New York dengan betul, tetapi juga mempertahankan hubungan ruang antara kawasan-kawasan yang berbeza. Oleh itu, penulis mencadangkan bahawa tugas menghasilkan dunia maya ini mungkin boleh menjadi Benchmark ruang baru.

Yang lebih teruk lagi masih datang.

Seorang pengguna internet yang tidak berjaya membeli tiket konser Kanye West, secara langsung menggunakan AI untuk mengadakan pertunjukan sendiri di peramban.

Projek keseluruhan masih dibina menggunakan Three.js. Hanya terdapat satu fail HTML, tanpa memanggil mana-mana model 3D sedia ada; pentas, watak, dan cahaya semuanya dijana melalui kod.

Sepuluh empat lagu disediakan untuk keseluruhan konser, dengan setiap lagu mempunyai rekaan cahaya yang unik dan visual pentas bola eksklusif.

Pengguna biasa boleh mendengar petikan, dan selepas menyambungkan Spotify Premium, mereka juga boleh memainkan lagu penuh dan pertunjukan keseluruhan.

Tidak berjaya mendapat tiket, terus cipta sendiri tempahan eksklusif, rugi sungguh!

Belum selesai!!!

Kapasi juga membayangkan di akhir post asal, dunia 3D ini boleh ditambahkan permainan seterusnya, membolehkan pemain masuk sebagai penonton, NPC, atau watak cerita.

Hasil versi permainan sudah dihasilkan oleh pengguna internet sebelum Kappa X menyusunnya.

Evaluasi model besar

Projek ini juga menggunakan Opus 5 dan Three.js, tidak hanya boleh dijalankan dan diinteraksi, tetapi juga dilengkapi dengan audio.

Kes-kes reka bentuk 3D yang lebih banyak juga terus muncul. Dari skala arka, susunan ruang hingga gaya adegan, Opus 5 telah mampu mengekalkan konsistensi yang relatif stabil dalam projek-projek berskala besar.

Masih banyak contoh serupa yang tidak ditunjukkan satu per satu di sini.

Secara objektif, karya-karya ini masih jauh dari permainan yang benar-benar matang.

Apakah permainan yang memukau itu menarik, sama ada ia stabil apabila dijalankan dalam jangka masa panjang, dan sama ada pemain benar-benar bersedia untuk tinggal selama 15 minit, masih belum ada jawapannya.

Namun, rintangan untuk membuat kandungan 3D secara langsung dan prototip boleh dimainkan memang telah diturunkan secara besar-besaran.

Apalagi, adakah cara baru untuk menguji kemampuan model yang juga cukup menarik dan menyenangkan?

Pelican, sudah sampai ke penghujung

Jadi, mengapa tiba-tiba perlu meminta model besar untuk menghasilkan The Lord of the Rings?

Ini masih berpunca daripada ujian “Pelikan Berbasikal” yang menjadi popular beberapa tahun yang lalu.

Soalan ini berasal daripada pembangun Simon Willison, dan memerlukan hanya satu ayat:

Hasilkan gambar SVG seekor pelikan yang memandu basikal.

Evaluasi model besar

Walaupun soalan ini kelihatan mudah, ia sebenarnya agak mencabar model.

Kerana SVG kelihatan seperti satu gambar, tetapi pada peringkat bawah ia adalah satu siri kod.

Model tidak hanya perlu tahu bagaimana penampakan pelikan dan basikal masing-masing, tetapi juga perlu memecahkannya menjadi garis, bulatan, dan poligon, kemudian mengatur kedudukan setiap komponen menggunakan koordinat.

Evaluasi model besar

Lebih penting lagi, pelikan dan basikal sendiri tidak begitu serasi.

Rangka, tayar, dan pedal basikal mesti kekal dalam geometri yang betul; pelikan pula mempunyai paruh besar, kaki pendek, dan bentuk tubuh yang kelihatan tidak mungkin untuk mengayuh basikal.

Evaluasi model besar

Apabila kedua-duanya digabungkan, hampir dapat dilihat sekilas sama ada model memahami hubungan ruang:

Roda bengkok atau tidak, kaki menyentuh pedal atau tidak, burung itu sebenarnya sedang mengendari sepeda, atau dihancurkan secara langsung oleh rangka sepeda.

Lihat demo pada akhir tahun 2024 di atas~

Oleh itu, "Pelican Berbasikal" pernah menjadi ujian klasik dalam kalangan masyarakat untuk menguji kemampuan model besar dalam pemahaman ruang, penggabungan objek, dan penghasilan kod.

Evaluasi model besar

But as the model grows stronger, this pelican is almost at the end of its ride.

Lihat di bawah DeepSeek R1 dan DeepSeek Dari prestasi V4, kita tahu bahawa model semasa sudah mampu menyelesaikan soalan ini dengan cukup baik.

Evaluasi model besar

Lebih penting lagi, satu SVG hanya dapat menilai output sekali sahaja oleh model.

Ia tidak mampu mengukur sama ada model boleh merancang projek yang kompleks, bekerja berterusan selama beberapa jam, dan semak serta betulkan ralatnya sendiri dalam ribuan baris kod.

Oleh itu, Kappasi menukar satu soalan kecil “lukis satu gambar” menjadi satu projek besar “bina satu dunia”—

The Pelicans can get off; Middle-earth has officially taken over.

Evaluasi model besar

Kapasi's Pelican

Segera, berita bahawa Kapasi bersedia menukar soalan “Pelican Test” juga tersebar ke pelbagai komuniti.

Ulasan yang disukai di Hacker News berpendapat bahawa walaupun kualiti gambar demo ini agak biasa, ini justru menunjukkan bahawa kita memerlukan ujian baru yang lebih sukar daripada menghasilkan satu gambar tunggal.

Patokan baru tidak seharusnya hanya melihat sama ada model mampu menggambar dengan betul, tetapi juga mengkaji sama ada ia mampu memahami sebuah dunia.

Evaluasi model besar

Setelah semua, "Pelikan Berbasikal" telah digunakan terlalu lama.

Model terus memecahkan rekod untuk tugas-tugas semacam ini, dan perbezaan antara satu sama lain semakin sukar dikenal pasti.

Sebaliknya, menghasilkan dunia 3D yang lengkap memerlukan model untuk memahami hubungan ruang antara tokoh dan objek, serta mengendalikan kamera, gerakan, dan perubahan adegan, bukan sekadar memanggil model penghasil video untuk menghasilkan satu rangkaian gambar.

Evaluasi model besar

Of course, some people have also raised objections.

The pelican test is sufficiently simple, low-cost, and results are easy to compare.

Untuk menguji satu model, menghabiskan begitu banyak token untuk menghasilkan seluruh dunia 3D agak seperti membakar kekuatan komputasi seperti kembang api.

Evaluasi model besar

Sementara itu, keupayaan Three.js sendiri untuk mengukur kemampuan komprehensif model besar juga dipertikaikan.

Sebahagian orang berpendapat bahawa demo sebegini paling banyak membuktikan bahawa Anthropic dilatih dengan baik dalam kod Three.js, tetapi tidak menunjukkan bahawa model benar-benar memahami ruang dan dunia fizikal.

Tetapi segera ada pengguna internet yang membantah:

Mengubah teks sastra yang abstrak dan tidak jelas menjadi animasi 3D, model perlu menangani hubungan ruang, hukum fizikal, objek harian, serta masalah matematik dalam transformasi 3D dan grafik komputer.

Jika ini masih dianggap hanya “bisa menulis Three.js”, agak meremehkan 5,500 baris kod ini.

Evaluasi model besar

Masih ada pengguna yang mengajukan soal yang lebih terbuka:

Adakah "penalaran ruang" benar-benar berbeza daripada penalaran yang biasa dilakukan model besar semasa memproses teks dan kod?

Satu pandangan berpendapat bahawa keberkesanan gambar bergantung pada sama ada model memahami hubungan ruang seperti "depan-belakang, dalam-luar, jauh-dekat, dan halangan", serta jarak, sudut, dan saiz relatif objek dari sudut pandang yang berbeza.

Evaluasi model besar

Namun, pandangan lain berpendapat bahawa sama ada model mengendalikan "di samping batu" atau "di dalam array", ia mungkin melakukan perkara yang sama: menghasilkan Token satu per satu berdasarkan konteks, dan dalam proses ini menyelesaikan penalaran.

Jika begitu, maka yang ditunjukkan oleh Opus 5 bukan sekadar kemampuan "ruang" yang tiba-tiba muncul.

Kemungkinan besar, kemampuan penalaran umum model bahasa besar yang asalnya digunakan untuk memahami teks dan kod, telah bermula meluas secara semula jadi ke dunia tiga dimensi.

Dari melukis seekor burung pelikan hingga membina sebuah Dunia Tengah, tajuknya kelihatan berubah, tetapi ujian di sebaliknya mungkin tetap sama:

Bolehkah model mentafsirkan pemahamannya terhadap dunia menjadi satu struktur yang benar-benar boleh dijalankan.

Dan pada akhirnya, mungkin masih ada satu soalan yang lebih tidak masuk akal lagi—

Jika model besar umum sudah mampu menulis kod sendiri untuk membina dunia 3D, serta memanggil API seperti Seedance dan ElevenLabs untuk menghasilkan gambar dan suara, maka seberapa perlu lagi pengguna membuka produk penghasil video khusus secara manual untuk memasukkan Prompt?

Pautan rujukan

[1]https://karpathy.ai/lotr-movie/

[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/

[3] https://x.com/wizardbrainz/status/2083012159341203708

[4]https://x.com/aniketjart/status/2083645765097033845

[5]https://x.com/davidfromkansas/status/2075691129899528254

[6]https://x.com/MindaugasLT/status/2083488027343470939

Artikel ini berasal daripada akaun微信公众号 "Quantum Bit", penulis: henry

Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.