Andrej Karpathy Menggunakan Claude Opus 5 untuk Menghasilkan Dunia 'Lord of the Rings' 3D dengan Harga $10

iconMetaEra
Kongsi
AI summary iconRingkasan
Andrej Karpathy menggunakan Claude Opus 5 untuk membina versi 3D pembukaan *The Lord of the Rings* menggunakan Three.js, menghabiskan $10 untuk 100,000 token. Dalam masa dua jam, model tersebut menghasilkan 5,500 baris kod, menghasilkan video animasi selama 93 saat. Adegan tersebut, walaupun kasar, menunjukkan keupayaan model untuk menghasilkan kandungan 3D daripada teks. ElevenLabs menangani audio, tetapi tiada versi boleh dimainkan atau kod sumber yang dirilis. Eksperimen ini mencerminkan penurunan kos untuk perisian visual tersuai, walaupun peningkatan diri masih menjadi cabaran. Aset berisiko tinggi mungkin mendapat manfaat daripada perkembangan seperti ini, kerana kebimbangan CFT mereda dengan peningkatan kecekapan.
Pada 2 Ogos 2026, Andrej Karpathy berkongsi di X: Dia memberikan paragraf pertama pembukaan The Lord of the Rings kepada Claude Opus 5, dengan anggaran 1 juta token, atau sekitar $10, untuk merendernya menjadi dunia 3D menggunakan Three.js.

Penulis artikel, sumber: 0x9999in1, ME News



TL;DR

  • Pada 2 Ogos 2026, Andrej Karpathy berkongsi di X: Dia memberikan paragraf pertama pembukaan The Lord of the Rings kepada Claude Opus 5, dengan anggaran 1 juta token, atau sekitar $10, untuk merendernya menjadi dunia 3D menggunakan Three.js.
  • Opus 5 berjalan selama kira-kira 2 jam, menulis kira-kira 5500 baris kod, dan menghasilkan video animasi 93 saat. Gambar kasar, tetapi berjaya mengubah teks menjadi adegan tiga dimensi yang bergerak.
  • Bukan perkara "AI menghabiskan 10 dolar untuk membuat permainan siap edar"—ia tidak melakukannya. Yang dipaparkan hanyalah video, tanpa repositori kod sumber terbuka atau versi boleh dimainkan.
  • Audio bukan dihasilkan oleh model. Karpathy mengatakan narasi itu dihasilkan secara manual menggunakan ElevenLabs kerana beliau memperhatikan suara yang digunakan.
  • Isyarat sebenar adalah: "kos penghasilan" perisian visual yang disesuaikan, sedang menurun lebih pantas berbanding kemampuan AI untuk "memeriksa dan mengalami karya sendiri".
  • Opus 5 tidak mampu menonton video secara native dengan cekap, juga tidak boleh masuk ke permainan untuk mencuba, hanya boleh mengambil tangkapan skrin perlahan-lahan di pelbagai nod, dan berulang kali mengalami ralat semasa proses ini.
  • Karpathy mengatakan "GTA yang muncul atas permintaan" adalah arah, bukan keadaan semasa. Hari ini, perkara ini lebih dekat kepada kotak perspektif stereoskopik automatik yang dihasilkan oleh browser.

Satu teks, dua jam, 5500 baris kod

Katakan perkara itu dengan jelas terlebih dahulu.

Pada 2 Disember 2026, Andrej Karpathy memuatkan satu pos. Beliau menjalankan eksperimen: mengambil petikan pembukaan The Lord of the Rings dan memberikannya kepada Claude Opus 5. Beliau memberikan bajet 1 juta token, yang dianggarkan sebanyak $10. Permintaannya hanya satu ayat—render ia menggunakan Three.js.

Then what?

Model berjalan sendiri selama kira-kira dua jam. Menulis sebanyak 5,500 baris kod. Hasil akhirnya ialah video 93 saat yang menunjukkan penerbangan melalui dunia Middle-earth yang distilasi dan bergerak.

Bagaimana Karpathy menilainya sendiri? Dua perkataan: janky but fun. Kasar, tetapi menarik.

Ini kata-kata yang jujur. Untuk mencapai hal ini, model perlu melakukan banyak tugas yang melelahkan: menempatkan berbagai bahan poligon ke dalam koordinat tiga dimensi (x, y, z), mengatur posisi mereka, menulis kod untuk membuat seluruh adegan bergerak, serta memastikan semua elemen ini berjalan tanpa rosak.

Sebuah esei, tanpa adegan, tanpa perpustakaan aset, tanpa arahan jelas. Peranan, alam sekitar, urutan, suasana, kamera, ritma—semuanya bergantung pada model sendiri untuk membayangkan. Ia sebenarnya berjaya menyusunnya.

Inilah yang membuat orang terkejut.

Tetapi sila tenang dahulu: apa yang telah dibuat, dan apa yang tidak

Sebelum bersemangat, anda perlu membezakan tiga perkara: apa yang sebenarnya dihasilkan oleh model, apa yang ditambahkan oleh manusia, dan apa yang tidak berlaku sama sekali.

Yang dihasilkan oleh model ialah 5500 baris kod, adegan Three.js yang dihasilkan secara berprogram, dan animasi yang boleh diputar dalam 93 saat. Bahagian ini adalah benar, boleh dipercayai, dan patut diperhatikan dengan serius.

Bagaimana dengan suara? Karpathy secara khusus menegaskan dalam jawapannya: narasi itu dibuat secara manual olehnya sendiri menggunakan ElevenLabs. Dia berkata bahawa LLM sebenarnya boleh memanggil API untuk menyelesaikannya secara automatik, tetapi dia peduli dengan suara yang digunakan, jadi dia melakukannya sendiri. Jadi, ini bukan garis pengeluaran automatik sepenuhnya "dari teks ke hasil akhir". Jangan katakan ia begitu.

Apa yang tidak berlaku?

Tiada repositori kod yang boleh dimuat turun. Tiada repositori sumber terbuka. Tiada versi boleh dimainkan di mana anda boleh masuk sebagai penonton, sebagai NPC, atau sebagai watak utama. Tiada kemampuan untuk menghasilkan dunia baru secara pantas semasa bermain. Tiada "model dunia" generik yang dipelajari. Juga tiada tabrakan, interaksi, atau konsistensi naratif peringkat pengeluaran. Bahkan, tiada senarai penggunaan dan kos Token yang boleh diperbanyakkan yang telah dipublikasikan.

Terbuka, iaitu satu video.

Jadi, frasa yang sering dikutip, "GTA yang muncul atas permintaan" — an ephemeral GTA of X on demand — adalah arah yang membuat Karpathy bersemangat, bukan sesuatu yang ada di tangannya sekarang. Produk akhir hari ini lebih menyerupai kotak perspektif tiga dimensi peramban yang dihasilkan secara automatik, jauh sekali dari permainan dunia terbuka.

Mengapa saya perlu menggunakan begitu banyak perkataan untuk membincangkan "apa yang ia tidak capai"?

Kerana distorsi terbesar dalam penyebaran demo permainan Opus 5 ini berlaku pada tahap ini. Ada yang melihat "membuat permainan The Lord of the Rings dengan $10" dan membagikannya, tetapi tidak memperhatikan teks kecil yang menyatakan "video, bukan produk akhir, audio buatan, tanpa kod". Pendapat harus dibina atas fakta, dan sempadan fakta perlu ditentukan terlebih dahulu.

Mengapa ini lebih patut diperhatikan berbanding "bangau yang berbasikal"?

Eksperimen Karpathy ini, makna sebenarnya bukan pada "pamer kemahiran", tetapi pada "mengganti ukuran".

Dulu, bagaimana orang menguji kemampuan kod pengekodan visual model besar? Minta ia menghasilkan SVG "bangau yang memandu basikal". Ujian ini berguna—ia mampu menunjukkan penalaran ruang, kepatuhan terhadap arahan, dan pemahaman terhadap grafik peramban. Tetapi ia terlalu mudah untuk "hafal jawapan", dan terlalu mudah untuk membuat kesimpulan berdasarkan satu gambar sahaja.

Tugas "The Lord of the Rings" ini telah memperpanjang dimensi ulasan secara signifikan.

Masa: Dari beberapa minit, diperpanjangkan kepada sekitar dua jam. Skala kod: Dari puluhan hingga ratusan baris, diperpanjangkan kepada sekitar 5500 baris. Ketidakjelasan: Dari "satu objek ditambah komposisi", berubah menjadi perlu mengendalikan semua aspek: watak, persekitaran, urutan masa, suasana, kamera, dan ritma. Keadaan: Dari statik asas, berubah menjadi peristiwa animasi yang bergerak mengikut masa. Bahan: Dari beberapa bentuk, berubah menjadi banyak objek berprogram yang boleh digunakan semula.

Yang paling kritikal ialah dimensi pengesahan. Lukis satu SVG, anda hanya perlu lihat satu bingkai untuk tahu sama ada ia betul atau tidak. Render satu dunia yang bergerak, anda perlu memeriksa ribuan momen, ribuan peralihan—geometri, kamera, halangan, pergerakan, ritma, prestasi, mana-mana satu sahaja boleh gagal.

Ini adalah tugas sebenar yang melibatkan jangka panjang, keambiguan tinggi, dan keadaan kuat. Ia mendekati perkara "membina perisian" itu sendiri, bukan sekadar "melukis gambar".

Tentu, perlu dinyatakan secara objektif: ini bukan ujian piawaian model yang ketat. Karpathy tidak mempublikasikan Prompt penuh, konfigurasi alat, bilangan percubaan semula, jejak Token, kod sumber, atau kriteria penilaian. Ia adalah eksperimen awam yang bermakna, bukan perbandingan melintang yang terkawal. Jangan gunakan ini untuk peringkat.

Yang murah ialah "penghasilan", yang mahal tetaplah "mata"

Apakah wawasan sebenar perkara ini?

Saya rasa satu pernyataan sahaja: Kos penghasilan perisian visual yang disesuaikan sedang menurun lebih pantas berbanding kemampuan AI untuk memeriksa dan mengalami karya mereka sendiri.

Ini perlu dijelaskan secara terperinci.

Kandungan yang sangat disesuaikan semacam ini—mengubah satu petikan teks tertentu menjadi adegan 3D eksklusif—dulu hampir tiada orang yang bersedia membuatnya secara khusus. Mengapa? Kos dan masa tidak sepadan. Anda menyewa sebuah pasukan untuk menjadikan pembukaan The Lord of the Rings menjadi animasi 93 saat, berapa banyak wang dan hari yang diperlukan?

Namun, LLM boleh terus beroperasi. Ia tidak letih, tidak mengeluh, hanya $10 untuk dua jam. Dunia yang disesuaikan berubah dari "barang mewah" menjadi "sesuatu yang boleh dihasilkan dengan mudah". Ini adalah penurunan harga yang nyata di sisi penawaran.

Tetapi masalahnya di sebelah lain.

Opus 5 mampu menciptakan dunia, tetapi tidak mampu melihat dunia ciptaannya dengan lancar. Ia tidak boleh menonton video secara efisien dan asli, juga tidak boleh masuk ke dalam permainan untuk mencuba. Ia hanya mampu mengambil tangkapan skrin perlahan-lahan di pelbagai nod, dan memeriksa satu persatu. Ini seperti seorang pelukis yang memakai penutup mata semasa melukis, dan hanya dibenarkan membuka mata sekejap setiap beberapa minit untuk melihat kanvas. Proses ini sering menghasilkan kesilapan, meninggalkan banyak bahagian kasar dan gangguan—janky datang daripada sini.

Penghasilan adalah semburan, pemeriksaan adalah bocor.

Ini adalah perbandingan paling tajam dalam postingan Karpathy: ia sudah mampu menciptakan sebuah dunia, tetapi belum mampu memeriksa dan mengalami dunia yang diciptakannya dengan lancar.

Mata, menjadi longkang baru.

Ini bukan kes terasing: sepanjang musim panas, "buat permainan dalam satu ayat"

Adakah orang yang bertanya: Adakah ini hanya satu persembahan beruntung?

Tidak begitu. Apabila dilihat dari garis masa, mulai Julai 2026, serangkaian demo sejenis sekitar Opus 5 muncul dan menjadi popular sepanjang musim panas.

Seseorang menggunakannya untuk membuat permainan strategi masa nyata bertema Homeworld, dan mendedahkan senarai kos—USD 632.65. Seseorang lain membuat klon bergaya Rocket League, dan versi ini lebih praktikal, kodnya boleh diperiksa, versinya boleh dimainkan, dan kebolehulangan lebih tinggi. Ada pula FPS dalam browser, eksplorasi gurun yang dijana secara prosedural, permainan seram, dan perlumbaan karter...

Do you see the pattern?

Kualiti demo-demo ini berbeza-beza, dan kebolehulangan hasilnya sangat berbeza. Ada yang hanya mempunyai video tanpa kod, ada yang bahkan memaparkan bil. Tetapi semuanya menunjukkan satu trend yang sama: menggunakan satu Prompt bahasa semula jadi untuk mendorong model menulis ribuan baris kod secara bebas dan berterusan, menyusun dunia interaktif yang boleh berjalan—perkara yang dahulu "tidak mungkin dibayangkan" kini menjadi "setiap minggu ada orang mencuba".

The Lord of the Rings oleh Karpathy bukanlah keajaiban yang muncul tiba-tiba. Ia adalah satu titik di atas lengkung ini. Satu titik yang secara kebetulan diceritakan dengan jelas oleh seseorang yang berpengaruh, menggunakan teks yang cukup romantis.

Jadi, adakah "Zaman Permainan yang Dibuat oleh AI" sudah tiba?

Kembali kepada soalan yang paling ingin ditanyakan.

Sudah datang?

Penilaian saya: Arah sudah ditentukan, tetapi masanya belum tiba.

Arahnya pasti, kerana lengkung kos sisi penawaran telah berbalik ke bawah dan menurun dengan pantas. Menghasilkan kandungan interaktif yang disesuaikan secara jangka panjang dengan AI, secara teknis telah berjaya melangkah dari 0 ke 1. Yang tinggal ialah melangkah dari 1 ke tahap boleh digunakan, boleh dimainkan, dan boleh dijual.

Mengatakan zaman belum tiba kerana tiga rintangan masih benar-benar berada di sana.

Pertama ialah gelung persepsi. Model mesti mampu melihat, bermain, dan menilai outputnya sendiri secara asli, bukan bergantung pada manusia untuk mengambil tangkapan layar, menyediakan suara, atau membersihkan kesalahan. Ini adalah bahagian paling sukar dalam kemampuan multimodal—bukan sekadar "memahami satu gambar", tetapi "memahami proses dinamik yang berubah seiring masa dan bersifat interaktif".

Kedua, adalah keterulangan dan ketersediaan. Video bukan perisian. Demo bukan produk. Satu klip menarik selama 93 saat, dan sesuatu yang orang lain boleh muat turun, jalankan, ubah, dan mainkan selama satu jam, dipisahkan oleh seluruh kerja keras kejuruteraan.

Ketiga, adalah beban perkataan "ketepatan masa". Karpathy membayangkan anda memasuki dunia yang dijana secara sementara, sebagai watak, sebagai penonton, sebagai NPC—seperti GTA yang muncul atas permintaan. Tetapi kini, ia memerlukan dua jam untuk menghasilkan satu video secara luar talian. Dari "dua jam untuk menghasilkan video" kepada "menjana jalan di bawah kaki anda secara langsung", ini bukan perubahan kuantitatif, tetapi perubahan kualitatif.

Jadi saya tidak suka ungkapan seperti "masa telah tiba". Terlalu berlebihan.

Saya lebih suka mengatakan ini: Kita sedang meninggalkan era "bangau berbasikal" dan memasuki masa peralihan di mana model dapat menciptakan dunia yang kasar, tetapi masih tidak dapat melihat apa yang telah mereka ciptakan.

Berapa lama tempoh peralihan ini? Tiada siapa yang tahu. Boleh jadi dua tahun, atau lima tahun. Bergantung pada bila “mata” itu—kesedaran dan kemampuan penilaian diri berasaskan AI—akan dilengkapkan.

Tetapi ada satu perkara yang saya cukup pasti.

Apabila mencipta sebuah dunia hanya memerlukan 10 dolar dan dua jam, kelangkaan bukan lagi pada "mencipta". Kelangkaan terletak pada "memahami apa yang telah kamu cipta" dan "apa sebenarnya yang ingin kamu cipta". Mesin bertanggung jawab atas "mencipta" dalam separuh kedua, manakala "ingin" dan "memahami" dalam separuh pertama masih sementara menjadi tanggungjawab manusia.

Tengah kasar sudah boleh berjalan.

Mengenai bila anda benar-benar boleh masuk—jangan tergesa-gesa, ambil masa perlahan-lahan. Ini perkara yang patut ditunggu.

Sumber rujukan

  • Pos dan video asal oleh Andrej Karpathy pada 2 Ogos 2026 di X (sebelum ini Twitter)
  • Anthropic mengumumkan rasmi《Claude Opus 5》, anthropic.com
  • Laman web rasmi Three.js, threejs.org
  • explainx.ai: "Karpathy's $10 Opus 5 Lord of the Rings World: The New AI Eval", 2 Mei 2026
  • Benzinga: "Andrej Karpathy Mengatakan AI Telah Melangkah Melampaui Promt Mudah Selepas Claude Opus Membina Dunia 3D 'Lord of the Rings'", Ogos 2026
  • Enterprise DNA: `Andrej Karpathy's next-gen benchmark moment`, 2 Mei 2026
  • explainx.ai: "Opus 5 Membina RTS Luar Angkasa Gaya Homeworld Daripada Satu Permintaan — $632.65 Kemudian", 28 Julai 2026
  • explainx.ai: "10 Promt Permainan Claude Opus 5 Teratas (Dengan Promt Sebenar)", 29 Julai 2026
Penafian: Maklumat yang terdapat pada halaman ini mungkin telah diperoleh daripada pihak ketiga dan tidak semestinya menggambarkan pandangan atau pendapat KuCoin. Kandungan ini adalah disediakan bagi tujuan maklumat umum sahaja, tanpa sebarang perwakilan atau waranti dalam apa jua bentuk, dan juga tidak boleh ditafsirkan sebagai nasihat kewangan atau pelaburan. KuCoin tidak akan bertanggungjawab untuk sebarang kesilapan atau pengabaian, atau untuk sebarang akibat yang terhasil daripada penggunaan maklumat ini. Pelaburan dalam aset digital boleh membawa risiko. Sila menilai risiko produk dan toleransi risiko anda dengan teliti berdasarkan keadaan kewangan anda sendiri. Untuk maklumat lanjut, sila rujuk kepada Terma Penggunaan dan Pendedahan Risiko kami.