एंड्रेज कारपथी ने $10 में क्लॉड ओपस 5 का उपयोग करके 3D 'द लॉर्ड ऑफ द रिंग्स' दुनिया बनाई

iconMetaEra
साझा करें
AI summary iconसारांश
एंड्रेज कारपथी ने Three.js का उपयोग करके *द लॉर्ड ऑफ द रिंग्स* के ओपनिंग का 3D संस्करण बनाने के लिए Claude Opus 5 का उपयोग किया, जिसमें 100,000 टोकन पर $10 खर्च हुए। दो घंटे में, मॉडल ने 5,500 पंक्तियों का कोड जनरेट किया, जिससे एक 93 सेकंड का एनिमेटेड वीडियो बना। दृश्य, हालांकि खुरदुरा था, लेकिन मॉडल की पाठ से 3D सामग्री जनरेट करने की क्षमता को दर्शाता था। एलेवनलैब्स ने ऑडियो का प्रबंधन किया, और कोई खेलने योग्य संस्करण या स्रोत कोड जारी नहीं किया गया। यह प्रयोग कस्टम विजुअल सॉफ्टवेयर की लागत में कमी को दर्शाता है, हालांकि स्व-सुधार अभी भी एक चुनौती है। जैसे-जैसे कुशलता बढ़ती है, CFT की चिंताएं कम होती हैं, इसलिए रिस्क-ऑन संपत्तियां ऐसे विकासों से लाभान्वित हो सकती हैं।
2 अगस्त, 2026 को, एंड्रेज कारपथी ने X पर साझा किया: उन्होंने द लॉर्ड ऑफ द रिंग्स के पहले पैराग्राफ को Claude Opus 5 को दिया, जिसे 10 लाख टोकन, लगभग 10 डॉलर के बजट के साथ Three.js का उपयोग करके 3D दुनिया में रेंडर करने के लिए कहा गया।

लेखक, स्रोत: 0x9999in1, ME News



TL;DR

  • 2 अगस्त, 2026 को, एंड्रेज कारपथी ने X पर साझा किया: उन्होंने द लॉर्ड ऑफ द रिंग्स के पहले पैराग्राफ को Claude Opus 5 को दिया, जिसे 10 लाख टोकन, लगभग 10 डॉलर के बजट के साथ Three.js का उपयोग करके 3D दुनिया में रेंडर करने के लिए कहा गया।
  • ऑपस 5 ने लगभग 2 घंटे चलाए, लगभग 5500 पंक्तियों कोड लिखा, और 93 सेकंड का एक एनिमेशन वीडियो बनाया। चित्र खुरदुरे हैं, लेकिन वास्तव में पाठ को गतिशील त्रिआयामी दृश्य में बदल दिया।
  • मुख्य बात यह नहीं है कि "AI ने 10 डॉलर में एक पूर्ण गेम बना दिया" — ऐसा नहीं हुआ। केवल वीडियो ही सार्वजनिक किया गया है, कोडबेस खुला नहीं है और न ही कोई खेलने योग्य संस्करण उपलब्ध है।
  • आवाज़ मॉडल द्वारा नहीं बनाई गई है। करपार्थी ने कहा कि नैरेटर की आवाज़ उन्होंने ElevenLabs का उपयोग करके हाथ से बनाई है, क्योंकि उन्हें आवाज़ किस प्रकार की होगी, इस पर ध्यान देना महत्वपूर्ण था।
  • असली संकेत यह है: कस्टम विजुअल सॉफ्टवेयर की "उत्पादन लागत" एआई की "अपने कार्य की जांच और अनुभव करने की क्षमता" से तेजी से घट रही है।
  • Opus 5 वीडियो देखने या गेम ट्रायल में दक्षतापूर्वक मूल रूप से काम नहीं करता है, इसके बजाय इसे विभिन्न नोड्स पर धीमे से स्क्रीनशॉट लेकर जांचना पड़ता है, जिसके दौरान कई बार त्रुटियाँ होती हैं।
  • करपाथी कहते हैं कि "ऑन-डिमांड GTA" एक दिशा है, न कि वर्तमान स्थिति। आज का यह चीज़ एक स्वचालित रूप से उत्पन्न ब्राउज़र स्टीरियो पर्सपेक्टिव बॉक्स के करीब है।

एक टेक्स्ट, दो घंटे, 5500 लाइन कोड

पहले बात स्पष्ट कर लें।

2 अगस्त, 2026 को, एंड्रेज कारपथी ने एक पोस्ट किया। उन्होंने एक प्रयोग किया: द लॉर्ड ऑफ द रिंग्स के शुरुआती पैराग्राफ को Claude Opus 5 को दिया, 10 लाख Token के बजट के साथ, जिसका अनुमान लगभग 10 डॉलर था। एकमात्र निर्देश था — इसे Three.js के साथ रेंडर करें।

Then what?

मॉडल ने लगभग दो घंटे तक खुद को चलाया। लगभग 5500 पंक्तियों का कोड लिखा। अंत में, एक 93 सेकंड का वीडियो तैयार किया गया, जिसमें एक स्टाइलिश, गतिशील मिडल-अर्थ दुनिया के माध्यम से कैमरा गुजरता है।

करपाथी खुद कैसे मूल्यांकन करते हैं? दो शब्द: जैंकी लेकिन मजेदार। खराब, लेकिन दिलचस्प।

यह बात बहुत ईमानदारी से कही गई है। क्योंकि इसे पूरा करने के लिए, मॉडल को कई गंदे और थकान वाले काम करने पड़ते हैं: एक-एक करके बहुभुज आइटम को त्रिआयामी निर्देशांक (x, y, z) में रखना, उनकी स्थिति तय करना, पूरे सीन को चलाने के लिए कोड लिखना, और यह सुनिश्चित करना कि ये सब कुछ बिना टूटे चल सके।

एक प्रासंगिक गद्य, बिना शॉट्स के, बिना एसेट लाइब्रेरी के, बिना किसी स्पष्ट निर्देश के। पात्र, वातावरण, क्रम, वातावरण, कैमरा शॉट, गति—सब कुछ मॉडल खुद कल्पना करता है। और यह वास्तव में इसे जोड़ पाया।

यही वह जगह है जहाँ आप थोड़ा अचरज में पड़ जाते हैं।

लेकिन पहले शांत हो जाएं: क्या बनाया गया है, क्या नहीं

जल्दबाजी में आने से पहले, तीन बातों को स्पष्ट कर लें: मॉडल ने वास्तव में क्या किया, मनुष्य ने क्या जोड़ा, और क्या बिल्कुल नहीं हुआ।

मॉडल द्वारा बनाया गया, वह 5500 पंक्तियाँ कोड, वह प्रोग्रामेटिक रूप से उत्पन्न Three.js सीन, वह 93 सेकंड का एनिमेशन है। यह हिस्सा वास्तविक, विश्वसनीय और ध्यान से देखने योग्य है।

लोग ने क्या भर दिया? ऑडियो। करपथी ने अपने जवाब में स्पष्ट किया: बैकग्राउंड वॉइस उन्होंने खुद ElevenLabs का उपयोग करके मैनुअल रूप से बनाई। उन्होंने कहा कि LLM वास्तव में API का उपयोग करके स्वचालित रूप से इसे पूरा कर सकता है, लेकिन उन्हें आवाज़ का चयन महत्वपूर्ण लगा, इसलिए उन्होंने खुद हाथ लगाया। इसलिए यह "टेक्स्ट से प्रोडक्शन" तक की पूरी तरह स्वचालित प्रक्रिया नहीं है। इसे ऐसा मत कहें।

क्या नहीं हुआ?

कोई डाउनलोड करने योग्य कोड रिपॉजिटरी नहीं है। कोई ओपन सोर्स रिपॉजिटरी नहीं है। कोई ऐसा खेलने योग्य संस्करण नहीं है जहाँ आप दर्शक, NPC, या पात्र के रूप में प्रवेश कर सकें। कोई ऐसी क्षमता नहीं है जहाँ आप खेलते समय नए दुनिया को वास्तविक समय में उत्पन्न कर सकें। कोई सामान्य, सीखा हुआ "विश्व मॉडल" नहीं है। और न ही उत्पादन-स्तरीय टकराव, अंतःक्रिया, या कथानक सामंजस्य है। यहाँ तक कि कोई पुनरुत्पादनयोग्य टोकन खपत और लागत की सूची भी प्रकाशित नहीं की गई है।

यह एक वीडियो है।

तो बार-बार उद्धृत किया गया वाक्य “अनुरोध पर दिखने वाला GTA” —— an ephemeral GTA of X on demand —— वह दिशा है जिसके बारे में Karpathy उत्साहित थे, न कि जो चीज़ उनके पास अभी है। आज का यह उत्पाद, एक स्वचालित रूप से उत्पन्न ब्राउज़र स्टीरियो पर्सपेक्टिव बॉक्स की तरह है, जो ओपन-वर्ल्ड गेम से लाखों किलोमीटर दूर है।

मैं इतने शब्दों में "यह क्या नहीं कर पाया" पर क्यों बात कर रहा हूँ?

क्योंकि इस ओपस 5 गेम डेमो के प्रसार में, सबसे बड़ा विकृति यही स्तर पर हुआ। कुछ लोगों ने "10 डॉलर में द लॉर्ड ऑफ द रिंग्स गेम बनाएं" देखकर शेयर किया, लेकिन "वीडियो, अपूर्ण, ऑडियो मैनुअल, कोड रहित" इन छोटे शब्दों को नहीं देखा। विचारों को तथ्यों पर आधारित होना चाहिए, और पहले तथ्यों की सीमा स्पष्ट करनी चाहिए।

Why is this more worth serious attention than "a pelican riding a bicycle"?

करपाथी के इस प्रयोग का वास्तविक अर्थ "दिखावा" नहीं, बल्कि "एक नया मापदंड" है।

पहले लोग महान मॉडल की विजुअल एन्कोडिंग क्षमता कैसे जांचते थे? उन्हें एक "साइकिल चला रहा हुआ पेलिकन" का SVG बनाने के लिए कहते थे। यह परीक्षण उपयोगी था—यह स्थानीय तर्क, निर्देशों का पालन, और ब्राउज़र ग्राफ़िक्स की समझ को दर्शाता था। लेकिन यह बहुत आसानी से "उत्तर याद करके" पार किया जा सकता था, और एक ही फ्रेम के आधार पर निर्णय लेना भी बहुत आसान था।

The "Lord of the Rings" task has significantly extended the evaluation dimensions.

समय अवधि: कुछ मिनट से लेकर लगभग दो घंटे तक। कोड का आकार: कुछ दर्जन से लेकर लगभग 5500 पंक्तियों तक। अस्पष्टता: "एक वस्तु और संरचना" से बदलकर "पात्र, परिवेश, कालक्रम, वातावरण, कैमरा एंगल, गति" सभी को संभालना। स्थिति: मूल रूप से स्थिर से बदलकर समय के साथ विकसित होने वाली एनिमेशन घटनाओं में। सामग्री: कुछ आकृतियों से बदलकर बड़ी संख्या में पुनःउपयोगयोग्य प्रोग्रामेटिक ऑब्जेक्ट्स में।

सबसे बड़ी चुनौती वेरिफिकेशन डाइमेंशन है। एक SVG बनाएं, आप एक फ्रेम देखकर ही जान सकते हैं कि यह सही है या नहीं। एक चलती हुई दुनिया को रेंडर करने के लिए, आपको असंख्य समय और ट्रांजिशन्स की जांच करनी पड़ती है—ज्योमेट्री, कैमरा, ओक्कलूजन, मूवमेंट, रिदम, परफॉर्मेंस, कोई भी एक जगह फेल हो सकती है।

यही लंबे अवधि, उच्च अस्पष्टता और मजबूत स्थिति वाला वास्तविक कार्य है। यह "चित्र बनाना" नहीं, बल्कि "सॉफ्टवेयर बनाना" की ओर अग्रसर है।

बेशक, एक वस्तुनिष्ठ बात यह भी है: यह कोई कठोर मॉडल बेंचमार्क नहीं है। कारपाथी ने पूरा प्रॉम्प्ट, टूलचेन कॉन्फ़िगरेशन, पुनर्प्रयास की संख्या, टोकन ट्रैजेक्टरी, सोर्स कोड और स्कोरिंग मानदंड जारी नहीं किए हैं। यह एक जानकारीपूर्ण सार्वजनिक प्रयोग है, एक नियंत्रित क्रॉस-कम्पेरिसन नहीं। इसका उपयोग किसी की रैंकिंग के लिए न करें।

सस्ता है "जनरेट", महंगा अभी भी "आंखें"

तो इस बात का वास्तविक अंतर्दृष्टि क्या है?

मुझे लगता है कि एक वाक्य में: कस्टम विजुअल सॉफ्टवेयर की उत्पादन लागत, AI द्वारा अपने कार्य की जांच और अनुभव करने की क्षमता की तुलना में तेजी से कम हो रही है।

This needs to be explained in detail.

ऐसी अत्यधिक कस्टमाइज़ की गई सामग्री—जिसमें किसी विशिष्ट पाठ को एक व्यक्तिगत 3D सीन में बदल दिया जाए—पहले लगभग कोई भी इसके लिए अलग से काम नहीं करना चाहता था। क्यों? लागत और समय दोनों अनुपातिक नहीं हैं। आप एक टीम को भाड़े पर रखते हैं, और वे आपके लिए "द लॉर्ड ऑफ दे रिंग्स" के शुरुआती 93 सेकंड का एनिमेशन बनाते हैं, तो इसमें कितना पैसा और कितने दिन लगेंगे?

लेकिन LLM लगातार काम कर सकता है। यह थकता नहीं, शिकायत नहीं करता, 10 डॉलर में दो घंटे चलता है। कस्टमाइज्ड दुनिया, "लक्ज़री" से "आसानी से उत्पन्न किया जाने वाला चीज़" बन गई है। यह आपूर्ति पक्ष पर एक वास्तविक, भारी कीमत कमी है।

लेकिन समस्या दूसरी ओर है।

ओपस 5 दुनिया बना सकता है, लेकिन अपनी बनाई गई दुनिया को सही से नहीं देख सकता। यह वीडियो देखने के लिए कुशल और मूल रूप से सक्षम नहीं है, और गेम में प्रयोग भी नहीं कर सकता। यह केवल विभिन्न नोड्स पर धीमे-धीमे स्क्रीनशॉट लेकर, एक-एक करके जांच सकता है। यह एक चित्रकार के समान है जो आँखें बंद करके पेंट करता है, और केवल कुछ मिनटों के बाद ही कैनवास को एक नज़र देखने की अनुमति पाता है। प्रक्रिया में कई बार त्रुटियाँ होती हैं, जिससे कई कच्चे और खराब स्थान बच जाते हैं—janky इसी से आया है।

Generation is a gush; inspection is a drip.

यही करपथी के पोस्ट में सबसे तीखी तुलना है: यह एक दुनिया बना सकता है, लेकिन अभी भी अपनी बनाई गई दुनिया की जांच और अनुभव करने में सक्षम नहीं है।

आँखें, नया बैंकनिंग बन गईं।

यह एकमात्र उदाहरण नहीं है: पूरी गर्मियों का "एक वाक्य में गेम बनाएं"

कोई पूछ सकता है: क्या यह केवल एक भाग्यशाली प्रदर्शन होगा?

ऐसा नहीं लगता। समय रेखा को फैलाकर देखें, जुलाई 2026 से, Opus 5 के चारों ओर एक पूरी श्रृंखला समान डेमो उभरे, जिसने पूरी गर्मियों में लोकप्रियता प्राप्त की।

किसी ने इसका उपयोग होमवर्ल्ड शैली के स्पेस रियल-टाइम स्ट्रेटेजी गेम के लिए किया, और 632.65 डॉलर की लागत सूची सार्वजनिक की। किसी ने रॉकेट लीग शैली की क्लोन बनाई, और यह अधिक व्यावहारिक है, कोड उपलब्ध है, संस्करण खेला जा सकता है, और पुनर्निर्माण क्षमता अधिक है। साथ ही, ब्राउज़र में FPS, प्रोग्रामेटिक रूप से उत्पन्न रेगिस्तान की खोज, हॉरर गेम, कार्टिंग रेस...

क्या आपने पैटर्न पहचान लिया?

इन डेमो की गुणवत्ता अलग-अलग है, और पुनर्निर्माण क्षमता में भारी अंतर है। कुछ में केवल वीडियो है, कुछ में बिल तक शेयर किए गए हैं। लेकिन वे सभी एक ही दिशा की ओर इशारा करते हैं: एक प्राकृतिक भाषा के प्रॉम्प्ट का उपयोग करके, मॉडल को लंबे समय तक स्वतंत्र रूप से हजारों-लाखों पंक्तियों कोड लिखने के लिए प्रेरित करना, ताकि एक कार्यरत, इंटरैक्टिव दुनिया बनाई जा सके—यह कार्य "असंभव" से "हर हफ्ते कोई न कोई इसे आजमा रहा है" में बदल गया है।

करपाथी का द लॉर्ड ऑफ द रिंग्स एक अचानक आने वाला चमत्कार नहीं है। यह इस वक्र पर एक बिंदु है। एक ऐसा बिंदु जिसे एक प्रभावशाली व्यक्ति ने, पर्याप्त रोमांटिक पाठ के साथ, पर्याप्त स्पष्टता से प्रस्तुत किया है।

तो, "AI द्वारा गेम बनाने का युग" आ गया है या नहीं?

उस सबसे अधिक पूछे जाने वाले प्रश्न पर वापस जाएं।

Has it arrived?

मेरा निर्णय है: दिशा तो निर्धारित हो चुकी है, लेकिन युग अभी आया नहीं है।

दिशा निश्चित है, क्योंकि आपूर्ति की लागत वक्र पहले ही नीचे की ओर मुड़ चुका है, और वह तेजी से नीचे जा रहा है। AI के माध्यम से लंबे समय तक कस्टमाइज़्ड इंटरैक्टिव कंटेंट जेनरेट करना, तकनीकी रूप से 0 से 1 तक का कदम पूरा हो चुका है। अब बाकी काम 1 से उपयोग करने योग्य, मज़ेदार और बेचने योग्य स्तर तक पहुँचना है।

समय नहीं आया है, क्योंकि तीन बाधाएँ अभी भी वास्तविक रूप से वहाँ मौजूद हैं।

पहला बिंदु है परिकल्पना बंद चक्र। मॉडल को मूल रूप से देखना, मूल रूप से खेलना और अपने आउटपुट का मूल्यांकन करना आवश्यक है, बल्कि किसी व्यक्ति के द्वारा स्क्रीनशॉट लेने, आवाज़ जोड़ने और समस्या का समाधान करने पर निर्भर नहीं होना चाहिए। यह बहुआयामी क्षमता में सबसे कठिन हिस्सा है—यह "एक छवि समझना" नहीं है, बल्कि "समय के साथ बदलती, अंतरक्रियात्मक गतिशील प्रक्रिया को समझना" है।

दूसरी बात, दोहराया जा सकना और डिलीवर किया जा सकना। वीडियो सॉफ्टवेयर नहीं होता। डेमो उत्पाद नहीं होता। 93 सेकंड का एक शानदार अंश और एक ऐसी चीज़ के बीच, जिसे कोई डाउनलोड कर सके, चला सके, संशोधित कर सके और एक घंटे तक खेल सके, पूरी इंजीनियरिंग की कठिन मेहनत होती है।

तीसरा पहलू है "रियल-टाइमनेस" शब्द का महत्व। करपथी की कल्पना है कि आप एक अस्थायी रूप से जनरेट किए गए विश्व में प्रवेश करते हैं, एक किरदार, दर्शक या NPC के रूप में—जैसे एक ऑन-डिमांड G.T.A.। लेकिन अभी यह दो घंटे के ऑफलाइन प्रोसेसिंग के बाद एक वीडियो बनाने का मामला है। "दो घंटे में वीडियो" से "आपके नीचे की सड़क का रियल-टाइम में जनरेशन" तक पहुँचना कोई मात्रात्मक परिवर्तन नहीं, बल्कि गुणात्मक क्रांति है।

तो मुझे "समय आ गया है" जैसा वाक्य पसंद नहीं है। बहुत भारी है।

मैं इसे इस तरह कहना पसंद करूंगा: हम "साइकिल चला रहे पेलिकन" के युग से निकल रहे हैं और एक ऐसे संक्रमणकाल में प्रवेश कर रहे हैं, जहां मॉडल खुद बनाए गए कच्चे दुनिया को देख नहीं पा रहे हैं।

इस अंतराल की अवधि कितनी होगी? कोई नहीं जानता। यह दो साल भी हो सकता है, पांच साल भी। यह उस "आंख" पर निर्भर करता है—AI-नेटिव अनुभव और स्व-समीक्षा क्षमता—जब यह पूरी होगी।

लेकिन एक बात मैं बिल्कुल निश्चित हूँ।

जब एक दुनिया बनाने के लिए केवल 10 डॉलर और दो घंटे की जरूरत होती है, तो "बनाना" अब दुर्लभ नहीं रहा। दुर्लभ है "आपने क्या बनाया" को समझना, और "आप वास्तव में क्या बनाना चाहते हैं"। मशीनें "बनाने" का काम करती हैं, जबकि "चाहना" और "समझना" का काम अभी भी मनुष्यों के हाथों में है।

The rough middle earth is already running.

जब आप वास्तव में अंदर जा पाएंगे—बेचैन न हों, धीरे-धीरे करें। यह बात, इंतजार करने लायक है।

Source citation

  • एंड्रेज कारपथी द्वारा 2 अगस्त, 2026 को X (पूर्व में ट्विटर) पर पोस्ट किया गया मूल पोस्ट और वीडियो
  • Anthropic ने Claude Opus 5 के लिए आधिकारिक घोषणा जारी की, anthropic.com
  • Three.js की आधिकारिक वेबसाइट, threejs.org
  • explainx.ai: कारपथी का $10 ओपस 5 द लॉर्ड ऑफ द रिंग्स वर्ल्ड: द न्यू एआई एवल, 2 अगस्त, 2026
  • Benzinga: एंड्रेज कारपथी कहते हैं कि AI ने क्लॉड ओपस द्वारा 3D 'द लॉर्ड ऑफ द रिंग्स' दुनिया बनाने के बाद सरल प्रॉम्प्ट्स को पार कर लिया है, 2026 अगस्त
  • Enterprise DNA: एंड्रेज कारपाथी का नेक्स्ट-जेन बेंचमार्क मोमेंट, 2 अगस्त, 2026
  • explainx.ai: "Opus 5 ने एक प्रॉम्प्ट से होमवर्ल्ड-शैली की स्पेस आरटीएस बनाई — $632.65 बाद", 28 जुलाई, 2026
  • explainx.ai: टॉप 10 Claude Opus 5 गेम प्रॉम्प्ट्स (वास्तविक प्रॉम्प्ट्स के साथ), 29 जुलाई, 2026
डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।