एंथ्रोपिक का ओपस 5 AI का उपयोग करके 3D 'द लॉर्ड ऑफ द रिंग्स' दुनिया बनाता है

icon MarsBit
साझा करें
AI summary iconसारांश
AI और क्रिप्टो समाचार टूटा, जब Anthropic का Opus 5 ने Three.js का उपयोग करके *द लॉर्ड ऑफ द रिंग्स* दुनिया का 3D संस्करण बनाया। यह प्रोजेक्ट, जिसकी अगुवाई AI शोधकर्ता Karpathy ने की, ने 1 मिलियन टोकन, 2 घंटे और 5,500 लाइनों के कोड का उपयोग किया। मॉडल ने उपन्यास की शुरुआत को एक ब्राउज़र-आधारित 3D दृश्य में प्रस्तुत किया, हालांकि परिणाम कच्चा और अमूर्त था। RWA (रियल-वर्ल्ड एसेट्स) के समाचार को बढ़ती लोकप्रियता मिल रही है, क्योंकि AI प्रयोग डिजिटल परिवेशों में सीमाओं को आगे बढ़ा रहे हैं।

बातें छोड़िए, तुरंत दैनिक लेटे रहने (doge) की शुरुआत करें!

अभी-अभी, दिग्गज कापासी ने घोषणा की कि "हम" Anthropic ने मॉडल को नए तरीके से ट्रेन करना शुरू कर दिया है—

The Lord of the Rings.

Large Model Evaluation

कपासी के अनुसार, यह "द लॉर्ड ऑफ द रिंग्स बेंचमार्क" पिछले लोकप्रिय "पेलिकन बाइसिकलिंग" SVG टेस्ट को बदल रहा है।

Large Model Evaluation

विशेष रूप से, कैपेसी ने सीधे द लॉर्ड ऑफ द रिंग्स की शुरुआत Opus 5 को दे दी, ताकि मॉडल Three.js का उपयोग करके एक पूरा "मिडल-एथ" तैयार कर सके।

अंतिम परिणाम के बारे में, यह कुछ इस तरह लगता है जैसे 1990 के अंत और 21वीं सदी की शुरुआत की चीनी 3D एनिमेटेड फिल्में: बहुत कच्ची और बहुत अमूर्त।

लेकिन वस्तुनिष्ठ रूप से, अगर आप न्यूजीलैंड में स्थित द लॉर्ड ऑफ द रिंग के शूटिंग स्थल होबिटन को अच्छी तरह से जानते हैं, तो आप वास्तव में थोड़ा सा समानता देख सकते हैं~

हालांकि, यह एक ऐसा चीज़ है जो दिखने में बहुत अच्छी नहीं लगती, लेकिन इसने Opus 5: 100 लाख टोकन, 2 घंटे और 5500 पंक्तियों कोड का उपयोग किया।

Of course, Claude is not the only one shining on stage.

सबसे मजेदार बात यह है कि नेटिज़न्स ने अभी एक नया बर्तन पेश किया है DeepSeek V4 फ्लैश संस्करण।

एक पूरा "चीनी लोग उड़ सकते हैं", चित्र में सभी व्यक्ति तैर रहे हैं।

In the face of these currently visible blunders, Kappasi is also quite reasonable.

उन्होंने बताया कि वर्तमान में Opus 5 अपने द्वारा उत्पन्न दुनिया में वास्तव में "प्रवेश" नहीं कर सकता, बल्कि विभिन्न समय बिंदुओं पर लगातार स्क्रीनशॉट लेना पड़ता है और फिर धीरे-धीरे यह जांचना पड़ता है कि कहाँ समस्या है।

और यह वर्तमान बड़े मॉडल की एक स्पष्ट कमजोरी को उजागर करता है:

वे कोड लिख सकते हैं, सीन बना सकते हैं, गेम बना सकते हैं, लेकिन अभी भी वीडियो को वास्तविक रूप से समझ नहीं सकते और न ही वे अपने द्वारा बनाए गए गेम को खुद खेलते हैं।

दो घंटे, एक मिडल-एथ को हाथ से बनाएं

चलिए, हम इस "द लॉर्ड ऑफ द रिंग्स" परीक्षण को कैसे किया जाता है, इसे देखते हैं।

अगर कैपेशी के ट्वीट का अक्षरशः अर्थ किया जाए, तो ऑपस 5 को दिए गए मुख्य प्रॉम्प्ट को शायद 'द लॉन्ग-वेटेड पार्टी' के पहले अध्याय से शुरू किया जाना चाहिए।

Large Model Evaluation

बिल्बो बैगिन्स ऑफ द बॉग्स ने 111वां जन्मदिन मनाने की घोषणा की, और होबिटन में तुरंत चर्चा शुरू हो गई...

जिन दोस्तों को दिलचस्पी है, वे खुद आजमा सकते हैं।

इसके अलावा, कैपेसी ने प्रॉम्प्ट में Three.js का उल्लेख किया है, जो एक JavaScript लाइब्रेरी है जिसका उपयोग कोड के माध्यम से 3D सीन बनाने के लिए किया जाता है।

इसलिए, ऑपस 5 का कार्य, पहले द लॉर्ड ऑफ द रिंग्स के शुरुआती पाठ को समझना है, और फिर उसे एक ऐसे 3D विश्व में बदलना है जो ब्राउज़र में रियल-टाइम में चल सके।

Large Model Evaluation

पूरी प्रक्रिया में, ओपस 5 को बहुभुजों का उपयोग करके पात्रों, भवनों और सामान को बनाना होगा, उन्हें क्रमशः x, y, z निर्देशांक प्रणाली में रखना होगा, और फिर कैमरे, प्रकाश और एनिमेशन को व्यवस्थित करना होगा।

कब व्यक्ति चलता है, कैमरा कहाँ घूमता है, प्रकाश कैसे बदलता है, और सीन में वस्तुएँ कैसे बातचीत करती हैं, यह सब मॉडल को कोड द्वारा परिभाषित करना होता है।

हालांकि अंतिम दृश्य को बहुत अच्छा नहीं कहा जा सकता है, और अक्सर मॉडलिंग और फ्लोटिंग समस्याएं जैसे कि पात्र का शरीर और सिर अलग हो जाते हैं... लेकिन पूरा सीन कम से कम वास्तविक रूप से तैयार किया गया था।

Large Model Evaluation

ध्यान दें कि यह वीडियो मॉडल द्वारा सीधे पिक्सेल के फ्रेम जनरेट करने से अलग है।

Three.js को पहले व्यक्ति, वस्तुओं और दृश्य को त्रि-आयामी वस्तुओं के रूप में बनाना होता है, फिर कोड के आधार पर उनकी स्थिति, कोण और गति की गणना वास्तविक समय में की जाती है।

इसलिए, हम जो डेमो देख रहे हैं, वह एक सामान्य AI-उत्पन्न वीडियो नहीं है, बल्कि एक 3D वेब स्कीन के रनटाइम स्क्रीनरिकॉर्डिंग है।

हालांकि, कैपेसी ने कमेंट सेक्शन में भी उल्लेख किया कि प्रोग्रामेटिक 3D और वीडियो जनरेशन में से एक चुनना जरूरी नहीं है।

एक यूजर ने सुझाव दिया कि इस कच्चे Three.js स्क्रीनरिकॉर्ड को Seedance के लिए रेफरेंस वीडियो के रूप में इस्तेमाल किया जा सकता है, और फिर वीडियो मॉडल को उच्चतर गुणवत्ता में पुनः रेंडर किया जा सकता है।

Large Model Evaluation

Kapasi quickly agreed.

उसकी कल्पना के अनुसार, प्रोग्रामेटिक कोड शॉट्स और नियंत्रण का प्रबंधन कर सकता है, जिससे पहले चरित्र कहाँ खड़े होंगे, कैमरा कैसे चलेगा, और कहानी कैसे आगे बढ़ेगी—ये हड्डियाँ तय हो जाएँगी।

अब रिकॉर्डिंग को वीडियो-टू-वीडियो मॉडल को दें, जो टेक्सचर, प्रकाश और विवरण जोड़ेगा और पूरे मिडल-अर्थ वर्ल्ड की दिखावट को पूरी तरह से बेहतर बनाएगा।

ऑडियो के मामले में, ओपस 5 ने इस बार सब कुछ एक साथ नहीं लिया।

कपासी ने कहा कि व्यक्तिगत ध्वनि गुणवत्ता की आवश्यकता के कारण अंततः ElevenLabs का उपयोग किया गया।

Large Model Evaluation

इसलिए, दृश्य, कैमरा शॉट्स और नैरेटिव के साथ शुरुआती अनुभाग, जो द लॉर्ड ऑफ द रिंग्स डेमो है, ऐसे ही सामने आ गया।

Kapasi ने पूरे प्रोजेक्ट को ओपन सोर्स कर दिया है, विस्तार से लिंक नीचे दिया गया है।

Large Model Evaluation

नेटिज़न्स बहुत अधिक दिलचस्प हैं

कैपेसी ने डेमो जारी करने के बाद, कई नेटिज़न्स ने इसे टेस्ट करने के लिए आया।

समग्र रूप से देखने पर, कहना होगा:

इस पीढ़ी के इंटरनेट यूजर्स कापासी से कहीं अधिक कल्पनाशील हैं।

किसी ने क्लॉड का उपयोग करके एक 'Earth Online' प्रोजेक्ट शुरू किया है, जिसका लक्ष्य एक समूह AI एजेंट के माध्यम से पूरे पृथ्वी को एक... डॉट डॉट Build it out.

अभी तक, एजेंट ने पूरी पृथ्वी नहीं बनाई है, बस एक लो-पॉलीगन शैली का सैन फ्रांसिस्को वॉटरफ्रंट बनाया है। लेकिन मौजूदा दृश्यों से लगता है कि भवनों के आकार, मानवीय मापदंड और समग्र शैली बहुत समान रखी गई हैं।

यह प्रभाव किसी लेगो दुनिया के एनिमेशन शो जैसा है। चित्रण जटिल नहीं है, लेकिन पात्र, स्थान और गतिविधियाँ एक ही दुनिया में स्थिर रूप से काम करती हैं।

इस दिशा में आगे बढ़ें, सरल शैली के एनिमेशन और हल्के गेम्स, जिनमें AI-नेटिव का एक आरंभिक रूप दिखाई दे रहा है।

एक और यूजर ने Fable 5 और GPT-5.6 Sol का उपयोग करके न्यूयॉर्क शहर का 3D डिजिटल मॉडल बनाया है और इसमें रियल-टाइम डेटा जोड़ा है।

मॉडल को न्यूयॉर्क की गलियों और इमारतों को सही ढंग से व्यवस्थित करना होगा, साथ ही विभिन्न क्षेत्रों के बीच के स्थानिक संबंधों को बनाए रखना होगा। इसलिए लेखक ने सुझाव दिया कि इस प्रकार का वर्चुअल दुनिया उत्पन्न करने का कार्य, शायद एक नया स्थानिक तर्क परीक्षण (Benchmark) बन सकता है।

अभी और भी अधिक अतिशयोक्ति आ रही है।

एक यूजर ने कैन्ये वेस्ट के कॉन्सर्ट के टिकट नहीं खरीदे, इसलिए उसने अपने ब्राउज़र में AI का उपयोग करके खुद के लिए एक कॉन्सर्ट का आयोजन कर लिया।

पूरा प्रोजेक्ट अभी भी Three.js द्वारा बनाया गया है। केवल एक HTML फ़ाइल है, कोई भी तैयार 3D मॉडल का उपयोग नहीं किया गया है, स्टेज, पात्र और प्रकाश सभी कोड द्वारा उत्पन्न किए गए हैं।

कंसर्ट के दौरान कुल 14 गाने तैयार किए गए थे, जिनमें से प्रत्येक गाने के लिए अलग प्रकाश डिजाइन और एक विशिष्ट गोलाकार स्टेज विजुअल था।

सामान्य उपयोगकर्ता अंश सुन सकते हैं, और Spotify Premium कनेक्ट करने के बाद, वे पूरे ट्रैक और पूरे प्रदर्शन को बजा सकते हैं।

टिकट नहीं मिला, तो खुद के लिए पूरा बैठक बना लेना, बहुत बुरा लगा!

अभी खत्म नहीं हुआ!!!

कैपेसी ने मूल पोस्ट के अंत में यह भी कल्पना की कि भविष्य में इन 3D दुनियाओं में गेमप्ले जोड़ा जा सकता है, ताकि खिलाड़ी दर्शक, NPC या कहानी के किरदार के रूप में इनमें प्रवेश कर सकें।

परिणामस्वरूप, गेम संस्करण के कैपेशियन द्वारा व्यवस्थित होने से पहले ही नेटिज़न्स ने इसे बना लिया।

Large Model Evaluation

इस प्रोजेक्ट में Opus 5 और Three.js का उपयोग किया गया है, जिससे न केवल यह चलता और इंटरैक्ट करता है, बल्कि इसमें ऑडियो भी शामिल है।

और भी अधिक 3D डिज़ाइन के उदाहरण आते जा रहे हैं। भवन के आकार, स्थान व्यवस्था से लेकर दृश्य शैली तक, Opus 5 पर्याप्त बड़े प्रोजेक्ट्स में अपेक्षाकृत स्थिर समानता बनाए रख पा रहा है।

इसी तरह के अन्य उदाहरण भी हैं, जिन्हें यहां सभी के लिए अलग-अलग नहीं दिखाया गया है।

वास्तविक रूप से परिपक्व गेम के रूप में, इन कार्यों की दूरी अभी भी है।

क्या भ्रमित कर देने वाले गेमप्ले में दिलचस्पी है, क्या लंबे समय तक स्थिर रहता है, और क्या खिलाड़ी वास्तव में 15 मिनट तक इसमें रहने के लिए तैयार होंगे—इन सभी प्रश्नों के उत्तर अभी तक नहीं मिले हैं।

लेकिन रियल-टाइम 3D कंटेंट और इंटरएक्टिव प्रोटोटाइप बनाने की बाधा वास्तव में काफी कम हो गई है।

और अगर मॉडल की क्षमता का परीक्षण करने का एक नया तरीका मिल जाए, जो इतना दिलचस्प और मजेदार भी हो, तो क्या बात है?

Pelican, ride's over

तो, अचानक बड़े मॉडल द्वारा द लॉर्ड ऑफ द रिंग्स उत्पन्न करने का क्या कारण है?

यह पिछले कुछ वर्षों में लोकप्रिय हुए "कैकेन साइकिल चलाते हुए" परीक्षण से शुरू होता है।

यह प्रश्न सबसे पहले डेवलपर सिमन विलिसन द्वारा दिया गया था, जिसमें केवल एक वाक्य शामिल था:

Generate an SVG image of a pelican riding a bicycle.

Large Model Evaluation

हालांकि यह प्रश्न सरल लगता है, लेकिन वास्तव में यह मॉडल की परीक्षा करता है।

क्योंकि SVG एक छवि की तरह दिखता है, लेकिन इसके नीचे एक कोड की श्रृंखला होती है।

मॉडल को न केवल पेलिकन और साइकिल का रूप जानना होगा, बल्कि उन्हें रेखाओं, वृत्तों और बहुभुजों में विभाजित करना होगा, और फिर प्रत्येक घटक की स्थिति को निर्देशांकों के साथ व्यवस्थित करना होगा।

Large Model Evaluation

अधिक महत्वपूर्ण बात यह है कि पेलिकन और साइकिल खुद ही बहुत कम मेल खाते हैं।

बाइक के फ्रेम, टायर और पेडल्स को सही ज्यामिति में रखना चाहिए; जबकि पेलिकन की बड़ी चोंच, छोटी टांगें और ऐसी बनावट है जो सवारी करने जैसी नहीं लगती।

Large Model Evaluation

दोनों को मिलाकर, मॉडल ने अंतरिक्ष संबंध को समझा है या नहीं, लगभग एक नजर में साफ़ हो जाता है:

पहिया टेढ़ा है या नहीं, पैर टेड़े पर नहीं लगे हैं, चिड़िया वास्तव में साइकिल चला रही है या कारखाने के ढांचे से तुरंत विभाजित हो गई है।

ऊपर दिए गए 2024 के अंत के डेमो को देखें~

इसी कारण, "पेलिकन साइकिल चला रहा है" एक पारंपरिक परीक्षण बन गया जो महान मॉडल की अंतरिक्ष समझ, वस्तु संयोजन और कोड उत्पादन क्षमता का परीक्षण करता है।

Large Model Evaluation

लेकिन जैसे-जैसे मॉडल अधिक शक्तिशाली होते जा रहे हैं, इस पेलिकन की सवारी भी जल्दी समाप्त होने वाली है।

नीचे देखें DeepSeek R1 और DeepSeek V4 के प्रदर्शन से पता चलता है कि आजकल के मॉडल इस प्रश्न को काफी अच्छी तरह से पूरा कर सकते हैं।

Large Model Evaluation

इससे भी अधिक महत्वपूर्ण बात यह है कि एक SVG केवल मॉडल के एकल आउटपुट का परीक्षण कर सकता है।

यह मॉडल को एक जटिल प्रोजेक्ट की योजना बनाने, कई घंटों तक लगातार काम करने और हजारों पंक्तियों के कोड में अपनी गलतियों को बार-बार जांचने और सुधारने की क्षमता नहीं माप सकता।

इसलिए, कापासी ने एक छोटा सवाल “एक चित्र बनाएं” को “एक दुनिया बनाएं” के बड़े प्रोजेक्ट में बदल दिया—

Pelican can get off, Middle-earth has officially taken over.

Large Model Evaluation

Kapasi's Pelican

जल्द ही, कैपेसी द्वारा "पेलिकन टेस्ट" के प्रश्न बदलने की खबर भी सभी समुदायों में पहुंच गई।

हैकर न्यूज़ के उच्च-मतदान टिप्पणियों के अनुसार, हालांकि इन डेमो की ग्राफिक्स क्वालिटी काफी साधारण है, लेकिन यह बताता है कि हमें एक ऐसा नया परीक्षण चाहिए जो एकल छवि उत्पन्न करने से अधिक कठिन हो।

नया मानक केवल यह देखना नहीं चाहिए कि मॉडल चित्र को सही ढंग से बना सकता है या नहीं, बल्कि यह भी जांचना चाहिए कि वह एक दुनिया को समझ सकता है या नहीं।

Large Model Evaluation

After all, "Pelican on a Bicycle" has been used for too long.

मॉडल इस तरह के कार्यों के लिए लगातार बेहतरीन परिणाम दे रहे हैं, और एक-दूसरे के बीच का अंतर देखना हर बार मुश्किल होता जा रहा है।

इसके विपरीत, एक पूर्ण 3D दुनिया बनाने के लिए, मॉडल को व्यक्तियों और वस्तुओं के बीच के स्थानिक संबंधों को समझना, कैमरे, एक्शन और सीन बदलावों को संभालना होगा, और सिर्फ एक वीडियो जेनरेशन मॉडल को एक दृश्य उत्पन्न करने के लिए निर्देशित करना नहीं होगा।

Large Model Evaluation

Of course, some people have also raised objections.

The pelican test is sufficiently concise, low-cost, and results are easy to compare.

एक मॉडल की जांच के लिए पूरे 3D विश्व को जनरेट करने के लिए इतने टोकन खर्च करना, कुछ हद तक कैलकुलेशन क्षमता को आतिशबाजी की तरह खर्च करने जैसा है।

Large Model Evaluation

इसी समय, Three.js की स्वयं क्षमता को बड़े मॉडल की समग्र क्षमता को मापने के लिए भी सवाल उठाया गया है।

कुछ लोगों का मानना है कि इस तरह के डेमो सिर्फ यह साबित कर सकते हैं कि Anthropic ने Three.js कोड पर अच्छी तरह से प्रशिक्षित किया है, लेकिन यह नहीं दर्शाता कि मॉडल वास्तव में स्थान और भौतिक दुनिया को समझता है।

लेकिन जल्द ही नेटिव्स ने विरोध किया:

एक अमूर्त और अस्पष्ट अर्थ वाले साहित्यिक पाठ को 3D एनिमेशन में बदलना, मॉडल को स्थानिक संबंधों, भौतिक नियमों, दैनिक वस्तुओं, और 3D परिवर्तनों तथा कंप्यूटर ग्राफ़िक्स में गणितीय समस्याओं को एक साथ संभालना होता है।

अगर यह अभी भी केवल “Three.js लिखना जानना” माना जाता है, तो यह 5500 पंक्तियों के कोड का थोड़ा अवमूल्यन है।

Large Model Evaluation

एक और नेटिज़न ने एक अधिक खुला प्रश्न पूछा:

क्या "स्पेशल रीजनिंग" वास्तव में बड़े मॉडल द्वारा सामान्यतः पाठ और कोड के साथ किए जाने वाले तर्क से भिन्न है?

एक दृष्टिकोण के अनुसार, चित्र की वैधता इस बात पर निर्भर करती है कि मॉडल "आगे-पीछे, अंदर-बाहर, दूर-निकट, ढकना" जैसे स्थानिक संबंधों, और विभिन्न दृष्टिकोणों पर वस्तुओं की दूरी, कोण और सापेक्ष आकार को समझता है या नहीं।

Large Model Evaluation

लेकिन एक अन्य दृष्टिकोण के अनुसार, चाहे मॉडल “पत्थर के पास” या “ऐरे के भीतर” के साथ काम कर रहा हो, वह संभवतः एक ही काम कर रहा है: संदर्भ के आधार पर टोकन को एक-एक करके उत्पन्न करना और इस प्रक्रिया में निष्कर्ष निकालना।

अगर ऐसा है, तो ओपस 5 द्वारा प्रदर्शित केवल एक अचानक उभरी “स्पेस क्षमता” ही नहीं है।

अधिक संभावना है कि बड़े भाषा मॉडल की मूल रूप से पाठ और कोड को समझने के लिए डिज़ाइन की गई सामान्य तर्क क्षमता, अब स्वाभाविक रूप से त्रि-आयामी दुनिया में विस्तारित हो रही है।

एक पेलिकन बनाने से लेकर एक मिडल-अर्थ दुनिया बनाने तक, विषय बदल गया लगता है, लेकिन पीछे की परीक्षा शायद हमेशा एक ही सवाल है:

क्या मॉडल अपनी दुनिया की समझ को एक वास्तविक रूप से कार्यरत संरचना में बदल सकता है?

और अंत में, शायद एक और अधिक अतिरंजित प्रश्न है—

अगर जनरल-पर्पस मॉडल पहले से कोड लिखकर 3D दुनिया बना सकता है और Seedance, ElevenLabs आदि API का उपयोग करके विजुअल और ऑडियो पैदा कर सकता है, तो उपयोगकर्ता को एक विशेष वीडियो जेनरेशन उत्पाद को खोलकर प्रॉम्प्ट दर्ज करने की कितनी आवश्यकता है?

रेफरेंस लिंक

[1]https://karpathy.ai/lotr-movie/

[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/

[3] https://x.com/wizardbrainz/status/2083012159341203708

[4]https://x.com/aniketjart/status/2083645765097033845

[5]https://x.com/davidfromkansas/status/2075691129899528254

[6]https://x.com/MindaugasLT/status/2083488027343470939

यह लेख वेचेन ग्रुप "Quantum Bit" से आया है, लेखक: henry

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।