बातें छोड़िए, तुरंत दैनिक लेटे रहने (doge) की शुरुआत करें!
अभी-अभी, दिग्गज कापासी ने घोषणा की कि "हम" Anthropic ने मॉडल को नए तरीके से ट्रेन करना शुरू कर दिया है—
The Lord of the Rings.

कपासी के अनुसार, यह "द लॉर्ड ऑफ द रिंग्स बेंचमार्क" पिछले लोकप्रिय "पेलिकन बाइसिकलिंग" SVG टेस्ट को बदल रहा है।

विशेष रूप से, कैपेसी ने सीधे द लॉर्ड ऑफ द रिंग्स की शुरुआत Opus 5 को दे दी, ताकि मॉडल Three.js का उपयोग करके एक पूरा "मिडल-एथ" तैयार कर सके।
अंतिम परिणाम के बारे में, यह कुछ इस तरह लगता है जैसे 1990 के अंत और 21वीं सदी की शुरुआत की चीनी 3D एनिमेटेड फिल्में: बहुत कच्ची और बहुत अमूर्त।
लेकिन वस्तुनिष्ठ रूप से, अगर आप न्यूजीलैंड में स्थित द लॉर्ड ऑफ द रिंग के शूटिंग स्थल होबिटन को अच्छी तरह से जानते हैं, तो आप वास्तव में थोड़ा सा समानता देख सकते हैं~
हालांकि, यह एक ऐसा चीज़ है जो दिखने में बहुत अच्छी नहीं लगती, लेकिन इसने Opus 5: 100 लाख टोकन, 2 घंटे और 5500 पंक्तियों कोड का उपयोग किया।
Of course, Claude is not the only one shining on stage.
सबसे मजेदार बात यह है कि नेटिज़न्स ने अभी एक नया बर्तन पेश किया है DeepSeek V4 फ्लैश संस्करण।
एक पूरा "चीनी लोग उड़ सकते हैं", चित्र में सभी व्यक्ति तैर रहे हैं।
In the face of these currently visible blunders, Kappasi is also quite reasonable.
उन्होंने बताया कि वर्तमान में Opus 5 अपने द्वारा उत्पन्न दुनिया में वास्तव में "प्रवेश" नहीं कर सकता, बल्कि विभिन्न समय बिंदुओं पर लगातार स्क्रीनशॉट लेना पड़ता है और फिर धीरे-धीरे यह जांचना पड़ता है कि कहाँ समस्या है।
और यह वर्तमान बड़े मॉडल की एक स्पष्ट कमजोरी को उजागर करता है:
वे कोड लिख सकते हैं, सीन बना सकते हैं, गेम बना सकते हैं, लेकिन अभी भी वीडियो को वास्तविक रूप से समझ नहीं सकते और न ही वे अपने द्वारा बनाए गए गेम को खुद खेलते हैं।
दो घंटे, एक मिडल-एथ को हाथ से बनाएं
चलिए, हम इस "द लॉर्ड ऑफ द रिंग्स" परीक्षण को कैसे किया जाता है, इसे देखते हैं।
अगर कैपेशी के ट्वीट का अक्षरशः अर्थ किया जाए, तो ऑपस 5 को दिए गए मुख्य प्रॉम्प्ट को शायद 'द लॉन्ग-वेटेड पार्टी' के पहले अध्याय से शुरू किया जाना चाहिए।

बिल्बो बैगिन्स ऑफ द बॉग्स ने 111वां जन्मदिन मनाने की घोषणा की, और होबिटन में तुरंत चर्चा शुरू हो गई...
जिन दोस्तों को दिलचस्पी है, वे खुद आजमा सकते हैं।
इसके अलावा, कैपेसी ने प्रॉम्प्ट में Three.js का उल्लेख किया है, जो एक JavaScript लाइब्रेरी है जिसका उपयोग कोड के माध्यम से 3D सीन बनाने के लिए किया जाता है।
इसलिए, ऑपस 5 का कार्य, पहले द लॉर्ड ऑफ द रिंग्स के शुरुआती पाठ को समझना है, और फिर उसे एक ऐसे 3D विश्व में बदलना है जो ब्राउज़र में रियल-टाइम में चल सके।

पूरी प्रक्रिया में, ओपस 5 को बहुभुजों का उपयोग करके पात्रों, भवनों और सामान को बनाना होगा, उन्हें क्रमशः x, y, z निर्देशांक प्रणाली में रखना होगा, और फिर कैमरे, प्रकाश और एनिमेशन को व्यवस्थित करना होगा।
कब व्यक्ति चलता है, कैमरा कहाँ घूमता है, प्रकाश कैसे बदलता है, और सीन में वस्तुएँ कैसे बातचीत करती हैं, यह सब मॉडल को कोड द्वारा परिभाषित करना होता है।
हालांकि अंतिम दृश्य को बहुत अच्छा नहीं कहा जा सकता है, और अक्सर मॉडलिंग और फ्लोटिंग समस्याएं जैसे कि पात्र का शरीर और सिर अलग हो जाते हैं... लेकिन पूरा सीन कम से कम वास्तविक रूप से तैयार किया गया था।

ध्यान दें कि यह वीडियो मॉडल द्वारा सीधे पिक्सेल के फ्रेम जनरेट करने से अलग है।
Three.js को पहले व्यक्ति, वस्तुओं और दृश्य को त्रि-आयामी वस्तुओं के रूप में बनाना होता है, फिर कोड के आधार पर उनकी स्थिति, कोण और गति की गणना वास्तविक समय में की जाती है।
इसलिए, हम जो डेमो देख रहे हैं, वह एक सामान्य AI-उत्पन्न वीडियो नहीं है, बल्कि एक 3D वेब स्कीन के रनटाइम स्क्रीनरिकॉर्डिंग है।
हालांकि, कैपेसी ने कमेंट सेक्शन में भी उल्लेख किया कि प्रोग्रामेटिक 3D और वीडियो जनरेशन में से एक चुनना जरूरी नहीं है।
एक यूजर ने सुझाव दिया कि इस कच्चे Three.js स्क्रीनरिकॉर्ड को Seedance के लिए रेफरेंस वीडियो के रूप में इस्तेमाल किया जा सकता है, और फिर वीडियो मॉडल को उच्चतर गुणवत्ता में पुनः रेंडर किया जा सकता है।

Kapasi quickly agreed.
उसकी कल्पना के अनुसार, प्रोग्रामेटिक कोड शॉट्स और नियंत्रण का प्रबंधन कर सकता है, जिससे पहले चरित्र कहाँ खड़े होंगे, कैमरा कैसे चलेगा, और कहानी कैसे आगे बढ़ेगी—ये हड्डियाँ तय हो जाएँगी।
अब रिकॉर्डिंग को वीडियो-टू-वीडियो मॉडल को दें, जो टेक्सचर, प्रकाश और विवरण जोड़ेगा और पूरे मिडल-अर्थ वर्ल्ड की दिखावट को पूरी तरह से बेहतर बनाएगा।
ऑडियो के मामले में, ओपस 5 ने इस बार सब कुछ एक साथ नहीं लिया।
कपासी ने कहा कि व्यक्तिगत ध्वनि गुणवत्ता की आवश्यकता के कारण अंततः ElevenLabs का उपयोग किया गया।

इसलिए, दृश्य, कैमरा शॉट्स और नैरेटिव के साथ शुरुआती अनुभाग, जो द लॉर्ड ऑफ द रिंग्स डेमो है, ऐसे ही सामने आ गया।
Kapasi ने पूरे प्रोजेक्ट को ओपन सोर्स कर दिया है, विस्तार से लिंक नीचे दिया गया है।

नेटिज़न्स बहुत अधिक दिलचस्प हैं
कैपेसी ने डेमो जारी करने के बाद, कई नेटिज़न्स ने इसे टेस्ट करने के लिए आया।
समग्र रूप से देखने पर, कहना होगा:
इस पीढ़ी के इंटरनेट यूजर्स कापासी से कहीं अधिक कल्पनाशील हैं।
किसी ने क्लॉड का उपयोग करके एक 'Earth Online' प्रोजेक्ट शुरू किया है, जिसका लक्ष्य एक समूह AI एजेंट के माध्यम से पूरे पृथ्वी को एक... डॉट डॉट Build it out.
अभी तक, एजेंट ने पूरी पृथ्वी नहीं बनाई है, बस एक लो-पॉलीगन शैली का सैन फ्रांसिस्को वॉटरफ्रंट बनाया है। लेकिन मौजूदा दृश्यों से लगता है कि भवनों के आकार, मानवीय मापदंड और समग्र शैली बहुत समान रखी गई हैं।
यह प्रभाव किसी लेगो दुनिया के एनिमेशन शो जैसा है। चित्रण जटिल नहीं है, लेकिन पात्र, स्थान और गतिविधियाँ एक ही दुनिया में स्थिर रूप से काम करती हैं।
इस दिशा में आगे बढ़ें, सरल शैली के एनिमेशन और हल्के गेम्स, जिनमें AI-नेटिव का एक आरंभिक रूप दिखाई दे रहा है।
एक और यूजर ने Fable 5 और GPT-5.6 Sol का उपयोग करके न्यूयॉर्क शहर का 3D डिजिटल मॉडल बनाया है और इसमें रियल-टाइम डेटा जोड़ा है।
मॉडल को न्यूयॉर्क की गलियों और इमारतों को सही ढंग से व्यवस्थित करना होगा, साथ ही विभिन्न क्षेत्रों के बीच के स्थानिक संबंधों को बनाए रखना होगा। इसलिए लेखक ने सुझाव दिया कि इस प्रकार का वर्चुअल दुनिया उत्पन्न करने का कार्य, शायद एक नया स्थानिक तर्क परीक्षण (Benchmark) बन सकता है।
अभी और भी अधिक अतिशयोक्ति आ रही है।
एक यूजर ने कैन्ये वेस्ट के कॉन्सर्ट के टिकट नहीं खरीदे, इसलिए उसने अपने ब्राउज़र में AI का उपयोग करके खुद के लिए एक कॉन्सर्ट का आयोजन कर लिया।
पूरा प्रोजेक्ट अभी भी Three.js द्वारा बनाया गया है। केवल एक HTML फ़ाइल है, कोई भी तैयार 3D मॉडल का उपयोग नहीं किया गया है, स्टेज, पात्र और प्रकाश सभी कोड द्वारा उत्पन्न किए गए हैं।
कंसर्ट के दौरान कुल 14 गाने तैयार किए गए थे, जिनमें से प्रत्येक गाने के लिए अलग प्रकाश डिजाइन और एक विशिष्ट गोलाकार स्टेज विजुअल था।
सामान्य उपयोगकर्ता अंश सुन सकते हैं, और Spotify Premium कनेक्ट करने के बाद, वे पूरे ट्रैक और पूरे प्रदर्शन को बजा सकते हैं।
टिकट नहीं मिला, तो खुद के लिए पूरा बैठक बना लेना, बहुत बुरा लगा!
अभी खत्म नहीं हुआ!!!
कैपेसी ने मूल पोस्ट के अंत में यह भी कल्पना की कि भविष्य में इन 3D दुनियाओं में गेमप्ले जोड़ा जा सकता है, ताकि खिलाड़ी दर्शक, NPC या कहानी के किरदार के रूप में इनमें प्रवेश कर सकें।
परिणामस्वरूप, गेम संस्करण के कैपेशियन द्वारा व्यवस्थित होने से पहले ही नेटिज़न्स ने इसे बना लिया।

इस प्रोजेक्ट में Opus 5 और Three.js का उपयोग किया गया है, जिससे न केवल यह चलता और इंटरैक्ट करता है, बल्कि इसमें ऑडियो भी शामिल है।
और भी अधिक 3D डिज़ाइन के उदाहरण आते जा रहे हैं। भवन के आकार, स्थान व्यवस्था से लेकर दृश्य शैली तक, Opus 5 पर्याप्त बड़े प्रोजेक्ट्स में अपेक्षाकृत स्थिर समानता बनाए रख पा रहा है।
इसी तरह के अन्य उदाहरण भी हैं, जिन्हें यहां सभी के लिए अलग-अलग नहीं दिखाया गया है।
वास्तविक रूप से परिपक्व गेम के रूप में, इन कार्यों की दूरी अभी भी है।
क्या भ्रमित कर देने वाले गेमप्ले में दिलचस्पी है, क्या लंबे समय तक स्थिर रहता है, और क्या खिलाड़ी वास्तव में 15 मिनट तक इसमें रहने के लिए तैयार होंगे—इन सभी प्रश्नों के उत्तर अभी तक नहीं मिले हैं।
लेकिन रियल-टाइम 3D कंटेंट और इंटरएक्टिव प्रोटोटाइप बनाने की बाधा वास्तव में काफी कम हो गई है।
और अगर मॉडल की क्षमता का परीक्षण करने का एक नया तरीका मिल जाए, जो इतना दिलचस्प और मजेदार भी हो, तो क्या बात है?
Pelican, ride's over
तो, अचानक बड़े मॉडल द्वारा द लॉर्ड ऑफ द रिंग्स उत्पन्न करने का क्या कारण है?
यह पिछले कुछ वर्षों में लोकप्रिय हुए "कैकेन साइकिल चलाते हुए" परीक्षण से शुरू होता है।
यह प्रश्न सबसे पहले डेवलपर सिमन विलिसन द्वारा दिया गया था, जिसमें केवल एक वाक्य शामिल था:
Generate an SVG image of a pelican riding a bicycle.

हालांकि यह प्रश्न सरल लगता है, लेकिन वास्तव में यह मॉडल की परीक्षा करता है।
क्योंकि SVG एक छवि की तरह दिखता है, लेकिन इसके नीचे एक कोड की श्रृंखला होती है।
मॉडल को न केवल पेलिकन और साइकिल का रूप जानना होगा, बल्कि उन्हें रेखाओं, वृत्तों और बहुभुजों में विभाजित करना होगा, और फिर प्रत्येक घटक की स्थिति को निर्देशांकों के साथ व्यवस्थित करना होगा।

अधिक महत्वपूर्ण बात यह है कि पेलिकन और साइकिल खुद ही बहुत कम मेल खाते हैं।
बाइक के फ्रेम, टायर और पेडल्स को सही ज्यामिति में रखना चाहिए; जबकि पेलिकन की बड़ी चोंच, छोटी टांगें और ऐसी बनावट है जो सवारी करने जैसी नहीं लगती।

दोनों को मिलाकर, मॉडल ने अंतरिक्ष संबंध को समझा है या नहीं, लगभग एक नजर में साफ़ हो जाता है:
पहिया टेढ़ा है या नहीं, पैर टेड़े पर नहीं लगे हैं, चिड़िया वास्तव में साइकिल चला रही है या कारखाने के ढांचे से तुरंत विभाजित हो गई है।
ऊपर दिए गए 2024 के अंत के डेमो को देखें~
इसी कारण, "पेलिकन साइकिल चला रहा है" एक पारंपरिक परीक्षण बन गया जो महान मॉडल की अंतरिक्ष समझ, वस्तु संयोजन और कोड उत्पादन क्षमता का परीक्षण करता है।

लेकिन जैसे-जैसे मॉडल अधिक शक्तिशाली होते जा रहे हैं, इस पेलिकन की सवारी भी जल्दी समाप्त होने वाली है।
नीचे देखें DeepSeek R1 और DeepSeek V4 के प्रदर्शन से पता चलता है कि आजकल के मॉडल इस प्रश्न को काफी अच्छी तरह से पूरा कर सकते हैं।

इससे भी अधिक महत्वपूर्ण बात यह है कि एक SVG केवल मॉडल के एकल आउटपुट का परीक्षण कर सकता है।
यह मॉडल को एक जटिल प्रोजेक्ट की योजना बनाने, कई घंटों तक लगातार काम करने और हजारों पंक्तियों के कोड में अपनी गलतियों को बार-बार जांचने और सुधारने की क्षमता नहीं माप सकता।
इसलिए, कापासी ने एक छोटा सवाल “एक चित्र बनाएं” को “एक दुनिया बनाएं” के बड़े प्रोजेक्ट में बदल दिया—
Pelican can get off, Middle-earth has officially taken over.

Kapasi's Pelican
जल्द ही, कैपेसी द्वारा "पेलिकन टेस्ट" के प्रश्न बदलने की खबर भी सभी समुदायों में पहुंच गई।
हैकर न्यूज़ के उच्च-मतदान टिप्पणियों के अनुसार, हालांकि इन डेमो की ग्राफिक्स क्वालिटी काफी साधारण है, लेकिन यह बताता है कि हमें एक ऐसा नया परीक्षण चाहिए जो एकल छवि उत्पन्न करने से अधिक कठिन हो।
नया मानक केवल यह देखना नहीं चाहिए कि मॉडल चित्र को सही ढंग से बना सकता है या नहीं, बल्कि यह भी जांचना चाहिए कि वह एक दुनिया को समझ सकता है या नहीं।

After all, "Pelican on a Bicycle" has been used for too long.
मॉडल इस तरह के कार्यों के लिए लगातार बेहतरीन परिणाम दे रहे हैं, और एक-दूसरे के बीच का अंतर देखना हर बार मुश्किल होता जा रहा है।
इसके विपरीत, एक पूर्ण 3D दुनिया बनाने के लिए, मॉडल को व्यक्तियों और वस्तुओं के बीच के स्थानिक संबंधों को समझना, कैमरे, एक्शन और सीन बदलावों को संभालना होगा, और सिर्फ एक वीडियो जेनरेशन मॉडल को एक दृश्य उत्पन्न करने के लिए निर्देशित करना नहीं होगा।

Of course, some people have also raised objections.
The pelican test is sufficiently concise, low-cost, and results are easy to compare.
एक मॉडल की जांच के लिए पूरे 3D विश्व को जनरेट करने के लिए इतने टोकन खर्च करना, कुछ हद तक कैलकुलेशन क्षमता को आतिशबाजी की तरह खर्च करने जैसा है।

इसी समय, Three.js की स्वयं क्षमता को बड़े मॉडल की समग्र क्षमता को मापने के लिए भी सवाल उठाया गया है।
कुछ लोगों का मानना है कि इस तरह के डेमो सिर्फ यह साबित कर सकते हैं कि Anthropic ने Three.js कोड पर अच्छी तरह से प्रशिक्षित किया है, लेकिन यह नहीं दर्शाता कि मॉडल वास्तव में स्थान और भौतिक दुनिया को समझता है।
लेकिन जल्द ही नेटिव्स ने विरोध किया:
एक अमूर्त और अस्पष्ट अर्थ वाले साहित्यिक पाठ को 3D एनिमेशन में बदलना, मॉडल को स्थानिक संबंधों, भौतिक नियमों, दैनिक वस्तुओं, और 3D परिवर्तनों तथा कंप्यूटर ग्राफ़िक्स में गणितीय समस्याओं को एक साथ संभालना होता है।
अगर यह अभी भी केवल “Three.js लिखना जानना” माना जाता है, तो यह 5500 पंक्तियों के कोड का थोड़ा अवमूल्यन है।

एक और नेटिज़न ने एक अधिक खुला प्रश्न पूछा:
क्या "स्पेशल रीजनिंग" वास्तव में बड़े मॉडल द्वारा सामान्यतः पाठ और कोड के साथ किए जाने वाले तर्क से भिन्न है?
एक दृष्टिकोण के अनुसार, चित्र की वैधता इस बात पर निर्भर करती है कि मॉडल "आगे-पीछे, अंदर-बाहर, दूर-निकट, ढकना" जैसे स्थानिक संबंधों, और विभिन्न दृष्टिकोणों पर वस्तुओं की दूरी, कोण और सापेक्ष आकार को समझता है या नहीं।

लेकिन एक अन्य दृष्टिकोण के अनुसार, चाहे मॉडल “पत्थर के पास” या “ऐरे के भीतर” के साथ काम कर रहा हो, वह संभवतः एक ही काम कर रहा है: संदर्भ के आधार पर टोकन को एक-एक करके उत्पन्न करना और इस प्रक्रिया में निष्कर्ष निकालना।
अगर ऐसा है, तो ओपस 5 द्वारा प्रदर्शित केवल एक अचानक उभरी “स्पेस क्षमता” ही नहीं है।
अधिक संभावना है कि बड़े भाषा मॉडल की मूल रूप से पाठ और कोड को समझने के लिए डिज़ाइन की गई सामान्य तर्क क्षमता, अब स्वाभाविक रूप से त्रि-आयामी दुनिया में विस्तारित हो रही है।
एक पेलिकन बनाने से लेकर एक मिडल-अर्थ दुनिया बनाने तक, विषय बदल गया लगता है, लेकिन पीछे की परीक्षा शायद हमेशा एक ही सवाल है:
क्या मॉडल अपनी दुनिया की समझ को एक वास्तविक रूप से कार्यरत संरचना में बदल सकता है?
और अंत में, शायद एक और अधिक अतिरंजित प्रश्न है—
अगर जनरल-पर्पस मॉडल पहले से कोड लिखकर 3D दुनिया बना सकता है और Seedance, ElevenLabs आदि API का उपयोग करके विजुअल और ऑडियो पैदा कर सकता है, तो उपयोगकर्ता को एक विशेष वीडियो जेनरेशन उत्पाद को खोलकर प्रॉम्प्ट दर्ज करने की कितनी आवश्यकता है?
रेफरेंस लिंक
[1]https://karpathy.ai/lotr-movie/
[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/
[3] https://x.com/wizardbrainz/status/2083012159341203708
[4]https://x.com/aniketjart/status/2083645765097033845
[5]https://x.com/davidfromkansas/status/2075691129899528254
[6]https://x.com/MindaugasLT/status/2083488027343470939
यह लेख वेचेन ग्रुप "Quantum Bit" से आया है, लेखक: henry
