3D दृश्य को पुनर्निर्मित करने के लिए पहले सैकड़ों सावधानी से ली गई फोटोग्राफ, महंगा उपकरण और एक स्वास्थ्यकर डोज़ धैर्य की आवश्यकता होती थी। स्टैनफोर्ड AI विशेषज्ञ फेई-फेई ली द्वारा सह-स्थापित स्पेशियल इंटेलिजेंस कंपनी वर्ल्ड लैब्स ने अभी इस कार्यप्रवाह को केवल दो या तीन स्नैपशॉट में संकुचित कर दिया है।
कंपनी का नया मॉडल, जिसे एटलस कहा जाता है, एक प्रीट्रेन्ड मल्टीमोडल ऑटोरिग्रेसिव डिफ्यूजन ट्रांसफॉर्मर है। सरल शब्दों में: यह एक एआई सिस्टम है जो टेक्स्ट, इमेज, वीडियो और 3D डेटा को एक साथ समझता है, और इस समझ का उपयोग करके कैमरे द्वारा नहीं लिया गया हर डेटा भर सकता है। परिणाम पूर्ण 3D सीन पुनर्निर्माण, नवीन दृश्य संश्लेषण, और कैमरा-नियंत्रित वीडियो उत्पादन है, जो न्यूनतम इनपुट से प्राप्त होता है।
एटलस वास्तव में क्या करता है
एटलस, वर्ल्ड लैब्स द्वारा "ओमनी वर्ल्ड मॉडल" के रूप में जाना जाता है, जो स्पेशियल इंटेलिजेंस के लिए कार्य करता है। इसे एक से छह संदर्भ छवियाँ दें, और यह आपके द्वारा निर्दिष्ट सटीक पथों के साथ 1440p रिज़ॉल्यूशन पर एक मिनट तक का वीडियो जेनरेट कर सकता है, जबकि कैमरा नियंत्रण को सटीकता से बनाए रखता है।
3D पुनर्निर्माण क्षमता वह जगह है जहाँ चीजें वास्तव में प्रभावशाली हो जाती हैं। पारंपरिक फोटोग्राममेट्री पाइपलाइनें आमतौर पर एक उपयोगी 3D मॉडल बनाने के लिए 100 से 300+ तस्वीरों की आवश्यकता होती है, जो सावधानी से योजना बनाए गए कोणों से ली गई होती हैं। एटलस इस आवश्यकता को केवल दो या तीन इनपुट तस्वीरों तक सीमित कर देता है, और कंपनी के अनुसार अद्भुत सटीकता के साथ पॉइंट क्लाउड्स और गॉसियन स्प्लैट्स जैसे स्पष्ट 3D प्रतिनिधित्व बनाता है।
स्पार्स-व्यू 3D पुनर्निर्माण बेंचमार्क, जिसमें DTU और ETH3D शामिल हैं, एटलस ने 25.3 की औसत निरपेक्ष-सापेक्ष पॉइंटमैप त्रुटि प्राप्त की। इसका सबसे करीबी ओपन-सोर्स प्रतिद्वंद्वी 28.7 स्कोर करने वाला था।
वर्ल्ड लैब्स के सह-संस्थापक नए दृश्य भविष्यवाणी को "स्थानिक बुद्धिमत्ता के लिए एक एआई-पूर्ण प्रारंभिक तत्व" के रूप में प्रस्तुत करते हैं। अर्थात्, उन कोणों से दृश्य को कल्पना करने की क्षमता, जिनसे आपने कभी फोटो नहीं लिया है, एक मूलभूत क्षमता है, जो रोबोटिक्स नेविगेशन से लेकर विजुअल इफेक्ट्स पाइपलाइन तक सब कुछ सक्षम बनाती है।
मानव निर्णय
उपभोक्ता परीक्षणों में, जिनमें कैमरा नियंत्रण गुणवत्ता का मूल्यांकन किया गया, मानव मूल्यांकनकर्ताओं ने 75% से 94% समय अन्य प्रतिस्पर्धी मॉडलों की तुलना में एटलस को पसंद किया।
एटलस डायनेमिक स्पेस-टाइम सिमुलेशन, जिसमें बुलेट-टाइम प्रभाव शामिल हैं, का समर्थन करता है। द नेट्रिक्स से आईकॉनिक स्लो-मोशन रोटेटिंग कैमरा मूव को सोचिए, लेकिन इसे सिंक्रोनाइज्ड कैमरों के जटिल रिग के बजाय एआई से जेनरेट किया गया है।
मॉडल इन सभी चीजों को एक समेकित स्थानिक संदर्भ के भीतर संभालता है। वीडियो जनरेशन, 3D पुनर्निर्माण और नवीन दृश्य संश्लेषण के लिए अलग-अलग उपकरणों को जोड़ने के बजाय, एटलस इन कार्यों को एकल प्रणाली में समेकित करता है।
प्रयोगशाला से सीमित रिलीज तक
वर्ल्ड लैब्स ने 2024 में कंपनी की स्थापना के बाद से इस क्षण की ओर काम किया है। शुरुआत से ही स्टार्टअप ने महत्वपूर्ण ध्यान आकर्षित किया, जिसका प्रमुख कारण ली का आधुनिक कंप्यूटर दृष्टि के निर्माताओं में से एक होना है। उनका ImageNet डेटासेट और संबंधित चुनौतियाँ एक दशक पहले गहरी सीखने की क्रांति को प्रेरित करने में केंद्रीय भूमिका निभाईं।
एटलस की घोषणा 1 सितंबर, 2026 को की गई थी, और वर्तमान में यह कुछ चयनित साझेदारों के लिए शुरुआती एक्सेस चरण में प्रवेश कर रहा है। वर्ल्ड लैब्स ने अभी तक मॉडल के वेट्स या कोड को सार्वजनिक रूप से जारी नहीं किया है, और अभी के लिए इस प्रौद्योगिकी को नियंत्रित एक्सेस की दीवार के पीछे रखे रखा है।

