Opus 5 الخاص بـ Anthropic يبني عالمًا ثلاثي الأبعاد من "سيد الخواتم" باستخدام الذكاء الاصطناعي

icon MarsBit
مشاركة
AI summary iconملخص
انكسرت أخبار الذكاء الاصطناعي والعملات المشفرة عندما أنشأ Opus 5 من Anthropic نسخة ثلاثية الأبعاد لعالم *سيد الخواتم* باستخدام Three.js. المشروع، الذي قاده باحث الذكاء الاصطناعي كارباتي، استخدم مليون رمز، وساعتين، و5500 سطر من الشيفرة. قام النموذج بتحويل مقدمة الرواية إلى مشهد ثلاثي الأبعاد قائم على المتصفح، على الرغم من أن النتيجة كانت خشنة ومجردة. تكتسب أخبار الأصول الواقعية (RWA) زخماً مع دفع تجارب الذكاء الاصطناعي لحدود البيئات الرقمية.

لا داعي للكلام، ابدأ مباشرة باليومية (doge)!

للتو، أعلنت العبقري كاباسي: "نحن" أنثروبيك بدأنا باستخدام طريقة جديدة تمامًا لتعزيز النماذج الكبيرة—

The Lord of the Rings.

تقييم النماذج الكبيرة

وفقًا لكاباسي، فإن "مقياس سيد الخواتم" هذا يستبدل اختبار SVG الشهير سابقًا "البطريق يركب دراجة".

تقييم النماذج الكبيرة

على وجه التحديد، قام كاباسي مباشرةً بتحميل مقدمة "سيد الخواتم" على Opus 5، وطلب من النموذج إنشاء عالم الوسط بالكامل باستخدام Three.js في الوقت الفعلي.

أما بالنسبة للنتيجة النهائية، فهي تشبه قليلاً أفلام الرسوم المتحركة ثلاثية الأبعاد الصينية في أواخر التسعينيات وأوائل القرن الحادي والعشرين: خشنة جدًا وتجريدية جدًا.

لكن بصدق، إذا نظرت جيدًا لفترة، وكنتم تعرفون موقع تصوير "سيد الخواتم" في هوبيتون بنيوزيلندا، فستلاحظون بالفعل بعض التشابه~

لكن هذا الشيء الذي يبدو غير متقن بشكل كبير، أنفق فعليًا Opus 5: 1,000,000 رمز، وساعتين، و5500 سطر من الكود.

Of course, Claude is not the only one shining on stage.

الأكثر إثارة للضحك هي وعاء جديد قدمه المستخدمون ديب سيك الإصدار V4 Flash.

"الصينيون يستطيعون الطيران" مباشرةً، مع طفو جميع الشخصيات في المشهد.

面对这些目前肉眼可见的穿帮,卡帕西倒也相当中肯。

أشار إلى أن Opus 5 لا يمكنه حاليًا "الدخول" حقًا إلى العالم الذي ينشئه، بل يمكنه فقط التقاط لقطات شاشة في نقاط زمنية مختلفة، ثم التحقق ببطء من أين حدثت المشكلة.

وهذا بالضبط يكشف عن نقطة ضعف واضحة في النماذج الكبيرة الحالية:

لقد تمكّنوا من كتابة الأكواد، وبناء المشاهد، وتوليد الألعاب، لكنهم لا يزالون غير قادرين على فهم الفيديوهات حقًا، ولا يلعبون الألعاب التي يصنعونها بأنفسهم.

ساعتان، اصنع ميديا بيل بيدك

دعونا نلقي نظرة على كيفية إجراء اختبار "سيد الخواتم" هذا.

إذا تم أخذ تغريدة كاباسي حرفياً، فإن الكلمة المفتاحية الرئيسية المُدخلة لـ Opus 5 يجب أن تكون الافتتاحية من الفصل الأول من رواية "سيد الخواتم"، بعنوان "الوليمة المتوقعة".

تقييم النماذج الكبيرة

بيلبو باغينز من كهف الجراب أعلن عن تنظيم حفل عيد ميلاد كبير بمناسبة بلوغه 111 عامًا، وبدأ الحديث في هوبشيتن على الفور...

الأصدقاء المهتمون يمكنهم تجربة ذلك بأنفسهم.

بالإضافة إلى ذلك، حدد كاباسي في مُحفّزه Three.js، وهو مكتبة JavaScript لبناء مشاهد ثلاثية الأبعاد باستخدام الكود.

وبالتالي، فإن المهمة التي يجب على Opus 5 إكمالها هي فهم النصوص الافتتاحية لـ "سيد الخواتم" أولاً، ثم تحويلها إلى عالم ثلاثي الأبعاد يعمل في الوقت الفعلي داخل المتصفح.

تقييم النماذج الكبيرة

خلال العملية بأكملها، يجب على Opus 5 تجميع الشخصيات والمباني والأدوات باستخدام مضلعات، ثم وضعها واحدة تلو الأخرى في نظام إحداثيات x و y و z، وضبط الكاميرا والإضاءة والرسوم المتحركة.

متى يتحرك الشخص، إلى أين تدور الكاميرا، كيف تتغير الإضاءة، وكيف يجب أن تتفاعل الأجسام في المشهد، كل ذلك يحتاج إلى تعريف النموذج باستخدام الكود.

على الرغم من أن المشهد النهائي لم يكن دقيقًا، وظهرت فيه مشاكل متكررة مثل اختراق النماذج والطفو، مثل انفصال جسم الشخص عن رأسه... إلا أن جميع العناصر تم تجميعها فعليًا.

تقييم النماذج الكبيرة

يجب ملاحظة أن هذا لا يعادل توليد نموذج الفيديو لبكسلات الإطارات واحدة تلو الأخرى.

يجب على Three.js أولاً إنشاء الشخصيات والأشياء والمشهد ككائنات ثلاثية الأبعاد، ثم حساب مواقعها وزواياها وحالتها الحركية في الوقت الفعلي بناءً على الكود.

لذلك، فإن العرض التوضيحي الذي شاهدناه ليس مقطع فيديو مُنشأ بواسطة الذكاء الاصطناعي عادي، بل هو تسجيل شاشة لمشهد ويب ثلاثي الأبعاد أثناء التشغيل.

لكن كاباسي ذكر أيضًا في قسم التعليقات أن توليد البرمجة ثلاثية الأبعاد والفيديو ليسا خيارين متبادلين.

اقترح أحد المستخدمين أنه يمكن تسليم تسجيل الشاشة الخشن لـ Three.js إلى Seedance كفيديو مرجعي، ثم استخدام نموذج الفيديو لإعادة توليد الفيديو بجودة أعلى.

تقييم النماذج الكبيرة

كاباسي أبدى موافقته بسرعة.

وفقًا لفكرة، يمكن للرمز البرمجي الآلي أن يتحمل مسؤولية تقسيم المشاهد والتحكم، أولًا بتحديد أين يقف الشخصيات، وكيف تتحرك الكاميرا، وكيف تتطور القصة.

ثم قم بتسليم التسجيل إلى نموذج Video-to-Video ليضيف النسيج والإضاءة والتفاصيل، ليُكمل جاذبية عالم ما بين النهرين بالكامل.

أما بالنسبة للصوت، فلم تُضَمّ Opus 5 هذا المرة.

كاباسي أشار إلى أنه نظرًا لمتطلباته الشخصية بشأن جودة الصوت، تم استخدام ElevenLabs في النهاية.

تقييم النماذج الكبيرة

وهكذا ظهرت مقدمة فيديو لـ "سيد الخواتم" مع مشاهد وتقنيات تصوير وتعليق صوتي.

Kapasi has also open-sourced the entire project; the specific link can be found at the end of the article.

تقييم النماذج الكبيرة

المستخدمون على الإنترنت أكثر إثارة من بيكاباسي

بعد إطلاق كاباسي للنسخة التجريبية، حضر العديد من المستخدمين لتجربتها.

بشكل عام، يمكن القول فقط:

المستخدمون الحاليون لديهم خيال أكثر من كاباسي.

قام شخص ما بتشغيل مشروع "Earth Online" باستخدام Claude، بهدف استخدام مجموعة من وكلاء الذكاء الاصطناعي لمحاكاة整个 الأرض نقر تم البناء.

حاليًا، لم يُنشئ العامل الأرض بأكملها، بل قام فقط ببناء منطقة سان فرانسيسكو الساحلية بأسلوب مثلثات منخفضة. لكن من المشهد الحالي، فإن نسب المباني ومقاييس الشخصيات والأسلوب العام متسقة بشكل كبير.

هذا التأثير يشبه قليلاً رسومًا متحركة عالم ليغو. الأسلوب البصري غير معقد، لكن الشخصيات والمشاهد والحركات تعمل بثبات ضمن نفس العالم.

استمر في هذا الاتجاه مع الرسوم المتحركة بأسلوب بسيط والألعاب الخفيفة، حيث ظهرت بالفعل بعض ملامح الطابع الأصلي للذكاء الاصطناعي.

كما استخدم بعض المستخدمين Fable 5 وGPT-5.6 Sol لإنشاء نموذج رقمي ثلاثي الأبعاد لمدينة نيويورك، ودمج بيانات مباشرة فيه.

يجب على النموذج ليس فقط وضع شوارع ومباني نيويورك في المواقع الصحيحة، بل أيضًا الحفاظ على العلاقات المكانية بين المناطق المختلفة. وبالتالي، يقترح المؤلف أن هذه المهمة لإنشاء عوالم افتراضية قد تصبح معيارًا جديدًا للتفكير المكاني.

الأكثر إثارةً لا يزال قادمًا.

لقد قام مستخدم على الإنترنت لم يستطع شراء تذاكر حفل كاني ويست بتنظيم حفلة له باستخدام الذكاء الاصطناعي في متصفحه.

لا يزال المشروع كاملاً مبنيًا باستخدام Three.js. يوجد ملف HTML واحد فقط، ولا يتم استدعاء أي نماذج ثلاثية الأبعاد جاهزة؛ فالمسرح والشخصيات والإضاءة كلها مولدة بواسطة الكود.

تم إعداد 14 أغنية في الحفلة الموسيقية بأكملها، وكل أغنية لها تصميم إضاءة مستقل ورؤية مسرح كروية مخصصة.

يمكن للمستخدمين العاديين الاستماع إلى مقاطع تجريبية، وبعد توصيل حساب Spotify Premium، يمكنهم تشغيل الأغاني الكاملة والعروض الكاملة.

لم أتمكن من شراء التذكرة، فقمت بإنشاء حجز خاص لنفسي، هذا خسارة فادحة!

لم ينتهِ بعد!!!

كاباسي أيضًا تخيل في نهاية帖子 الأصلي أنه يمكن إضافة عناصر لعب إلى هذه العوالم ثلاثية الأبعاد في المستقبل، مما يسمح لللاعبين بالدخول إليها كمراقبين أو ككائنات غير لاعبين أو حتى كشخصيات في القصة.

النسخة اللعبة تم إنشاؤها من قبل المستخدمين قبل أن يتمكن كاباسيا من تنظيمها.

تقييم النماذج الكبيرة

يستخدم هذا المشروع أيضًا Opus 5 وThree.js، ولا يقتصر على التشغيل والتفاعل فحسب، بل يضيف أيضًا صوتًا.

تظهر المزيد من حالات استخدام التصميم ثلاثي الأبعاد باستمرار. من النسب المعمارية وتخطيط المساحات إلى أسلوب المشهد، يتمكن Opus 5 من الحفاظ على اتساق نسبي في مشاريع بحجم كبير.

هناك أمثلة مشابهة كثيرة أخرى، ولن نعرضها جميعًا هنا.

بصورة موضوعية، لا تزال هذه الأعمال بعيدة عن أن تكون ألعابًا ناضجة حقًا.

لا توجد إجابات بعد على ما إذا كانت طرق اللعب المتنوعة ممتعة، أو ما إذا كانت تعمل بثبات على المدى الطويل، أو ما إذا كان اللاعبون سيشعرون فعلاً برغبة في البقاء داخلها لمدة 15 دقيقة.

لكن عتبة إنشاء المحتوى ثلاثي الأبعاد في الوقت الفعلي والنماذج القابلة للعب قد انخفضت بشكل كبير.

أليس من الجميل أن توجد طريقة جديدة لاختبار قدرات النموذج، مع كونها ممتعة ومرحة في نفس الوقت؟

البجع، وصلت للنهاية

إذًا، لماذا فجأة نطلب من النموذج الكبير توليد "سيد الخواتم"؟

يجب العودة إلى اختبار "البجع يركب الدراجة" الذي انتشر بشدة قبل بضع سنوات.

هذه المسألة أصلها من المطور سيمون ويليسون، ويتطلب أن تكون جملة واحدة فقط:

Generate an SVG image of a pelican riding a bicycle.

تقييم النماذج الكبيرة

على الرغم من أن هذا السؤال يبدو بسيطًا، إلا أنه يختبر النموذج بشكل كبير.

لأن SVG تبدو كصورة، لكنها في الأساس سلسلة من التعليمات البرمجية.

يجب على النموذج أن يعرف ليس فقط كيف يبدو الطائر النورس والدراجة، بل أيضًا أن يفكّكهما إلى خطوط ودوائر وأشكال متعددة الأضلاع، ثم يُرتب مواقع كل مكون باستخدام إحداثيات.

تقييم النماذج الكبيرة

الأهم من ذلك، أن الطائر النورس والدراجة لا يتناسبان مع بعضهما البعض على الإطلاق.

يجب أن تحتفظ دراجة الهيكل والإطارات والدواسات بالهندسة الصحيحة؛ بينما الطائر النورس يمتلك منقارًا كبيرًا وأرجلًا قصيرة، وشكلًا لا يبدو أبدًا مناسبًا للدراجة.

تقييم النماذج الكبيرة

عند دمج الاثنين معًا، يمكن معرفة ما إذا كان النموذج يفهم العلاقات المكانية تقريبًا بنظرة واحدة:

ما إذا كانت العجلة مائلة أم لا، أو ما إذا كانت القدمان تلامسان الدواسات أم لا، أو ما إذا كان الطائر يقود الدراجة أم يتم تقطيعه فورًا بواسطة الإطار.

انظر إلى هذه العروض التوضيحية من نهاية عام 2024~

لهذا السبب، أصبح "البجع يركب دراجة" اختبارًا كلاسيكيًا شعبيًا لقياس قدرات النماذج الكبيرة على فهم الفضاء، ودمج العناصر، وتوليد الكود.

تقييم النماذج الكبيرة

لكن مع تزايد قوة النموذج، فإن هذا البلشون سيصل قريبًا إلى نهاية رحلته.

انظر أدناه ديب سيك R1 و ديب سيك من أداء V4، نعلم أن النماذج الحالية تستطيع إكمال هذه المسألة بشكل جيد جدًا.

تقييم النماذج الكبيرة

الأهم من ذلك، أن SVG واحدة لا يمكنها تقييم إخراج نموذج واحد فقط.

لا يمكنه قياس ما إذا كان النموذج قادرًا على تخطيط مشروع معقد، والعمل بشكل متواصل لساعات عديدة، والتحقق من أخطائه وتصحيحها مرارًا وتكرارًا في آلاف الأسطر من الكود.

فاستبدل كاباسي مسألة صغيرة تقول "ارسم رسمًا" بمشروع كبير يقضي "ببناء عالم" —

The Pelicans can get off; Middle-earth has officially taken over.

تقييم النماذج الكبيرة

Kapasi's Pelican

سرعان ما انتشرت أخبار أن كاباسي ستغير أسئلة "اختبار الغاق" إلى جميع المجتمعات.

التعليقات الأكثر تصويتاً على Hacker News ترى أنه على الرغم من أن جودة الصور في هذه العروض التوضيحية منخفضة، إلا أن هذا يوضح بالضبط أننا بحاجة إلى اختبار جديد أكثر صعوبة من توليد صورة واحدة.

لا ينبغي أن يُقاس المعيار الجديد فقط بقدرة النموذج على رسم الصور بشكل صحيح، بل يجب أيضًا تقييم قدرته على فهم العالم.

تقييم النماذج الكبيرة

بعد كل شيء، "البجع يركب الدراجة" استُخدم لفترة طويلة جدًا.

تستمر النماذج في تحقيق نتائج قياسية في هذه المهام، ويصبح من الصعب التمييز بين الفروق بينها.

على النقيض من ذلك، فإن إنشاء عالم ثلاثي الأبعاد كامل يتطلب من النموذج فهم العلاقات المكانية بين الشخصيات والأشياء، ومعالجة الكاميرا والحركات وتغييرات المشهد، وليس مجرد استدعاء نموذج توليد الفيديو لإخراج مشهد واحد.

تقييم النماذج الكبيرة

Of course, some people have also raised objections.

The pelican test is sufficiently concise, low-cost, and results are easy to compare.

لتجربة نموذج واحد، استهلاك هذا العدد الكبير من الرموز لإنشاء عالم ثلاثي الأبعاد كامل يشبه إلى حد ما إهدار الطاقة الحسابية في عرض ألعاب نارية.

تقييم النماذج الكبيرة

في الوقت نفسه، تم الطعن في قدرة Three.js نفسها على قياس القدرة الشاملة للنماذج الكبيرة.

يعتقد البعض أن هذا النوع من العروض التوضيحية لا يمكنه إثبات سوى أن Anthropic درّبت النموذج جيدًا على كود Three.js، لكنه لا يُظهر أن النموذج يفهم الفضاء والعالم المادي حقًا.

لكن سرعان ما ردّ مستخدمون على الإنترنت:

تحويل نص أدبي مجرّد وغامض المعنى إلى رسوم متحركة ثلاثية الأبعاد يتطلب من النموذج معالجة العلاقات المكانية، والقوانين الفيزيائية، والأشياء اليومية، بالإضافة إلى المسائل الرياضية المتعلقة بالتحولات ثلاثية الأبعاد ورسومات الحاسوب.

إذا كان هذا لا يزال يُعتبر مجرد "القدرة على كتابة Three.js"، فهذا يقلل من قيمة هذه الـ 5500 سطر من الكود إلى حد كبير.

تقييم النماذج الكبيرة

كما طرح مستخدمون آخرون سؤالًا أكثر انفتاحًا:

هل يختلف "الاستدلال المكاني" حقًا عن الاستدلال الذي تستخدمه النماذج الكبيرة عادةً عند معالجة النصوص والرموز؟

يعتقد بعض الخبراء أن صلاحية الصورة تعتمد على فهم النموذج للعلاقات المكانية مثل "القدم والخلف، الداخلي والخارجي، القريب والبعيد، التغطية"، وكذلك المسافة والزاوية والحجم النسبي للأشياء من زوايا مختلفة.

تقييم النماذج الكبيرة

لكن وجهة نظر أخرى ترى أنه بغض النظر عن ما إذا كان النموذج يعالج "بجانب الحجر" أو "داخل المصفوفة"، فإنه قد يقوم بنفس الشيء: توليد الرموز واحدة تلو الأخرى بناءً على السياق، وتنفيذ الاستدلال خلال هذه العملية.

إذا كان الأمر كذلك، فما يُظهره Opus 5 لا يقتصر فقط على قدرة "مكانيّة" ظهرت فجأة.

من المرجح أكثر أن قدرات الاستدلال العامة للنماذج اللغوية الكبيرة، التي كانت مصممة أصلاً لفهم النصوص والكود، قد بدأت تتمدد بشكل طبيعي إلى العالم ثلاثي الأبعاد.

من رسم طائر النورس إلى بناء عالم وسطى، قد يبدو أن الموضوع تغير، لكن الاختبار خلفه ربما كان دائمًا نفس السؤال:

هل يمكن للنموذج أن يحول فهمه للعالم إلى هيكل حقيقي قابل للتشغيل؟

وفي النهاية، ربما يكون هناك سؤال أكثر غرابة—

إذا كان النموذج العام الكبير قادرًا بالفعل على كتابة الكود بنفسه لإنشاء عالم ثلاثي الأبعاد، ثم استدعاء واجهات برمجة التطبيقات مثل Seedance وElevenLabs لإكمال الصور والصوت، فما مدى ضرورة أن يقوم المستخدم بفتح منتج مخصص لإنشاء الفيديو وإدخال الـPrompt يدويًا؟

رابط المرجع

[1]https://karpathy.ai/lotr-movie/

[2]https://simonwillison.net/2025/Jun/6/six-months-in-llms/

[3] https://x.com/wizardbrainz/status/2083012159341203708

[4]https://x.com/aniketjart/status/2083645765097033845

[5]https://x.com/davidfromkansas/status/2075691129899528254

[6]https://x.com/MindaugasLT/status/2083488027343470939

هذا المقال من حساب وينشين "Quantum Bit"، الكاتب: henry

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.