صدر Claude 5.1 للتو، وفي الجانب الآخر، يقترب OpenAI Astra فورًا.
الآن، حتى جوجل أطلقت تحركًا جديدًا. أحدث تسريبات تشير إلى أن Gemini 3.8 Flash ستُطرح غدًا.


يبدو أن دائرة الذكاء الاصطناعي على وشك الاحتفال بالعام الجديد.
Gemini 3.5 Pro تم إيقافه، والإصدار الكبير التالي هو 4.0
أكثر من اهتمام الناس بإطلاق Gemini 3.8 Flash، يتساءلون كثيرًا: متى سيصدر Gemini 3.5 Pro؟!
عذرًا، لا داعي للانتظار، لقد تخلت جوجل...

منذ إعلان مؤتمر I/O في مايو من هذا العام، مرّ ما يقرب من 4 أشهر، ولم يتطور Gemini 3.5 Pro إلى حد يُقارن حتى بـ Flash.
جوجل أيضًا لم تبقَ خيارًا سوى التخلي المباشر عن "القطعة".
لحسن الحظ، تمت تقييم Gemini 4.0 بشكل ممتاز أثناء التدريب المسبق، ويستمر التدريب اللاحق بنجاح.


كشف حصري من WSJ يُنبئ أيضًا بقوة برنامج Gemini 3.8 Flash (الرمز الداخلي "Skimaki") في البرمجة.
يُزعم أنه في اختبارات المقارنة الداخلية لـ Google باستخدام أداة الترميز Jetski، تفوق 3.8 Flash مباشرةً على نموذج Opus.
Moreover, this model has been in development for months, long before Google's leadership "earthquake."
استقال هاسابيس من منصبه، وغادر جيف دين، العالم الرئيسي، مما أثار قلق الكثيرين بشأن مستقبل جيميني.

However, it currently appears that everything is proceeding smoothly internally.
حاليًا، تخطط جوجل لطرح Gemini 3.8 Flash أولاً لأن هذا النموذج يمتلك معلمات أقل ويتطلب حسابات أقل، مما يجعله أسهل في تحقيق نتائج.
حسب مصادر داخلية، بدأت جوجل في بداية هذا العام في تخصيص موارد بشرية وحوسبية إضافية لتحسين قدرة Gemini على كتابة الكود.
على وجه الخصوص، تم زيادة الاستثمار في "التعلم المعزز" لتمكين الذكاء الاصطناعي من تعلم مهارات جديدة من خلال التجربة والخطأ المستمر.
ويمكن لجوجل ديب مايند والمختبرات الأخرى المضي قدمًا في عدة مشاريع في وقت واحد، بحيث حتى لو فشل هذا، يمكن للآخر أن يحل محله.
Gemini 3.5 Pro لم تحقق التوقعات، لكن Gemini 4.0 لم تُصدر بعد.
في الوقت الحالي، تتمتع "الشركتان الرائدتان" في سيليكون فالي، OpenAI وAnthropic، بقدرة كبيرة في النماذج المتقدمة ووكلاء البرمجة.
تُشير المعلومات إلى أن النسخة القادمة من OpenAI، Astra، تستخدم أيضًا طريقة استدلال جديدة تُسمى "العمق التكراري" (recurrent depth)، مما يقلل من عدد رموز التفكير ويعزز الأداء بشكل كبير.
هذه الورقة الرابحة، ستُكشف عنها هذا الأسبوع.

وفي هذا الوقت بالضبط، يجب على جوجل أن تقدم شيئًا ما.
بعد وعد劈柴 بعدة أشهر، لم يُطلق سوى نموذج 3.7 Flash، ولم يُصدر أي نموذج آخر يثير حماس مجتمع الذكاء الاصطناعي.
ربما يظهر Gemini 3.8 Flash الليلة.

Gemini لأول مرة، يبدأ بمشاهدة الفيديوهات بنفسه
قبل النشر هنا، أطلقت جوجل اليوم حملة ترويجية مسبقة لإضافة قدرة جديدة إلى Gemini—
فهم الفيديو بواسطة الوكيل
هذه الميزة تحقق نقاطًا كبيرة.
قم بتحميل فيديو من مؤتمر I/O، نفس النموذج Gemini 3.7 Flash، انخفض استهلاك الرموز مباشرة بنسبة 88%.

أعلنت جوجل في مدونتها الرسمية أن نماذج Gemini 3.7 Flash و3.6 Flash و3.5 Flash-Lite تدعم جميعها قدرة الفهم الوسيطي للفيديو، ويمكن الوصول إليها من خلال Google AI Studio وGemini Enterprise Agent Platform.
بتشغيل هذا المفتاح على معايير تحليل الفيديو القياسية، يمكن أن ينخفض استهلاك الرموز بنسبة تصل إلى 88٪، وتنخفض تكاليف التحليل بنسبة تصل إلى 66٪، بينما تزداد الدقة بنسبة تصل إلى 7٪.

ولا تُفرض أي رسوم إضافية، ويظل التسعير عبر رمز API القياسي. عادةً ما يتصادم توفير المال مع الدقة. لكن هذه المرة لم يتصادما.

لأن Gemini تعلّم "سحب شريط التقدم".
الطريقة السابقة للمعالجة تُسمى "ثابتة"، حيث يستقبل النموذج تدفقًا ثابتًا للإطارات بشكل سلبي، ويتم تحديد معدل الإطارات بواسطة معلمة API، ولا يمتلك النموذج أي سلطة.
الآن يمكن للنموذج أن يتخذ قراراته الخاصة بشأن أي جزء ينظر إليه، وبأي سرعة، سواء كان يشاهد الصورة، أو يستمع إلى الصوت، أو يقرأ النص المكتوب مباشرة.

هذه ليست المرة الأولى التي تفعل فيها جوجل هذا.
كانت رؤية agentic السابقة تجمع بين تنفيذ الكود وفهم الصور الأصلي لـ Gemini، حيث كان النموذج قادرًا على كتابة كود تلقائيًا لتكبير الصورة أو قصها أو مقارنتها بناءً على صورة معينة.
الآن دور الفيديو، بنفس الفكرة، لكن تم استبدال الأداة بأداة الفيديو الأصلية.
أربعة مهام كانت صعبة للغاية في السابق
يتم أيضًا سرد عدة سيناريوهات تطبيقية صعبة في المدونة الرسمية.
استرجاع مقاطع بأقل من الثانية. سابقًا، كانت النماذج "تُشاهد" الفيديو وتلتقط صورة واحدة فقط في الثانية. المشكلة أن الكثير من الأشياء تمر بسرعة أقل من الثانية.
يمكن الآن تحديد هذه اللحظات بدقة تقل عن ثانية واحدة.
هذا يعني أن عملية "القص التلقائي" أصبحت قابلة للتنفيذ فعليًا لأول مرة: سابقًا، كان على محرري الفيديو أن يقضوا وقتًا طويلاً في التحقق من خط الزمن، وتحديد الإطارات المناسبة للقص يدويًا، أما الآن، فيمكن أولاً السماح للنموذج بفحص المحتوى وتحديد نقاط القطع المحتملة، ثم يختار الإنسان من بينها.

البحث عن إبرة في كومة قش طويلة. طرح سؤال معقد على مادة تستمر لساعات، دون الحاجة إلى حرق ملايين الرموز.
كشف الشذوذ. بعد أن يركز النموذج على نافذة زمنية معينة، يمكنه زيادة معدل الإطارات وإعادة أخذ العينات لهذه الفترة فقط، لرؤية الحركات السريعة والعيوب الدقيقة في الصورة. تعتبر خطوط الإنتاج للتفتيش على الجودة ومراقبة الأمن أكثر استفادة من ذلك، لأن الشذوذ يحدث عادةً خلال بضع ثوانٍ فقط.
احسب. كانت النماذج في الماضي تخطئ بشكل ثابت في الأسئلة مثل: كم مرة تكرر فعل ما؟ كم عدد الكائنات المختلفة في المشهد؟ والسبب بسيط: كانت اللحظات المفقودة تحتوي بالضبط على أشياء.

العميل أخيرًا بدأ يشاهد الفيديو
الفيديو كان دائمًا الأغلى بين جميع الوسائط.
النص رخيص، والصور جيدة، لكن الفيديوهات كبيرة وطويلة، فدقيقة واحدة منها تستهلك ما يعادل كتابًا كاملًا من الرموز.
لذلك، خلال السنتين الماضيتين، كان الجميع يتحدثون عن الوكلاء، لكنهم كانوا يركزون أكثر على قدرتها على القراءة والكتابة واستخدام الأدوات.
المشكلة أن وكيلًا يعتمد بشكل رئيسي على فهم النصوص، يرى في الواقع عالمًا تم 「إعادة سرده」 من قبل شخص آخر.
إنها لا تعرف شيئًا عن الأشياء التي تم تصويرها بواسطة الكاميرات، أو تسجيلها خلال الاجتماعات، أو المرور عبر خطوط الإنتاج، والتي لا يرغب أحد في قضاء الوقت لتحويلها إلى نص.
الآن، تم خفض منحنى التكلفة بشكل كبير.
إذا كان يمكن لوكيل أن يترجم عدة ساعات من المراقبة، وعشرات الساعات من الدروس، ومئات المواد دون أن ينفد الميزانية، فسيتغير طريقة تواصله مع العالم.
لا يحتاج الآن إلى الانتظار حتى يُحول شخص ما المشهد إلى نص ليُقدّمه له، ولا يحتاج إلى الاختيار بين "القدرة على الرؤية" و"الدقة في الرؤية".
جوجل، كانت أول من قام بهذا المُحَوِّل.
معركة الذكاء الاصطناعي، الجولة القادمة
في الأيام القليلة الماضية، تزامنت جداول إصدار الأربع شركات تقريبًا.
لقد وصل Claude 5.1 للتو، بينما كان OpenAI Astra بالفعل عند الباب، وقام جوجل أخيرًا بعد أشهر من التخزين بإطلاق Gemini 3.8 Flash للمنافسة.
بعد هذا التحديث، يركز كلاود الآن على مجالين رئيسيين: البرمجة والبحث العلمي.
ستصبح أسترا الجيل التالي "وكيلًا مستمرًا"، وبكلمات أوتامان، فإن قدرتها على استخدام الحاسوب قد وصلت إلى مستوى الإنسان.

سيشهد Gemini 3.8 Flash أيضًا قفزة أكبر في البرمجة.
الآن، فتحت OpenAI وAnthropic وGoogle وSpaceXAI جميعها بقوة.

ماسك يُعلن عن إصدار Grok 4.7 بعد عشرة أيام
هذه المعركة لم تدخل بعد أشد مراحلها قسوة.
المراجع:
https://x.com/Google/status/2094840983913402704
https://deepmind.google/blog/introducing-agentic-video-in-gemini/
هذا المقال من حساب WeChat "New Intelligence Yuan"، الكاتب: Apocalypses of ASI
