أطلقت جوجل في 2 سبتمبر 2026 نسخة Gemini 3.8 Flash ونسخة Gemini 3.8 Flash Cyber المخصصة لمؤسسات الدفاع السيبراني الموثوقة. تتمتع النسخة العادية بسياق يبلغ مليون رمز، وتُركّز على البرمجة والوكيلات والمهام المتخصصة؛ وفي الاختبارات التي نشرتها جوجل، حققت أداءً بنسبة 73.7% في هندسة البرمجيات الطويلة الأمد، وهي قريبة من نسبة 74.0% لـ Claude Opus 5، وتفوقت على النماذج الأخرى في أداء الوكيل المالي، والوكيل القانوني، وبعض مهام الاستدلال الشامل. أما النسخة Cyber، فهي قادرة على اكتشاف الثغرات و generating التصحيحات تلقائيًا: حققت نسبة نجاح تزيد عن 70% في اختبارات داخلية جوجل عبر 20 لغة برمجة، وحصل فريق Chrome على عدد تصحيحات صحيحة يعادل 2.6 مرة ما تحققه النماذج التجارية الكبيرة. يُقدّم سعر API الحالي بسعر 0.75 دولار لكل مليون رمز إدخال و3.75 دولار لكل مليون رمز إخراج، لكن النموذج يُحقق أداءً أعلى من خلال خطوات استدلال إضافية واستدعاء أدوات، وأظهرت التقييمات المستقلة أن تكلفة المهمة الواحدة أعلى بحوالي 40% مقارنة بـ 3.7 Flash. الإشارة الأساسية في هذا الإطلاق هي أن قدرات الوكيل التي كانت سابقًا حكرًا على النماذج الرائدة المكلفة تدخل الآن نطاق النماذج المنخفضة التكلفة والقابلة للنشر على نطاق واسع، لكن البيانات المتعلقة بالأداء لا تزال تعتمد بشكل أساسي على اختبارات جوجل وشركائها، كما أن النسخة Cyber غير متاحة للمستخدمين العاديين.كاتب المقال، المصدر: DeepMind
تم تحديثه ثلاث مرات خلال ستة أسابيع، وأصبح Google Flash النموذج الرئيسي
Gemini 3.8 Flash يأتي بعد ثلاثة أسابيع فقط من إصدار 3.7 Flash، وهو الإصدار الثالث من Flash الذي تطلقه Google خلال ستة أسابيع.
في الماضي، كان يعني "Flash" عادةً السرعة العالية والتكلفة المنخفضة، لكن القدرة كانت أضعف بكثير مقارنة بالنموذج الرائد. إن موضع Gemini 3.8 يتغير: لا يزال جوجل يصفه كـ"نموذج عمل" مناسب للنشر على نطاق واسع، لكنه يركز الآن على القدرات الرئيسية مثل البرمجة على المدى الطويل، واستدعاء الأدوات المتواصل، والتحليل المتخصص، بدلاً من تقييده فقط بالمهمات الخفيفة مثل المحادثة والملخصات.
يدعم النموذج الجديد المدخلات النصية والصور والصوت والفيديو وPDF، مع سياق يصل إلى مليون رمز وأقصى إخراج بـ 64 ألف رمز، ويمكنه استدعاء أدوات البحث والوظائف وعمليات الكمبيوتر. وقد تم إطلاقه رسميًا وليس كنسخة تجريبية، ويمكن استخدامه عبر Gemini API وGoogle AI Studio وGemini Enterprise وGoogle Antigravity وتطبيق Gemini ووضع البحث بالذكاء الاصطناعي وGoogle Sheets.
تم تفعيل 3.8 Flash بشكل افتراضي أيضًا في وكيل Google المُستضاف Antigravity. وهذا يشير إلى أن النموذج يستهدف بشكل حقيقي الوكلاء الذين يحتاجون إلى التخطيط المتكرر، واستدعاء الأدوات، والتحقق من النتائج، والتصحيح المستمر، وليس فقط الإجابات الفردية.
أداء البرمجة اقترب من نماذج الرأس المكلفة
في اختبار DeepSWE v1.1 طويل المدى للهندسة البرمجية الذي أعلنته Google، حقق Gemini 3.8 Flash درجة 73.7٪، وهي أعلى من 65.3٪ لـ 3.7 Flash و72.7٪ لـ GPT‑5.6 Sol، وتفوقه بـ 0.3 نقطة مئوية عن Claude Opus 5.
تتطلب هذه الاختبارات من النموذج الدخول إلى قاعدة كود حقيقية، وفهم العلاقات بين الملفات المتعددة، وتحديد المشكلات وإجراء التعديلات التي يمكنها تجاوز الاختبارات. وهي أقرب إلى عمل وكيل البرمجة الفعلي مقارنة بإنشاء دالة مستقلة.
في Vals Finance Agent v2، حصل 3.8 Flash على 61.4٪، بينما حصلت 3.7 Flash وClaude Opus 5 وGPT‑5.6 Sol على 59.0٪ و58.6٪ و53.8٪ على التوالي.
في اختبار Harvey Legal Agent، حقق 3.8 Flash نسبة 10.0٪، وهي أعلى من 8.8٪ لـ 3.7 Flash و6.7٪ لـ Claude Opus 5 و2.5٪ لـ GPT‑5.6 Sol. ومع ذلك، فإن الدرجات المطلقة لجميع النماذج في هذا التقييم منخفضة جدًا، و"الوصول إلى المرتبة الأولى" لا يعني قدرتها على التعامل الموثوق بالمهام القانونية المعقدة.
في اختبار الاستدلال متعدد التخصصات HLE-Verified، حقق 3.8 Flash 54.9٪، بينما حقق GPT‑5.6 Sol وClaude Opus 5 نسبة 54.5٪ و54.4٪ على التوالي، والفرق بين الثلاثة ضئيل جدًا ولا يكفي لإثبات تفوق مستقر وشامل لأي نموذج.
تُنشر هذه النتائج بشكل أساسي من قبل Google وفقًا لإعداداتها الخاصة. ستؤثر النماذج وإطارات الوكلاء وقوة الاستدلال وصلاحيات الأدوات والميزانية الاختبارية على النتائج النهائية، وبالتالي فإن الاستنتاج الأكثر منطقية هو أن النماذج من فئة Flash تقترب من بعض النماذج الرائدة باهظة الثمن، وليس أن Gemini متفوقة بشكل شامل على جميع المهام.
"العمل بجد أكبر" يعني الذكاء الأكبر، وقد يعني أيضًا التكلفة الأعلى
تعزو جوجل تحسين قدرات 3.8 Flash إلى خيار تصميمي مباشر: جعل النموذج "يعمل بجدية أكبر".
عند مواجهة مهام معقدة، فإنه يستخدم خطوات استدلالية وسطية إضافية، ويعيد استدعاء الأدوات بشكل متكرر، ويفحص بنشاط العمل الذي تم إنجازه. يمكن للمطورين اختيار ثلاثة مستويات تفكير: منخفض، متوسط، وعالي، مع كون المستوى المتوسط هو الإعداد الافتراضي؛ فالمستوى العالي مناسب للبرمجة الصعبة والتفكير متعدد الخطوات، بينما المستوى المنخفض مناسب للمحادثات في الوقت الفعلي وإنشاء المسودات والمهمات الحساسة للتأخير.
هذا يقلل من احتمالية توقف العامل مبكرًا، أو تفويت خطوات، أو الانحراف الكامل عن الهدف بعد فشل استدعاء أداة واحدة، لكنه يستهلك المزيد من الرموز.
في اختبارات مستقلة لـ Artificial Analysis، حقق 3.8 Flash درجة ذكاء 59 عند مستوى تفكير عالٍ، بزيادة قدرها 3 نقاط مقارنة بـ 3.7 Flash، ويعادل تقريبًا أداء إعداد الاستدلال غير الأقصى لـ GPT‑5.6 Sol. كما أن متوسط سرعة الإخراج يبلغ حوالي 300 رمز في الثانية، مع استغراق متوسط قدره 2.5 دقيقة لإكمال كل اختبار فردي.
لكن متوسط إخراج Token في 3.8 Flash زاد بنسبة حوالي 30٪، كما زاد عدد دورات التنفيذ في تقييمات الوكلاء. على الرغم من أن سعر كل Token لم يرتفع، فإن التكلفة المتوسطة لكل مهمة تبلغ حوالي 0.58 دولار أمريكي، وهي أعلى بنسبة حوالي 40٪ مقارنة بـ 0.40 دولار أمريكي في 3.7 Flash.
لذلك، فإن "السعر المنخفض" لا يعني بالضرورة أن "كل مهمة ستكون أرخص". إذا لم تتطلب المهمة نفسها تفكيرًا معقدًا، فإن تشغيل 3.8 Flash بقوة عالية قد يؤدي فقط إلى زيادة الوقت والتكاليف. كما توصي Google بتبني سير عمل يركز على الكفاءة من خلال خفض مستوى التفكير، أو الاستمرار في استخدام 3.7 Flash الذي لا يزال مدعومًا.
السعر المنخفض الحالي هو عرض مؤقت فقط
حتى 31 ديسمبر 2026، يكون سعر العرض لـ Gemini 3.8 Flash هو 0.75 دولار لكل مليون توكين إدخال و3.75 دولار لكل مليون توكين إخراج، وهو نفس سعر 3.7 Flash الحالي.
اعتبارًا من 1 يناير 2027، ستصبح الأسعار القياسية 1.50 دولار لكل مليون توكين مُدخل و7.50 دولار لكل توكين مُخرَج، أي مضاعفة دقيقة. لا ينبغي للمطورين اعتبار أسعار فترة الإطلاق كأسعار دائمة عند تقييم التكاليف على المدى الطويل.
حتى عند حساب السعر وفقًا للمعايير المستقبلية، فإنه لا يزال أقل من بعض النماذج الرائدة؛ ولكن بالنسبة للوكلاء الذين يحتاجون إلى توليد عشرات الآلاف من الرموز وتنفيذ عشرات الجولات من استدعاءات الأدوات، يجب مقارنة تكلفة المهمة الكاملة، وليس فقط رقم كل مليون رمز المذكور في جدول الأسعار.
هدف إصدار Cyber ليس شرح الثغرة، بل تسليم التصحيح مباشرة
أطلقت جوجل أيضًا Gemini 3.8 Flash Cyber. إنه يشارك القدرات الأساسية مع الإصدار العادي، لكنه تلقى تدريبًا أكثر تركيزًا على الأمن السيبراني، ويتبنى قيودًا أخف على الأمن السيبراني، مما يمكّنه من إنجاز مهام تحليل الثغرات التي قد يرفضها النموذج العادي.
في معيار اكتشاف الثغرات CyberGym، أعلنت Google أنها وصلت إلى أحدث المستويات. نظرًا لأن CyberGym يركز بشكل رئيسي على مشاريع C وC++, قامت الشركة بتصميم مجموعة اختبارات داخلية تغطي 20 لغة برمجة وتشمل مكتبات كود حقيقية معقدة، حيث تجاوزت نسبة نجاح Flash Cyber في اكتشاف الثغرات 70%.
اكتشاف الثغرة هو فقط الخطوة الأولى. وشددت جوجل بشكل خاص على أن تركيز تدريب Cyber هو إصلاح المشكلات، وليس توليد برامج استغلال هجومية.
في اختبار التصحيح CWE-Bench الذي يُدار بواسطة Collinear، حقق الإرسال الأول لـ Flash Cyber معدل نجاح قدره 47.2%، مقارنة بـ 47.8% للنموذج الرائد المُقارن. وكانت النتائج قريبة من بعضها البعض، لكن جوجل أشارت إلى أن تكلفة تشغيل Flash Cyber أقل.
هذا يمثل تحول هدف وكيل الأمن السيبراني من "إبلاغ المهندسين بوجود مشكلة محتملة هنا" إلى فهم الثغرات، وكتابة التصحيحات، وتشغيل الاختبارات، والتحقق من التعديلات. إذا كانت النتائج كافية من حيث الموثوقية، فقد يقلل من الوقت الذي تستغرقه فرق الأمن من اكتشاف الثغرة إلى نشر الإصلاح.
Chrome حصل على ضعفين وستة أعشار من التصحيح الصحيح، لكنه لا يزال قيد اختبار الشركة المصنعة والشركاء
لقد استخدمت جوجل Flash Cyber في أعمال أمان الكود الداخلي.
فريق أمان Chrome يدّعي أن عدد تصحيحات الثغرات الصحيحة التي ينتجها يبلغ 2.6 ضعف عدد الثغرات التي تنتجها نماذج تجارية أكبر مقارنةً. أما شركة الأمن السيبراني Wiz فتقول إن معدل استرجاع الثغرات لـ Flash Cyber أعلى بـ 7.5 إلى 9.7 نقطة مئوية مقارنة بالنماذج الرائدة الأخرى، وبتكلفة أقل بـ 2.3 إلى 5.2 مرة.
كما أشار فريق بحث الثغرات في Google Cloud إلى أن النموذج اكتشف ثغرة أساسية حرجة في أقل من ساعتين، في حين يمكن أن تستغرق الدراسات المماثلة شهورًا.
هذه النتائج ذات قيمة مرجعية واقعية، لكنها لا يمكن اعتبارها تقييمات عامة مستقلة وقابلة للتكرار. لم تُنشر من Google تفاصيل الثغرة الأساسية، أو قائمة النماذج المقارنة، أو مسار التشغيل الكامل؛ بيانات Chrome مأخوذة من داخل Google، كما أن Wiz تُعد شريكًا في Fairwind. وبالتالي، فإن هذه النتائج تثبت أن النماذج قادرة على المشاركة في أعمال أمنية حقيقية، لكنها لا تثبت أنها تحقق نفس المستوى من الأداء بشكل مستقر عبر جميع مكتبات الكود وأنواع الثغرات.
أقوى قدرات الأمان السيبراني مخصصة فقط للجهات الموثوقة
يُقدَّم Flash Cyber من خلال برنامج Fairwind الجديد الذي أنشأه Google، ويشمل حاليًا أكثر من 650 مشاركًا، ويشمل بشكل رئيسي وكالات أمن سيبراني حكومية، ومشغلي البنية التحتية الحيوية، ومسؤولي صيانة البرمجيات، وشركات أمنية كبيرة.
يجب على المؤسسات المشاركة تقييد نطاق الأشخاص الذين لديهم وصول داخلي، واتخاذ تدابير أمنية مثل المصادقة متعددة العوامل. بعد دمج النموذج مع CodeMender Agent، يمكنه العثور على الثغرات والتحقق منها وإصلاحها في بيئة السحابة الخاصة بالمؤسسة.
لا يزال يمكن للعملاء العاديين لـ Google Cloud استخدام CodeMender مع نموذج Gemini العام، لكنهم لا يمكنهم الحصول مباشرة على القدرات الكاملة لـ Flash Cyber.
طريقة الإصدار هذه "نموذج أساسي واحد، ومستويي صلاحيات" تشبه إلى حد كبير استراتيجية Anthropic السابقة في تقسيم Claude إلى Fable وMythos: حيث يتم فتح القدرات البرمجية والتحليلية العامة للسوق، بينما تُقدَّم وظائف الأمن السيبراني الأسهل تحويلها إلى قدرات هجومية من خلال المراجعة الهوية، والتحكم في الوصول، والمراقبة المستمرة.
لم تحدث ترقيات واضحة في الأمان، لكن هناك تدهور في بعض الترجمات غير الإنجليزية
يحتوي الإصدار العادي 3.8 Flash على قيود أمنية تتعلق بالمحتوى الكيميائي والبيولوجي والإشعاعي والنووي وهجمات الإنترنت؛ بينما يُفتح الإصدار السيبراني، الذي يتطلب إنجاز مهام دفاعية متخصصة، مع قيود أمنية إلكترونية أكثر مرونة، فقط للمنظمات التي خضعت للمراجعة.
تعتبر بطاقة نموذج Google أن النموذج 3.8 Flash لا يظهر قدرات جديدة جوهرية في المجالات عالية المخاطر التي تركز عليها إطار أمان الشركة المتقدم مقارنةً بـ 3.7 Flash، وبالتالي لم يُفعّل تصنيف مخاطر أعلى. كما تحسّنت حمايته في اختبارات حقن تعليمات برمجية غير مباشرة Gray Swan.
ومع ذلك، كشفت بطاقة النموذج أن 3.8 Flash تراجعت بنسبة 5.4 نقطة مئوية مقارنة بـ 3.7 Flash في اختبارات الأمان متعددة اللغات الآلية. وصرح جوجل بعد التحقق اليدوي أن معظم هذه الفروق تعود إلى إشارات خاطئة أو محتوى غير جاد، لكن العينات الكاملة والبيانات حسب اللغة لم تُنشر.
لا يزال النموذج يعاني من المشكلات الشائعة في نماذج اللغة الكبيرة، بما في ذلك الوهم، والاستجابة البطيئة أو تجاوز الوقت أحيانًا، واستخدام عدد مفرط من الرموز لتحسين الأداء. يُشار إلى تاريخ انتهاء المعرفة بمارس 2026، لكن جوجل توضح أن المعرفة الموثوقة في بعض المجالات قد لا تزال محدثة فقط حتى حوالي يناير 2025؛ ويجب التحقق عبر الإنترنت عند التعامل مع أحدث المعلومات.
المنافسة الحقيقية تنتقل من "من الأكثر ذكاءً" إلى "من يمكن استخدامه على نطاق واسع"
أبرز ما يُستحق الملاحظة في Gemini 3.8 Flash ليس تفوّقها في معيار واحد ببضع أجزاء من المئة، بل أن Google تُدمج قدرات البرمجة طويلة المدى، والتحليل المتخصص، واستدعاء الأدوات الذاتية ضمن فئة سعرية Flash.
النماذج الرائدة مناسبة للمهام الصعبة ذات القيمة العالية والتردد المنخفض؛ بينما قد تعالج الوكلاء التي تعمل فعليًا في خدمة العملاء المؤسسية، وخطوط تطوير البرمجيات، وتحليلات المالية، ومسح الأمان، ملايين الطلبات يوميًا. في هذه السيناريوهات، غالبًا ما تكون السرعة وتكلفة كل طلب ونسبة نجاح كل مهمة أكثر أهمية من الترتيب الأول في التصنيفات.
3.8 يُظهر Flash أيضًا التناقض في هذا المسار: كلما كان النموذج أكثر كفاءة في التحقق المتكرر والعمل المستمر، زاد احتمال توليد عدد أكبر من الرموز، مما يرفع تكلفة المهمة الواحدة للنماذج "الرخيصة". لذا، فإن محور المنافسة المستقبلي بين الوكلاء ليس فقط من يجيب بشكل أفضل، بل أيضًا من يستطيع تحديد متى يستمر في التفكير، ومتى يستخدم الأدوات، ومتى يجب أن يتوقف.
