أطلقت Anthropic Claude Sonnet 5.5، محاولةً تضييق قدرات Opus 5.5 الرائدة في نموذج عادي أرخص وأكثر ملاءمة للاستدعاءات المتكررة عالية التردد. لا يزال سعر واجهة برمجة التطبيقات 2 دولار و10 دولارات لكل مليون رمز إدخال/إخراج، لكن الشركة تدّعي أن سرعة الإخراج زادت بأكثر من 30%، وانخفض عدد الرموز المطلوبة لإكمال المهام النموذجية، مما يؤدي إلى انخفاض تكلفة المهمة الواحدة بنسبة تصل إلى 30%. في الاختبارات الرسمية، حقق Sonnet 5.5 70.6% في Terminal‑Bench 4.0، متفوقًا على Sonnet 5 البالغ 10.3% وOpus 5.5 البالغ 66.4%؛ كما اقترب من Opus بدرجة 1846 Elo في مهمة المهنة GDPval‑AA بدرجة 1844 Elo. ومع ذلك، فإن "Opus بنصف السعر" ليست النتيجة الكاملة: اكتشفت Artificial Analysis أن Sonnet 5.5 يُنتج في المتوسط حوالي 193,000 رمز إخراج لكل سؤال عند أقصى قوة استدلال، وهو أعلى تكوين استهلاكًا للرموز الذي اختبروه، مما يجعل تكلفة السؤال الواحد أعلى بنسبة 50% تقريبًا من Sonnet 5؛ كما أظهر اختبار مراجعة الكود الحقيقي من CodeRabbit أن Sonnet 5.5، رغم أنه أسرع بمرتين تقريبًا مقارنة بالجيل السابق، لا يزال يفوت مشكلات صعبة يمكن لـ Opus اكتشافها. وبالتالي، فهو أكثر شبهاً بنموذج رئيسي جديد مثالي للمهام الواضحة والقابلة للتكرار، وليس بديلاً شاملاً لـ Opus.مؤلف المقال، المصدر: Anthropic
Anthropic تعيد توجيه Sonnet ليصبح القوة الرئيسية للوكلاء اليومية
Sonnet 5.5 هو النموذج الثاني في سلسلة Claude 5.5. على عكس Opus 5.5 الذي تم إصداره قبل أسبوع ويستهدف المهام المفتوحة المعقدة، فإن Anthropic تُعرّف Sonnet 5.5 كنموذج مصمم للمهام اليومية ذات الحدود الواضحة والتي تتطلب تشغيلًا متكررًا بكثافة: إصلاح أخطاء البرامج، ومراجعة الكود، والتحقيق في المواد، وإنشاء المستندات والعروض التقديمية وجداول البيانات.
يدعم النموذج الإدخال النصي والصوري، ويوفر سياقًا بـ 1,000,000 رمز، ويمكن استخدامه على موقع Claude الإلكتروني وتطبيقاته المحمولة، وواجهة برمجة تطبيقات Anthropic، وAWS وGoogle Cloud وMicrosoft Azure. اسم الواجهة هوclaude-sonnet-5-5. لم تُنشر من Anthropic أي معلومات حول عدد المعلمات، أو بنية النموذج، أو بيانات التدريب، أو قوة الحوسبة المستخدمة للتدريب، لذا لا يمكن تحديد ما إذا كانت التحسينات ناتجة عن التدريب الأساسي، أو ما بعد التدريب، أو استراتيجيات الاستدلال، أو تحسينات سلسلة أدوات العامل.
الفرق بينه وبين Opus ليس مجرد "قدرة أضعف وسعر أرخص". ترغب Anthropic في تشكيل تقسيم جديد للنماذج: يُستخدم Opus للمهام المعقدة التي لا تُعرف تعريفاتها بشكل كامل وتحتاج إلى تقييم مستمر؛ بينما يُستخدم Sonnet لتنفيذ المهام المحددة بسرعة وزيادة عدد الطلبات بتكلفة أقل.
70.6% مقابل 10.3%، وهي البيانات الأكثر وضوحًا والتي تتطلب فهمًا حذرًا
حصل Sonnet 5.5 على 70.6% في اختبار Terminal‑Bench 4.0 الذي أعلنته Anthropic، بينما حصل Sonnet 5 على 10.3% فقط، وهو أعلى حتى من Opus 5.5 الذي حصل على 66.4%. يطلب هذا المعيار من الوكيل إكمال مهام متعددة الخطوات احترافية في بيئة سطر الأوامر، مما يعكس التوافق بين كتابة الكود وتشغيل الأوامر واستخدام الأدوات.
لم تكن التحسينات في المشاريع الأخرى بهذا القدر من التطرف، لكنها لا تزال واضحة. ارتفع CursorBench 4.0 من 34.1% في Sonnet 5 إلى 55.5%، وهو ما يبعد نقطتين مئويتين فقط عن 57.8% في Opus 5.5؛ وارتفع Humanity’s Last Exam مع الأدوات من 54.9% إلى 64.5%؛ وارتفع OSWorld 2.1 للتحكم في الحاسوب من 57.0% إلى 80.1%، وهو قريب من 81.8% في Opus.
في مهمة المعرفة المهنية GDPval-AA، حصل Sonnet 5.5 على 1844 Elo، وOpus 5.5 على 1846؛ وفي تقييم المهام الطويلة المعرفية AA-Briefcase، كانت النتائج 1811 و1822 على التوالي. وبناءً على ذلك، ترى Anthropic أن بعض مهام العمل المتخصصة ذات الحدود الواضحة لم تعد بحاجة إلى تفعيل النموذج الرائد افتراضيًا.
لكن لا يمكن دمج هذه الأرقام ببساطة في "تجاوز Sonnet Opus". فالمشاريع المختلفة لا تستخدم نفس شدة الاستدلال بالكامل، كما أن Anthropic أوضحت صراحةً أن Opus لا يزال أقوى بشكل ملحوظ في المهام التي تتطلب الحفاظ على الحكم على المدى الطويل أو التعامل مع الأهداف المفتوحة.
مثال معكوس مثير للاهتمام يأتي من FrontierCode. حقق Sonnet 5.5 نسبة 52.1% تحت شدة الاستدلال Xhigh، لكنه انخفض إلى 46.2% عند الترقية إلى Max. شرح Anthropic أن النموذج يُشغّل بشكل متكرر أكثر عوامل فرعية لمراجعة الكود في وضع Max، ونتيجة لذلك تجاوز الوقت المحدد مرتين أو عدّل كودًا خارج نطاق المهمة، مما أدى إلى تصنيفه كفشل في التقييم.
هذا الناتج يوضح أن المزيد من الاستدلال أو المزيد من الوكلاء لا يعني بالضرورة الحصول على إجابات أفضل. قد تخسر النموذج نقاطًا بسبب التحقق المفرط، أو توسيع نطاق المهمة، أو استنفاد ميزانية الوقت.
لم تنخفض قيمة كل رمز، فلماذا تدّعي الإدارة أن تكلفة المهمة أقل بنسبة 30%؟
السعر العام لـ Sonnet 5.5 هو نفسه لـ Sonnet 5: 2 دولار لكل مليون توكين إدخال، و10 دولارات لكل مليون توكين إخراج، و2.5 دولار لكتابة المخزن المؤقت، و0.2 دولار لقراءة المخزن المؤقت، وهي نصف الأسعار المقابلة لـ Opus 5.5.
ما يُسمّيه Anthropic بـ"الخصم حتى 30% في المهام الفردية" ليس انخفاضًا في أسعار واجهة برمجة التطبيقات، بل يعني أن النموذج يحتاج إلى خطوات وToken أقل لإكمال نفس المهمة. وتشير الشركة الرسمية إلى أن سرعة التوليد زادت بنسبة أكثر من 30%؛ لاحظ Slack في اختباراته الداخلية تقليلًا في عدد Token الناتجة بنسبة حوالي 14%، وقالت Atlassian إن سرعة الوكلاء زادت بنسبة تصل إلى 30%، بينما أبلغت Lovable عن تقليل في استدعاء الأدوات بنسبة حوالي ثلث، وانخفاض في عدد مرات تشغيل Shell بنسبة تقارب النصف.
عند اختبار Sonnet 5.5 على 2441 مهمة في أسئلة وأجوبة مالية، واستخراج البيانات، وتحليلها، وتوقعها، استخدمت في المتوسط حوالي 121 ألف رمز لكل مهمة، بينما استخدم Sonnet 5 حوالي 497 ألف رمز. نظرًا لأن هذه جميعها اختبارات خاصة للشركاء، لا يمكن للخارجيين التحقق من صعوبة المهام أو النصوص أو المخرجات الكاملة، لكن النتائج تشير معًا إلى تغيير واحد: النموذج الجديد يقلل من البحث المتكرر، أو قراءة المواد مرات عديدة، أو إجراء استدلالات داخلية طويلة جدًا.
هذا مهم بشكل خاص للوكيل. في المحادثات التقليدية، يؤثر إخراج مئات الرموز في مرة واحدة تأثيرًا محدودًا؛ لكن الوكيل طويل الأمد سيقوم بقراءة السياق مرارًا وتكرارًا، واستدعاء الأدوات، وتصحيح النتائج، وقد تتحول الزوائد في خطوة واحدة إلى فروق كبيرة في الوقت والتكاليف بعد عشرات الجولات.
أقصى قوة استدلال تكشف حقيقة تكلفة أخرى
أعطى الاختبار المستقل لـ Artificial Analysis إصدار Sonnet 5.5 بأعلى إعدادات الاستدلال درجة 56، متخلفًا فقط بدرجتين عن Opus 5.5 الذي حصل على 58 في مؤشر الذكاء الشامل.
لكن الثمن المدفوع لتحقيق هذا الإنجاز مرتفع جدًا: يولد Sonnet 5.5 ما متوسطه 193,000 رمز إخراج لكل اختبار، وهو أعلى مستوى تم قياسه من قبل المؤسسة، وأعلى بحوالي 60% من Opus 5.5 Max وSonnet 5 Max، وأعلى بسبعة أضعاف تقريبًا من GPT‑6 Astra Max. ووصلت تكلفته المقدرة لكل سؤال إلى 7.60 دولارًا، أي أعلى بحوالي 50% من Sonnet 5.
هذا لا يتعارض مباشرة مع ادعاء Anthropic بأن تكلفة المهام انخفضت بنسبة تصل إلى 30٪. تصف النتائج الرسمية بشكل أساسي أحمال العمل النموذجية ومستوى استنتاج منخفض؛ بينما تقاس Artificial Analysis الحالة التي يتم فيها تفعيل Max من أجل تحقيق الحد الأقصى من القدرة.
تشير النتيجتان معًا إلى أن قوة الاستدلال أصبحت جزءًا من منتج النموذج. قد يقدم Sonnet 5.5 في وضع Low أو Medium قيمة ممتازة مقابل السعر؛ إذا تم رفع قوة الاستدلال إلى Max لمجاراة Opus، فرغم أن تكلفته لكل Token أقل، فقد يفقد ميزته التكلفة بسبب كمية الإنتاج الزائدة.
كما وجدت Artificial Analysis أن دقة معرفة Sonnet 5.5 تبلغ حوالي 54٪، وهي أقل من 66٪ لـ Opus؛ كما تأخرت في مشاريع الاستدلال العلمي بنحو ست نقاط مئوية. ما يُسمى بـ "الاقتراب من Opus" يعتمد أساسًا على عمليات الوكلاء النهائية وبعض الأعمال المعرفية، ولا يمكن توسيعه ليشمل جميع القدرات.
في مراجعة الكود الحقيقية، فإن ميزة السرعة قائمة، كما لا تزال الفجوة بين الطرازات الرائدة موجودة
استخدم CodeRabbit مجموعة من اختبارات يوم الإصدار بناءً على أخطاء معروفة من مشاريع مفتوحة المصدر الحقيقية.
في 13 حالة مراجعة شفرة صعبة، اكتشف Sonnet 5.5 مع التفكير المنطقي 6 مشكلات، متجاوزًا Sonnet 5 الذي اكتشف 4؛ وكانت دقة التعليقات الفعالة 41.2% و40.0% على التوالي. لكن Opus 5.5 في الوضع القياسي اكتشف 8، وفي الوضع Max اكتشف 10، مما يشير إلى أن الفجوة لا تزال واضحة في مهام المراجعة المعقدة.
في مجموعة اختبار أخرى شملت 44 طلب سحب حقيقي، استغرق Sonnet 5.5 في المتوسط 6 دقائق و33 ثانية لكل مراجعة، بينما استغرق Sonnet 5 13 دقيقة و31 ثانية. قدم الأول تعليقات أقل بنسبة 24%، وتملك آراء تافهة لا تزيد عن ثلث تقريبًا مقارنة بالجيل السابق؛ وباستخدام الأسعار العامة، تبلغ تكلفة استدعاء النموذج الأساسي في المتوسط حوالي 0.46 دولارًا، بينما كانت تكلفة Sonnet 5 حوالي 1.16 دولارًا.
ومع ذلك، لم تُكتمل بعد درجة التغطية الكاملة للأخطاء لهذه المجموعة من 44 PR عند نشر المقالة، لذا لا يمكن حاليًا التأكد مما إذا كانت التعليقات الأقل كتابة قد حذفت مشكلات حقيقية إضافية. كما أن عينة الحالات الـ13 الصعبة هي صغيرة جدًا، ويشير CodeRabbit نفسه إلى أنها كافية لملاحظة الاتجاه، لكنها غير كافية لتحديد الترتيب العام.
التفويض الأنسب للنماذج هو: يُكلَّف Sonnet 5.5 بمراجعة سريعة وروتينية لكل PR؛ بينما تُرفع التغييرات التي تتعلق بالأمن أو البنية الأساسية أو الأخطاء التي يُكلّف تفويتها ثمنًا مرتفعًا إلى Opus أو الخبراء البشريين.
يبدأ التصميم البصري في أن يصبح نقطة بيع للنموذج الوظيفي العام
كما ركزت Anthropic بشكل خاص على قدرات Sonnet 5.5 في التصميم البصري. حيث قدم العرض التوضيحي الرسمي Sonnet 5 و5.5 على التوالي لإنشاء 400 طائر من الطيور المهاجرة تحلق معًا، وتلال رملية مُشكّلة بالرياح، وساعة كبيرة مكونة من 24 جرسًا صغيرًا في ملف HTML واحد. ويتميز النموذج الجديد بسرعة إنتاج أعلى، بالإضافة إلى اكتمال أعلى في الرسوم المتحركة والطبقات والواجهة.
يمكنه أيضًا إنشار عروض تقديمية بناءً على القوالب. قدمت Anthropic في اختبار داخلي مواد الأداء الفصلي لشركة مدرجة، ونص مكالمة هاتفية، ونموذج عرض تقديمي مكون من عشر شرائح، واعتبر خبيران أن الإصدار الأول من Sonnet 5.5 يمكن إرساله مباشرة.
ما زالت هذه أمثلة عرضية اختارها المصنع، ولا تمثل قدرة النموذج على فهم ثابت لكل قوالب الشركات. لا تزال دقة البيانات في الرسوم البيانية المعقدة، والمواصفات العلامات التجارية، ومصادر الاقتباس بحاجة إلى مراجعة يدوية، لكنها تعكس اتجاهًا جديدًا في المنافسة النموذجية: ليس فقط توليد محتوى صحيح، بل أيضًا تسليم واجهات ووثائق قريبة من المنتج النهائي.
زيادة قدرات الأمان تعني أيضًا أن بعض الطلبات سيتم توليها من قبل النماذج القديمة
Sonnet 5.5 هو أول نموذج Sonnet يُطلق مع حماية أمنية إلكترونية من الفئة الرائدة. تشير Anthropic إلى أن قدراته الأمنية الإلكترونية تقترب من Opus 5، لذا لا تزال إصلاحات الثغرات العادية ممكنة، لكن طلبات الأمن الإلكتروني ذات المخاطر الأعلى تُحول بشكل شفاف إلى Sonnet 5.
كما اختبرت الشركة السلوكات التي تضلل المستخدمين، وتخالف مصالحهم، وتساعد على إساءة الاستخدام عالية المخاطر، وتجاوز الحدود البيئية في حوالي 1850 سيناريو. وأفادت الشركة أن النموذج الجديد يحقق أداءً مماثلاً أو أفضل من Sonnet 5 في معظم المؤشرات، وهو أقل نموذج Claude تجربة نشطة لحدود الحاويات.
ومع ذلك، فإن هذه التقييمات هي أساسًا تقييمات آلية داخلية من Anthropic ولا يمكن اعتبارها دليلاً كاملاً على المخاطر في البيئات الواقعية. كما تعترف الشركة نفسها بأنه لا توجد مجموعة اختبارات واحدة قادرة على اكتشاف جميع أنماط الفشل.
Sonnet 5.5 هو أول Sonnet يُضاف إليه فلتر مضاد للتشتيت، ووسع آلية "الاحتفاظ بمحتوى التفكير" لمنع نقل سياق الاستدلال بين الحسابات المختلفة. التأثير على المطورين العاديين محدود، لكن بعض سير العمل التي تنقل محادثات Claude Code بين الحسابات تحتاج إلى تعديل.
التغيير الحقيقي ليس أن تكون في المرتبة الأولى في التصنيف، بل أن تصبح "النماذج القوية بما يكفي" الخيار الافتراضي
Sonnet 5.5 لم يُعلن عن أي بنية نموذجية جديدة، ولم يتفوق بشكل شامل على Opus. إن أهميته الأكبر تكمن في نقل كم كبير من المهام التي كانت تتطلب نماذج رائدة سابقًا إلى نماذج متوسطة المستوى أسرع وأقل تكلفة بـ 50% لكل رمز.
لأنظمة خدمة العملاء ومراجعة الكود والتحقيق في المعلومات وإنتاج المستندات التي تعمل آلاف المرات يوميًا، لا يُحدد قرار النشر عادةً بواسطة أعلى درجة فردية، بل بعدد الخطوات المطلوبة لكل مهمة، وعدد التوكنات، وفترة الانتظار، وما إذا كان يمكن رفع الأخطاء للتعامل معها. تكمن قيمة Sonnet 5.5 بالضبط في هذه المؤشرات.
