أطلقت Anthropic Claude Opus 5.5 مع تخفيض في التكلفة بنسبة 40% والتركيز على موثوقية المهام الطويلة

icon币界网
مشاركة
AI summary iconملخص
أطلقت Anthropic Claude Opus 5.5 في 22 سبتمبر 2026، مع خفض في التكلفة بنسبة 40% مقارنة بالإصدار السابق. يدعم النموذج الاستثمار طويل الأجل من خلال تحسين الموثوقية للمهام الممتدة. فهو يتعامل مع البرمجة والبحث المعقدة، بما في ذلك نقل كود يبلغ 680,000 سطر في أقل من يوم واحد. يضيف التحديث حماية ضد حقن الأوامر، ويركز على اختبارات السلامة في بيئات واقعية. تختلف وفورات التكلفة بناءً على تعقيد المهمة واستخدام الأدوات.
موقع CoinNews يُفيد:

أطلقت Anthropic في 22 سبتمبر Claude Opus 5.5، وهو أول نموذج في سلسلة Claude 5.5. وتتمثل نقطة البيع الأساسية التي قدمتها الشركة بشكل مباشر: تحقيق مستوى Claude Fable 5.1 في معظم المهام، مع خفض تكلفة التشغيل بنسبة 40% مقارنة بالجيل السابق Opus 5. لكن ما يستحق الملاحظة حقًا في هذا الإطلاق ليس فقط السعر والتصنيفات، بل تركيز Anthropic المتزايد على المهام الطويلة، والعمليات غير القابلة للعكس، وحماية حقن التعليمات البرمجية.

أفادت الشركة الرسمية أن Opus 5.5 يُظهر تحسينًا ملحوظًا في الترميز المعقد، والأبحاث، ومهام الخبرة. حيث استخدم فريق من المُختبرين المبكرين النموذج لنقل حوالي 680 ألف سطر من الكود في أقل من يوم واحد؛ كما أكّدت Anthropic أن النموذج قادر على الحفاظ على سياق أطول واستمرارية خطط أكثر فعالية. يمكن للحالات أن تُظهر حدود القدرة، لكنها لا يمكن اعتبارها متوسط وقت التسليم لجميع المشاريع. فبنية قاعدة الكود، ونطاق الاختبارات، والمراجعة البشرية ستُغيّر النتائج.

خفض التكاليف لا يعني "النسخة المخفضة من الطراز الرائد"، بل إعادة تحديد حدود استخدام النموذج

في الماضي، كان يُترك Opus عادةً للمهام الأكثر تعقيدًا وتكلفة، بينما كانت المهام اليومية تُسند إلى نماذج أسرع. إذا كان Opus 5.5 قادرًا فعلاً على الوصول إلى مستوى Fable 5.1 بتكلفة أقل، فقد تبدأ الشركات في استخدام النموذج الرائد في كميات أكبر من مراجعة الكود وتحليل الوثائق وعمليات البحث، وليس فقط عند طلب طلبات ذات قيمة عالية قليلة.

انخفاض التكلفة بنسبة 40% هو البيان الرسمي من Anthropic مقارنة بـ Opus 5، ولا يعني أن فواتير كل شركة ستقل بنفس النسبة. تعتمد التكاليف الفعلية على طول المدخلات والمخرجات، والتخزين المؤقت، وعدد مرات استدعاء الأدوات، وما إذا كان يجب إعادة محاولة المهمة. قد تستهلك النماذج الأقوى المزيد من إجمالي الرموز بسبب تكليفها بمهمات أطول. يجب على المشترين اختبار "إجمالي تكلفة إنجاز مهمة" باستخدام أحمال عملهم الخاصة، بدلاً من مقارنة السعر الوحدوي فقط.

يجب قياس قدرة المهام الطويلة أيضًا من حيث جودة الإنجاز. قد تولد عملية نقل كود كبيرة عددًا كبيرًا من التغييرات التي تبدو معقولة، لكن التكلفة الحقيقية تشمل اختبارات الرجوع، وصراعات التبعيات، والنشر والاسترجاع. إذا احتاج النموذج إلى مهندسين لقضاء أيام في إصلاح المشكلات الهامشية، فستتقلص ميزة السرعة. يجب أن تكون أبرز التقييمات مسجلةً مع نسب النجاح، وعدد مرات التدخل البشري، والأخطاء غير القابلة للتصحيح، وليس فقط عدد أسطر الكود المولدة.

أشارت Anthropic إلى أن Opus 5.5 خضع لاختبارات ما قبل الإطلاق من قبل مقيّمين خارجيين مثل Frontier Design وMETR. يمكن أن يزيد المشاركة الخارجية من المصداقية، لكنها لا تعني أن جميع التقارير والبيانات الأصلية وبيئات الاختبار قد تم الإفصاح عنها بالكامل. لا يزال على المستخدمين التمييز بين النتائج التي أعلنتها الشركة والنتائج التي توصلت إليها تقييمات مستقلة ونتائج إعادة الإنتاج في بيئاتهم الخاصة.

يبدأ اختبار الأمان في التركيز على أشكال الحوادث الحقيقية، وليس فقط معدل رفض الإجابات القصيرة.

أعلنت Anthropic أن Opus 5.5 حقق أفضل أداء لها حتى الآن في مراجعة سلوكها الآلي. شملت الاختبارات آلاف السيناريوهات المحاكاة، مع التركيز على ما إذا كان النموذج سيتخذ إجراءات يصعب التراجع عنها، أو يتجاوز الحدود المحددة من قبل المستخدم، أو يحافظ على المهمة الأصلية عند مواجهة حقن التوجيه. كما أضافت الشركة مهام مستحيلة، ومهمات أطول مدة، وسيناريوهات مبنية على حوادث حقيقية إلى التقييم.

هذه درس لا بد من تعلمه بعد دخول الذكاء الاصطناعي الوكيل إلى بيئة الإنتاج. غالبًا ما تركز اختبارات الأمان التقليدية على ما إذا كان النموذج سيجيب على أسئلة حساسة معينة، لكن الوكلاء القادرين على تصفح الويب واستخدام طرفية النظام وتعديل الملفات، تأتي مخاطرهم من سلسلة الإجراءات: فقد يستمرون في التنفيذ بناءً على افتراضات خاطئة، أو قد يعاملون النصوص الضارة الموجودة على الصفحات كتعليمات. خطأ واحد في النقر أو توسيع الصلاحيات أصعب في التراجع عنه من إجابة غير مناسبة.

"الحد الأدنى من التجاوزات" لا يساوي دائمًا "عدم التجاوز". لقد اعترفت Anthropic صراحةً بوجود قيود على النموذج. لا يزال يتعين على الشركات عند النشر تطبيق مبدأ الحد الأدنى من الصلاحيات، وتأكيد العمليات، وسجلات قابلة للتتبع، وبيئات معزولة، وآليات التراجع. خاصةً بالنسبة لتغييرات قواعد البيانات الإنتاجية، والدفع، والبنية التحتية، لا ينبغي إلغاء الموافقة البشرية فقط لأن درجة أمان النموذج ارتفعت.

هذا هو أول نموذج يُطلق بعد أن اقترح Anthropic "إبطاء وتيرة التقدم". تهدف الشركة إلى إرسال إشارة مفادها أن الاستمرار في تحسين القدرات يجب أن يرافقه دمج تقييمات خارجية واختبارات أمان أكثر واقعية في عملية الإطلاق. ومع ذلك، فإن تقييم ما إذا كان هذا الالتزام سيتحقق يعتمد على الكشف المستمر عن حالات الفشل، وأساليب الاختبار، وفعالية الإصلاحات في المستقبل، وليس فقط على أعلى درجة تم تحقيقها في إصدار واحد.

بالنسبة للمستخدمين، فإن أكثر ما يستحق تجربته في Opus 5.5 ليس ما إذا كانت إجابات المحادثة أكثر جمالًا، بل ما إذا كان بإمكانه الحفاظ على الضوابط خلال مهام تستغرق ساعات وتستخدم أدوات وخطوات متعددة، وما إذا كان سيتوقف عندما تكون المعلومات غير كافية. يتحول التنافس في سوق النماذج من "من يجيب بذكاء أكبر" إلى "من يستطيع إنجاز المهام المعقدة بتكلفة قابلة للتحكم". إن انخفاض الأسعار يمنح عددًا أكبر من الأشخاص فرصة التجربة، بينما تحدد الانضباط الأمني والهندسي ما إذا كانت هذه التجارب ستنتقل فعليًا إلى الإنتاج.

يمكن للشركات أثناء التجربة إنشاء مجموعة بسيطة ولكن صارمة من المقارنات: مقارنة Opus 5 وOpus 5.5 والنماذج الأقل تكلفة باستخدام نفس مجموعة المهام الحقيقية، وتسجيل وقت الإنجاز، والتكلفة الإجمالية، ومعدل المرور في الاختبارات، وكمية التعديلات اليدوية، وعدد الإجراءات عالية الخطورة. فقط عندما تتحسن جميع هذه المؤشرات معًا، يكون الترقية ذات معنى تجاري. العروض التوضيحية في يوم الإصدار مناسبة لاكتشاف الإمكانيات، بينما التقييمات الداخلية المستمرة على مدى أسابيع عديدة هي الأنسب لاتخاذ قرارات الصلاحيات والميزانية.

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.