GPT-5.6 يخفض تكاليف المهام بنسبة 82% في AWS Kiro على الرغم من انخفاض السعر بنسبة 20%

icon MarsBit
مشاركة
AI summary iconملخص
خفضت مهمة GPT-5.6 Terra تكاليفها بنسبة 82% على AWS Kiro، على الرغم من انخفاض السعر بنسبة 20% في 30 يوليو. جاءت تحسينات الكفاءة من تقليل المحاولات الفاشلة واستخدام أقل للرموز. تم إطلاق نماذج GPT-5.6 — Sol وTerra وLuna — على Kiro في يوليو. قام AWS وOpenAI بتحسين البيئة معًا. مع استمرار تقلب أسعار العملات المشفرة، يُظهر مؤشر الخوف والطمع إشارات مختلطة.

نفس النموذج، انخفض السعر الرسمي فقط بنسبة 20٪، لكن فاتورتك انخفضت بنسبة ثمانين بالمئة.

كيرو

في 24 أغسطس، أعلنت OpenAI عن نتائج اختبار أجرته مع AWS:

على Terminal-Bench 2.1، انخفضت تكلفة إكمال مهمة ناجحة من قبل GPT-5.6 Terra في Kiro بنسبة حوالي 82%.

Kiro هو منصة الذكاء الاصطناعي لتطوير البرمجيات من AWS، وتشمل IDE وCLI وWeb.

إخوة Sol وTerra وLuna من عائلة GPT-5.6، قد ركضوا داخله لأكثر من شهر.

هذه النسبة البالغة 82% ليست خفضًا رسميًا.

آخر تعديل في سعر Terra كان في 30 يوليو، بزيادة قدرها 20%.

كيرو

إعلان تعديل أسعار OpenAI في 30 يوليو، هبوط Terra بنسبة 20%.

انخفض السعر_unitي بنسبة 20% فقط، بينما يمكن خفض الفاتورة بنسبة ثمانين بالمائة.

النسبة المئوية الستون المفقودة في الوسط، من أين تم توفيرها، هي ما يستحق حقًا اهتمامنا.

GPT-5.6 logged into Kiro in July this year.

في البداية، في 13، أعلنت AWS أن GPT-5.6 Sol و Terra و Luna متاحة رسميًا على Amazon Bedrock.

في اليوم التالي، أعلنت كيرو عبر مدونة عن إطلاق ثلاثة نماذج على IDE وCLI وWeb.

كيرو

هذا أول مرة يدخل فيها نموذج OpenAI إلى Kiro، بالضبط في الذكرى السنوية الأولى للعرض التجريبي العام لـ Kiro.

أولاً، ضع النموذج على الرف، ثم أرسله للعمل، وبعد أكثر من شهر، عاد OpenAI لتقديم الواجب:

قام طرفان بالتعاون على ضبط بيئة Kiro ونماذج OpenAI معًا، فانخفض تكلفة إنجاز مهمة ناجحة من Terra بنسبة حوالي 82%.

المدخر

أموال تُهدر في طرق مُعقّدة

في التعديل الذي تم في 30 يوليو، انخفض Terra بنسبة 20٪، لكن في اختبار Kiro، انخفض تكلفة المهمة الواحدة بنسبة 82٪.

أين تأتي الستون بالمائة التي تم توفيرها؟

الاتجاهات هي فقط هكذا:

يتم إنتاج عدد أقل من الرموز من النموذج، وعدد مرات استدعاء الأدوات يتقلص، ويقلل من محاولات إعادة المحاولة والمسارات الطويلة بعد الفشل.

إذًا، الجزء الكبير المدخر ليس مبلغًا يُدفع في كل استدعاء، بل هو الأموال التي كانت ستُهدر على الاستدعاءات غير الضرورية.

السبب بسيط: عندما يفشل وكيل ذكاء اصطناعي في إنجاز المهمة مرة واحدة، تُسجّل الفاتورة على أي حال. حتى إذا اختار مسارًا خاطئًا في منتصف الطريق، وانحرف لثلاث دورات ثم عاد، تُستهلك هذه الرموز أيضًا.

في التطوير الحقيقي، غالبًا ما تتسرب الأموال بهذه الطريقة.

كما أشارت OpenAI في مدونتها الرسمية إلى نفس المنطق، حيث تأتي الكفاءة من ثلاث طبقات:

إطار وكيل يُطلق الطلب وينسق السياق، ونظام ترتيب يُنسق الطلبات في الوسط، وأخيرًا النموذج نفسه الذي يعمل على وحدة معالجة الرسومات.

كيرو

تفكيك OpenAI لمصادر كفاءة GPT-5.6: الطلب يبدأ من إطار الوكلاء، ثم يُنسق عبر نظام التخطيط، وأخيرًا يُشغّل على وحدات معالجة الرسوميات، وكل طبقة تحقق توفيرًا.

توفر المال حتى في توزيع المهام على النماذج.

استخدمت OpenAI أيضًا مثالًا آخر: يمكن لتدفق العمل الترميزي أن يبدأ باستخدام Sol لفهم المشكلة ووضع الخطة، ثم الانتقال إلى Luna لتنفيذ التغييرات المحددة بوضوح، وكتابة الاختبارات، وتشغيل التقييمات.

نفس خط الإنتاج، مع تخصيص مستويات مختلفة من الذكاء لكل مرحلة.

النموذج يشكل نصف الفاتورة فقط

تغيير الإطار يعني تغيير السعر

这套题,不是让模型单独答卷。

إنها تُدخل النموذج في بيئة طرفية، وتمنحه هدفًا غامضًا، وتجعله يخطط للمسار بنفسه، ويستخدم الأدوات، ويكتب النصوص البرمجية، ويعالج الأخطاء، ويعيد التكرار مرارًا وتكرارًا.

لذلك، النتائج التي تم تحقيقها هي نتيجة مزيج "الوكيل + النموذج".

كيرو

قائمة Terminal-Bench 2.1 العامة، ظهر بند تكلفة إضافي بجانب دقة التنبؤ. (مصدر الصورة: Terminal-Bench)

الأرقام الأربعة في القائمة هي الأكثر وضوحًا في توضيح الأمر:

Claude Code مع Fable 5، 83.8٪، 552.67 دولار؛

Codex مع GPT-5.5، 83.1٪، 2059.19 دولارًا؛

Codex مع GPT-5.6 Terra، 78.4٪، 421.15 دولارًا؛

Codex مع GPT-5.6 Luna، 75.7٪، 241.45 دولار.

الفرق في النقاط بين السطرين الأولين كان فقط 0.7 بالمئة، لكن الفاتورة كانت تختلف بأكثر من أربع مرات.

نفس النموذج، عند تحميله في أطر مختلفة، مع تنظيم سياقات وأدوات استراتيجية مختلفة، ينتج أسعارًا مختلفة تمامًا.

وفقًا للبيانات المقدمة من Kiro الرسمية، حصل Terra على درجة 77.4 في مؤشر Coding Agent، وهي أعلى بقليل من درجة Claude Fable 5 البالغة 77.2.

مزاياه ليست في الدرجة، بل في السعر المقابل لتلك الدرجة.

نقطة قوة كيرو المبنية على المواصفات تكمن هنا أيضًا، واللعبة الأساسية تلخص في جملة واحدة: لا تبدأ بكتابة الكود فورًا.

إنها أولاً تفكّك الهدف الغامض للمستخدم إلى وثيقة متطلبات رسمية، وتصميم تقني، وقائمة مهام قابلة للتنفيذ، ثم تُسلّمها للنموذج.

بهذه الطريقة، لا يحصل النموذج على جملة غامضة، بل على مهمة مُنظمة.

من يعرف Agent سيتفاعل فورًا، حيث أن هذه الخطوة تُ省略 التكلفة الأغلى على الإطلاق.

غالبًا ما يتم حرق رموز أكثر من تلك التي تُستخدم فعليًا في العمل بسبب انحراف النموذج، وإعادة العمل، وإعادة البناء من الصفر.

لا يزال كيرو قد وضع حاجزين في العملية: التوقف قبل تعديل الكود فعليًا لمنح شخص ما فرصة لمراجعته؛ وبعد إكمال العمل، تشغيل اختبار تلقائي للتحقق من صحته.

كل إعادة عمل يتم منعها من قبل هذين البوابتين توفر أموالًا حقيقية.

كلود في أرضية أمازون

أخذت GPT نصفها

قبل عام، كان Kiro مجرد IDE موجه بالمواصفات، وكان مُختار النموذج في ملعب Anthropic.

بعد عام، أضافت AWS ثلاثة نماذج من OpenAI على منصتها الذكية الخاصة بها.

من الصعب تصور مشهد يضم Sol وTerra وLuna وClaude في قائمة منسدلة واحدة قبل عام.

على الرغم من أن GPT-5.6 هو "الانتقال الكامل للعائلة" هذه المرة، إلا أنه لم يُفتح "بالكامل".

يتم إطلاق النماذج الثلاثة تدريجيًا وتجريبيًا للمستخدمين من فئات Pro و Pro+ و Pro Max و Power، مع توفرها في منطقتين فقط: شمال فرجينيا في الولايات المتحدة وفرانكفورت في أوروبا، مع دعم الاستدلال عبر المناطق.

هناك أيضًا نقطة لا يعتاد عليها الكثيرون: هذه النماذج تعمل في Kiro عبر سلسلة تفكير خفية، فلا يمكنك رؤية خطوات الاستدلال، بل فقط النتيجة النهائية.

الأشخاص المعتادون على متابعة وكيل يُجري الاستدلال خطوة بخطوة، سيشعرون وكأنهم يلقون المهمة في صندوق غير شفاف.

وفقًا للإفادة الرسمية، هذا سلوك متوقع ولا يؤثر على جودة الإخراج.

النماذج الثلاثة مُحددة الأسعار بوضوح في Kiro.

في 14 يوليو، عند الإطلاق الأولي، كانت نفس المهمة تخصم 2.4 ضعفًا من SOL، و1.2 ضعفًا من Terra، و0.6 ضعفًا من Luna.

في 30 يوليو، بعد تخفيض OpenAI، تبع Kiro في اليوم التالي: خُفِّض Luna من 0.6 ضعف إلى 0.1 ضعف، وانخفض Terra من 1.2 ضعف إلى 1.0 ضعف، بينما لم يُجرَ أي تغيير على Sol.

كيرو

يُظهر AWS موقفه بوضوح: لا يمكن لمنصة تطوير أن ترتبط بنموذج واحد فقط.

في نفس المُحدِّد، بدأت نموذجان رائدان في التنافس على تخفيض الأسعار.

معايير تقييم النموذج تغيرت أيضًا: الدرجة العالية لا تعني تلقائيًا الفوز، ويمكن الفوز بإنفاق أقل.

للمطورين، كان السؤال السابق عند اختيار النموذج هو "كم يكلف هذا النموذج لكل مليون وحدة مُعالجة؟"، أما الآن فيجب أن تسأل: "كم سأدفع حقًا لجعله يُنجز هذه المهمة؟"

المراجع:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

هذا المقال من حساب WeChat "سينزي يوان" (ID: AI_era)، الكاتب: ASI Revelation، المحرر: Yuan Yu

إخلاء المسؤولية: قد تكون المعلومات الواردة في هذه الصفحة قد حصلت عليها من أطراف ثالثة ولا تعكس بالضرورة وجهات نظر أو آراء KuCoin. يُقدّم هذا المحتوى لأغراض إعلامية عامة فقط ، دون أي تمثيل أو ضمان من أي نوع ، ولا يجوز تفسيره على أنه مشورة مالية أو استثمارية. لن تكون KuCoin مسؤولة عن أي أخطاء أو سهو ، أو عن أي نتائج ناتجة عن استخدام هذه المعلومات. يمكن أن تكون الاستثمارات في الأصول الرقمية محفوفة بالمخاطر. يرجى تقييم مخاطر المنتج بعناية وتحملك للمخاطر بناء على ظروفك المالية الخاصة. لمزيد من المعلومات، يرجى الرجوع إلى شروط الاستخدام واخلاء المسؤولية.