GPT-5.6 AWS Kiro में 20% की कीमत कमी के बावजूद कार्य लागत को 82% तक कम कर देता है

icon MarsBit
साझा करें
AI summary iconसारांश
GPT-5.6 ने AWS Kiro पर Terra के कार्य लागत को 82% तक कम कर दिया, हालाँकि 30 जुलाई को 20% की कीमत में कमी आई। दक्षता में वृद्धि का कारण कम विफल प्रयास और कम टोकन उपयोग था। GPT-5.6 मॉडल—Sol, Terra, और Luna—जुलाई में Kiro पर लॉन्च हुए। AWS और OpenAI ने मिलकर वातावरण को अनुकूलित किया। चूँकि क्रिप्टो कीमत अभी भी अस्थिर है, भय और लालच सूचकांक मिश्रित संकेत दे रहा है।

एक ही मॉडल के लिए, आधिकारिक कीमत में केवल 20% की कमी हुई, लेकिन आपका बिल 80% कम हो गया।

किरो

24 अगस्त को, OpenAI ने AWS के साथ किए गए एक परीक्षण के परिणामों की घोषणा की:

Terminal-Bench 2.1 पर, GPT-5.6 Terra द्वारा Kiro में एक सफल कार्य पूरा करने की लागत लगभग 82% घट गई है।

Kiro एक AWS सॉफ्टवेयर डेवलपमेंट एजेंट प्लेटफॉर्म है, जो IDE, CLI और वेब को कवर करता है।

GPT-5.6 परिवार के तीन भाई, Sol, Terra, Luna, एक महीने से अधिक समय से अंदर दौड़ रहे हैं।

यह 82% आधिकारिक छूट नहीं है।

Terra की अंतिम कीमत समायोजन 30 जुलाई को 20% के परिमाण में हुआ था।

किरो

30 जुलाई को OpenAI की कीमत समायोजन घोषणा, Terra में 20% की कमी।

मूल्य केवल 20% कम हुआ, लेकिन बिल में 80% की कमी हुई।

जो अंतर 60 प्रतिशत का है, वह कहाँ से बचाया गया, यही हमारा वास्तविक ध्यान केंद्रित करने योग्य मुद्दा है।

GPT-5.6 का Kiro पर लॉन्च इस साल जुलाई में हुआ था।

13 को, AWS ने घोषणा की कि GPT-5.6 Sol, Terra, Luna Amazon Bedrock पर उपलब्ध हैं।

अगले दिन, किरो ने ब्लॉग पोस्ट करके घोषणा की कि तीन मॉडल IDE, CLI और वेब पर लॉन्च हो गए हैं।

किरो

यह OpenAI मॉडल की पहली बार Kiro में प्रवेश है, जो ठीक Kiro के ओपन प्रीव्यू के पूरे एक साल पूरा होने के समय हुआ है।

पहले मॉडल को शेल्फ पर रख दें, फिर काम पर भेज दें, एक महीने से अधिक के बाद, OpenAI जवाब लेकर आता है:

दोनों ने मिलकर Kiro वातावरण और OpenAI मॉडल को एक साथ ट्यून किया, जिससे Terra द्वारा एक सफल कार्य पूरा करने की लागत लगभग 82% घट गई।

बचाए गए

बेकार का पैसा

7 जुलाई के समायोजन में, Terra में 20% की कमी हुई, लेकिन Kiro के परीक्षण में, एकल कार्य लागत में 82% की कमी हुई।

वह छह दशमलव भाग की बचत कहाँ से आई?

दिशाएँ इतनी ही हैं:

मॉडल द्वारा उत्पन्न टोकन कम हो गए हैं, टूल्स की री-कॉल की संख्या कम हो गई है, और विफलता के बाद पुनः प्रयास और लंबे रास्ते कम हो गए हैं।

इसलिए बचाई गई यह बड़ी राशि प्रत्येक कॉल के लिए नहीं, बल्कि उन कॉल्स के लिए है जो मूल रूप से बर्बाद हो जाते।

बहुत सरल बात है: एक AI एजेंट एक बार काम बर्बाद कर दे, तो बिल वैसे ही जारी रहता है। यह बीच में गलत रास्ता चुनता है, तीन चक्कर भटकता है, और फिर वापस आता है—इन सभी token की भी बिल जारी रहती है।

वास्तविक विकास में, पैसा अक्सर इसी तरह खो जाता है।

OpenAI ने अपने आधिकारिक ब्लॉग में भी एक ही तर्क को बताया है, जिसमें दक्षता तीन स्तरों से आती है:

Request initiation, context organization agent framework, orchestration system that mediates requests in between, and finally the model itself running on GPU.

किरो

OpenAI ने GPT-5.6 की दक्षता के स्रोत को विघटित किया: अनुरोध बुद्धिमान ढांचे से शुरू होता है, फिर व्यवस्थापन प्रणाली द्वारा नियंत्रित होता है, और अंत में GPU पर मॉडल चलाया जाता है, प्रत्येक स्तर पर बचत हो रही है।

बचत को मॉडल के कार्य विभाजन तक भी ले जाएं।

OpenAI ने एक उपयोग का उदाहरण भी दिया है: कोडिंग वर्कफ्लो में सबसे पहले Sol का उपयोग करके समस्या को स्पष्ट किया जा सकता है और योजना तैयार की जा सकती है, फिर Luna का उपयोग करके पहले से परिभाषित परिवर्तनों को लागू किया जा सकता है, परीक्षण लिखे जा सकते हैं और मूल्यांकन चलाया जा सकता है।

एक ही लाइन पर, विभिन्न चरणों के लिए विभिन्न स्तरों की बुद्धिमत्ता।

मॉडल केवल बिल का आधा हिस्सा लेता है

अलग फ्रेमवर्क का उपयोग करने से कीमत बदल जाती है

Terminal-Bench 2.1 का यह प्रश्नपत्र मॉडल को अकेले उत्तर देने के लिए नहीं है।

यह मॉडल को एक टर्मिनल वातावरण में डाल देता है, एक अस्पष्ट लक्ष्य देता है, और इसे स्वयं मार्ग योजना बनाने, उपकरणों को कॉल करने, स्क्रिप्ट लिखने, त्रुटियों को संभालने और बार-बार दोहराने की अनुमति देता है।

इसलिए प्राप्त परिणाम, "एजेंट + मॉडल" संयोजन का परिणाम है।

किरो

टर्मिनल-बेंच 2.1 ओपन लीडरबोर्ड, सटीकता के दाईं ओर लागत का एक नया स्तंभ जोड़ा गया है। (चित्र स्रोत: टर्मिनल-बेंच)

सूची में चार पंक्तियों के अंक सबसे अच्छी तरह से समस्या को समझाते हैं:

Claude Code के साथ Fable 5, 83.8%, 552.67 डॉलर;

Codex के साथ GPT-5.5, 83.1%, 2059.19 डॉलर;

Codex के साथ GPT-5.6 Terra, 78.4%, 421.15 डॉलर;

Codex के साथ GPT-5.6 Luna, 75.7%, 241.45 डॉलर।

पहली दो पंक्तियों के स्कोर में केवल 0.7 प्रतिशत का अंतर है, लेकिन बिल लगभग चार गुना अधिक है।

एक ही मॉडल को अलग-अलग फ्रेमवर्क में डालकर, अलग-अलग कॉन्टेक्स्ट ऑर्गनाइजेशन और टूल स्ट्रैटेजी के साथ चलाने पर, नतीजा पूरी तरह से अलग होता है।

किरो के आधिकारिक डेटा के अनुसार, टेरा कोडिंग एजेंट सूचकांक पर 77.4 अंक प्राप्त करती है, जो क्लॉड फेबल 5 के 77.2 से थोड़ा अधिक है।

इसकी बिक्री की बात अंकों में नहीं, बल्कि इन अंकों के संगत मूल्य में है।

किरो का यहीं स्पेक-ड्रिवन अप्रोच है, मुख्य खेल एक ही वाक्य में: शुरू में कोड नहीं लिखना।

यह पहले उपयोगकर्ता के अस्पष्ट लक्ष्य को एक वास्तविक आवश्यकता दस्तावेज़, तकनीकी डिज़ाइन और कार्यान्वयन योग्य कार्य सूची में विभाजित करता है, और फिर मॉडल को सौंप देता है।

इस तरह, मॉडल को एक अस्पष्ट वाक्य के बजाय एक स्पष्ट रूप से परिभाषित कार्य मिलता है।

एजेंट को जानने वाले तुरंत समझ जाएंगे कि इस चरण में सबसे महंगा खर्च छोड़ दिया गया है।

मॉडल भटक जाता है, फिर से काम करना पड़ता है, पूरा फिर से शुरू करना पड़ता है, जितने टोकन वास्तविक काम के लिए खर्च होते हैं, उससे अधिक टोकन बर्बाद हो जाते हैं।

Kiro ने प्रक्रिया में दो बाधाएँ रखी हैं: कोड को वास्तविक रूप से बदलने से पहले, इसे किसी के द्वारा जाँचने के लिए रोक दें; और काम पूरा होने के बाद, एक स्वचालित परीक्षण चलाकर यह सुनिश्चित करें कि यह सही है।

हर रीवर्क को रोकने से असली पैसे बचते हैं।

Claude अमेज़न के टेरिटरी पर

GPT ने आधा हिस्सा ले लिया

एक साल पहले, किरो केवल एक स्पेक-ड्रिवन IDE था, और मॉडल सिलेक्टर एंथ्रोपिक का घर था।

एक साल बाद, AWS ने अपने स्वयं के बुद्धिमान एजेंट प्लेटफॉर्म पर तीन OpenAI मॉडल एक साथ शामिल किए।

एक साल पहले सोल, टेरा, लूना और क्लॉड को एक ही ड्रॉपडाउन मेनू में एक साथ देखना मुश्किल था।

हालांकि GPT-5.6 इस बार 'पूरा परिवार आवासित' है, लेकिन यह 'समग्र रूप से खुला' नहीं है।

तीन मॉडल धीरे-धीरे और प्रयोगात्मक रूप से खुले हैं, जो Pro, Pro+, Pro Max और Power उपयोगकर्ताओं के लिए हैं, केवल दो क्षेत्रों में: अमेरिका के उत्तरी वर्जीनिया और यूरोप के फ्रैंकफर्ट, जो क्रॉस-रीजनल इन्फरेंस को सपोर्ट करते हैं।

एक और बात जिसके बारे में कई लोग अनुकूलित नहीं हो पा रहे हैं: इन मॉडल्स को Kiro में छिपी हुई तर्क श्रृंखला के साथ चलाया जाता है, आप इसके तर्क के चरणों को नहीं देख सकते, केवल अंतिम परिणाम देख सकते हैं।

एजेंट के एक-एक कदम के अनुसार तर्क करने वालों को लगता है कि जैसे काम को एक अपारदर्शी बॉक्स में फेंक दिया गया है।

आधिकारिक रूप से कहा गया है कि यह अपेक्षित व्यवहार है और यह आउटपुट गुणवत्ता को प्रभावित नहीं करता है।

Three-tier model is clearly priced in Kiro.

जुलाई 14 को शुरू होने के समय, इसी कार्य के लिए, Sol पर 2.4 गुना, Terra पर 1.2 गुना और Luna पर 0.6 गुना काटा गया।

30 जुलाई को OpenAI की उस घटना के बाद, अगले दिन Kiro ने अपना कदम उठाया: Luna को 0.6 गुना से घटाकर 0.1 गुना कर दिया गया, Terra को 1.2 गुना से घटाकर 1.0 गुना कर दिया गया, जबकि Sol पर कोई बदलाव नहीं हुआ।

किरो

AWS का रुख स्पष्ट है: एक डेवलपमेंट प्लेटफॉर्म केवल एक मॉडल से बंधा नहीं हो सकता।

Same selector, two cutting-edge models start undercutting each other.

मूल्यांकन मानदंड भी बदल गए हैं: उच्च अंक हमेशा जीत का अर्थ नहीं हैं, कम खर्च करने से भी जीता जा सकता है।

डेवलपर्स के लिए, पहले यह पूछा जाता था कि "इस मॉडल की कीमत एक मिलियन टोकन के लिए क्या है?", अब यह पूछना पड़ता है कि "इसे इस काम को पूरा करने के लिए मुझे कितना खर्च करना पड़ेगा?"

संदर्भ:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

यह लेख वेचेन ग्रुप "न्यूज़िज़यन" (ID: AI_era) से आया है, लेखक: ASI उपदेश, संपादक: युआनयु

डिस्क्लेमर: इस पेज पर दी गई जानकारी थर्ड पार्टीज़ से प्राप्त की गई हो सकती है और यह जरूरी नहीं कि KuCoin के विचारों या राय को दर्शाती हो। यह सामग्री केवल सामान्य सूचनात्मक उद्देश्यों के लिए प्रदान की गई है, किसी भी प्रकार के प्रस्तुतीकरण या वारंटी के बिना, न ही इसे वित्तीय या निवेश सलाह के रूप में माना जाएगा। KuCoin किसी भी त्रुटि या चूक के लिए या इस जानकारी के इस्तेमाल से होने वाले किसी भी नतीजे के लिए उत्तरदायी नहीं होगा। डिजिटल संपत्तियों में निवेश जोखिम भरा हो सकता है। कृपया अपनी वित्तीय परिस्थितियों के आधार पर किसी प्रोडक्ट के जोखिमों और अपनी जोखिम सहनशीलता का सावधानीपूर्वक मूल्यांकन करें। अधिक जानकारी के लिए, कृपया हमारे उपयोग के नियम और जोखिम प्रकटीकरण देखें।