
एंट्री-लेवल Luna की कीमत में भारी कटौती, प्रति मिलियन टोकन इनपुट मूल्य 1 डॉलर से घटकर 0.2 डॉलर हो गया है, और आउटपुट मूल्य 6 डॉलर से घटकर 1.2 डॉलर हो गया है।
In RMB, the input price decreased from approximately ¥6.8 to ¥1.35, and the output price decreased from approximately ¥40.6 to ¥8.1.
"दैनिक काम का मुख्य भाग" के लिए टेरा भी 20% कम हो गया है, इनपुट और आउटपुट की कीमतें क्रमशः 2 डॉलर और 12 डॉलर तक घट गई हैं।
In RMB, they are approximately ¥13.5 and ¥81.2 respectively.
केवल फ्लैगशिप मॉडल Sol मूल्य पर स्थिर है, लेकिन इसमें Fast mode लॉन्च किया गया है, जिसकी गति मानक मोड की तुलना में अधिकतम 2.5 गुना है, और त्वरित करने पर कोई अतिरिक्त शुल्क नहीं।

कोडेक्स ने अपनी उपयोग सीमा को भारी से रीसेट करने के बाद, कीमतों में भी तुरंत कटौती कर दी, ओपनएआई तुम किसे दबाने वाले हो…
यह कीमत का युद्ध सीधे तौर पर तीव्र हो गया है।
OpenAI ने कहा कि कीमत में कमी इसलिए हुई क्योंकि GPT-5.6 Sol ने खुद अपने लिए पैसे बचाए हैं।
GPT-5.6 Sol ने अपने स्वयं के विकास में भाग लिया, जिससे दक्षता में क्रांतिकारी वृद्धि हुई, इसलिए हम नए और पुराने उपयोगकर्ताओं को धन्यवाद देते हैं~
ओपनएआई, तुमने भी बाएं पैर से दाएं पैर पर दुबला उड़ने का तरीका अपना लिया है

।
दो की कीमत में कमी, एक का त्वरित होना
अब, GPT-5.6 के तीन मॉडल्स की API कीमतें क्रमशः हैं:
GPT-5.6 Luna: प्रति मिलियन टोकन इनपुट 0.2 डॉलर, आउटपुट 1.2 डॉलर;
GPT-5.6 Terra: प्रति मिलियन टोकन इनपुट 2 डॉलर, आउटपुट 12 डॉलर;
GPT-5.6 Sol: प्रति मिलियन टोकन इनपुट 5 डॉलर, आउटपुट 30 डॉलर।

After the price drop, Luna experienced a massive plunge.
इसकी इनपुट कीमत पिछली पीढ़ी GPT-5.4 nano के बराबर है, और आउटपुट कीमत 0.05 डॉलर सस्ती है।
लेकिन दोनों मॉडल अलग-अलग काम करते हैं, GPT-5.4 nano मुख्य रूप से वर्गीकरण, जानकारी निकालने और क्रमबद्ध करने जैसे सरल और अक्सर होने वाले कार्यों के लिए उपयुक्त है।
GPT-5.6 Luna को OpenAI द्वारा लागत संवेदनशील कार्यभार के लिए एक मॉडल के रूप में स्थित किया गया है, जो उपकरणों को कॉल कर सकता है, लंबे संदर्भ को संभाल सकता है, और बहु-चरण प्रवाहों को निष्पादित कर सकता है।
सरल शब्दों में, OpenAI उन मॉडल्स को बेच रहा है जो एजेंट्स के काम को संभालते हैं, और उनकी कीमत पिछले साधारण छोटे मॉडल्स की कीमत के बराबर है।
टेरा ने सावधानी बरती, 20% की कमी के साथ।
Sol अपनी मूल कीमत पर रहता है, जिसमें Fast mode जोड़ा गया है, जिसकी गति मानक मोड की तुलना में अधिकतम 2.5 गुना है, लेकिन कीमत मानक मोड की दोगुनी है, और मॉडल की बुद्धिमत्ता समान रहती है।
यह पिछले Priority Processing को भी बदल देगा। पहले priority टैग का उपयोग करने वाले API अनुरोध स्वचालित रूप से Fast mode पर स्विच हो जाएंगे।
अधिकारियों ने कहा कि इस समायोजन को कोडेक्स और चैटजीपीटी वर्क में भी शामिल किया जाएगा।
सब्सक्रिप्शन मूल्य में कमी नहीं होगी, और उपयोगकर्ता की कुल कोटा भी बढ़ाई नहीं जाएगी, लेकिन Terra और Luna का उपयोग करने पर खपत होने वाली कोटा में संबंधित रूप से कमी होगी।
एक ही सदस्यता शुल्क से मॉडल कई बार काम कर सकता है।
OpenAI ने ChatGPT और Codex CLI में Auto-review मॉडल को GPT-5.4 से GPT-5.6 Luna में बदल दिया।
Auto-review पीछे की ओर कोड और संशोधन परिणामों की जांच करता है, जो एक आम उच्च आवृत्ति Agent कार्य है।
मॉडल अपग्रेड और लूना की कीमत में कमी के संयोजन से, ओपनएआई का अनुमान है कि इसकी लागत मूल स्तर के लगभग दसवें हिस्से तक घट जाएगी।
सस्ते मॉडल अब केवल वर्गीकरण, निकालना जैसे पारंपरिक "काम" ही नहीं कर रहे हैं, बल्कि कोड समीक्षा, बैकएंड मॉनिटरिंग जैसे निर्णय और उपकरण उपयोग की आवश्यकता वाले चरणों में प्रवेश करने लगे हैं।
वर्तमान में तीन मॉडल्स की स्थिति है:
बजट संवेदनशील और अधिक मात्रा में उपयोग किए जाने वाले कार्यों को Luna को सौंपें;
सामान्य दैनिक कार्य Terra को सौंपें;
उच्च कठिनाई वाले कार्य के लिए अभी भी Sol का उपयोग करें;
अगर इंतजार करना भी धीमा लगता है, तो गति खरीदने के लिए दोगुना पैसा खर्च करें।
GPT-5.6 अपनी लागत कम करने में शामिल हो गया है
क्यों अचानक कीमत में कमी हुई?
OpenAI ने कहा कि कारण GPT-5.6 Sol ने अपने उत्पादन प्रणाली के अनुकूलन में भाग लिया।
इससे बढ़ी हुई दक्षता, जिसने मूल्य सूची पर छूट के अंकों में रूपांतरित किया।
विशेष रूप से, GPT-5.6 Sol ने कुछ उत्पादन वातावरण GPU Kernel को पुनः लिखा और अनुकूलित किया, सैकड़ों Token जनरेशन प्रयोगों का डिज़ाइन और चलाया, और प्रशिक्षण के निगरानी में भाग लिया, जब समस्याएँ उत्पन्न हुईं तो हस्तक्षेप किया।
अंतिम परिणाम भी उल्लेखनीय रहे: GPU Kernel अनुकूलन के माध्यम से GPT-5.6 की एंड-टू-एंड सेवा लागत 20% कम हुई; अनुमानित डिकोडिंग में सुधार के साथ Token उत्पादन की दक्षता 15% से अधिक बढ़ी।

GPU Kernel को GPU पर मॉडल द्वारा निष्पादित विशिष्ट गणना कार्यों के लिए निचले स्तर के प्रोग्राम के रूप में समझा जा सकता है।
मॉडल में कोई बदलाव नहीं करना है, बस इन प्रोग्राम्स को अधिक कुशल तरीके से लिखा जाए, तो एक ही GPU अधिक तेज़ी से गणना पूरी कर सकती है, अधिक अनुरोधों को संभाल सकती है, और प्रति एकल कॉल लागत भी कम हो जाएगी।
अनुमानित डिकोडिंग में, उत्तर उत्पन्न करते समय, अगले संभावित टोकन को पहले बैच के रूप में "अनुमानित" किया जाता है, और फिर मुख्य मॉडल द्वारा सत्यापित किया जाता है। जितना अनुमान सटीक होगा, उतने ही कम कदमों की आवश्यकता होगी जिन्हें एक-एक करके उत्पन्न करना और प्रतीक्षा करना होगा।
दोनों अनुकूलन ने मॉडल की क्षमता को कम नहीं किया है, लेकिन एक ही मॉडल को तेज़ और सस्ता चलाने में मदद करते हैं।
हालांकि, यह GPT-5.6 का स्वयं को पूरी तरह से अपग्रेड करना नहीं है।
OpenAI ने विशेष रूप से जोर दिया कि पूरी प्रक्रिया अभी भी मानव द्वारा नियंत्रित है।
मॉडल कोड लिख सकते हैं, प्रयोग चला सकते हैं, अनियमितताओं का निरीक्षण कर सकते हैं, लेकिन लक्ष्य कैसे निर्धारित किया जाए, परिणाम उपयोगी हैं या नहीं, और कोड उत्पादन वातावरण में जाएगा या नहीं—यह सब अभी भी 'Human in the Loop' पर निर्भर करता है।
OMT
अंत में, एक नया परिवर्तन है।
इस छूट का एक विशिष्ट लक्ष्य है: एजेंट वर्कफ्लो।
सबसे ज्यादा छूट वाला Luna, केवल वर्गीकरण और निकास के लिए उपयोग किए जाने वाला पारंपरिक छोटा मॉडल नहीं है।
OpenAI के स्थिति के अनुसार, यह उपकरणों को कॉल कर सकता है और बहु-चरण के कार्यों को निष्पादित कर सकता है, जो मुख्य रूप से उच्च आवृत्ति और लागत संवेदनशील वर्कलोड के लिए उपलब्ध है।
इसलिए, लूना की कीमत में 80% की कमी हुई, जिससे एजेंट के दीर्घकालिक संचालन की सीमा भी कम हो गई।
जिन समीक्षा, प्रमाणीकरण और निगरानी कार्यों को अत्यधिक लागत के कारण अक्सर नहीं किया जा सकता था, उन्हें कार्य प्रवाह का एक नियमित चरण बनाने का अवसर मिलता है।
GPT-5.6 के सहयोग से अपने उत्पादन प्रणाली को अनुकूलित करते हुए, एक नया चक्र उत्पन्न हुआ:
मॉडल की भागीदारी से ऑपरेशन की दक्षता में वृद्धि होती है, लागत कम होती है; कीमत कम होने के बाद, मॉडल अधिक उच्च आवृत्ति वाले कार्यप्रवाहों में शामिल होता है; कॉल स्केल बढ़ने से अगली पीढ़ी की दक्षता में सुधार होता है।
OpenAI का यह कीमत कम करने का चक्र पहले से ही आकार ले चुका है।
इस सब के बाद, अब दबाव सीधे A कंपनी पर है:
अब आपकी बारी है।

संदर्भ लिंक: [1] https://x.com/OpenAI/status/2082878156483219672 [2] https://x.com/sama/status/2082880720989532597
यह लेख वेचेन ग्रुप "क्वांटम बिट" से आया है, लेखक: फ्रंटियर टेक्नोलॉजी पर ध्यान दें
