ایک ہی ماڈل، آفیشل قیمت صرف 20% کم ہوئی، لیکن آپ کا بل آٹھ فیصد کم ہو گیا۔

24 اگست، OpenAI نے AWS کے ساتھ مل کر کیے گئے ٹیسٹ کے نتائج کا اعلان کیا:
ٹرمنل-بینچ 2.1 پر، GPT-5.6 Terra کا کرو میں ایک کامیاب کام مکمل کرنے کا خرچ تقریباً 82 فیصد کم ہو گیا۔
Kiro، AWS کا سافٹ ویئر ڈویلپمنٹ ایجنٹ پلیٹ فارم ہے جو IDE، CLI اور ویب کو کور کرتا ہے۔
GPT-5.6 فیملی کے تین بھائی، Sol، Terra، Luna، ایک ماہ سے زائد عرصہ سے اندر دوڑ رہے ہیں۔
یہ 82%، افسرانا کمی نہیں ہے۔
ٹیرا کی آخری قیمت میں تبدیلی 30 جولائی کو 20% کے فیصد کے ساتھ ہوئی۔

30 جولائی کو OpenAI کی قیمت میں تبدیلی کا اعلان، ٹیرا میں 20 فیصد کمی۔
قیمت صرف 20% کم ہوئی، لیکن بل میں 80% کی کمی ہوئی۔
جو ساٹھ فیصد کا فرق درمیان میں ہے، وہ کہاں سے بچایا گیا، اس کی حقیقت ہمیں توجہ دینے کے قابل ہے۔
GPT-5.6 کا Kiro پر لاگ ان یہ سال جولائی میں ہوا۔
13 کو، AWS نے اعلان کیا کہ GPT-5.6 Sol، Terra، اور Luna Amazon Bedrock پر مکمل طور پر دستیاب ہیں۔
اگلے دن، کیرو نے ایک بلاگ پوسٹ جاری کرکے تین ماڈلز کو IDE، CLI اور ویب پر لانچ کرنے کا اعلان کیا۔

یہ پہلی بار ہے کہ OpenAI ماڈل Kiro میں داخل ہوا، جو بالکل Kiro کے عوامی پریویو کے ایک سال مکمل ہونے کے موقع پر آیا۔
سب سے پہلے ماڈل کو شیلف پر رکھ دیں، پھر کام پر بھیج دیں، ایک ماہ سے زیادہ کے بعد، OpenAI واپس آ کر اپنا اسائنمنٹ جمع کراتا ہے:
دو کمپنیوں نے مل کر Kiro ماحول اور OpenAI ماڈل کو ایک ساتھ ٹیون کیا، جس سے Terra کے ایک کامیاب کام کی لاگت میں تقریباً 82% کی کمی آئی۔
بچت ہوئی
گھوم کر جانے کا پیسہ
30 جولائی کے ایڈجسٹمنٹ کے دوران، ٹیرا میں 20% کی کمی آئی، لیکن کیرو کے ٹیسٹ میں، ایک ٹاسک کی لاگت 82% تک کم ہو گئی۔
وہ جو 60 فیصد بچت ہوئی، وہ کہاں سے آئی؟
سب سے زیادہ سمتیں یہی ہیں:
مڈل کم ٹوکنز پیدا کرتا ہے، ٹولز کو کم بار ری کال کرنا پڑتا ہے، اور ناکامی کے بعد دوبارہ کوششیں یا لمبے راستے اپنانے کی ضرورت کم ہو گئی ہے۔
اس لیے بچائی گئی بڑی رقم، ہر کال کی رقم نہیں بلکہ وہ کالوں کی رقم ہے جو ورنہ ضائع ہو جاتیں۔
بس ایک بات سمجھیں: ایک AI ایجینٹ ایک بار غلطی کرے تو بھی بل جاری رہتا ہے۔ اگر وہ راستہ غلط لے لے، تین چکر بھٹک جائے، اور پھر واپس آ جائے، تو بھی ان ٹوکنز کا بل لگتا ہے۔
حقیقی ترقی میں، پیسہ اکثر اسی طرح چھوٹ جاتا ہے۔
اوپن اے آئی نے اپنے باضابطہ بلاگ میں بھی ایک ہی منطق کو نشان زد کیا ہے، جس کی کارکردگی تین سطحوں سے حاصل ہوتی ہے:
درخواست شروع کرنا، تنظیم کے سیاق و سباق کا ایجنٹ فریم ورک، اس کے بعد درخواستوں کو منظم کرنے والا سسٹم، اور آخر میں GPU پر چلنے والا ماڈل خود۔

اوپن اے آئی GPT-5.6 کی کارکردگی کے ذرائع کو سمجھتی ہے: درخواستیں智能体 فریم ورک سے شروع ہوتی ہیں، پھر اورکیشن سسٹم کے ذریعے منظم ہوتی ہیں، اور آخرکار GPU پر ماڈل چلایا جاتا ہے—ہر لیول پر بچت کی جاتی ہے۔
آپ مالیات بچا سکتے ہیں اور ماڈل کی تقسیم پر بھی بچا سکتے ہیں۔
اوپن اے آئی نے ایک استعمال کا بھی ذکر کیا: کوڈنگ ورک فلو میں پہلے Sol کا استعمال کرکے مسئلہ کو واضح کیا جا سکتا ہے اور منصوبہ بنایا جا سکتا ہے، پھر لونا کو تبدیلیوں کو لاگو کرنے، ٹیسٹ لکھنے اور جائزہ لینے کے لیے استعمال کیا جا سکتا ہے۔
ایک ہی لائن پر، مختلف مراحل کے لیے مختلف سطح کی ذکاوت مختص کی جاتی ہے۔
ماڈل صرف بل کا نصف ہے
فریم ورک بدلنا ہے تو قیمت بھی بدل جائے گی
ٹرمنل-بینچ 2.1 یہ سیٹ مدل کو الگ سے جواب دینے کے لیے نہیں ہے۔
یہ ماڈل کو ایک ٹرمینل ماحول میں ڈال دیتا ہے، ایک ادھورا مقصد دیتا ہے، اور اسے خود راستہ منصوبہ بند کرنے، ٹولز کا استعمال کرنے، اسکرپٹ لکھنے، خطاوں کا حل نکالنے اور دہرائی جانے والی ترقی کرنے کی اجازت دیتا ہے۔
تو نکلنے والی کارکردگی، "ایجنٹ + ماڈل" کے کمبینیشن کی کارکردگی ہے۔

ٹرمنل-بینچ 2.1 کا علیحدہ اعلان، درستگی کے دائیں طرف ایک نئی لاگت کا عنصر شامل ہے۔ (تصویر کا حوالہ: ٹرمنل-بینچ)
فہرست میں چار قطاروں کے اعداد و شمار سب سے زیادہ واضح طور پر بات کرتے ہیں:
کلوڈ کوڈ کے ساتھ فیبل 5، 83.8٪، 552.67 ڈالر؛
Codex کے ساتھ GPT-5.5، 83.1٪، 2059.19 ڈالر؛
Codex کے ساتھ GPT-5.6 Terra، 78.4٪، 421.15 ڈالر؛
کوڈیکس کے ساتھ GPT-5.6 لونا، 75.7٪، 241.45 ڈالر۔
پہلی دو لائنوں کے اسکور میں صرف 0.7 فیصد کا فرق ہے، لیکن بل تقریباً 4 گنا زیادہ ہے۔
ایک ہی ماڈل کو مختلف فریم ورکس میں ڈال کر، مختلف کنٹیکسٹ آرگنائزیشن اور ٹول اسٹریٹیجیز کے ساتھ استعمال کرنے پر، نتائج بالکل الگ ہوتے ہیں۔
کیرو کے افسران کے مطابق، ٹیرا کوڈنگ ایجینٹ انڈیکس پر 77.4 اسکور حاصل کرتی ہے، جو کلاؤڈ فیبل 5 کے 77.2 سے صرف تھوڑا سا زیادہ ہے۔
اس کی خصوصیت اس کے اسکور میں نہیں، بلکہ اس اسکور کے مطابق قیمت میں ہے۔
کیرو کا اس spec-driven ایپروچ کا مرکزی نقطہ بھی یہی ہے، اصل گیم کا ایک جملہ ہے: شروع میں کوڈ لکھنے کی اجازت نہیں۔
یہ پہلے صارف کے اس ادھورے مقصد کو ایک سنجیدہ ضرورت کے دستاویز، ٹیکنیکل ڈیزائن اور قابل انجام کاموں کی فہرست میں تقسیم کرتا ہے، اور پھر اسے ماڈل کو دیتا ہے۔
اس طرح، ماڈل کو ایک ادھوری بات نہیں، بلکہ ایک واضح کام ملتا ہے۔
ایجینٹ کو جاننے والے فوراً سمجھ جائیں گے کہ یہ مرحلہ سب سے مہنگا خرچہ بچا رہا ہے۔
مڈل کا غلط راستہ اپنانا، دوبارہ کام کرنا، اور پورا کام دوبارہ شروع کرنا، اکثر اصل کام سے زیادہ ٹوکنز کو ضائع کر دیتا ہے۔
کیرو نے پروسیس میں دو گیٹس چھوڑے ہیں: کوڈ میں حقیقی تبدیلی سے پہلے، ایک بار دوبارہ جانچنے کے لیے روک جائے؛ اور کام مکمل ہونے کے بعد، خودکار طور پر ٹیسٹ چلائے جائیں تاکہ یہ تصدیق کی جا سکے کہ کچھ غلط تو نہیں ہوا۔
ہر دو بار کی رکاوٹ سے بچنے سے اصل سونا اور چاندی بچت ہوتی ہے۔
کلود ایمیزون کے ٹیریٹری پر
GPT نے آدھا حصہ لے لیا
ایک سال پہلے، کیرو صرف ایک اسپیک-ڈرائیون IDE تھا، اور ماڈل سیلیکٹر اینتھروپک کا گھر تھا۔
ایک سال بعد، AWS نے اپنے خود کی گئی ایجینٹ پلیٹ فارم پر تین OpenAI ماڈلز فوری طور پر شامل کر دیے۔
سول، ٹیرا، لونا اور کلوڈ کو ایک ہی ڈراپ ڈاؤن مینو میں ایک ساتھ رکھنا، ایک سال پہلے تصور کرنا مشکل تھا۔
ہاں، GPT-5.6 اس بار "پورا خاندان آباد ہو گیا" ہے، لیکن "پوری طرح کھلا" نہیں ہے۔
تین ماڈلز تدریجی اور تجرباتی طور پر کھولے گئے ہیں، جو Pro، Pro+، Pro Max اور Power صارفین کے لیے ہیں، اور صرف دو علاقوں میں دستیاب ہیں: امریکہ کا شمالی ورجینیا اور یورپ کا فرانکفرٹ، جو کراس ریجنل انفرنس کو سپورٹ کرتے ہیں۔
ایک اور بات جس کے ساتھ بہت سے لوگ آشنا نہیں ہیں: یہ ماڈلز Kiro میں پوشیدہ سوچ کے سلسلے کے ذریعے کام کرتے ہیں، آپ ان کے استدلال کے مراحل نہیں دیکھ سکتے، صرف نتیجہ دیکھ سکتے ہیں۔
جو لوگ ایجنٹ کے ایک ایک قدم کو دیکھ کر استدلال کرنے کے عادی ہیں، وہ اسے ایک ادھورے ڈبے میں کام ڈال دینے جیسا محسوس کرتے ہیں۔
سرکاری طور پر کہا گیا ہے کہ یہ متوقع کارروائی ہے اور آؤٹ پٹ کی معیار پر اثر نہیں ڈالتی۔
کِرُو میں تین اسٹیج ماڈل کی قیمتیں واضح طور پر ظاہر کی گئی ہیں۔
14 جولائی کو جب یہ شروع ہوا، تو اسی کام کے لیے، Sol پر 2.4 گنا، Terra پر 1.2 گنا، اور Luna پر 0.6 گنا کٹوتی ہوئی۔
30 جولائی کو OpenAI کی اس کمی کا اثر ہوا، اگلے دن Kiro نے بھی اپنی پالیسی تبدیل کی: Luna کو 0.6 گنا سے گھٹا کر 0.1 گنا کر دیا گیا، Terra کو 1.2 گنا سے 1.0 گنا تک کم کر دیا گیا، جبکہ Sol پر کوئی تبدیلی نہیں ہوئی۔

AWS کا رویہ واضح ہو چکا ہے: ایک ڈیولپمنٹ پلیٹ فارم صرف ایک ماڈل سے منسلک نہیں ہونا چاہیے۔
ایک ہی سیلیکٹر میں، دو اگریاں ماڈلز ایک دوسرے کے قیمتیں کم کرنے لگے۔
معیارِ جائزہ بھی تبدیل ہو گیا: زیادہ اسکور ہونا ضروری نہیں کہ جیت جائے، کم خرچ کرنا بھی جیت سکتا ہے۔
ڈیولپرز کے لیے، پہلے وہ پوچھتے تھے کہ "یہ ماڈل ایک ملین ٹوکن کے لیے کتنے کا ہے"، اب وہ پوچھتے ہیں کہ "اسے اس کام کو مکمل کرنے کے لیے مجھے کتنی رقم خرچ کرنی پڑے گی؟"
حوالہ جات:
https://x.com/OpenAIDevs/status/2091966982015103068
https://openai.com/index/gpt-5-6-in-kiro/
یہ مضمون ویچن گروپ "نیوزی یوان" (ID: AI_era) سے ہے، مصنف: ASI احکام، ایڈیٹر: یوان یو
