Aynı modelde, resmi fiyat sadece %20 indirildi, ancak faturanız %80 azaldı.

24 Ağustos'ta OpenAI, AWS ile birlikte gerçekleştirdiği bir test sonucunu duyurdu:
Terminal-Bench 2.1'de, GPT-5.6 Terra'nın Kiro'da bir başarı görevi tamamlama maliyeti yaklaşık %82 azaldı.
Kiro, IDE, CLI ve Web'i kapsayan bir AWS yazılım geliştirme ajanı platformudur.
GPT-5.6 ailesinin Sol, Terra ve Luna üçlüsü, bir aydan fazla süredir içinde koşuyor.
Bu %82, resmi bir fiyat düşüşü değildir.
Terra'nın son fiyat değişikliği 30 Temmuz'da %20 olarak yapıldı.

30 Temmuz'da OpenAI fiyat değişikliği duyurusu, Terra %20 düşüş.
Birim fiyat sadece %20 düşüyor, ancak fatura %80 oranında azalıyor.
Gerçekten dikkat etmemiz gereken, ortadaki altmış yüzde noktanın nereden tasarruf edildiğidir.
GPT-5.6'nın KuCoin'e giriş işlemi bu yıl Temmuz'da gerçekleşti.
13'te AWS, GPT-5.6 Sol, Terra ve Luna'nın Amazon Bedrock'ta resmen kullanılabilir olduğunu duyurdu.
Bir sonraki gün, Kiro blog gönderisiyle üç modelin IDE, CLI ve Web'e entegre edildiğini duyurdu.

Bu, OpenAI modelinin ilk kez Kiro'ya girişi ve tam olarak Kiro'nun kamuya açık önizlemesinin birinci yıldönümüne denk geliyor.
Modeli önce rafta serginleyin, sonra işe gönderin, bir aydan fazla sonra OpenAI ödevi teslim ediyor:
İki taraf, Kiro ortamını ve OpenAI modelini birlikte ayarladı ve Terra'nın bir başarı görevi gerçekleştirmek için maliyeti yaklaşık %82 düştü.
Tasarruf edilen
Yanlış yolda harcanan para
30 Temmuz'daki fiyat ajustmanında Terra %20 düştü, ancak Kiro'nun testinde tek görev maliyeti %82 düştü.
O zaman tasarruf edilen altıda bir, nereden geliyor?
Yönler sadece bunlar:
Model tarafından üretilen token sayısı azaldı, araçların tekrar çağrılma sayısı azaldı, başarısızlık sonrası yeniden deneme ve uzun yollar daha az oldu.
Bu büyük tasarruf, her çağrıda harcanan para değil, aksi halde boşa gidecek olan çağrıların parasıdır.
Basit bir mantık var: Bir AI ajanı bir görevi bir kez başarısız olursa, fatura aynı şekilde kesilir. Ara yolda yanlış bir yol seçer, üç tur sapar ve sonra geri dönerse, bu tokenler de aynı şekilde tahsil edilir.
Gerçek geliştirme sırasında, para genellikle böyle kaçar.
OpenAI, resmi blogunda aynı mantığı da vurguladı; verimlilik üç katmandan geliyor:
İstek başlatma, bağlamı düzenleme akıllı arayüz çerçevesi, ortada istekleri düzenleyen sistem, sonunda ise GPU'da çalışan model.

OpenAI, GPT-5.6'nın verimlilik kaynağını şu şekilde analiz ediyor: İstek, akıllı sistem çerçevesinden başlayarak düzenleyici sistem tarafından yönlendirilir ve nihayetinde GPU'da model çalıştırılır; her katman tasarruf sağlar.
Tasarruf yapmak, model görev dağılımına kadar uzanıyor.
OpenAI, bir kodlama akışının önce Soru ile sorunu netleştirmeyi ve planı belirlemeyi, ardından Luna'ya tanımlanmış değişiklikleri uygulamak, test yazmak ve değerlendirme çalıştırmak için geçiş yapmasını örneklemiştir.
Aynı üretim hattı, farklı aşamalarda farklı seviyelerde akıllılık.
Model, faturanın yarısını oluşturuyor.
Çerçeveyi değiştirdiğinizde fiyat da değişir
Terminal-Bench 2.1 bu soru seti, modelin ayrı ayrı cevap vermesi için değildir.
Bir terminal ortamına modeli atar, belirsiz bir hedef verir ve modelin kendi kendine yol planlamasını, araçları çağırmasını, betik yazmasını, hataları çözmeyi ve tekrarlı olarak yinelemesini sağlar.
Bu nedenle elde edilen sonuç, "akıllı ajan + model" kombinasyonunun sonucudur.

Terminal-Bench 2.1 açık listesi, doğruluk sağ tarafında maliyet adlı yeni bir madde eklenmiştir. (Görsel: Terminal-Bench)
Listedeki dört satır sayı en iyi şekilde açıklamaktadır:
Claude Code ile Fable 5, %83,8, 552,67 dolar;
Codex, GPT-5.5 ile %83,1, 2059,19 dolar;
Codex, GPT-5.6 Terra'ya %78,4, 421,15 dolar;
Codex, GPT-5.6 Luna, %75,7, 241,45 dolar.
İlk iki satır arasındaki puan farkı sadece %0,7 iken fatura neredeyse 4 kat fark ediyor.
Aynı model, farklı çerçevelere yerleştirilip farklı bağlam organizasyonları ve araç stratejileriyle birlikte kullanıldığında, sonuç tamamen farklı fiyatlar verir.
Kiro'nun resmi verilerine göre, Terra, Coding Agent Endeksi'nde 77,4 puan alırken, Claude Fable 5'in 77,2 puanından biraz daha yüksek.
Puanı değil, bu puana karşılık gelen fiyat avantajıdır.
Kiro'nun bu spec-tabanlı odak noktası da burada; temel oyun kuralları sadece bir cümle: Kod yazmaya başlamayın.
İlk olarak kullanıcıdan belirsiz hedeften, resmi bir gereksinim belgesi, teknik tasarım ve yürütülebilir görev listesi oluşturur, ardından modele iletir.
Bu şekilde, model elde etmediği belirsiz bir cümle,而是 bir düzenlenmiş iş.
Agent'i tanıyanlar, bu adımda en pahalı masrafın atlandığını hemen anlar.
Modelin sapması, yeniden çalıştırma, tamamen baştan yapma sürecinde harcanan tokenler, düzgün iş yapmaktan daha fazla olur.
Kiro, kod gerçekten değiştirilmeden önce birinin gözden geçirmesi için iki engel koydu; iş tamamlandıktan sonra otomatik olarak bir test çalıştırarak doğruluğunu kontrol etti.
Bu iki engelin her biri, gerçek para tasarrufu sağlar.
Claude, Amazon'ın topraklarında
GPT, yarısını aldı
Bir yıl önce, Kiro sadece bir spec-driven IDE idi ve model seçici Anthropic'in sahasındaydı.
Bir yıl sonra, AWS kendi geliştirici ajan platformunda üç OpenAI modelini aynı anda sundu.
Bir yıl önce Sol, Terra, Luna ve Claude'nin aynı bir açılır menüde yan yana gelmesini hayal etmek zor olurdu.
GPT-5.6 bu sefer 'tüm aile katıldı', ancak 'tamamen açık değil'.
Üç model, Pro, Pro+, Pro Max ve Power kullanıcıları için adım adım ve deneysel olarak açılmaktadır; bölgeler yalnızca ABD'nin Kuzey Virginia'sı ve Avrupa'nın Frankfurt'u olmak üzere iki tanedir ve çapraz bölge çıkarımı desteklenmektedir.
Karşılaşılan diğer bir nokta: Bu modeller, Kiro'da gizli bir düşünce zinciri kullanıyor; çıkarım adımlarını göremiyorsunuz, yalnızca sonucu görüyorsunuz.
Adımlar halinde akıl yürütme yapmasını alışkınlık kazanmış kişiler, bir şeyi saydam olmayan bir kutuya atıyormuş gibi hisseder.
Resmi açıklama, bunun beklenen bir davranış olduğunu ve çıktı kalitesini etkilemediğini belirtiyor.
Üç seviyeli model Kiro'da açıkça fiyatlandırılmıştır.
14 Temmuz'da yeni başlatıldığında, aynı görev için Sol %2,4, Terra %1,2, Luna %0,6 oranında düşürülüyor.
30 Temmuz'da OpenAI'nin bu indirimi uygulamasıyla, bir sonraki gün Kiro da takip etti: Luna, 0,6 katından 0,1 katına indirildi, Terra 1,2 katından 1,0 katına düşürüldü, ancak Sol değişmeden kaldı.

AWS'nin tutumu açıkça ortada: Bir geliştirme platformu, yalnızca bir modelle bağlı kalamaz.
Aynı seçicide, iki öncü model birbirini fiyat olarak baskı altına alıyor.
Değerlendirme kriterleri de değişti: yüksek puan kazanmak artık mutlaka kazanmak anlamına gelmiyor, az para harcamak da kazanabilir.
Geliştiriciler için, önceki zamanlarda model seçerken “Bu model, milyon token başına ne kadar?” sorusunu soruyordu, şimdi ise “Bu işi yapması için ne kadar harcamam gerekiyor?” sorusunu soruyor.
Kaynaklar:
https://x.com/OpenAIDevs/status/2091966982015103068
https://openai.com/index/gpt-5-6-in-kiro/
Bu yazı, WeChat hesabından "Yeni Akıl" (ID: AI_era) tarafından paylaşılmıştır, yazar: ASI İlahiyatı, editör: Yuan Yu
