GPT-5.6, AWS Kiro'da görev maliyetlerini %82 azaltıyor, fiyat düşüşüne rağmen %20

icon MarsBit
Paylaş
AI summary iconÖzet
GPT-5.6, 30 Temmuz'da %20'lik bir fiyat düşüşüne rağmen AWS Kiro'da Terra görev maliyetlerini %82 azalttı. Verimlilik artışı, daha az başarısız deneme ve daha düşük token kullanımı sayesinde sağlandı. GPT-5.6 modelleri—Sol, Terra ve Luna—Temmuz'da Kiro'da başlatıldı. AWS ve OpenAI ortaklaşa ortamı optimize etti. Kripto fiyatları dalgalı kalırken, korku ve açgözlülük endeksi karışık sinyaller veriyor.

Aynı modelde, resmi fiyat sadece %20 indirildi, ancak faturanız %80 azaldı.

Kiro

24 Ağustos'ta OpenAI, AWS ile birlikte gerçekleştirdiği bir test sonucunu duyurdu:

Terminal-Bench 2.1'de, GPT-5.6 Terra'nın Kiro'da bir başarı görevi tamamlama maliyeti yaklaşık %82 azaldı.

Kiro, IDE, CLI ve Web'i kapsayan bir AWS yazılım geliştirme ajanı platformudur.

GPT-5.6 ailesinin Sol, Terra ve Luna üçlüsü, bir aydan fazla süredir içinde koşuyor.

Bu %82, resmi bir fiyat düşüşü değildir.

Terra'nın son fiyat değişikliği 30 Temmuz'da %20 olarak yapıldı.

Kiro

30 Temmuz'da OpenAI fiyat değişikliği duyurusu, Terra %20 düşüş.

Birim fiyat sadece %20 düşüyor, ancak fatura %80 oranında azalıyor.

Gerçekten dikkat etmemiz gereken, ortadaki altmış yüzde noktanın nereden tasarruf edildiğidir.

GPT-5.6'nın KuCoin'e giriş işlemi bu yıl Temmuz'da gerçekleşti.

13'te AWS, GPT-5.6 Sol, Terra ve Luna'nın Amazon Bedrock'ta resmen kullanılabilir olduğunu duyurdu.

Bir sonraki gün, Kiro blog gönderisiyle üç modelin IDE, CLI ve Web'e entegre edildiğini duyurdu.

Kiro

Bu, OpenAI modelinin ilk kez Kiro'ya girişi ve tam olarak Kiro'nun kamuya açık önizlemesinin birinci yıldönümüne denk geliyor.

Modeli önce rafta serginleyin, sonra işe gönderin, bir aydan fazla sonra OpenAI ödevi teslim ediyor:

İki taraf, Kiro ortamını ve OpenAI modelini birlikte ayarladı ve Terra'nın bir başarı görevi gerçekleştirmek için maliyeti yaklaşık %82 düştü.

Tasarruf edilen

Yanlış yolda harcanan para

30 Temmuz'daki fiyat ajustmanında Terra %20 düştü, ancak Kiro'nun testinde tek görev maliyeti %82 düştü.

O zaman tasarruf edilen altıda bir, nereden geliyor?

Yönler sadece bunlar:

Model tarafından üretilen token sayısı azaldı, araçların tekrar çağrılma sayısı azaldı, başarısızlık sonrası yeniden deneme ve uzun yollar daha az oldu.

Bu büyük tasarruf, her çağrıda harcanan para değil, aksi halde boşa gidecek olan çağrıların parasıdır.

Basit bir mantık var: Bir AI ajanı bir görevi bir kez başarısız olursa, fatura aynı şekilde kesilir. Ara yolda yanlış bir yol seçer, üç tur sapar ve sonra geri dönerse, bu tokenler de aynı şekilde tahsil edilir.

Gerçek geliştirme sırasında, para genellikle böyle kaçar.

OpenAI, resmi blogunda aynı mantığı da vurguladı; verimlilik üç katmandan geliyor:

İstek başlatma, bağlamı düzenleme akıllı arayüz çerçevesi, ortada istekleri düzenleyen sistem, sonunda ise GPU'da çalışan model.

Kiro

OpenAI, GPT-5.6'nın verimlilik kaynağını şu şekilde analiz ediyor: İstek, akıllı sistem çerçevesinden başlayarak düzenleyici sistem tarafından yönlendirilir ve nihayetinde GPU'da model çalıştırılır; her katman tasarruf sağlar.

Tasarruf yapmak, model görev dağılımına kadar uzanıyor.

OpenAI, bir kodlama akışının önce Soru ile sorunu netleştirmeyi ve planı belirlemeyi, ardından Luna'ya tanımlanmış değişiklikleri uygulamak, test yazmak ve değerlendirme çalıştırmak için geçiş yapmasını örneklemiştir.

Aynı üretim hattı, farklı aşamalarda farklı seviyelerde akıllılık.

Model, faturanın yarısını oluşturuyor.

Çerçeveyi değiştirdiğinizde fiyat da değişir

Terminal-Bench 2.1 bu soru seti, modelin ayrı ayrı cevap vermesi için değildir.

Bir terminal ortamına modeli atar, belirsiz bir hedef verir ve modelin kendi kendine yol planlamasını, araçları çağırmasını, betik yazmasını, hataları çözmeyi ve tekrarlı olarak yinelemesini sağlar.

Bu nedenle elde edilen sonuç, "akıllı ajan + model" kombinasyonunun sonucudur.

Kiro

Terminal-Bench 2.1 açık listesi, doğruluk sağ tarafında maliyet adlı yeni bir madde eklenmiştir. (Görsel: Terminal-Bench)

Listedeki dört satır sayı en iyi şekilde açıklamaktadır:

Claude Code ile Fable 5, %83,8, 552,67 dolar;

Codex, GPT-5.5 ile %83,1, 2059,19 dolar;

Codex, GPT-5.6 Terra'ya %78,4, 421,15 dolar;

Codex, GPT-5.6 Luna, %75,7, 241,45 dolar.

İlk iki satır arasındaki puan farkı sadece %0,7 iken fatura neredeyse 4 kat fark ediyor.

Aynı model, farklı çerçevelere yerleştirilip farklı bağlam organizasyonları ve araç stratejileriyle birlikte kullanıldığında, sonuç tamamen farklı fiyatlar verir.

Kiro'nun resmi verilerine göre, Terra, Coding Agent Endeksi'nde 77,4 puan alırken, Claude Fable 5'in 77,2 puanından biraz daha yüksek.

Puanı değil, bu puana karşılık gelen fiyat avantajıdır.

Kiro'nun bu spec-tabanlı odak noktası da burada; temel oyun kuralları sadece bir cümle: Kod yazmaya başlamayın.

İlk olarak kullanıcıdan belirsiz hedeften, resmi bir gereksinim belgesi, teknik tasarım ve yürütülebilir görev listesi oluşturur, ardından modele iletir.

Bu şekilde, model elde etmediği belirsiz bir cümle,而是 bir düzenlenmiş iş.

Agent'i tanıyanlar, bu adımda en pahalı masrafın atlandığını hemen anlar.

Modelin sapması, yeniden çalıştırma, tamamen baştan yapma sürecinde harcanan tokenler, düzgün iş yapmaktan daha fazla olur.

Kiro, kod gerçekten değiştirilmeden önce birinin gözden geçirmesi için iki engel koydu; iş tamamlandıktan sonra otomatik olarak bir test çalıştırarak doğruluğunu kontrol etti.

Bu iki engelin her biri, gerçek para tasarrufu sağlar.

Claude, Amazon'ın topraklarında

GPT, yarısını aldı

Bir yıl önce, Kiro sadece bir spec-driven IDE idi ve model seçici Anthropic'in sahasındaydı.

Bir yıl sonra, AWS kendi geliştirici ajan platformunda üç OpenAI modelini aynı anda sundu.

Bir yıl önce Sol, Terra, Luna ve Claude'nin aynı bir açılır menüde yan yana gelmesini hayal etmek zor olurdu.

GPT-5.6 bu sefer 'tüm aile katıldı', ancak 'tamamen açık değil'.

Üç model, Pro, Pro+, Pro Max ve Power kullanıcıları için adım adım ve deneysel olarak açılmaktadır; bölgeler yalnızca ABD'nin Kuzey Virginia'sı ve Avrupa'nın Frankfurt'u olmak üzere iki tanedir ve çapraz bölge çıkarımı desteklenmektedir.

Karşılaşılan diğer bir nokta: Bu modeller, Kiro'da gizli bir düşünce zinciri kullanıyor; çıkarım adımlarını göremiyorsunuz, yalnızca sonucu görüyorsunuz.

Adımlar halinde akıl yürütme yapmasını alışkınlık kazanmış kişiler, bir şeyi saydam olmayan bir kutuya atıyormuş gibi hisseder.

Resmi açıklama, bunun beklenen bir davranış olduğunu ve çıktı kalitesini etkilemediğini belirtiyor.

Üç seviyeli model Kiro'da açıkça fiyatlandırılmıştır.

14 Temmuz'da yeni başlatıldığında, aynı görev için Sol %2,4, Terra %1,2, Luna %0,6 oranında düşürülüyor.

30 Temmuz'da OpenAI'nin bu indirimi uygulamasıyla, bir sonraki gün Kiro da takip etti: Luna, 0,6 katından 0,1 katına indirildi, Terra 1,2 katından 1,0 katına düşürüldü, ancak Sol değişmeden kaldı.

Kiro

AWS'nin tutumu açıkça ortada: Bir geliştirme platformu, yalnızca bir modelle bağlı kalamaz.

Aynı seçicide, iki öncü model birbirini fiyat olarak baskı altına alıyor.

Değerlendirme kriterleri de değişti: yüksek puan kazanmak artık mutlaka kazanmak anlamına gelmiyor, az para harcamak da kazanabilir.

Geliştiriciler için, önceki zamanlarda model seçerken “Bu model, milyon token başına ne kadar?” sorusunu soruyordu, şimdi ise “Bu işi yapması için ne kadar harcamam gerekiyor?” sorusunu soruyor.

Kaynaklar:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

Bu yazı, WeChat hesabından "Yeni Akıl" (ID: AI_era) tarafından paylaşılmıştır, yazar: ASI İlahiyatı, editör: Yuan Yu

Yasal Uyarı: Bu sayfadaki bilgiler üçüncü şahıslardan alınmış olabilir ve KuCoin'in görüşlerini veya fikirlerini yansıtmayabilir. Bu içerik, herhangi bir beyan veya garanti olmaksızın yalnızca genel bilgilendirme amacıyla sağlanmıştır ve finansal veya yatırım tavsiyesi olarak yorumlanamaz. KuCoin, herhangi bir hata veya eksiklikten veya bu bilgilerin kullanımından kaynaklanan sonuçtan sorumlu değildir. Dijital varlıklara yapılan yatırımlar riskli olabilir. Lütfen bir ürünün risklerini ve risk toleransınızı kendi finansal koşullarınıza göre dikkatlice değerlendirin. Daha fazla bilgi için lütfen Kullanım Koşullarımıza ve Risk Açıklamamıza bakınız.