GPT-5.6 Memotong Biaya Tugas Sebesar 82% di AWS Kiro Meskipun Harga Turun 20%

icon MarsBit
Bagikan
AI summary iconRingkasan
GPT-5.6 mengurangi biaya tugas Terra sebesar 82% di AWS Kiro, meskipun terjadi penurunan harga 20% pada 30 Juli. Peningkatan efisiensi berasal dari lebih sedikit upaya yang gagal dan penggunaan token yang lebih rendah. Model GPT-5.6—Sol, Terra, dan Luna—diluncurkan di Kiro pada Juli. AWS dan OpenAI mengoptimalkan lingkungan bersama-sama. Sementara harga kripto tetap volatil, indeks fear and greed menunjukkan sinyal campuran.

Model yang sama, harga resmi hanya turun 20%, tetapi tagihan Anda berkurang delapan puluh persen.

Kiro

Pada 24 Agustus, OpenAI mengumumkan hasil pengujian bersama AWS:

Di Terminal-Bench 2.1, biaya untuk menyelesaikan tugas berhasil oleh GPT-5.6 Terra di Kiro berkurang sekitar 82%.

Kiro adalah platform agen pengembangan perangkat lunak AWS yang mencakup IDE, CLI, dan Web.

Tiga bersaudara Sol, Terra, dan Luna dari keluarga GPT-5.6 telah berjalan di dalamnya selama lebih dari sebulan.

82% ini bukan penurunan harga resmi.

Terra terakhir kali disesuaikan pada 30 Juli, dengan perubahan 20%.

Kiro

Pengumuman penyesuaian harga OpenAI pada 30 Juli, Terra turun 20%.

Harga per unit hanya turun 20%, tetapi tagihan bisa dipotong hingga delapan puluh persen.

Enam puluh persen yang hilang di tengah itu berasal dari mana, itulah yang benar-benar patut kita perhatikan.

GPT-5.6 meluncur di Kiro pada Juli tahun ini.

Pada tanggal 13, AWS mengumumkan bahwa GPT-5.6 Sol, Terra, dan Luna kini tersedia di Amazon Bedrock.

Hari berikutnya, Kiro memposting blog yang mengumumkan peluncuran tiga model di IDE, CLI, dan Web.

Kiro

Ini adalah pertama kalinya model OpenAI masuk ke Kiro, tepat saat merayakan satu tahun pra-peluncuran publik Kiro.

Taruh model di rak terlebih dahulu, lalu kirim untuk bekerja, lebih dari sebulan kemudian, OpenAI kembali menyerahkan tugasnya:

Dua pihak bekerja sama untuk menyesuaikan lingkungan Kiro dan model OpenAI, sehingga biaya menyelesaikan satu tugas sukses oleh Terra turun sekitar 82%.

Yang dihemat

Uang yang terbuang sia-sia

Pada penyesuaian harga tanggal 30 Juli, Terra turun 20%, tetapi dalam pengujian Kiro, biaya tugas tunggal turun 82%.

Enam puluh persen yang dihemat itu berasal dari mana?

Arahnya hanya beberapa ini:

Model menghasilkan lebih sedikit token, lebih sedikit panggilan ulang alat, dan lebih sedikit percobaan ulang serta rute memutar setelah kegagalan.

Jadi, bagian besar yang dihemat bukanlah biaya setiap panggilan, melainkan biaya panggilan yang sebelumnya akan terbuang sia-sia.

Alasannya sederhana: seorang agen AI gagal menyelesaikan tugas sekali, tagihan tetap dicatat. Bahkan jika ia memilih jalur yang salah di tengah jalan, menyimpang selama tiga putaran, lalu kembali, token-token tersebut tetap dibayar.

Dalam pengembangan nyata, uang sering kali hilang seperti ini.

OpenAI juga menyebut logika yang sama di blog resmi mereka, efisiensi berasal dari tiga lapisan:

Framework agen yang menginisiasi permintaan dan mengatur konteks, sistem orkestrasi yang mengoordinasikan permintaan di tengah, baru kemudian model itu sendiri yang berjalan di GPU.

Kiro

OpenAI mengurai sumber efisiensi GPT-5.6: permintaan dimulai dari kerangka agen, diatur oleh sistem orkestrasi, lalu dijalankan di GPU, di setiap lapisan dilakukan penghematan.

Hemat uang bahkan hingga ke pembagian tugas model.

OpenAI juga pernah memberikan contoh penggunaan: alur kerja pemrograman dapat mulai dengan Sol untuk memahami masalah dan menetapkan rencana, lalu beralih ke Luna untuk menerapkan perubahan yang telah didefinisikan, menulis pengujian, dan menjalankan evaluasi.

Garis produksi yang sama, dengan tingkat kecerdasan berbeda di setiap tahap.

Model hanya menempati setengah tagihan

Ganti kerangka, ganti harga

Soal Terminal-Bench 2.1 ini bukan untuk model menjawab secara terpisah.

Ia memasukkan model ke dalam lingkungan terminal, memberikan tujuan yang kabur, dan membiarkannya merencanakan jalur sendiri, memanggil alat, menulis skrip, menangani kesalahan, serta berulang kali mengiterasi.

Jadi, hasil yang diperoleh adalah hasil dari kombinasi "agen + model".

Kiro

Daftar publik Terminal-Bench 2.1, di sebelah kanan akurasi ditambahkan biaya. (Sumber gambar: Terminal-Bench)

Empat baris angka di peringkat paling mewakili masalah ini:

Claude Code dengan Fable 5, 83,8%, $552,67;

Codex dengan GPT-5.5, 83,1%, $2059,19;

Codex dengan GPT-5.6 Terra, 78,4%, 421,15 dolar;

Codex dengan GPT-5.6 Luna, 75,7%, 241,45 dolar.

Skor dua baris pertama hanya berbeda 0,7 persen, tetapi tagihannya berbeda hampir empat kali lipat.

Model yang sama, dimasukkan ke dalam kerangka yang berbeda, dengan organisasi konteks dan strategi alat yang berbeda, hasilnya sama sekali tidak sama.

Menurut data resmi dari Kiro, Terra mendapatkan skor 77,4 di Coding Agent Index, hanya sedikit lebih tinggi dari Claude Fable 5 yang mendapat 77,2.

Keunggulannya bukan pada skornya, tetapi pada harga yang sesuai dengan skor tersebut.

Titik fokus Kiro yang berbasis spesifikasi juga ada di sini, inti permainannya hanya satu kalimat: Jangan langsung menulis kode saat mulai.

Ia terlebih dahulu memecah tujuan kabur pengguna menjadi dokumen kebutuhan resmi, desain teknis, dan daftar tugas yang dapat dieksekusi, lalu menyerahkannya ke model.

Dengan cara ini, model tidak lagi menerima kalimat yang kabur, melainkan tugas yang jelas dan terstruktur.

Orang yang familiar dengan Agent akan langsung menyadari bahwa langkah ini menghilangkan biaya paling mahal.

Model melenceng, dikerjakan ulang, dibongkar dan dimulai dari awal, token yang terbuang seringkali lebih banyak daripada yang digunakan untuk bekerja secara normal.

Kiro masih meninggalkan dua titik pemeriksaan dalam prosesnya: berhenti sejenak untuk meminta orang lain meninjau sebelum kode benar-benar diubah; setelah pekerjaan selesai, secara otomatis menjalankan serangkaian pengujian untuk memverifikasi kebenarannya.

Setiap pembatalan yang dihentikan oleh dua gerbang ini dapat menghemat uang sungguhan.

Claude di wilayah Amazon

GPT mengambil setengahnya

Satu tahun lalu, Kiro masih hanya sebuah IDE yang didorong oleh spesifikasi, dengan pemilih model menjadi wilayah kekuasaan Anthropic.

Satu tahun kemudian, AWS sekaligus menambahkan tiga model OpenAI ke platform agen pengembangan sendiri.

Sol, Terra, Luna, dan Claude berjejer dalam menu dropdown yang sama, pemandangan yang sulit dibayangkan satu tahun lalu.

Meskipun GPT-5.6 kali ini adalah "seluruh keluarga bergabung", namun belum "dibuka secara menyeluruh".

Tiga model dirilis secara bertahap dan eksperimental untuk pengguna Pro, Pro+, Pro Max, dan Power, dengan hanya dua wilayah: Northern Virginia, Amerika Serikat, dan Frankfurt, Eropa, yang mendukung inferensi lintas wilayah.

Masih ada satu hal yang banyak orang tidak terbiasa: model-model ini menggunakan hidden chain of thought di Kiro, Anda tidak dapat melihat langkah-langkah penalarannya, hanya hasil akhirnya.

Orang yang terbiasa melihat Agent bernalar langkah demi langkah akan merasa seperti melemparkan tugas ke dalam kotak yang tidak transparan.

Menurut pihak resmi, ini adalah perilaku yang diharapkan dan tidak memengaruhi kualitas output.

Tiga model harga ditampilkan secara jelas di Kiro.

Pada saat peluncuran pada 14 Juli, tugas yang sama, Sol dikurangi 2,4 kali, Terra dikurangi 1,2 kali, Luna dikurangi 0,6 kali.

Pada 30 Juli, penurunan harga dari OpenAI terwujud, dan hari berikutnya Kiro mengikuti: Luna turun dari 0,6 kali menjadi 0,1 kali, Terra turun dari 1,2 kali menjadi 1,0 kali, sementara Sol tetap tidak berubah.

Kiro

Sikap AWS sudah jelas: sebuah platform pengembangan tidak bisa hanya mengikat satu model.

Dalam selector yang sama, dua model terdepan mulai saling menurunkan harga.

Kriteria evaluasi model juga berubah: skor tinggi tidak lagi secara otomatis berarti menang, dan menghabiskan lebih sedikit uang juga bisa menang.

Bagi pengembang, dulu yang ditanyakan adalah "Berapa biaya model ini per juta token?", sekarang harus bertanya, "Berapa biaya yang harus saya keluarkan untuk membuatnya menyelesaikan hal ini?"

Referensi:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

Artikel ini berasal dari akun WeChat "Sinzhiyuan" (ID: AI_era), penulis: ASI Revelation, editor: Yuanyu

Penafian: Informasi pada halaman ini mungkin telah diperoleh dari pihak ketiga dan tidak mencerminkan pandangan atau opini KuCoin. Konten ini disediakan hanya untuk tujuan informasi umum, tanpa representasi atau jaminan apa pun, dan tidak dapat ditafsirkan sebagai saran keuangan atau investasi. KuCoin tidak bertanggung jawab terhadap segala kesalahan atau kelalaian, atau hasil apa pun yang keluar dari penggunaan informasi ini. Berinvestasi di aset digital dapat berisiko. Harap mengevaluasi risiko produk dan toleransi risiko Anda secara cermat berdasarkan situasi keuangan Anda sendiri. Untuk informasi lebih lanjut, silakan lihat Ketentuan Penggunaan dan Pengungkapan Risiko.