Model yang sama, harga rasmi hanya turun 20%, tetapi bil anda berkurang 80%.

Pada 24 Ogos, OpenAI mengumumkan keputusan ujian bersama AWS:
Di Terminal-Bench 2.1, kos untuk menyelesaikan tugas berjaya GPT-5.6 Terra di Kiro telah berkurang sebanyak kira-kira 82%.
Kiro adalah platform agen pembangunan perisian AWS yang mencakup IDE, CLI, dan Web.
Tiga bersaudara Sol, Terra, dan Luna dari keluarga GPT-5.6 telah berjalan selama lebih dari sebulan.
82% ini bukan penurunan harga rasmi.
Penyesuaian harga terakhir Terra adalah pada 30 Julai, dengan kadar 20%.

Pengumuman penyesuaian harga OpenAI pada 30 Julai, Terra turun 20%.
Harga unit hanya turun 20%, tetapi bil boleh dipotong sehingga 80%.
Enam puluh peratus yang hilang di tengah-tengah itu berasal dari mana, itulah yang benar-benar patut kita perhatikan.
GPT-5.6 melanggan Kiro pada bulan Julai tahun ini.
Pada 13, AWS mengumumkan bahawa GPT-5.6 Sol, Terra, dan Luna kini tersedia di Amazon Bedrock.
Pada hari berikutnya, Kiro memuat blog untuk mengumumkan pelancaran tiga model di IDE, CLI, dan Web.

Ini adalah pertama kalinya model OpenAI masuk ke Kiro, tepat pada perayaan satu tahun pra-pelancaran terbuka Kiro.
Letakkan model ke rak terlebih dahulu, kemudian tarik pergi untuk bekerja, sebulan lebih kemudian, OpenAI kembali untuk menyerahkan tugasan:
Dua pihak bekerjasama untuk menyesuaikan persekitaran Kiro dan model OpenAI, mengurangkan kos untuk menyelesaikan satu tugas berjaya oleh Terra sebanyak kira-kira 82%.
Yang disimpan
Uang yang terbuang sia-sia
Pada penyesuaian harga pada 30 Julai, Terra turun 20%, tetapi dalam ujian Kiro, kos tugas tunggal turun 82%.
Enam puluh peratus yang disimpan itu datang dari mana?
Arahnya hanya beberapa ini:
Model mengeluarkan lebih sedikit token, jumlah panggilan ulang alat berkurang, dan percubaan semula serta laluan yang lebih panjang selepas kegagalan juga berkurang.
Jadi, bahagian yang dijimatkan bukanlah wang setiap panggilan, tetapi wang yang sebelumnya akan terbuang sia-sia.
Alasannya sangat mudah: sekali saja agen AI gagal menyelesaikan tugas, bilangan tetap dicatat. Ia memilih jalan yang salah di tengah jalan, menyimpang selama tiga putaran sebelum kembali, token-token ini tetap dikenakan.
Dalam pembangunan sebenar, wang sering kali bocor dengan cara ini.
OpenAI juga menyebut logik yang sama di blog rasmi mereka, kecekapan datang daripada tiga lapisan:
Rangkaian agen yang menginisiasi permintaan dan mengatur konteks, sistem pengaturan yang mengkoordinasikan permintaan di tengah, dan akhirnya model itu sendiri yang berjalan di GPU.

OpenAI menganalisis sumber kecekapan GPT-5.6: Permintaan bermula daripada kerangka agen, diatur oleh sistem pengurusan, dan akhirnya dijalankan di GPU—setiap peringkat berusaha mengurangkan penggunaan.
Hemat duit, bahkan boleh hemat pada pembahagian tugas model.
OpenAI juga pernah menyebutkan penggunaan lain: alur kerja pengkodean boleh bermula dengan Sol untuk memahami masalah dan menentukan perancangan, kemudian beralih ke Luna untuk melaksanakan perubahan yang telah ditakrifkan, menulis ujian, dan menjalankan penilaian.
Garis pengeluaran yang sama, dengan peringkat kecerdasan berbeza pada setiap peringkat.
Model hanya menempati separuh bil
Ganti kerangka, ganti harga
Set soalan Terminal-Bench 2.1 ini bukan untuk model menjawab secara berasingan.
Ia memasukkan model ke dalam persekitaran terminal, memberikan sasaran yang kabur, dan membiarkannya merancang jalan sendiri, memanggil alat, menulis skrip, mengendalikan ralat, dan mengulangi proses berulang kali.
Jadi, hasil yang diperoleh adalah hasil daripada gabungan "agen + model".

Papan pemimpin Terminal-Bench 2.1 menambahkan kos di sebelah kanan ketepatan. (Sumber gambar: Terminal-Bench)
Empat baris nombor dalam senarai paling menerangkan masalahnya:
Claude Code dengan Fable 5, 83.8%, $552.67;
Codex dengan GPT-5.5, 83.1%, USD 2059.19;
Codex bersama GPT-5.6 Terra, 78.4%, 421.15 dolar;
Codex bersama GPT-5.6 Luna, 75.7%, USD 241.45.
Skor dua baris pertama hanya berbeza 0.7 peratus, tetapi bilnya berbeza hampir empat kali ganda.
Model yang sama, dimasukkan ke dalam kerangka yang berbeza, dengan organisasi konteks dan strategi alat yang berbeza, akan menghasilkan harga yang sama sekali berbeza.
Menurut data rasmi Kiro, Terra mendapat 77.4 poin dalam Indeks Agen Pengekodan, hanya sedikit lebih tinggi daripada Claude Fable 5 yang mendapat 77.2.
Kelebihannya bukan pada skor, tetapi pada harga yang sepadan dengan skor tersebut.
Titik kekuatan Kiro yang berfokus pada spesifikasi juga berada di sini, inti permainannya hanya satu kalimat: Jangan langsung menulis kod.
Ia terlebih dahulu memecahkan sasaran kabur pengguna menjadi dokumen keperluan rasmi, reka bentuk teknikal, dan senarai tugas yang boleh dilaksanakan, kemudian menyerahkannya kepada model.
Dengan cara ini, model tidak lagi menerima satu pernyataan yang kabur, tetapi satu tugas yang telah dirapikan.
Orang yang mengenal Agent akan segera sedar bahawa langkah ini mengelakkan perbelanjaan paling mahal.
Model tersasar, perlu dikerjakan semula, dibuang dan dimulai dari awal, token yang terbuang seringkali lebih banyak daripada yang digunakan untuk kerja sebenar.
Kiro masih meninggalkan dua pintu pengawasan dalam prosesnya: berhenti sebentar untuk meminta seseorang memeriksa sebelum kod benar-benar diubah; selepas tugas selesai, ujian automatik akan dijalankan semula untuk mengesahkan kebetulan.
Setiap kali kerja semula yang dihentikan oleh dua pintu ini, dapat menghemat wang sungguhan.
Claude di wilayah Amazon
GPT mengambil separuh
Satu tahun lalu, Kiro masih merupakan IDE yang ditentukan oleh spesifikasi, dengan pemilih model menjadi wilayah Anthropic.
Satu tahun kemudian, AWS memperkenalkan tiga model OpenAI secara serentak di platform agen buatan miliknya sendiri.
Sol, Terra, Luna, dan Claude disenaraikan bersama dalam menu tarik-turun yang sama, gambaran yang sukar dibayangkan setahun yang lalu.
Walaupun GPT-5.6 kali ini adalah "seluruh keluarga berpindah", ia tidak "dibuka sepenuhnya".
Tiga model ini dibuka secara bertahap dan eksperimen untuk pengguna Pro, Pro+, Pro Max, dan Power, dengan hanya dua wilayah: Northern Virginia, Amerika Syarikat dan Frankfurt, Eropah, menyokong inferens lintas wilayah.
Satu lagi yang banyak orang tidak terbiasa: model-model ini menggunakan rantai pemikiran tersembunyi di Kiro, anda tidak dapat melihat langkah-langkah penalarannya, hanya hasil akhirnya.
Orang yang terbiasa memantau agen membuat penalaran langkah demi langkah akan merasa seperti melempar tugas ke dalam kotak yang tidak telus.
Menurut pihak rasmi, ini adalah tingkah laku yang dijangka dan tidak mempengaruhi kualiti output.
Tiga model harga ditetapkan secara jelas di Kiro.
Pada 14 Julai, semasa pelancaran, tugas yang sama, Sol dikurangkan 2.4 kali, Terra dikurangkan 1.2 kali, Luna dikurangkan 0.6 kali.
Pada 30 Julai, penurunan harga oleh OpenAI berlaku, dan pada hari berikutnya, Kiro mengikuti: Luna diturunkan dari 0.6 kali menjadi 0.1 kali, Terra diturunkan dari 1.2 kali menjadi 1.0 kali, manakala Sol tidak berubah.

Sikap AWS telah dinyatakan dengan jelas: satu platform pembangunan tidak boleh hanya terikat pada satu model.
Dalam pilihan yang sama, dua model terkini bermula saling menurunkan harga.
Kriteria penilaian model juga berubah: skor tinggi tidak lagi secara automatik menjamin kemenangan, dan menghabiskan lebih sedikit wang juga boleh menang.
Bagi pembangun, dahulu soalan yang diajukan tentang pemilihan model ialah “Berapa harga model ini per sejuta token?”, sekarang perlu bertanya, “Berapa banyak yang perlu saya bayar untuk memastikan ia menyelesaikan perkara ini?”
Rujukan:
https://x.com/OpenAIDevs/status/2091966982015103068
https://openai.com/indeks/gpt-5-6-in-kiro/
Artikel ini berasal daripada akaun微信公众号 "Sinzhiyuan" (ID: AI_era), penulis: ASI Revelation, penyunting: Yuan Yu
