
Luna entry-level langsung diskon besar, harga input per juta token turun dari $1 menjadi $0,2, harga output turun dari $6 menjadi $1,2.
Dikonversi ke yuan Tiongkok, harga input turun dari sekitar 6,8 yuan menjadi 1,35 yuan, sedangkan harga output turun dari sekitar 40,6 yuan menjadi 8,1 yuan.
Terra yang menjadi andalan sehari-hari juga turun 20%, harga masuk dan keluar masing-masing turun menjadi $2 dan $12.
Dikonversi ke yuan Tiongkok, masing-masing sekitar 13,5 yuan dan 81,2 yuan.
Hanya model unggulan Sol yang tetap pada harga aslinya, tetapi diluncurkan mode Fast dengan kecepatan hingga 2,5 kali lebih cepat daripada mode standar, tanpa tambahan biaya.

Setelah Codex melakukan reset penggunaan secara besar-besaran, penurunan harga langsung diumumkan, OpenAI, kamu mau bersaing sampai mati siapa...
Perang harga ini langsung memanas.
OpenAI menyatakan bahwa penurunan harga disebabkan karena GPT-5.6 Sol membantu dirinya sendiri menghemat uang.
GPT-5.6 Sol berpartisipasi dalam penyempurnaan dirinya sendiri, efisiensinya meningkat pesat, sehingga kami memberikan penghargaan kepada pengguna baru dan lama~
OpenAI, kamu juga mainin trik naik dengan menginjak kaki kanan pakai kaki kiri ini ya

.
Dua produk diskon, satu dipercepat
Sekarang, harga API untuk tiga model GPT-5.6 adalah:
GPT-5.6 Luna: Input $0,2 per juta token, output $1,2;
GPT-5.6 Terra: Input $2 per million tokens, output $12;
GPT-5.6 Sol: $5 per million tokens input, $30 per million tokens output.

Setelah penurunan harga, Luna mengalami jatuh bebas.
Harga inputnya sudah sebanding dengan generasi sebelumnya GPT-5.4 nano, sementara harga output bahkan lebih murah 0,05 dolar.
Namun, kedua model tersebut tidak melakukan pekerjaan yang sama persis; GPT-5.4 nano terutama dirancang untuk tugas-tugas sederhana dan frekuensi tinggi seperti klasifikasi, ekstraksi informasi, dan perankingan.
GPT-5.6 Luna diposisikan oleh OpenAI sebagai model yang ditujukan untuk beban kerja yang sensitif terhadap biaya, yang dapat memanggil alat, menangani konteks panjang, dan menjalankan alur kerja multi-langkah.
Secara sederhana, OpenAI sedang menjual model yang mendukung Agent dengan harga yang dulu hanya berlaku untuk model kecil sederhana.
Terra relatif terkendali, turun 20%.
Sol tetap pada harga aslinya, menambahkan mode Fast, kecepatan hingga 2,5 kali lebih cepat daripada mode standar, dengan harga dua kali lipat mode standar, sementara tingkat kecerdasan model tetap sama.
Ini juga akan menggantikan Priority Processing sebelumnya. Permintaan API yang sebelumnya menggunakan tag priority akan secara otomatis beralih ke mode Fast.
Pihak resmi menyatakan bahwa penyesuaian ini juga akan masuk ke Codex dan ChatGPT Work.
Harga langganan tidak akan diturunkan, total kuota pengguna juga tidak akan bertambah, tetapi saat memanggil Terra dan Luna, kuota yang digunakan akan berkurang secara sesuai.
Dengan biaya langganan yang sama, model dapat melakukan lebih banyak tugas.
OpenAI juga secara tidak sengaja mengganti model auto-review di ChatGPT dan Codex CLI dari GPT-5.4 menjadi GPT-5.6 Luna.
Auto-review bertanggung jawab untuk memeriksa kode dan hasil modifikasi di latar belakang, merupakan tugas Agent frekuensi tinggi yang khas.
Dengan menggabungkan peningkatan model dan penurunan harga Luna, OpenAI memperkirakan biayanya akan turun menjadi sekitar sepertiga dari semula.
Model murah tidak lagi hanya bertanggung jawab atas tugas-tugas tradisional seperti klasifikasi dan ekstraksi, tetapi mulai memasuki tahap-tahap yang memerlukan penilaian dan pemanggilan alat, seperti tinjauan kode dan pemantauan backend.
Saat ini, posisi ketiga model tersebut adalah:
Tugaskan tugas yang sensitif terhadap anggaran dan memerlukan volume pemanggilan tinggi ke Luna;
Tugas sehari-hari biasa diserahkan ke Terra;
Tugas sulit tetap menggunakan Sol;
Jika menunggu saja terasa terlalu lambat, bayar dua kali lipat untuk mempercepatnya.
GPT-5.6 mulai berpartisipasi dalam mengurangi biaya sendiri
Mengapa harga turun mendadak?
OpenAI menyatakan bahwa alasannya adalah GPT-5.6 Sol berpartisipasi dalam optimasi sistem produksi mereka sendiri.
Efisiensi yang ditingkatkan berubah menjadi angka diskon di daftar harga.
Secara khusus, GPT-5.6 Sol menulis ulang dan mengoptimalkan sebagian GPU Kernel lingkungan produksi, merancang serta menjalankan ratusan eksperimen generasi Token, serta berpartisipasi dalam pemantauan pelatihan dan ikut campur saat terjadi masalah.
Hasil akhir juga sangat menonjol: mengoptimalkan GPU Kernel, mengurangi biaya layanan end-to-end GPT-5.6 sebesar 20%; meningkatkan speculative decoding, meningkatkan efisiensi generasi Token lebih dari 15%.

GPU Kernel dapat dipahami sebagai program dasar yang menjalankan tugas komputasi spesifik model di GPU.
Model itu sendiri tidak perlu diubah, selama program-program ini ditulis lebih efisien, GPU yang sama akan dapat menyelesaikan perhitungan lebih cepat, menangani lebih banyak permintaan, dan biaya per panggilan juga akan turun.
Penerkaan dekripsi adalah proses di mana, saat menghasilkan jawaban, sejumlah token berikutnya yang mungkin muncul ditebak secara massal, lalu diverifikasi oleh model utama. Semakin akurat tebakan tersebut, semakin sedikit langkah yang perlu dijalankan secara berurutan dan ditunggu.
Kedua optimasi tersebut tidak mengurangi kemampuan model, tetapi membuat model yang sama berjalan lebih cepat dan lebih murah.
Namun, ini belum merupakan peningkatan mandiri penuh oleh GPT-5.6.
OpenAI secara khusus menekankan bahwa seluruh proses tetap dipimpin oleh manusia.
Model dapat menulis kode, menjalankan eksperimen, dan memantau anomali, tetapi penetapan tujuan, kelayakan hasil, serta apakah kode masuk ke lingkungan produksi tetap memerlukan 'Human in the Loop'.
OMT
Terakhir, ada perubahan baru.
Penurunan harga ini memiliki titik fokus yang spesifik: alur kerja Agent.
Luna yang diskonnya paling besar bukan hanya model kecil tradisional yang digunakan untuk klasifikasi dan ekstraksi.
Menurut posisi OpenAI, ia dapat memanggil alat dan menjalankan tugas multi-langkah, terutama ditujukan untuk beban kerja frekuensi tinggi dan sensitif terhadap biaya.
Oleh karena itu, penurunan Luna sebesar 80% juga menurunkan ambang batas untuk operasi jangka panjang Agent.
Membuat tugas-tugas tinjauan, verifikasi, dan pemantauan yang sebelumnya terlalu mahal untuk dilakukan secara rutin, menjadi langkah biasa dalam alur kerja.
Ditambah lagi dengan partisipasi GPT-5.6 dalam mengoptimalkan sistem produksinya sendiri, sebuah siklus baru muncul:
Partisipasi model meningkatkan efisiensi operasional, menurunkan biaya; setelah harga turun, model masuk ke lebih banyak alur kerja frekuensi tinggi; skala pemanggilan membesar, mendorong optimasi efisiensi berikutnya.
Roda diskon OpenAI ini telah menunjukkan bentuk awalnya.
Setelah serangkaian tindakan ini, tekanan sekarang langsung berada di pihak A:
Giliranmu.

Tautan referensi: [1] https://x.com/OpenAI/status/2082878156483219672 [2] https://x.com/sama/status/2082880720989532597
Artikel ini berasal dari akun WeChat "Quantum Bit", penulis: Peduli teknologi mutakhir
