
Базова версія Luna знижує ціни: ціна введення з 1 долара до 0,2 долара за мільйон токенів, ціна виведення з 6 доларів до 1,2 долара.
У перерахунку на китайські юані ціна введення знизилася з приблизно 6,8 юаня до 1,35 юаня, а ціна виведення — з приблизно 40,6 юаня до 8,1 юаня.
Також Terra, орієнтована на «щоденну основну роботу», знизилася на 20%, ціни введення та виведення знизилися до 2 та 12 доларів відповідно.
У перерахунку на китайські юані це приблизно 13,5 юаня та 81,2 юаня.
Лише флагманська модель Sol залишається за початковою ціною, але тепер доступний режим Fast mode зі швидкістю до 2,5 разів вищою, ніж у стандартному режимі — прискорення без додаткової вартості.

Після того як Codex жорстко скинув ліміти використання, зниження цін теж негайно було запроваджено, OpenAI, ти хочеш вигнати з ринку кого?…
Ціна на цьому ринку вже досягла піку.
OpenAI заявила, що зниження ціни відбулося тому, що GPT-5.6 Sol сам собі зекономив гроші.
GPT-5.6 Sol участь у вдосконаленні себе, ефективність стрімко зросла, тому ми вдячні новим та старим користувачам~
Цю схему, коли ліва нога ступає на праву і піднімається на місці, теж освоїв OpenAI

.
Дві знижки, одна прискорення
Зараз ціни на API трьох моделей GPT-5.6 такі:
GPT-5.6 Luna: 0,2 долара за вхідні мільйон токенів, 1,2 долара за вихідні;
GPT-5.6 Terra: 2 долари за вхід мільйона токенів, 12 доларів за вихід;
GPT-5.6 Sol: 5 доларів за вхідні мільйон токенів, 30 доларів за вихідні.

Після зниження ціни Luna зазнала різкого падіння.
Його ціна за вхід вже дорівнює ціні попереднього покоління GPT-5.4 nano, а ціна за вихід навіть на 0,05 долара нижча.
Але обидві моделі виконують не зовсім однакові завдання: GPT-5.4 nano переважно призначена для простих, частотних завдань, таких як класифікація, витяг інформації та ранжування.
GPT-5.6 Luna від OpenAI позиціонується як модель для вантажів, чутливих до витрат, яка може викликати інструменти, обробляти довгі контексти та виконувати багатокрокові робочі процеси.
Просто кажучи, OpenAI продає моделі, що підтримують роботу агентів, за цінами, які раніше були властиві простим малим моделям.
Terra відносно обережна, зниження на 20%.
Sol залишається за тією ж ціною, додано режим Fast, швидкість якого досягає до 2,5 разів швидше, ніж у стандартному режимі, а ціна становить удвічі більше, ніж у стандартному режимі; рівень інтелекту моделі залишається незмінним.
Він також замінить попередній Priority Processing. Запити API, які раніше використовували мітку priority, автоматично переключаться на режим Fast.
Офіційно повідомляється, що ця корекція також стосується Codex і ChatGPT Work.
Ціна підписки не зменшиться, загальний обсяг ліміту користувача також не збільшиться, але при виклику Terra та Luna споживання ліміту відповідно зменшиться.
Та сама сума підписки дозволяє моделі виконувати більше завдань.
OpenAI також замінила модель Auto-review у ChatGPT і Codex CLI з GPT-5.4 на GPT-5.6 Luna.
Auto-review відповідає за перевірку коду та результатів змін у тилі, що є типовим завданням з високою частотою виконання.
Поєднання оновлення моделі та зниження ціни на Luna дозволяє OpenAI очікувати зниження витрат приблизно до десятої частини від початкового рівня.
Дешеві моделі більше не обмежуються традиційними «побічними завданнями», такими як класифікація та витягування, а починають входити в такі етапи, як перевірка коду та моніторинг бекенду, які вимагають прийняття рішень та виклику інструментів.
Наразі позиціонування трьох моделей таке:
Завдання з високим обсягом викликів і чутливістю до бюджету передайте Luna;
Звичайні щоденні завдання передаються Terra;
Для складних завдань продовжуйте використовувати Sol;
Якщо навіть очікування здається занадто повільним, заплатіть у два рази більше, щоб прискорити швидкість.
GPT-5.6 почав участь у зменшенні витрат
Чому раптово знизилася ціна?
OpenAI зазначила, що причина полягає в тому, що GPT-5.6 Sol участвувала в оптимізації власної виробничої системи.
Ефективність, яку вона підвищила, перетворилася на знижки у цінових таблицях.
Зокрема, GPT-5.6 Sol переписав та оптимізував частину GPU-ядер виробничого середовища, спроектував та провів сотні експериментів з генерацією токенів, а також брав участь у моніторингу навчання та втручався при виникненні проблем.
Результати також виявилися відмінними: оптимізація GPU Kernel знизила витрати на енд-ту-енд сервіс GPT-5.6 на 20%; покращення спекулятивного декодування збільшило ефективність генерації токенів більше ніж на 15%.

GPU Kernel — це нижчорівнева програма, яка виконує конкретні обчислювальні завдання моделі на GPU.
Сама модель змінювати не потрібно — достатньо написати ці програми більш ефективно, щоб той самий GPU міг швидше виконувати обчислення, обробляти більше запитів і зменшити вартість одного виклику.
Передбачуване декодування полягає у тому, що під час генерації відповіді спочатку масово «відгадуються» наступні можливі токени, а потім вони перевіряються основною моделлю. Чим точніші передбачення, тим менше кроків потрібно генерувати та очікувати по черзі.
Обидві оптимізації не знижують здатність моделі, але дозволяють запускати ту саму модель швидше та дешевше.
Проте це ще не повна автономна оновлення GPT-5.6.
OpenAI спеціально підкреслила, що весь процес все ще перебуває під людським керівництвом.
Моделі можуть писати код, запускати експерименти та моніторити аномалії, але визначення цілей, придатність результатів та чи буде код впроваджено в виробничому середовищі — все це все ще вимагає «Human in the Loop».
OMT
Нарешті, ще одна нова зміна.
Це зниження цін має дуже конкретну точку застосування: робочі процеси Agent.
Найбільш знижена Luna — це не просто традиційні малі моделі для класифікації та витягування.
Згідно з позиціонуванням OpenAI, він може викликати інструменти та виконувати багатокрокові завдання, основна увага якого зосереджена на високочастотних, чутливих до витрат навантаженнях.
Тому зниження Luna на 80% також знижує бар’єри для довгострокової роботи агента.
Дозвольте раніше через високу вартість неможливим завданням з перевірки, верифікації та моніторингу стати регулярними етапами робочого процесу.
Разом із участю GPT-5.6 у оптимізації власної виробничої системи з’явилася нова циклічна структура:
Участь моделей підвищує ефективність роботи та знижує витрати; після зниження цін моделі входять у більше частотних робочих процесів; збільшення масштабу викликів сприяє наступній хвилі оптимізації ефективності.
Цей цикл зниження цін від OpenAI вже почав формуватися.
Після всіх цих дій тиск тепер повністю на компанії A:
Твоя черга.

Посилання для довідки: [1] https://x.com/OpenAI/status/2082878156483219672 [2] https://x.com/sama/status/2082880720989532597
Цей матеріал зі сторінки WeChat «Quantum Bit», автор: слідкуйте за передовими технологіями
