
Базовая версия Luna теперь по скидке: цена ввода снизилась с 1 доллара до 0,2 доллара за миллион токенов, цена вывода — с 6 долларов до 1,2 доллара.
В пересчете на китайские юани цена ввода снизилась с примерно 6,8 юаня до 1,35 юаня, цена вывода снизилась с примерно 40,6 юаня до 8,1 юаня.
Также снизилась цена на Terra, предназначенную для «ежедневной основной работы», на 20% — входная и выходная цены снизились до 2 и 12 долларов соответственно.
В пересчете на китайские юани это примерно 13,5 и 81,2 юаня.
Только флагманская модель Sol сохраняет свою первоначальную цену, но теперь доступен режим Fast, скорость которого достигает 2,5 раза выше, чем у стандартного режима, без дополнительной платы.

После того как Codex жестко сбросил лимиты использования, снижение цен тоже сразу последовало — OpenAI, ты хочешь выжать кого-то из рынка…
Эта ценовая война сразу накалилась.
OpenAI заявила, что снижение цены произошло потому, что GPT-5.6 Sol сам себе сэкономил деньги.
GPT-5.6 Sol участвует в собственном улучшении, эффективность значительно возросла, поэтому мы благодарим новых и существующих пользователей~
Ты тоже начал играть в эту штуку — левая нога на правой, взлет на месте

.
Две снижены в цене, одна ускорена
Сейчас цены API для трех моделей GPT-5.6 составляют:
GPT-5.6 Luna: 0,2 доллара за миллион токенов ввода, 1,2 доллара за вывод;
GPT-5.6 Terra: 2 доллара за миллион токенов на входе, 12 долларов за миллион токенов на выходе;
GPT-5.6 Sol: 5 долларов за миллион токенов входа, 30 долларов за миллион токенов выхода.

После снижения цены Luna стала крупным обвалом.
Его цена ввода уже достигла уровня предыдущего поколения GPT-5.4 nano, а цена вывода даже дешевле на 0,05 доллара.
Однако модели выполняют не совсем одинаковые задачи: GPT-5.4 nano в основном ориентирован на простые, часто повторяющиеся задачи, такие как классификация, извлечение информации и ранжирование.
GPT-5.6 Luna позиционируется OpenAI как модель, ориентированная на задачи с высокой чувствительностью к стоимости, способную вызывать инструменты, обрабатывать длинные контексты и выполнять многошаговые рабочие процессы.
Проще говоря, OpenAI продает модели, поддерживающие работу агентов, по ценам, которые раньше были у простых небольших моделей.
Terra сдержанна, снижение на 20%.
Sol сохраняет свою первоначальную цену, добавлен режим Fast, скорость которого достигает до 2,5 раз выше, чем у стандартного режима, при этом цена составляет двойную от стандартного режима, а уровень интеллекта модели остается неизменным.
Он также заменит ранее использовавшийся Priority Processing. API-запросы, ранее использующие метку priority, автоматически переключатся на режим Fast.
Официально заявлено, что эта корректировка также затронет Codex и ChatGPT Work.
Цена подписки не будет снижена, общий объем квот пользователей также не увеличится, но при вызове Terra и Luna потребление квот будет соответствующим образом уменьшено.
Та же самая плата за подписку позволяет модели выполнять задачи больше раз.
OpenAI также заменила модель автоматического обзора в ChatGPT и Codex CLI с GPT-5.4 на GPT-5.6 Luna.
Auto-review отвечает за проверку кода и результатов изменений на фоне, что является типичной задачей с высокой частотой выполнения.
С учетом обновления модели и снижения цены на Luna, OpenAI ожидает, что ее расходы снизятся примерно в десять раз.
Дешевые модели больше не ограничиваются традиционными «рутинными задачами», такими как классификация и извлечение, а начинают включаться в такие этапы, как проверка кода и мониторинг серверов, требующие принятия решений и вызова инструментов.
В настоящее время позиционирование трех моделей следующее:
Задачи с чувствительным бюджетом и высоким объемом запросов поручайте Luna;
Обычные ежедневные задачи поручены Terra;
Для сложных задач продолжайте использовать Sol;
Если даже ожидание кажется слишком медленным, потратьте вдвое больше денег, чтобы ускорить процесс.
GPT-5.6 начинает участвовать в снижении собственных затрат
Почему резкое снижение цены?
OpenAI заявила, что причиной стало участие GPT-5.6 Sol в оптимизации собственной производственной системы.
Повышенная эффективность превратилась в скидки, отраженные в ценовой таблице.
В частности, GPT-5.6 Sol переписал и оптимизировал часть GPU-ядер в производственной среде, спроектировал и провел сотни экспериментов по генерации токенов, а также участвовал в мониторинге обучения и вмешивался при возникновении проблем.
Результаты также впечатляют: оптимизация GPU Kernel снизила стоимость端到端-сервиса GPT-5.6 на 20%; улучшение предсказательного декодирования повысило эффективность генерации токенов более чем на 15%.

GPU Kernel можно понимать как низкоуровневую программу, выполняющую конкретные вычислительные задачи модели на GPU.
Сама модель меняться не должна; достаточно сделать эти программы более эффективными — тогда на том же GPU вычисления будут выполняться быстрее, обрабатываться больше запросов, и стоимость одного вызова также снизится.
Предсказательное декодирование заключается в том, что при генерации ответа сначала пакетно «угадываются» следующие возможные токены, а затем они проверяются основной моделью. Чем точнее угадывание, тем меньше шагов необходимо выполнять по одному и ждать.
Оба улучшения не снижают способности модели, но позволяют запускать одну и ту же модель быстрее и дешевле.
Однако это еще не полная автономная модернизация GPT-5.6.
OpenAI специально подчеркивает, что весь процесс по-прежнему находится под человеческим контролем.
Модели могут писать код, запускать эксперименты и мониторить аномалии, но определение целей, оценка применимости результатов и решение о внедрении кода в производственную среду всё ещё требуют участия человека.
OMT
Наконец, еще одно новое изменение.
Это снижение цены имеет конкретную цель: рабочие процессы Agent.
Самый сильно скидочный Luna — это не просто традиционная малая модель для классификации и извлечения.
Согласно позиционированию OpenAI, он может вызывать инструменты и выполнять многошаговые задачи, в основном ориентируясь на высокочастотные, чувствительные к затратам рабочие нагрузки.
Таким образом, снижение цены Luna на 80% также снижает барьеры для долгосрочной работы агента.
Сделать проверки, верификации и мониторинг, которые ранее из-за высокой стоимости не могли выполняться часто, регулярными этапами рабочего процесса.
В сочетании с участием GPT-5.6 в оптимизации собственной производственной системы появилась новая циклическая система:
Участие моделей повышает эффективность работы и снижает стоимость; после снижения цен модели внедряются в большее количество высокочастотных рабочих процессов; увеличение масштаба вызовов стимулирует следующий цикл оптимизации эффективности.
Этот цикл снижения цен от OpenAI уже начал формироваться.
После всех этих действий давление теперь полностью на компании A:
Теперь твоя очередь.

Ссылки для справки: [1] https://x.com/OpenAI/status/2082878156483219672 [2] https://x.com/sama/status/2082880720989532597
Эта статья взята из официального аккаунта WeChat «Quantum Bit», автор:關注前沿科技
