Та сама модель, офіційна ціна знизилася лише на 20%, а ваш рахунок зменшився на вісімдесят відсотків.

24 серпня OpenAI опублікувала результати тесту, проведеного разом із AWS:
На Terminal-Bench 2.1 вартість виконання успішного завдання GPT-5.6 Terra у Kiro знизилася приблизно на 82%.
Kiro — це платформа програмного розробницького агента AWS, яка охоплює IDE, CLI та веб.
Три брати Sol, Terra, Luna з родини GPT-5.6 вже бігають всередині більше місяця.
Ці 82% — не офіційне зниження ціни.
Остання корекція Terra відбулася 30 липня, на 20%.

30 липня оголошення про зміну цін від OpenAI, Terra знижена на 20%.
Ціна знижується лише на 20%, а рахунок можна зменшити на вісімдесят відсотків.
Ті шістдесят відсотків, які відсутні посередині, — саме звідси варто шукати економію, і саме це варто нашої уваги.
GPT-5.6登陆Kiro是今年7月的事儿。
Спочатку 13-го AWS оголосила, що GPT-5.6 Sol, Terra, Luna тепер доступні в Amazon Bedrock.
На наступний день Kiro опублікував блог, оголосивши про запуск трьох моделей у IDE, CLI та веб-інтерфейсі.

Це перший раз, коли модель OpenAI потрапила до Kiro, і це збіглося з річницею відкритого попереднього огляду Kiro.
Спочатку виведіть модель на поличку, а потім відправте працювати; через місяць з половиною OpenAI повертається з домашнім завданням:
Дві компанії разом налаштували середовище Kiro та модель OpenAI, в результаті чого вартість виконання успішної задачі Terra знизилася приблизно на 82%.
Зекономлено
Гроші, витрачені неправильною дорогою
Під час корекції 30 липня Terra знизилася на 20%, але в тестах Kiro вартість однієї задачі знизилася на 82%.
А звідки взялися ті шістдесят відсотків, що було зекономлено?
Напрямків всього кілька:
Модель генерує менше токенів, зменшується кількість повторних викликів інструментів, а також зменшується кількість спроб повтору та обходів після невдач.
Отже, ця значна економія — це не гроші, що зберігаються при кожному виклику, а гроші, які раніше витрачалися даремно на виклики.
Просто: якщо AI-агент один раз не впорався із завданням, рахунок все одно зараховується. Він вибрав неправильний шлях, тричі збився з курсу, а потім повернувся — ці токени все одно беруться до оплати.
У реальному розробці гроші часто саме так і витікають.
OpenAI також згадувала ту саму логіку у своєму офіційному блозі: ефективність походить з трьох рівнів:
Фреймворк агентів, що ініціюють запити та організовують контекст, система оркестрування, що координує запити посередині, і нарешті сама модель, що виконується на GPU.

OpenAI розбирає джерела ефективності GPT-5.6: запити починаються з інтелектуальної архітектури, проходять через систему оркестрування, а потім виконуються на GPU — кожен рівень оптимізує витрати.
Зекономте гроші навіть на розподілі обов’язків серед моделей.
OpenAI також наводила такий приклад використання: робочий процес кодування спочатку може використовувати Sol, щоб чітко зрозуміти проблему та визначити план, а потім переключитися на Luna для реалізації вже чітко визначених змін, написання тестів та запуску оцінок.
Одна й та ж лінія виробництва, різні етапи мають різні рівні інтелекту.
Модель займає лише половину рахунку
Зміна рамок — зміна ціни
Цей набір завдань Terminal-Bench 2.1 не призначений для того, щоб модель відповідала окремо.
Він запускає модель у термінальному середовищі, встановлює нечітку мету і дозволяє їй самостійно планувати шлях, використовувати інструменти, писати сценарії, вирішувати помилки та повторно ітерувати.
Отже, отриманий результат — це результат комбінації «агент + модель».

Відкритий рейтинг Terminal-Bench 2.1, праворуч від точності з’явилася нова категорія — витрати. (Джерело: Terminal-Bench)
Чотири рядки цифр у рейтингу найкраще все пояснюють:
Claude Code з Fable 5, 83,8%, 552,67 долара;
Codex з GPT-5.5, 83,1%, 2059,19 долара;
Codex у поєднанні з GPT-5.6 Terra, 78,4%, 421,15 долара;
Codex у поєднанні з GPT-5.6 Luna, 75,7%, 241,45 долара.
Різниця в балах у перших двох рядках становила лише 0,7 відсоткового пункту, але рахунок відрізнявся майже в чотири рази.
Та сама модель, встановлена в різні фреймворки, з різними стратегіями організації контексту та інструментів, дає зовсім різні результати.
За даними Kiro, Terra отримала 77,4 бала на індексі Coding Agent, що трохи вище, ніж у Claude Fable 5 — 77,2.
Його перевага полягає не в балах, а в ціні, яка відповідає цим балам.
Також саме тут Кіро зосереджується на spec-driven підході: суть гри в одному реченні — не дозволяється одразу писати код.
Спочатку він розбиває нечітку мету користувача на чіткий документ вимог, технічний дизайн та список виконуваних завдань, а потім передає це моделі.
Таким чином, модель отримує не невизначене речення, а чітко сформульоване завдання.
Ті, хто знайомий з Agent, миттєво зрозуміють, що цей крок виключає найбільш витратну частину витрат.
Модель відхиляється, потрібно переробляти, викидати все й починати знову — спалені токени часто перевищують ті, що використовуються для справжньої роботи.
Кіро залишив у процесі дві контрольні точки: зупинитися, щоб хтось перевірив код перед його реальним зміненням; після завершення роботи автоматично запустити тестування, щоб перевірити правильність.
Кожна виправлена помилка, зупинена цими двома бар’єрами, дозволяє зекономити реальні гроші.
Клауд на території Amazon
GPT забрав половину
Рік тому Kiro був лише IDE, спрямованим на специфікації, а вибір моделі був доменом Anthropic.
Через рік AWS одночасно додала три моделі OpenAI на власній платформі агентів.
Sol, Terra, Luna та Claude розташовані в одному випадаючому меню — цю картину важко було уявити рік тому.
Хоча GPT-5.6 цього разу «всі сім’єю переїхали», він не «повністю відкритий».
Три моделі відкриваються поступово та експериментально для користувачів Pro, Pro+, Pro Max і Power; регіони — лише два: північна Вірджинія, США, та Франкфурт, Європа, з підтримкою міжрегіонального висновку.
Ще одна річ, з якою багато хто не звик: ці моделі в Kiro працюють з прихованою ланцюжковою міркуванням — ви не бачите їхніх кроків міркування, а лише кінцевий результат.
Ті, хто звик дивитися, як агент крок за кроком міркує, відчувають це як кинуття завдання в непрозору коробку.
Офіційно заявлено, що це очікувана поведінка, яка не впливає на якість виводу.
Три рівні моделей чітко вказані в Kiro.
На момент запуску 14 липня та саме завдання мали такі відсотки зняття: Sol — 2,4 рази, Terra — 1,2 рази, Luna — 0,6 рази.
30 липня, після зниження цін в OpenAI, наступного дня Kiro відповів: Luna була зменшена з 0,6 до 0,1, Terra — з 1,2 до 1,0, а Sol залишилася без змін.

Позиція AWS очевидна: платформа для розробки не може бути прив’язана лише до однієї моделі.
У тому ж селекторі дві передові моделі почали конкурувати цінами.
Критерії оцінки моделей також змінилися: високий бал більше не означає автоматичну перемогу, перемогти можна й з малими витратами.
Для розробників раніше запитували: «Скільки коштує ця модель за мільйон токенів?», а зараз треба запитувати: «Скільки мені буде коштувати, щоб вона виконала цю справу?»
Джерела:
https://x.com/OpenAIDevs/status/2091966982015103068
https://openai.com/index/gpt-5-6-in-kiro/
Цей матеріал зі сторінки WeChat «Новий розум» (ID: AI_era), автор: АСІ Апокаліпсис, редактор: Юаньюй
