GPT-5.6 снижает стоимость задач на 82% в AWS Kiro, несмотря на снижение цены на 20%

icon MarsBit
Поделиться
AI summary iconСводка
GPT-5.6 сократил затраты на задачи Terra на 82% на AWS Kiro, несмотря на снижение цен на 20% 30 июля. Повышение эффективности было достигнуто за счет меньшего количества неудачных попыток и снижения использования токенов. Модели GPT-5.6 — Sol, Terra и Luna — были запущены на Kiro в июле. AWS и OpenAI совместно оптимизировали среду. Поскольку цена криптовалют остается волатильной, индекс страха и жадности показывает смешанные сигналы.

Та же модель, официальная цена снизилась всего на 20%, а ваш счет уменьшился на восемьдесят процентов.

Киро

24 августа OpenAI опубликовала результаты теста, проведенного вместе с AWS:

На Terminal-Bench 2.1 стоимость выполнения успешной задачи GPT-5.6 Terra в Kiro снизилась примерно на 82%.

Kiro — это платформа программного обеспечения для разработки с использованием ИИ от AWS, охватывающая IDE, CLI и веб.

Три брата Sol, Terra, Luna из семьи GPT-5.6 уже бегают внутри более месяца.

Эти 82% — не официальное снижение цены.

Последняя корректировка Terra произошла 30 июля и составила 20%.

Киро

30 июля公告:OpenAI пересмотрел цены, Terra снижена на 20%.

Цена снижается всего на 20%, а счет можно сократить на восемьдесят процентов.

Те шестьдесят процентов, которые отсутствуют посередине, — именно оттуда стоит искать экономию, и это действительно заслуживает нашего внимания.

GPT-5.6 launched on Kiro in July this year.

Сначала 13-го числа AWS объявила, что GPT-5.6 Sol, Terra и Luna теперь доступны в Amazon Bedrock.

На следующий день Kiro опубликовал блог-пост о запуске трех моделей в IDE, CLI и веб-версии.

Киро

Это первый раз, когда модель OpenAI попадает в Kiro, как раз в годовщину открытого предварительного просмотра Kiro.

Сначала разместите модель на полке, затем отправьте её работать, через месяц OpenAI возвращается с выполненным заданием:

Две компании совместно настроили среду Kiro и модель OpenAI, снизив стоимость выполнения успешной задачи Terra примерно на 82%.

Сэкономлено

Деньги, потраченные впустую

При корректировке 30 июля Terra снизилась на 20%, однако в тестах Kiro стоимость одиночной задачи снизилась на 82%.

А откуда взялись эти сэкономленные шестьдесят процентов?

Направлений всего несколько:

Модель генерирует меньше токенов, реже вызывает инструменты повторно и реже выполняет повторные попытки или обходные пути после неудачи.

Таким образом, экономия этой значительной суммы — это не деньги за каждый вызов, а те деньги, которые изначально были бы потрачены впустую.

Все просто: если ИИ-агент один раз провалил задачу, счет все равно выставляется. Даже если он на полпути выбрал неверный путь и три раза сбился с курса, прежде чем вернуться, все эти токены все равно списываются.

В реальной разработке деньги часто именно так и утекают.

OpenAI также указала на ту же логику в официальном блоге: эффективность происходит из трех уровней:

Фреймворк агентов, инициирующих запросы и организующих контекст, система оркестровки, координирующая запросы посередине, и наконец сама модель, запущенная на GPU.

Киро

OpenAI анализирует источники эффективности GPT-5.6: запросы начинаются с агентной архитектуры, затем передаются через систему оркестрации и в конечном итоге выполняются на GPU — каждый уровень оптимизирован для экономии.

Вы можете сэкономить даже на распределении обязанностей между моделями.

OpenAI также приводил пример использования: сначала можно использовать Sol, чтобы четко понять проблему и определить план, а затем переключиться на Luna для реализации уже четко определенных изменений, написания тестов и запуска оценок.

Одна и та же производственная линия, на разных этапах используются разные уровни интеллекта.

Модель занимает только половину счета

Смена рамки — смена цены

Этот набор вопросов Terminal-Bench 2.1 не предназначен для того, чтобы модель отвечала отдельно.

Он помещает модель в терминальную среду, ставит перед ней расплывчатую цель и заставляет её самостоятельно планировать путь, вызывать инструменты, писать скрипты, обрабатывать ошибки и многократно итерировать.

Таким образом, достигнутые результаты — это результат комбинации «агент + модель».

Киро

Открытый рейтинг Terminal-Bench 2.1: справа от точности добавлена статья затрат. (Источник изображения: Terminal-Bench)

Четыре строки цифр в рейтинге лучше всего это демонстрируют:

Claude Code с Fable 5, 83,8%, 552,67 доллара;

Codex с GPT-5.5, 83,1%, 2059,19 доллара;

Codex с GPT-5.6 Terra, 78,4%, 421,15 доллара;

Codex в паре с GPT-5.6 Luna, 75,7%, 241,45 доллара.

Разница в баллах между первыми двумя строками составила всего 0,7 процентных пункта, но счет отличался почти в четыре раза.

Одна и та же модель, встроенная в разные фреймворки с различными стратегиями организации контекста и инструментов, дает совершенно разные результаты.

Согласно данным, предоставленным Kiro, Terra набрала 77,4 балла по индексу Coding Agent, что лишь немного выше, чем 77,2 у Claude Fable 5.

Его преимущества заключаются не в баллах, а в цене, соответствующей этим баллам.

Точка приложения усилий Киро здесь также — суть геймплея проста: нельзя сразу писать код.

Он сначала разбивает расплывчатую цель пользователя на официальный документ требований, технический дизайн и список выполнимых задач, а затем передает это модели.

Таким образом, модель получает не расплывчатое высказывание, а четко структурированную задачу.

Знакомые с Agent люди сразу поймут, что этот шаг исключает самые дорогие расходы.

Модель сбивается с пути, требует переделки, полного сноса и перезапуска — сожженные токены часто превышают те, что были потрачены на настоящую работу.

Кирилл оставил два контрольных пункта в процессе: перед фактическим изменением кода — остановиться и дать кому-нибудь его проверить; после завершения работы — автоматически запустить тесты для проверки корректности.

Каждая повторная обработка, остановленная этими двумя воротами, позволяет сэкономить реальные деньги.

Клауд на территории Amazon

GPT забрал половину

Год назад Kiro был всего лишь IDE, ориентированным на спецификации, а выбор модели был прерогативой Anthropic.

Через год AWS разместил на своей собственной платформе агентов сразу три модели OpenAI.

Sol, Terra, Luna и Claude расположены в одном выпадающем меню — год назад это было трудно представить.

Хотя GPT-5.6 на этот раз «все члены семьи прибыли», он еще не «полностью открыт».

Три модели выпускаются постепенно и экспериментально для пользователей Pro, Pro+, Pro Max и Power; регионы — только северная Вирджиния в США и Франкфурт в Европе, поддерживается межрегиональное вычисление.

Еще один момент, который многим непривычен: эти модели в Kiro используют скрытую цепочку рассуждений — вы не видите их шагов рассуждения, только конечный результат.

Те, кто привык следить за тем, как агент пошагово рассуждает, чувствуют, будто бросают задачу в непрозрачную коробку.

Официально заявлено, что это ожидаемое поведение, не влияющее на качество вывода.

Трехуровневая модель явно указана в Kiro.

В тот день, 14 июля, при выходе того же задания Sol вычитался в 2,4 раза, Terra — в 1,2 раза, Luna — в 0,6 раза.

30 июля, после снижения ставок OpenAI, на следующий день Kiro последовал примеру: Luna была снижена с 0,6 до 0,1, Terra — с 1,2 до 1,0, а Sol осталась без изменений.

Киро

Позиция AWS очевидна: платформа для разработки не может быть привязана только к одной модели.

В одном и том же селекторе две передовые модели начинают конкурировать по ценам.

Критерии оценки модели также изменились: высокий балл больше не означает автоматическую победу, победить можно и с минимальными затратами.

Для разработчиков раньше спрашивали: «Сколько стоит этот модель за миллион токенов?», а теперь нужно спрашивать: «Сколько мне будет стоить заставить её выполнить эту задачу?»

Справочные материалы:

https://x.com/OpenAIDevs/status/2091966982015103068

https://openai.com/index/gpt-5-6-in-kiro/

Эта статья взята из официального аккаунта WeChat «Синьчжиюань» (ID: AI_era), автор: АСИ, редактор: Юаньюй

Отказ от ответственности: Информация на этой странице может быть получена от третьих лиц и не обязательно отражает взгляды или мнения KuCoin. Данный контент предоставляется исключительно в общих информационных целях, без каких-либо заверений или гарантий, а также не может быть истолкован как финансовый или инвестиционный совет. KuCoin не несет ответственности за ошибки или упущения, а также за любые результаты, полученные в результате использования этой информации. Инвестиции в цифровые активы могут быть рискованными. Пожалуйста, тщательно оценивайте риски, связанные с продуктом, и свою устойчивость к риску, исходя из собственных финансовых обстоятельств. Для получения более подробной информации, пожалуйста, ознакомьтесь с нашими Условиями использования и Уведомлением о риске.