Почему стоимость токенов ИИ падает: ценовая война LLM, ИИ-агенты и будущее инференса

Почему стоимость токенов ИИ падает: ценовая война LLM, ИИ-агенты и будущее инференса

Пользовательское изображение
Стоимость генерации и обработки токенов больших языковых моделей снизилась с темпами, которых едва ли смогла повторить какая-либо другая отрасль. К началу сентября 2026 года Индекс расходов на токены LLM от Silicon Data, являющийся взвешенным по использованию эталоном эффективных рыночных цен, достиг рекордно низкого уровня в 97 центов за миллион токенов — более чем вдвое ниже летнего пика и лишь малая часть уровней, наблюдавшихся всего несколько лет назад. Это снижение свидетельствует об интенсивной конкуренции между передовыми лабораториями, быстром росте мощных моделей с открытыми весами от китайских разработчиков, улучшении эффективности программного и аппаратного обеспечения и изменении паттернов спроса, обусловленных ИИ-агентами.
 
Результатом становится рынок, на котором инференс с высоким объемом стал значительно более доступным, даже несмотря на то, что сложные многоэтапные рабочие процессы агентов потребляют гораздо больше токенов, чем простые чат-взаимодействия. Падение цен на токены обусловлено в первую очередь конкуренцией и технической эффективностью, а не чистым уничтожением спроса, что позволяет расширять применение агентных решений, одновременно создавая давление на маржу для провайдеров моделей и заставляя предприятия тщательно оптимизировать маршрутизацию и выбор моделей.

Рекордно низкие цены на токены сигнализируют об усилении конкуренции на рынке

Индекс расходов на токены LLM Silicon Data, публикуемый под тикером Bloomberg SDLLMTK, упал до 0,97 доллара за миллион токенов 1 сентября 2026 года, согласно данным компании и соответствующим отчетам. Это стал самый низкий показатель с момента запуска индекса и означал снижение более чем на 50 процентов по сравнению с пиками в начале лета. Более широкий анализ показал, что средние затраты на вывод снизились с примерно 2,04 доллара в конце мая 2026 года до диапазона 1,16–1,18 доллара в начале августа, после чего продолжили падать. Эти цифры отражают взвешенные по использованию эффективные цены на смеси передовых и открытых моделей, наблюдаемые через платформы многопровайдерской маршрутизации, обеспечивая более четкое представление о том, что реально платит рынок, по сравнению с публичными ценами.
 
Долгосрочный контекст подчеркивает масштаб сдвига: производительность класса GPT-3.5, которая стоила около 20 долларов за миллион токенов в конце 2022 года, к октябрю 2024 года уже снизилась до примерно 0,07 доллара по данным отслеживания Stanford HAI, с дальнейшим сжатием с тех пор. Скорректированные по возможностям затраты снизились еще быстрее во многих случаях, с оценками улучшения соотношения цена-производительность на 5–10 раз в год для некоторых тестов. Недавнее ускорение совпало с конкретными конкурентными шагами, а не с резким падением общего объема использования ИИ. Предприятия и разработчики продолжают расширять потребление токенов, однако средняя цена остается ниже, поскольку более дешевые варианты захватывают долю рынка, а поставщики корректируют публичные тарифы. Эта динамика сделала ранее дорогие задачи с высоким объемом более жизнеспособными и подчеркнула разницу между удельной экономикой и общими расходами.

Агрессивное снижение цен на GPT-5.6 от OpenAI ускоряет спад

В конце июля 2026 года OpenAI снизила цены на семейство GPT-5.6 всего через несколько недель после общего доступа. Уровень Luna был снижен на 80 процентов, что привело к цене на входные токены 0,20 доллара и выходные токены 1,20 доллара за миллион. Модель среднего уровня Terra получила снижение на 20 процентов до 2 долларов за вход и 12 долларов за выход. Флагманская модель Sol изначально сохранила цену 5/30, а позже в течение трехмесячного периода была проведена промо-снижения более чем на 20 процентов. Заявления компании объяснили эти изменения частично за счет повышения внутренней эффективности самих моделей, включая улучшенную оптимизацию кода и эффективность обслуживания. Эти шаги были предприняты на фоне усиления контроля бизнеса над счетами за ИИ и роста популярности более дешевых альтернатив.
 
Время и переоценка так скоро после запуска свидетельствовали о готовности приоритизировать объем и рыночную позицию над краткосрочной маржей для трафика среднего и низкого уровня. Наибольшую выгоду получат высоконагруженные задачи, такие как классификация, извлечение, маршрутизация и ранние этапы циклов агентов, поскольку теперь они могут работать в масштабе на мощных моделях без предыдущего ценового барьера. Последующие корректировки и внедрение более быстрых режимов по премиум-цене демонстрируют многоуровневую стратегию, которая сохраняет различие передовых возможностей, одновременно делая повседневный интеллект более доступным. Снижения напрямую способствовали наблюдаемому сжатию смешанных рыночных индексов.

Китайские модели с открытым исходным кодом переопределяют конкурентный порог

Китайские разработчики представили высокоэффективные модели с открытым весом и низкой стоимостью, которые значительно ниже по цене по сравнению с передовыми западными решениями. Предложения DeepSeek часто фигурируют среди самых экономичных вариантов на платформах маршрутизации: некоторые конфигурации ранее оценивались в низкие десятки центов за миллион токенов, а более поздние версии сохраняют агрессивные тарифы даже после корректировок для пиковых и внепиковых периодов. Модели Kimi от Moonshot AI, включая серию K3, предлагают еще один конкурентный вариант: их списочные цены, хотя и выше, чем у самых дешевых открытых решений, все же ниже многих проприетарных решений среднего уровня с учетом производительности в определенных рабочих нагрузках.
 
Отчеты за середину 2026 года показали, что китайские модели захватывают значительную долю на агрегаторских платформах, причем некоторые анализы отмечали, что четыре самых популярных модели на одном из крупных роутеров в течение года были китайскими. Разрыв в возможностях сократился во многих практических задачах, таких как программирование, суммаризация и работа с общими знаниями, что позволило пользователям, чувствительным к стоимости, и стартапам перенести объемы. Это давление заставляет провайдеров проприетарных решений реагировать снижением цен или рисковать потерей сегментов с высоким объемом. Открытые веса также позволяют размещать модели самостоятельно или у третьих сторон с дальнейшим снижением эффективных затрат для организаций, обладающих необходимыми операционными возможностями. Совокупный эффект проявляется в смешанных индексах, поскольку использование перемещается в сторону более дешевых альтернатив для подходящих задач.

Повышение эффективности в программном обеспечении и оказание сложного ценового давления

За пределами конкуренции по списковым ценам технический прогресс снизил базовую стоимость генерации каждого токена. Квантование, спекулятивное декодирование, улучшенное управление KV-кешем, более эффективная пакетная обработка и специфические оптимизации моделей снизили объем вычислений, необходимых на каждый токен. Инженеры OpenAI в середине 2026 года открыто обсудили программные оптимизации, которые более чем вдвое снизили некоторые затраты на вывод, позволив трафику гостей на ChatGPT работать на значительно меньшем объеме GPU, чем предполагалось ранее. Пользовательские ускорители и более тесная совместная разработка моделей и аппаратного обеспечения продолжают повышать уровень использования.
 
Эти достижения позволяют провайдерам снижать цены, сохраняя или даже улучшая маржу на оставшемся высокодоходном трафике. Улучшения соотношения цены и производительности оборудования примерно на 30 процентов в год и повышение энергоэффективности почти на 40 процентов, как отмечается в соответствующих отраслевых анализах, создают структурный попутный ветер. Сочетание этих факторов означает, что даже без конкурентного давления минимальный уровень затрат будет продолжать снижаться, хотя и более медленно. В сочетании с конкуренцией на основе открытых моделей и агрессивными ценовыми реакциями это приводит к быстрому наблюдаемому сжатию. Провайдеры, которые не смогут использовать эти преимущества эффективности, рискуют быть более серьезно обойденными по цене.

AI-агенты стимулируют рост объемов токенов несмотря на более низкую стоимость единицы

Хотя цена за токен резко снизилась, общие расходы на инференс не обязательно уменьшились пропорционально. Агентные системы, многоэтапные рабочие процессы, которые планируют, вызывают инструменты, проверяют результаты и итерируют, потребляют значительно больше токенов, чем традиционные чат-приложения или однократные взаимодействия. Анализы показывают, что агенты могут требовать в 5–30 раз больше токенов для эквивалентных задач из-за повторной передачи контекста, промежуточных рассуждений, выводов инструментов и циклов самокоррекции. Агент для программирования, работающий в течение часа, может обрабатывать миллионы токенов, тогда как простой чат-бот использует десятки тысяч.
 
Gartner и другие исследовательские прогнозы предполагают, что затраты на инференс для агентных рабочих процессов могут вырасти в несколько раз, даже несмотря на падение цен за единицу, что отражает как рост объема, так и частую необходимость в более мощных моделях для рассуждений. Эта закономерность напоминает парадокс Джевонса: более дешевый интеллект расширяет набор экономически целесообразных применений, увеличивая общий объем потребления. Предприятия, внедряющие агентов в масштабе, поэтому сталкиваются с ростом абсолютных расходов, если не внедряют тщательную маршрутизацию, кэширование, каскадирование моделей и оптимизацию промптов. Падение стоимости за единицу именно делает масштабное развертывание агентов возможным; без него многие из этих систем оставались бы слишком дорогими для использования в производстве.

Скорость снижения стоимости с учетом возможностей превышает скорость падения номинальной цены токена

Номинальные цены за токен недооценивают реальное улучшение, поскольку модели продолжают повышать свои возможности. Доллар, потраченный в 2026 году, позволяет приобрести не только более дешевые токены, но и более мощные системы, чем тот же доллар, потраченный несколько лет назад. Данные Stanford HAI и Epoch AI показывают, что в многих случаях стоимость при фиксированном уровне возможностей снижается примерно в 10 раз в год, а улучшения по конкретным задачам могут быть еще выше. Самы передовые модели стали дешевле с каждой новой генерацией, несмотря на рост абсолютной производительности.
 
Интеллект класса GPT-4, который ранее стоил десятки долларов за миллион токенов, теперь доступен у нескольких поставщиков за небольшую долю от этой цены. Поэтому показатели с поправкой на качество демонстрируют еще более резкое падение, чем общий индекс. Это двойное движение — снижение цен за единицу и рост возможностей — объясняет, почему вычислительные рабочие нагрузки, связанные с агентами и тестовым временем, которые были невыгодными в 2023–2024 годах, стали обычным делом. Организациям, оценивающим общую стоимость владения, необходимо учитывать оба аспекта, а не сосредотачиваться исключительно на заявленных тарифах.

Открытые модели и конкуренция за хостинг расширяют предложение

Наличие мощных моделей с открытым весом значительно расширило эффективное предложение вычислительной мощности для вывода за пределы проприетарных лабораторий. Провайдеры облачных услуг и специализированные хосты для вывода могут предлагать конкурентные тарифы на модели класса Llama, DeepSeek, Qwen и аналогичные, не неся полных затрат на обучение передовых моделей. Это создает постоянное конкурентное ограничение на проприетарное ценообразование. Платформы маршрутизации наблюдали значительный рост доли трафика с открытым исходным кодом или открытым весом в периоды активных выпусков китайских моделей.
 
Предприятия, которые ранее избегали таких моделей из-за требований к безопасности или хранению данных, все чаще оценивают их для нечувствительных рабочих нагрузок. Самостоятельное развертывание дополнительно снижает предельные затраты для организаций, способных амортизировать затраты на оборудование и инженерные усилия. В результате возникает двойственный рынок, в котором наиболее мощные проприетарные модели пользуются премиумом, а значительная и растущая доля объема перемещается на более дешевые альтернативы. Поэтому провайдерам необходимо конкурировать как по абсолютной производительности, так и по соотношению цены и производительности на всем спектре запросов.

Паттерны корпоративных расходов смещаются в сторону оптимизации и маршрутизации

По мере снижения цен за единицу и роста объемов запросов опытные покупатели ответили внедрением маршрутизации моделей, каскадирования, кэширования и контроля использования. Юридические технологии и другие специализированные компании сообщили о многократном снижении затрат за счет сочетания премиум-моделей для ключевых этапов с более дешевыми альтернативами для рутинной обработки без измеримой потери качества в их рабочих нагрузках. Агрегаторы и внутренние шлюзы теперь делают возможным отправлять каждый запрос в самую низкозатратную модель, соответствующую необходимому порогу качества.
 
Кэширование запросов, пакетная обработка и более медленные несрочные режимы дополнительно снижают эффективные затраты. Некоторые организации, исчерпавшие годовые бюджеты на ИИ в начале года, ввели внутренние лимиты или перешли на модели более низкого уровня. Эти действия усиливают понижательное давление на смешанные рыночные цены, одновременно позволяя общему внедрению ИИ продолжать расширяться. Победителями в такой среде становятся команды, которые рассматривают выбор моделей и инфраструктуру как постоянные задачи оптимизации, а не как статичные выборы поставщиков.

Рост давления на маржу у поставщиков Frontier Model

Быстрое падение цен создает четкие трудности для компаний, которые сильно инвестировали в обучение передовых моделей. Снижение дохода от токенов на единицу возможностей может сжать путь к прибыльности, даже при росте общего объема использования. И OpenAI, и Anthropic столкнулись с повышенным вниманием со стороны регуляторов в отношении ценовой власти и будущих марж, особенно в контексте потенциальных публичных отчетов. Китайские лаборатории, которые обучают модели при более низких заявленных затратах и ценах, агрессивно захватывают объем, который иначе мог бы поддерживать более высокие западные цены.
 
В то же время смещение в сторону агентных рабочих нагрузок, которые предпочитают модели с более сильными способностями к рассуждению, частично компенсирует это, поскольку такие модели по-прежнему пользуются значительным премиумом. Поставщики реагируют дифференцированным ценообразованием, снижением затрат за счет повышения эффективности и дифференциацией продуктов. Остается открытым вопрос, смогут ли эти стратегии восстановить привлекательную единичную экономическую эффективность при сохранении доли рынка — это будет определять капиталоемкость и конкурентную структуру отрасли в ближайшие годы.

Экономика оборудования и инфраструктуры продолжает развиваться

Затраты на вычисления лежат в основе ценообразования вывода. Улучшения в использовании GPU, специализированных ускорителей, пропускной способности памяти и сетевого взаимодействия способствуют снижению стоимости на токен. Специализированные чипы, разработанные специально для нагрузок трансформеров, обещают дополнительные преимущества после выхода на массовое производство. Повышение энергоэффективности снижает операционные расходы в масштабе. Эти структурные тенденции поддерживают дальнейшее снижение цен независимо от уровня конкуренции.
 
В то же время огромный капитал, необходимый для создания и эксплуатации крупных кластеров, создает барьеры и определяет, какие компании могут конкурировать на передовой. Взаимодействие между прогрессом в аппаратном обеспечении и оптимизацией программного обеспечения определит, насколько быстро нижняя граница стоимости будет продолжать снижаться, и смогут ли модели с открытыми весами закрыть оставшиеся разрывы в возможностях при сопоставимой экономической эффективности.

Будущее инференса направлено на специализированные и каскадные системы

Глядя вперёд, сочетание снижения стоимости токенов и роста сложности агентов указывает на более сложные архитектуры вывода. Каскадные системы, использующие дешёвые модели для первоначальной фильтрации и дорогие модели только при необходимости, маршрутизация на основе смеси экспертов, специализированные малые модели для распространённых подзадач и продвинутое кэширование станут стандартом. Техники вычислений во время тестирования, обменивающие дополнительные токены на более высокую надёжность, станут более привлекательными по мере снижения цены этих токенов.
 
Экономическая целесообразность непрерывных фоновых агентов и масштабной автоматизации растет. Организации, которые создадут надежную инфраструктуру для оценки, маршрутизации и мониторинга затрат, извлекут наибольшую пользу. Ценовая война вряд ли закончится внезапно; скорее, она, вероятно, перейдет в постоянную конкуренцию по уровням качества, задержек и специализации.

Практические последствия для разработчиков и предприятий

Разработчики и предприятия теперь работают в среде, где предельная стоимость интеллекта настолько низка, что позволяет агрессивно экспериментировать, однако общие расходы могут быстро расти при развертывании агентов. Лучшие практики включают непрерывное сравнение соотношения цена-производительность между провайдерами, активное использование кэширования и пакетных режимов, тщательную разработку промптов для снижения ненужных токенов и четкое внутреннее бюджетирование для рабочих нагрузок агентов.
 
Выбор правильной модели на каждом этапе рабочего процесса часто позволяет добиться большей экономии, чем переговоры о скидках к списочной цене. Мониторинг затрат с учетом нагрузки, а не списочных цен, дает более точную картину реальной экономики. Компании, которые рассматривают управление стоимостью инференса как основную инженерную дисциплину, а не как дополнительную задачу, наиболее эффективно масштабируют приложения ИИ по мере развития рынка.

ЧаВо

Насколько реально упали цены на токены ИИ за последние годы?

Долгосрочные данные из Stanford HAI и связанных трекеров показывают, что затраты на инференс класса GPT-3.5 снизились более чем в 280 раз с конца 2022 по конец 2024 года, с дальнейшим сжатием до 2026 года. Меры с учетом способностей часто демонстрируют еще более значительные ежегодные улучшения примерно в 5–10 раз и более по конкретным тестам. Недавние комбинированные индексы, такие как индекс Silicon Data, достигли рекордно низких значений около 97 центов за миллион токенов в начале сентября 2026 года после более значительных снижений в начале года.
 

Что именно вызвало резкое падение в середине-конце 2026 года?

Основными краткосрочными драйверами стали значительное снижение цен OpenAI на модели GPT-5.6 Luna и Terra в конце июля 2026 года, а также сохраняющаяся агрессивная ценовая политика и рост возможностей китайских моделей с открытым весом, таких как DeepSeek и Moonshot. Эти шаги сместили спрос в сторону более дешевых вариантов и вынудили более широкие рыночные корректировки, заметные в индексах с учетом объема использования.
 

Означают ли падения цен на токены снижение общих расходов на ИИ?

Не обязательно. Агентные системы потребляют значительно больше токенов на выполненную задачу — часто в 5–30 раз больше, чем простые взаимодействия, из-за итеративных рассуждений, использования инструментов и повторной передачи контекста. Многие организации поэтому наблюдают рост абсолютных расходов, даже когда цена за токен снижается — это классический пример расширения использования после снижения стоимости.
 

Как китайские модели сравниваются по цене и возможностям?

Китайские модели с открытым исходным кодом и API часто значительно превосходят западные передовые решения по цене при сопоставимых рабочих нагрузках: некоторые конфигурации ранее предлагались по цене менее одного доллара за миллион токенов, а более поздние версии остаются крайне конкурентоспособными. Производительность на практических задачах быстро улучшилась, что привело к ощутимому росту доли на платформах маршрутизации, хотя различия сохраняются на самых высоких уровнях логического мышления и специализированных тестах.
 

Какую роль играют улучшения эффективности по сравнению с чистой ценовой конкуренцией?

Оба фактора важны. Оптимизации программного обеспечения, такие как улучшенная квантизация, спекулятивное декодирование и методы обслуживания, снизили реальную стоимость генерации токенов, позволив провайдерам снижать цены при сохранении маржи. Улучшения в аппаратной части усиливают эту тенденцию. Конкурентное давление со стороны открытых моделей и конкурирующих лабораторий ускоряет превращение этих преимуществ в более низкие списки и эффективные рыночные цены.
 

Должны ли предприятия полностью перейти на самые дешевые доступные модели?

Редко. Оптимальный подход обычно заключается в селективной маршрутизации: используйте более дешевые модели для этапов с высоким объемом и низким риском, а более мощные модели оставляйте для критически важных рассуждений или задач с высокой стоимостью ошибки. Многие организации достигают значительной экономии за счет каскадирования и выбора на основе оценки, не жертвуя при этом общей качеством вывода.

🔥 KuCoin предлагает более стабильный вариант на волатильном рынке

Если вас беспокоят частые колебания на рынке, и вы ищете более стабильный способ пассивного заработка, KuCoin — это идеальное место:
 
Пользовательское изображение
 
Simple Earn: Делайте депозит и вывод токенов в любое время, получая стабильную доходность.
KuCoin Earn: Получайте стабильную прибыль с помощью профессионального управления активами.
Холд для заработка: Получайте вознаграждения за хранение активов в Финансовом, Торговом, Маржинальном, Фьючерсном, Майнинговом и Едином аккаунтах.
Стейкинг: Раскройте потенциал дохода от ончейн-активов.
Расширенные инвестиции: Расширенные инвестиции предлагают различные структурированные продукты, чтобы помочь вашим деньгам расти на любом рынке.
Shark Fin: Защита основной суммы и гарантированная прибыль
Бивалютные инвестиции: Покупайте дешевле и продавайте дороже с прозрачным расчетом доходности.
Snowball: Высокая доходность с защитой цены.
Покупка со скидкой: Покупайте криптовалюту по сниженным ценам.
KCS Loyalty: Повысьте уровень, чтобы получать эксклюзивные бонусы, стейкингом ≥ 1 KCS.
KuCoin Wealth: Откройте для себя будущую стоимость и начните свой путь умных инвестиций.
Преимущества KCS: Держите и стейкайте KCS, чтобы получить доступ к преимуществам на платформе.
KCS Staking 2.0: Участвуйте в управлении KCS в цепочке, чтобы получать доход.

Отказ от ответственности: Этот материал предоставлен исключительно в информационных целях и не является инвестиционной рекомендацией. Инвестиции в криптовалюты сопряжены с рисками. Проведите собственное исследование (DYOR).
 

Отказ от ответственности: Эта страница была переведена для вашего удобства с использованием технологии искусственного интеллекта. Для получения наиболее точной информации обратитесь к оригинальной английской версии.