Пришло время подсчитать свои токены, как обычный владелец продуктового магазина.Автор статьи, источник: 0x9999in1, ME News
Коротко
- Конец бешеного роста хэшрейта — безумные счета. Медовый месяц субсидий от гигантов официально завершился, токены стали цифровой валютой, и каждый ватт хэшрейта имеет дорогую цену.
- Потери повсюду и вызывают тревогу. Избыточные промпты, неконтролируемый мусор от RAG (поисково-усиленного генерирования) и агенты, застрявшие в бесконечных циклах, тайно и быстро истощают денежные потоки компаний.
- Срочно необходима крайняя инженерная самопомощь. Семантический кэш (Semantic Cache), сжатие промптов (Prompt Compression) и маршрутизация моделей (Model Routing) больше не являются дополнительными преимуществами, а представляют собой три ключевых инструмента, от которых зависит выживание.
- Фреймворк前沿Agent задал направление. Агенты, такие как OpenClaw и Hermes, демонстрируют настоящую «экономику токенов» в условиях ограниченных вычислительных ресурсов, например, на мобильных устройствах, благодаря точному управлению контекстом и структурированному выводу.
- Конечным лекарством является пробуждение мышления ROI (возврат на инвестиции). Прощайтесь с грубым использованием ресурсов и переходите к детализированной эксплуатации. Рост цен на вычислительную мощность — это не конец отрасли, а жесткая перезагрузка, оставляющая только тех игроков, кто по-настоящему уважает издержки.
Иллюзия развеялась: когда счет за вычислительную мощность превращается в приговор
Ветер утих.
За последние два года мы жили в иллюзии, тщательно созданной капиталом и гигантами. В этом мире вычислительная мощность казалась водопроводной водой: достаточно открыть кран — и крупные модели непрерывно выдают изысканные фразы, сложный код и ответы, кажущиеся всезнающими.
Мы тратим напрасно. Мы бесцеремонно втискиваем в Prompt длинные документы в несколько тысяч слов. Мы заставляем самые передовые модели с триллионами параметров выполнять абсурдные мелкие задачи, такие как «сделать первую букву этого текста заглавной».
Почему? Потому что дешево. Потому что OpenAI, Anthropic и другие платят за нас за счет денег инвесторов.
Но теперь сон закончился.
Вычислительная мощность повсеместно дорожает. Это не пугающие слова, а суровая реальность, которая уже происходит. Борьба за чипы NVIDIA H100 переросла из коммерческой конкуренции в геополитическое противостояние. Энергопотребление центров обработки данных приближается к пределу возможностей электросетей. Каждый вызов API сопровождается сгоранием кремниевых чипов и ревом охладительных башен.
Крупные игроки больше не занимаются благотворительностью. Хотя единица оплаты API по-прежнему остается ничтожно малой «1K Tokens», когда ваш бизнес начинает расти, а ежедневное количество вызовов превышает миллион или десятки миллионов, эта цифра уже не кажется мелочью.
Это водопад. Это кровосос. Это кошмар, от которого CFO любой стартап-компании просыпается посреди ночи.
Токен, базовая атомарная единица эпохи больших моделей, официально приравнен к доллару и юаню. Одно слово — тысяча золотых — больше не преувеличение, а реальные финансовые отчеты.
Как сэкономить Token после повышения хэшрейта?
Это не просто сложная техническая проблема. Это вопрос выживания бизнес-модели.
Тайный уголок: как именно ушли ваши токены?
Чтобы остановить кровотечение, сначала нужно найти рану.
Многие не понимают, как расходуются токены. Они смотрят на ежемесячно растущие счета, как на непонятную тайную книгу. На самом деле, потеря токенов часто происходит в самых незаметных и скрытых местах.
Цена вежливости и ловушка «мусорных речей»
Вы вежливо разговариваете с ИИ?
Привет, не мог бы ты мне помочь? Большое спасибо, мне нужно, чтобы ты сыграл роль опытного маркетолога…
Остановитесь. Хватит.
Как человек, ты джентльмен. Но в экономике токенов ты — расточитель.
У больших моделей нет эмоций. Им не нужны ваши «пожалуйста» и «спасибо». Им не нужны эти пустые социальные вежливости. Каждое слово, каждый знак препинания, даже каждый пробел — это токен. За всё это взимается плата.
Еще более пугающим является «мусор», генерируемый фреймворком. Многие разработчики при создании приложений, чтобы обеспечить стабильность вывода, используют чрезвычайно длинные, перегруженные системные промпты (System Prompt). «Вы обязаны соблюдать следующие десять принципов…» «Если вы не знаете, ответьте, что не знаете, не выдумывайте…»
Эти слова полезны? Да. Но если каждый раз, в каждом диалоге, при каждом цикле многоэтапного взаимодействия, приходится заново вычислять эти тысячи токенов, то такие потери поразительны. Контекстное окно — это не бесплатный шкаф для хранения, это дорогостоящий деловой центр Манхэттена.
Out-of-control RAG: Violent document dumping
RAG (ретривал-аугментированная генерация) считается серебряной пулей для решения проблемы иллюзий крупных моделей.
Но на практике RAG часто становится катастрофой.
Идеальный RAG: точно извлекает три наиболее релевантных предложения, подает их модели и получает идеальный ответ.
Реальный RAG: пользователь задал вопрос, векторная база данных схватила десять PDF-документов по десять тысяч слов каждый и швырнула их прямо в лицо модели.
«Ищи ответ сам», — подумал разработчик.
Это не просто лень. Это преступление против хэшрейта.
Обилие несвязанной контекстной информации не только нарушает механизм внимания модели (вызывая явление «Lost in the Middle»), но и приводит к астрономическому потреблению токенов. Вы думаете, что задали простой вопрос, но на самом деле заставили модель прочитать половину библиотеки. И эту стоимость чтения вам придется оплатить.
Агент, попавший в бесконечный цикл
Больше, чем дорогой RAG, — это неконтролируемый агент.
Предоставление ИИ способностей к планированию, мышлению и использованию инструментов — это сегодня абсолютная актуальность. Режим ReAct (рассуждение и действие) заставляет ИИ работать так, как будто это человек.
Мне нужно проверить погоду сегодня.
Вызов API погоды.
Ошибка получения.
Thought: Только что не удалось, я попробую еще раз.
Вызов API погоды.
Вы заметили? Если API внезапно отключится или логика агента попадет в тупик, он будет бесконечно крутиться в этом цикле. Каждый цикл «размышления» и «действия» потребляет чрезвычайно дорогие токены вывода.
Цена выходного токена обычно в несколько раз выше цены входного токена.
Агент без механизма аварийной остановки и ограничения максимального числа итераций — это бездонная яма, поглощающая токены. Он может исчерпать вашу кредитную карту, пока вы спите.
Скрабирование кости для исцеления яда: жесткий руководство по техническому само спасению
Жаловаться на рост цен бесполезно. Зрелые наблюдатели сосредоточены на решениях.
Когда грубое накопление вычислительной мощности осталось в прошлом, тонкое инженерное мастерство стало единственным барьером. Как сжать последнюю каплю воды из полотенца, так и извлечь каждую каплю ценности из каждого токена.
Семантический кэш (Semantic Cache): не платите дважды за один и тот же вопрос
Это самый прямой и жесткий способ сэкономить деньги.
Суть человека — это повторитель, и вопросы пользователей часто очень однотипны. Вопросы вроде «Как сбросить пароль?» или «Как получить счет-фактуру?» могут задаваться сотни и тысячи раз каждый день.
Если каждый раз обращаться к GPT-4, это как стрелять из пушки по комарам.
Внедрение семантического кэша. Когда пользователь задает вопрос, он сначала преобразуется в вектор и сравнивается по сходству с кэшем. Если ранее кто-то задавал похожий вопрос (например, «Что делать, если забыл пароль?»), и степень совпадения очень высока, возвращается ответ из кэша.
Без использования крупных моделей. Не расходует никаких токенов. Задержка снижена с секунд до миллисекунд.
Это уже не просто экономия денег, это снижение уровня опыта.
Сжатие подсказок (Prompt Compression): минимализм на алгоритмическом уровне
Если длинный контекст — это грех, сожмите его.
Это не требует ручного удаления слов и фраз, а основано на алгоритмах. В настоящее время в отрасли уже появились различные технологии сжатия подсказок на основе информационной энтропии. Эти инструменты могут анализировать длинный текст и определять, какие слова критически важны для понимания смысла крупной моделью, а какие являются лишними или несущественными стоп-словами.
Они могут сжать текст из 1000 токенов, сохранив основную семантику, без потерь (или с минимальными потерями) до 300 токенов.
Пусть машины общаются с машинами. Используйте «марсианский язык» — неуклюжий, даже грамматически неверный для человека — чтобы общаться с крупными моделями. Потому что механизм самообращения крупных моделей достаточно мощный, чтобы понимать.
Вы сэкономили 70% платы за проезд.
Маршрутизация моделей (Model Routing): Правильные люди делают правильные вещи
Это самый сложный этап для архитекторов.
Не стоит слепо поручать все задачи самой дорогой и самой мощной модели. Не нужно использовать пушку для стрельбы по воробьям.
Внутри отличного приложения ИИ должна быть матрица взаимодействия нескольких моделей. Нам нужен «маршрутизатор (Router)» для распределения.
- Простое извлечение сущностей, преобразование формата, многоязычный перевод? Направляйте прямо на локально развернутые открытые маленькие модели (например, Llama 3 8B) или крайне дешевые API (например, Claude 3 Haiku). Стоимость практически незаметна.
- Требуется глубокое логическое рассуждение, сложное написание кода, многоэтапное планирование? В этом случае используйте такие мощные инструменты, как GPT-4o или Claude 3.5 Sonnet.
Как хорошо налаженная компания: вопросы, которые может решить ресепшн, не передаются генеральному директору. После повышения цен на вычислительную мощность, тот, кто сможет реализовать этот механизм маршрутизации наиболее плавно и точно, снизит свою общую стоимость токена до десятой части от стоимости конкурентов.
Передовые исследования: анализ «токономики» агентов на примере OpenClaw и Hermes
Настоящие технологические передовые позиции давно почуяли кровавый запах роста вычислительной мощности.
Когда мы обращаем внимание на сегодняшнюю передовую экосистему агентов — особенно на фреймворки, стремящиеся разрушить ограничения облачных вычислительных мощностей и выйти на крайние и мобильные устройства, — вы увидите, что уже началась кампания по крайней оптимизации токенов.
Мобильное давление: нет роскоши контекста
Почему я специально упоминаю интеграцию с мобильным приложением? Потому что это финальное испытание эффективности токена.
На ПК или в облаке вы, возможно, можете мириться с задержкой в несколько секунд и большим контекстным окном. Но на мобильном устройстве, при запуске агента в среде с ограниченными ресурсами, пропускная способность становится узким местом, память — узким местом, и заряд батареи — тоже узким местом.
Это вынуждает рамки быть чрезвычайно скупыми.
Наблюдая за развитием OpenClaw, вы заметите, что он контролирует использование токенов почти до мании. При выполнении сложных задач OpenClaw не использует грубое наложение полного контекста. Напротив, он сильно полагается на оптимизацию структурированных выходных данных.
Он понимает, что предоставление модели свободы приводит к неконтролируемому потоку токенов. Заставляя модель выводить результаты в строгом JSON Schema или даже более низкоуровневом бинарно-дружественном формате, OpenClaw значительно сокращает избыточные символы в процессе генерации. Он не заставляет ИИ «общаться» — он заставляет ИИ напрямую «заполнять формы».
Это строгое ограничение формата вывода, хотя и кажется направленным на упрощение парсинга для нижестоящих программ, на фоне дефицита вычислительных мощностей объективно обеспечило эффективную экономию трафика.
Hermes Agent: хирургическое управление контекстом
Теперь рассмотрим модели серии Hermes, представленные Nous Research, и их применение в агентной среде.
Многие открытые модели при вызове функций из-за недостаточной способности к пониманию часто вынуждены многократно пробовать и ошибаться, что потребляет большое количество токенов. Преимущество Hermes заключается в точности выполнения инструкций.
Точность означает сделать всё правильно с первого раза. Сделать всё правильно с первого раза — это наибольшая экономия.
В ходе многократного взаимодействия контекстное окно, по мере углубления диалога, растет, как снежный ком. Продвинутые пользователи экосистемы Hermes Agent давно отказались от глупой практики «сохранять всю историю».
Они внедрили динамический механизм памяти.
- Рабочая память (Working Memory): сохраняйте только последние 3–5 циклов прямого диалога, оставаясь быстрым.
- Долгосрочная память (Long-term Memory): При превышении ограничения окна запускается крайне легковесная фоновая модель, которая кратко резюмирует предыдущий диалог и сохраняет ключевые моменты в векторной базе.
Старый диалог был отброшен, но знания сохранились.
Они не выбрасывают мусор, а проводят хирургическое удаление и наложение швов на память. Такая тонкая управление контекстом не только преодолевает физические ограничения длины токенов, но и обеспечивает резкое снижение вычислительных затрат на макроуровне.
Независимо от структурированного управления OpenClaw или динамического управления памятью Hermes, они оба демонстрируют тенденцию: в будущем агенты будут конкурировать не за количество доступных инструментов, а за способность выполнять самые сложные задачи при экстремально ограниченном бюджете токенов.
Это танец в кандалах. И тот, кто танцует лучше всех, выиграет следующую эпоху.
Скачок мышления: от потребительского мышления к инвестиционному мышлению (пробуждение ROI)
Снимите все технические термины, и давайте вернемся к сути бизнеса.
Все мощности увеличились в цене, и главное изменение, которое это принесло, — не заставляет инженеров работать допоздна, чтобы менять код. Оно вызывает принудительное обновление мышления всей индустрии ИИ.
В эпоху дешевых цен мы относились к токенам с «потребительским мышлением».
Как в супермаркете: увидел товар со скидкой — бросил в корзину. Нам не важно, действительно ли эта функция требует крупных моделей, нам важно только то, что «это выглядит круто».
Многие компании слепо подключают LLM к своим внутренним системам, выдавая учетные записи каждому сотруднику, даже заставляя ИИ генерировать меню столовой. В результате, когда приходит счет в конце месяца, все в шоке.
Сейчас мы должны переключиться на «инвестиционное мышление».
Каждое потребление токена — это инвестиция. При наличии инвестиций необходимо рассчитывать ROI (возврат на инвестиции).
Этот токен был потрачен, что он мне принес?
Повысилась ли закрытость тикетов службы поддержки?
Сократило ли это время устранения багов программистами?
Или это просто бесполезное «Ха-ха, этот ИИ такой смешной»?
Если для функции использование правила или традиционного машинного обучения стоит всего 0,1 юаня, а подключение крупной модели требует 1 юаня на токены, но при этом повышение коэффициента конверсии составляет лишь ничтожные 2%.
Тогда отсеките его. Отсеките его без колебаний.
Больше не гонимся за громкими AI-обещаниями «большого и всеобъемлющего», а переходим к точечному воздействию с акцентом на «малое и совершенное». Реорганизация бизнес-процессов должна основываться на крайней чувствительности к стоимости вычислительных ресурсов.
Мы должны научиться говорить «нет» бизнес-отделам. Когда они спрашивают: «Можно ли, чтобы ИИ прочитал все 100 000 аналитических отчетов и дал вам сводку?», вы должны ответить вопросом: «Ваши бизнес-доходы покроют стоимость API в несколько миллионов токенов?»
Посчитайте. Экономьте. Подсчитывайте свои токены, как традиционный владелец продуктового магазина.
Это совсем не киберпанк. Это очень по-деревенски.
Но это именно тот путь, который необходимо пройти ИИ на пути к зрелости.
Заключение: Пейзаж после отлива
Веселье на ветру всегда кратковременно, в конечном итоге вступят в силу законы коммерческой гравитации.
Всеобщее повышение хешрейта — это не столько кризис, сколько запоздалое очищение. Оно грубо прокалывает пузырь, надутый неограниченными субсидиями, и возвращает всех к холодной реальности.
Но это не плохо.
Он заставил нас отказаться от слепой веры в «чудо за счёт силы» и вновь обрести уважение к инженерной эффективности. Он вывел из игры тех, кто просто пишет несколько промптов и到处 обманывает, оставив сцену настоящим жёстким командам, которые понимают базовую архитектуру, маршрутизацию моделей и умеют максимально эффективно использовать вычислительные мощности на мобильных устройствах.
Когда всё уляжется, компании, которые выживут и будут хорошо себя чувствовать, — это не те, у кого самые дорогие модели.
А те, кто, глядя на стремительно меняющиеся цифры токенов на панели, остаются спокойными и уверены, что зарабатывают больше, чем тратят.
В конце концов, когда отливает прилив, мы видим, кто плавает обнажённым. На этот раз отливает прилив выгод от вычислительной мощности.
Только тот, кто кует каждую каплю токена, как золото, может надеть настоящую броню.
Источник:
- Nvidia Corporation. (2025). Data Center Compute Constraints and Global Supply Chain Outlook. Investor Relations Report.
- Anthropic. (2025). Кэширование запросов и экономика окна контекста в Claude Managed Agents. Документация Anthropic API.
- OpenAI. (2025). Лучшие практики для оптимизации токенов и внедрения RAG. OpenAI Developer Platform.
- Nous Research. (2025). Hermes Agent Framework: Efficient Context Management for Edge Computing. Nous Research Technical Blog.
- OpenClaw Community. (2026). Мобильная интеграция и стратегии нулевых отходов для токенов в глубоких агентных рабочих процессах. Репозиторий GitHub / Технический белый документ.
- Bloomberg. (2026). The End of the AI Subsidy Era: How Datacenter Energy Caps are Restructuring Cloud Pricing. Bloomberg Technology.
