Все говорят, что Claude Code тратит токены напрасно, насколько это дорого? Наконец-то кто-то посчитал цифры.
Недавно команда Composio провела интересный сравнительный эксперимент, используя одну и ту же модель Кими K3, запустить в трех разных агентных фреймворках (harness) — Claude Code, Hermes и Кими Код—— Всего было протестировано 28 абсолютно одинаковых задач.

В результате, три harness имеют примерно одинаковую успешность выполнения задач: Кими Code успешно справился с 22 из 28, Hermes — с 21, Claude Code — с 20. Разница небольшая.
Реальное различие создает потребление токенов. Одно и то же задание, выполненное с использованием разных harness, может потребовать до 30 раз больше токенов!
По медиане, Кими Код составляет примерно 61 000 токенов, Hermes — около 67 000, а Claude Code сразу взлетает до 340 000, что примерно в Кими В 6 раз больше кода.

Нажмите Кими Цена K3 составляет 3 доллара за миллион входящих токенов (в рабочих потоках агента входящие токены обычно составляют около 95%), средняя стоимость каждого задания составляет: Кими Код 0,22 доллара, Hermes 0,28 доллара, а Claude Code достиг 2 долларов. Разница очевидна.
По скорости также различаются. Среднее время выполнения: Hermes самый быстрый — 179 секунд; Кими Код 297 секунд; Claude Code 348 секунд.
Самый быстрый — Hermes, самый экономичный по токенам — Кими Код, оба не совпадают.
Команда Composio сделала прямой вывод: если вы хотите снизить стоимость агента, сначала посмотрите, какой харнесс вы используете, а не спешите менять модель. Их данные показывают, что сам харнесс может увеличить стоимость в 9 раз, в то время как способности моделей практически одинаковы.

Себастьян Расчка также опубликовал пост, увидев этот результат, и отметил, что это похоже на его предыдущие наблюдения с использованием Qwen3.6: Claude Code использует в 2–3 раза больше токенов, чем многие другие инструменты, при сопоставимом уровне успеха.

Он предположил несколько возможных причин: это недостаточная оптимизация? наличие бага? или так было намеренно спроектировано (поскольку это может помочь при более сложных задачах)? Он отметил, что нужно потратить еще время, чтобы внимательно разобраться.
Затем он добавил наблюдения, сделанные им при написании статьи о локальном coding agent в прошлом месяце. Тогда он проанализировал, почему Claude Code использует больше токенов, и обнаружил, что различия связаны в основном с входными токенами, а не с выходными. То есть Claude не генерирует вдвое больше контента. Логи показывают, что в ходе многократного взаимодействия harness Claude повторно передает модели все больше контекста, включая предыдущие сообщения, вызовы инструментов, вывод команд и содержимое файлов. Например, в одном случае Claude использовал около 578 000 входных токенов, но только около 4500 выходных токенов за 25 циклов. Следовательно, более вероятное объяснение заключается в том, что harness Claude при многопроцессном выполнении агента накапливает или учитывает более крупную историю промпта.

Эти тестовые результаты, похоже, выявляют значимый тренд: важность harness уже не уступает важности самой модели.
Недавняя статья (от Writer — компании, создающей платформу корпоративных AI-агентов), систематически демонстрирует это: с помощью экспериментов с контролируемыми переменными она доказывает, что замена слоя harness более эффективна для снижения затрат, чем замена модели, и все модели получают выгоду.

В частности, они провели строгий эксперимент с контролируемыми переменными: при фиксированных 22 корпоративных задачах и 6 базовых моделях (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6) они заменили только оркестрационный слой — традиционный производственный цикл агентов был заменен на собственную платформу Harness от Writer.
Результаты эксперимента показали: средняя стоимость каждой задачи снизилась на 41% (с 0,21 доллара до 0,12 доллара), медианная задержка сократилась на 44% (с 48 секунд до 27 секунд), потребление токенов уменьшилось на 38% (с 14,2 тыс. до 8,8 тыс.), а качество выполнения задач осталось практически на том же уровне (0,78 до 0,81 — из-за небольшого объема выборки это можно считать незначительной разницей). В плане соотношения цены и качества повышение качества на доллар затрат составило до 82%, а количество задач, выполняемых на миллион токенов, увеличилось с 54,9 до 92,0.
Таким образом, после того как модель превратилась в «воду, электричество и газ», именно harness определяет ваш счет за электричество? Другими словами: раньше говорили «модель — это продукт», а теперь «harness — это продукт»?

Since harness is so important, shouldn't the subsequent accounting be more detailed?
Некоторые отметили, что нам необходимо добавить пункт «налог harness» в существующие эталонные показатели. Особенно учитывая, что при попадании инструмента и повторных попыток в цикл этот налог не растет линейно.

Другими словами, в конкурсе агентов в будущем первая половина будет определять, «можно ли это сделать», а вторая половина — «кто сделает то же самое дешевле» — а секрет экономии заключается не в модели, а в harness.

У вас были похожие ощущения во время работы агента? Делитесь в комментариях.
Эта статья взята из официального аккаунта WeChat «Machine Heart» (ID: almosthuman2014), автор: Machine Heart
