Використання токенів Claude Code у 30 разів вище, ніж у інших у тесті агентської фреймворку

icon MarsBit
Поділитися
AI summary iconКороткий зміст
Нові токени були протестовані командою Composio, яка порівняла використання токенів у трьох агентних фреймворках — Claude Code, Hermes і Kimi Code — за допомогою моделі Kimi K3 на 28 ідентичних завданнях. Новини про запуск токенів підкреслюють, що Claude Code використав до 30 разів більше токенів, ніж інші, з медіаною 340 000 токенів порівняно з 61 000 у Kimi Code. Витрати досягли $2 за завдання для Claude Code, порівняно з $0,22 для Kimi Code. Тест показує, що дизайн агента значно впливає на ефективність та витрати на токени.

Всі кажуть, що Claude Code витрачає токени даремно, наскільки він дорогий? Нарешті хтось порахував цифри.

Останнім часом було проведено цікавий порівняльний експеримент від команди Composio. Вони використали ту саму модель Kimi K3, запустіть у трьох різних фреймворках агентів (harness) — Claude Code, Hermes і Kimi Код—— було протестовано 28 абсолютно однакових завдань.

Оркестрація моделей

В результаті, три harness майже однаково успішно виконали завдання: Kimi Code — 22 з 28, Hermes — 21, Claude Code — 20. Різниця не велика.

Справжнє розходження — це витрати токенів. Одне й те саме завдання, виконане з використанням різних harness, може вимагати до 30 разів більше токенів!

За медіаною, Kimi Код використовує приблизно 61 000 токенів, Hermes — приблизно 67 000, а Claude Code стрімко зростає до 340 000, що майже Kimi Шість разів більше, ніж код.

Оркестрація моделей

Натисніть Kimi Ціна K3 становить 3 долари за мільйон вхідних токенів (у робочих потоках агента вхідні токени зазвичай становлять близько 95%), середня вартість кожного завдання становить: Kimi Код 0,22 долара, Hermes — 0,28 долара, а Claude Code досяг 2 доларів. Різниця очевидна.

Також відрізняється швидкість. Медіанний час: Hermes найшвидший — 179 секунд; Kimi Код 297 секунд; Claude Code 348 секунд.

Отже, найшвидший — Hermes, а найекономніший щодо токенів — Kimi Код, обидва не збігаються.

Команда Composio зробила прямий висновок: якщо ви хочете знизити витрати на агента, спочатку перевірте, який harness ви використовуєте, а не поспішайте міняти модель. Їхні дані показують, що сам harness може відрізняти витрати в 9 разів, тоді як здатність моделей насправді майже однакова.

Оркестрація моделей

Себастьян Расчка також опублікував пост, побачивши цей результат, сказавши, що це схоже на його попередні спостереження з Qwen3.6: Claude Code у випадках з подібною успішністю використовує в 2–3 рази більше токенів, ніж багато інших harness-ів.

Оркестрація моделей

Він запропонував кілька можливих причин: чи це недостатня оптимізація? чи є баг? чи це було навмисно зроблено так (оскільки це може допомогти у складніших завданнях)? Він зазначив, що потрібно ще трохи часу, щоб уважно перевірити.

Потім він додав спостереження, зроблені ним під час написання статті про локальний coding agent минулого місяця. Тоді він аналізував, чому Claude Code використовує більше токенів, і виявив, що різниця полягає в основному у вхідних токенах, а не у вихідних. Іншими словами, Claude не пише вдвічі більше контенту. Логи показують, що в ході багатокрокової взаємодії Claude’s harness повторно передає моделі більше контексту, включаючи попередні повідомлення, виклики інструментів, вивід команд та вміст файлів. Наприклад, під час одного запуску Claude використав близько 578 000 вхідних токенів, але лише близько 4500 токенів на виході, за 25 циклів. Отже, більш ймовірне пояснення полягає в тому, що Claude’s harness під час багатокрокового виконання агента накопичує або враховує більший історичний обсяг промпту.

Оркестрація моделей

Ці тестові результати, схоже, виявляють незанедбаний тренд: важливість harness стала рівною важливості самої моделі.

Останній дослідження (від Writer, компанії, що розробляє платформу для корпоративних AI-агентів) систематично розкриває це: за допомогою експериментів з контрольними змінними було доведено, що заміна шару harness ефективніше зменшує витрати, ніж заміна моделі, і всі моделі отримують користь.

Оркестрація моделей

Зокрема, вони провели строгий експеримент з контролем змінних: за незмінних умов 22 корпоративних завдань і 6 базових моделей (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6) вони замінили лише рівень оркестрації — традиційний виробничий агентний цикл було замінено на Harness від Writer.

Результати експерименту показали: середня вартість кожної задачі знизилася на 41% (0,21 долара → 0,12 долара), медіанна затримка скоротилася на 44% (48 секунд → 27 секунд), споживання токенів зменшилося на 38% (14,2 тис. → 8,8 тис.), а якість виконання задач залишилася майже незмінною (0,78 → 0,81; через невеликий обсяг вибірки це вважається незначною різницею). Щодо співвідношення ціни та якості, підвищення якості на долар зросло на 82%, а кількість завдань, що виконуються на мільйон токенів, зросла з 54,9 до 92,0.

Отже, після того як модель перетворилася на «воду, електрику та газ», саме harness є тим кондиціонером, що визначає ваш рахунок за електроенергію? Іншими словами: раніше хтось казав «модель — це продукт», а зараз «harness — це продукт»?

Оркестрація моделей

Оскільки harness настільки важливий, чи не слід тепер враховувати рахунки детальніше?

Хтось зазначив, що нам необхідно додати до існуючих benchmark «податок harness». Зокрема, враховуючи, що коли виклики інструментів і повторні спроби потрапляють у петлю, цей податок не зростає лінійно.

Оркестрація моделей

Іншими словами, у майбутніх конкурсах агентів перша частина — це «чи можна це зробити», а друга частина — «хто зробить те саме дешевше» — а секрет економії — не в моделі, а в harness.

Оркестрація моделей

Чи були у вас подібні досвіди під час запуску Agent? Запрошуємо до обговорення в коментарях.

Цей матеріал зі сторінки WeChat «Machine Heart» (ID: almosthuman2014), автор: Machine Heart

Відмова від відповідальності: Інформація на цій сторінці може бути отримана від третіх осіб і не обов'язково відображає погляди або думки KuCoin. Цей контент надається лише для загального інформування, без будь-яких запевнень або гарантій, а також не може розглядатися як фінансова або інвестиційна порада. KuCoin не несе відповідальності за будь-які помилки або упущення, а також за будь-які результати, отримані в результаті використання цієї інформації. Інвестиції в цифрові активи можуть бути ризикованими. Будь ласка, ретельно оцініть ризики продукту та свою толерантність до ризику, виходячи з ваших власних фінансових обставин. Для отримання додаткової інформації, будь ласка, зверніться до наших Умов використання та Розкриття інформації про ризики.