ChainThink повідомляє, 1 серпня компанія Composio, інфраструктурна компанія для AI Agent, розширила тестування, підключивши той самий Kimi K3 до шести рамок Agent і виконавши 26 однакових завдань.
Об’єктом порівняння є рамки виконання, базова модель — Kimi K3. Результати тестування показали, що Kimi Code виконала 21 завдання і посіла перше місце; Hermes виконала 20 завдань;
Pi Agent та Claude Code завершили по 19 завдань; OpenCode — 18; Codex — 17.
За офіційною ціною Kimi K3, Hermes і Pi Agent мають найнижчу середню вартість за завдання — відповідно 0,39 долара США і 0,40 долара США;
Claude Code коштує 1,47 долара США, що приблизно в 3,8 раза більше, ніж Hermes. Щодо швидкості, медіанний час виконання однієї задачі Pi Agent становить 161,7 секунди, а Claude Code — 347,6 секунди.
Тестування показало, що при зміні фреймворку в межах однієї моделі кількість успішних завдань відрізняється максимум на 4, середня вартість — майже в 4 рази, а час виконання — більше ніж у 2 рази.
