El uso de tokens de Claude Code hasta 30 veces mayor que el de otros en la prueba del marco de agentes

icon MarsBit
Compartir
AI summary iconResumen
Las nuevas listas de tokens fueron sometidas recientemente a una prueba de referencia por el equipo de Composio, que comparó el uso de tokens en tres marcos de agentes: Claude Code, Hermes y Kimi Code, utilizando el modelo Kimi K3 en 28 tareas idénticas. Las noticias sobre el lanzamiento de tokens destacan que Claude Code utilizó hasta 30 veces más tokens que los demás, con una mediana de 340.000 tokens frente a 61.000 para Kimi Code. Los costos alcanzaron $2 por tarea para Claude Code, en comparación con $0,22 para Kimi Code. La prueba muestra que el diseño del agente afecta significativamente la eficiencia y el costo de los tokens.

Todos dicen que Claude Code gasta tokens, ¿cuánto gasta realmente? Por fin alguien ha calculado el número.

Recientemente, hubo un experimento comparativo bastante interesante del equipo de Composio. Utilizaron el mismo modelo Kimi K3, ejecútalo en tres marcos de agente diferentes (harness): Claude Code, Hermes y Kimi Código—— Se probaron un total de 28 tareas completamente idénticas.

Orquestación de modelos

Como resultado, la tasa de éxito de los tres harness para completar la tarea es aproximadamente la misma: Kimi Code logró 22 de 28, Hermes 21 y Claude Code 20. La diferencia no es grande.

Lo que realmente marca la diferencia es el consumo de tokens. ¡Para la misma tarea, ejecutada con diferentes harnesses, el uso de tokens puede variar hasta 30 veces!

En términos de la mediana, Kimi El código utiliza aproximadamente 61.000 tokens, Hermes alrededor de 67.000, mientras que Claude Code se dispara directamente a 340.000, casi Kimi Seis veces el código.

Orquestación de modelos

Presione Kimi El costo se calcula a razón de 3 dólares por millón de tokens de entrada (en los flujos de agentes, los tokens de entrada suelen representar alrededor del 95%), por lo que el costo promedio por tarea es aproximadamente: Kimi Code cuesta 0.22 dólares, Hermes 0.28 dólares, y Claude Code llega a 2 dólares. La diferencia es clara.

También difieren en velocidad. El tiempo mediano, Hermes es el más rápido, con 179 segundos; Kimi Código 297 segundos; Claude Código 348 segundos.

Por lo tanto, el más rápido es Hermes, y el que menos tokens consume es Kimi Código, ambos no coinciden.

El equipo de Composio llega a una conclusión directa: si deseas reducir el costo de los agentes, primero revisa qué harness estás utilizando, en lugar de cambiar rápidamente el modelo. Sus datos muestran que el harness solo puede diferenciar los costos hasta en 9 veces, mientras que el rendimiento de los modelos es realmente similar.

Orquestación de modelos

Sebastian Raschka también publicó un mensaje tras ver este resultado, diciendo que es similar a sus observaciones anteriores con Qwen3.6: Claude Code utiliza entre 2 y 3 veces más tokens que muchos otros harnesses, con tasas de éxito similares.

Orquestación de modelos

Propuso varias posibles razones: ¿fue poco optimizado? ¿tiene errores? ¿o fue diseñado así intencionalmente (porque podría ser útil en tareas más difíciles)? Indicó que necesita dedicar más tiempo a revisarlo detenidamente.

Luego añadió sus observaciones al escribir el artículo sobre agentes de codificación local el mes pasado. En ese momento, analizó por qué Claude Code utilizaba más tokens y descubrió que la diferencia radicaba principalmente en los tokens de entrada, no en los de salida. Es decir, Claude no escribió el doble de contenido. Los registros muestran que el harness de Claude vuelve a insertar repetidamente más contexto en el modelo durante interacciones múltiples, incluyendo mensajes anteriores, llamadas a herramientas, salidas de comandos y contenido de archivos. Por ejemplo, en una ocasión, Claude utilizó aproximadamente 578.000 tokens de entrada, pero solo generó alrededor de 4.500 tokens de salida, distribuidos en 25 rondas. Por lo tanto, la explicación más probable es que el harness de Claude acumula o incluye un historial más extenso en el extremo del prompt durante la ejecución de agentes en múltiples pasos.

Orquestación de modelos

These test results appear to reveal a trend that cannot be ignored: the importance of harness is now on par with the model itself.

Un reciente artículo de investigación (de Writer, una empresa que desarrolla una plataforma de agentes de IA empresarial) revela sistemáticamente esto: demuestra mediante experimentos con variables controladas que cambiar la capa de harness reduce más los costos que cambiar el modelo, y todos los modelos se benefician.

Orquestación de modelos

Específicamente, llevaron a cabo un experimento riguroso de «variables controladas»: manteniendo fijos 22 tareas empresariales y 6 modelos base (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6), solo reemplazaron la capa de orquestación: sustituyendo el ciclo de agentes productivos tradicional por el Harness propio de Writer.

Los resultados del experimento muestran: una reducción promedio del 41% en el costo por tarea (de $0.21 a $0.12), una disminución del 44% en la latencia mediana (de 48 segundos a 27 segundos), y una reducción del 38% en el consumo de tokens (de 14.2k a 8.8k), mientras que la calidad de finalización de las tareas se mantuvo prácticamente constante (0.78 a 0.81, considerándose sin diferencia significativa debido al tamaño muestral pequeño). En términos de relación calidad-costo, el aumento en la calidad por dólar gastado alcanzó un 82%, y el número de tareas completadas por millón de tokens aumentó de 54.9 a 92.0.

Entonces, después de que el modelo se convirtiera en "agua, electricidad y gas", ¿es harness el acondicionador de aire que determina tu factura de electricidad? En otras palabras: antes decían "el modelo es el producto", ¿ahora es "harness es el producto"?

Orquestación de modelos

Since harness is so important, shouldn't the subsequent accounting be more detailed?

Alguien señaló que es necesario incorporar el "impuesto harness" a los benchmarks existentes. Especialmente teniendo en cuenta que, una vez que las llamadas a herramientas y los reintentos entran en un bucle, este impuesto no crece linealmente.

Orquestación de modelos

En otras palabras, en la competencia de agentes del futuro, la primera mitad se trata de “si se puede hacer”, y la segunda mitad será sobre “quién lo hace con menos gastos” — y el secreto para ahorrar no está en el modelo, sino en el harness.

Orquestación de modelos

¿Has tenido una experiencia similar mientras ejecutabas el Agent? ¡Bienvenido a discutirlo en los comentarios!

Este artículo proviene del canal de WeChat "Machine Heart" (ID: almosthuman2014), autor: Machine Heart

Descargo de responsabilidad: La información contenida en esta página puede proceder de terceros y no refleja necesariamente los puntos de vista u opiniones de KuCoin. Este contenido se proporciona solo con fines informativos generales, sin ninguna representación o garantía de ningún tipo, y tampoco debe interpretarse como asesoramiento financiero o de inversión. KuCoin no es responsable de ningún error u omisión, ni de ningún resultado derivado del uso de esta información. Las inversiones en activos digitales pueden ser arriesgadas. Evalúa con cuidado los riesgos de un producto y tu tolerancia al riesgo en función de tus propias circunstancias financieras. Para más información, consulta nuestras Condiciones de uso y la Declaración de riesgos.