Sử dụng token của Claude Code cao gấp tới 30 lần so với các mô hình khác trong bài kiểm tra Agent Framework

icon MarsBit
Chia sẻ
AI summary iconTóm tắt
Các danh sách token mới gần đây đã được đội ngũ Composio thực hiện bài kiểm tra chuẩn, so sánh việc sử dụng token trên ba khung công tác tác nhân—Claude Code, Hermes và Kimi Code—bằng mô hình Kimi K3 trên 28 tác vụ giống nhau. Tin tức về việc ra mắt token cho thấy Claude Code đã sử dụng nhiều hơn tới 30 lần số token so với các đối thủ khác, với trung vị là 340.000 token so với 61.000 token của Kimi Code. Chi phí đạt tới $2 mỗi tác vụ đối với Claude Code, so với $0,22 cho Kimi Code. Bài kiểm tra cho thấy thiết kế tác nhân ảnh hưởng đáng kể đến hiệu quả và chi phí token.

Mọi người đều nói Claude Code tốn quá nhiều Token, vậy nó tốn đến mức nào? Cuối cùng cũng đã có người tính ra con số cụ thể.

Gần đây, có một thí nghiệm so sánh thú vị đến từ đội ngũ Composio. Họ sử dụng cùng một mô hình Kimi K3, chạy riêng biệt trong ba khung agent khác nhau —— Claude Code, Hermes và Kimi Mã—— Đã kiểm tra tổng cộng 28 nhiệm vụ hoàn toàn giống nhau.

Sắp xếp mô hình

Kết quả là, tỷ lệ thành công của ba harness trong việc hoàn thành nhiệm vụ gần như nhau: Kimi Code thành công 22 trong số 28, Hermes là 21, Claude Code là 20. Sự chênh lệch không lớn.

Điều thực sự tạo ra sự khác biệt là lượng token tiêu thụ. Cùng một nhiệm vụ, khi chạy bằng các harness khác nhau, lượng token sử dụng có thể chênh lệch lên đến 30 lần!

The median is Kimi Mã code khoảng 61.000 token, Hermes khoảng 67.000, trong khi Claude Code tăng trực tiếp lên 340.000, gần bằng Kimi 6 lần mã.

Sắp xếp mô hình

Nhấn Kimi Với giá 3 USD cho mỗi triệu token đầu vào của K3 (trong luồng công việc agent, token đầu vào thường chiếm khoảng 95%), chi phí trung bình mỗi nhiệm vụ là: Kimi Mã 0,22 USD, Hermes 0,28 USD, trong khi Claude Code đã lên tới 2 USD. Sự khác biệt rất rõ ràng.

Về tốc độ cũng khác nhau. Thời gian trung vị, Hermes nhanh nhất, 179 giây; Kimi Mã 297 giây; Claude Mã 348 giây.

Vì vậy, nhanh nhất là Hermes, tiết kiệm token nhất là Kimi Mã, cả hai không trùng nhau.

Đội ngũ Composio đã rút ra một kết luận trực tiếp: nếu bạn muốn giảm chi phí cho agent, hãy xem xét trước tiên bạn đang sử dụng harness nào, thay vì vội vàng thay đổi mô hình. Dữ liệu của họ cho thấy chính harness đã có thể làm chênh lệch chi phí lên đến 9 lần, trong khi khả năng biểu hiện của các mô hình thực tế gần như tương đương.

Sắp xếp mô hình

Sebastian Raschka cũng đã đăng bài sau khi thấy kết quả này, cho biết điều này tương tự với quan sát trước đây của ông khi sử dụng Qwen3.6: Claude Code thường sử dụng lượng token gấp 2 đến 3 lần so với nhiều harness khác trong khi tỷ lệ thành công tương đương.

Sắp xếp mô hình

Anh ấy đưa ra một vài nguyên nhân có thể xảy ra: liệu có phải do chưa được tối ưu hóa nhiều? Có lỗi không? Hay được thiết kế cố ý như vậy (vì có thể hữu ích trong các nhiệm vụ khó hơn)? Anh ấy cho biết cần dành thêm thời gian để kiểm tra kỹ lưỡng.

Sau đó, anh ấy bổ sung những quan sát của mình khi viết bài về agent mã hóa cục bộ vào tháng trước. Khi đó, anh ấy đã phân tích lý do tại sao Claude Code sử dụng nhiều token hơn và phát hiện ra sự khác biệt chủ yếu nằm ở token đầu vào, chứ không phải token đầu ra. Nói cách khác, Claude không viết nhiều hơn gấp đôi nội dung. Nhật ký cho thấy, trong các tương tác đa vòng, harness của Claude liên tục đưa thêm ngữ cảnh vào mô hình, bao gồm các tin nhắn trước đó, các lời gọi công cụ, đầu ra lệnh và nội dung tệp. Ví dụ, trong một lần chạy, Claude sử dụng khoảng 578.000 token đầu vào nhưng chỉ tạo ra khoảng 4.500 token đầu ra, trải qua 25 vòng. Do đó, lời giải thích có khả năng cao hơn là harness của Claude trong quá trình chạy agent đa bước sẽ tích lũy hoặc tính toán một lịch sử prompt đầu vào lớn hơn.

Sắp xếp mô hình

Các kết quả kiểm tra này dường như tiết lộ một xu hướng không thể bỏ qua: tầm quan trọng của harness đã không kém gì so với chính mô hình.

Một bài báo gần đây (từ Writer, một công ty xây dựng nền tảng AI Agent cấp doanh nghiệp) đã hệ thống hóa điều này: nó chứng minh bằng thí nghiệm biến kiểm soát rằng việc thay đổi lớp harness mang lại hiệu quả cắt giảm chi phí lớn hơn so với việc thay đổi mô hình, và tất cả các mô hình đều được hưởng lợi.

Sắp xếp mô hình

Cụ thể, họ đã thực hiện một thí nghiệm “kiểm soát biến số” nghiêm ngặt: trong khi giữ nguyên 22 nhiệm vụ doanh nghiệp và 6 mô hình cơ sở (Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1, Palmyra X6), họ chỉ thay thế lớp sắp xếp — thay thế vòng lặp tác nhân sản xuất truyền thống bằng Harness do Writer tự phát triển.

Kết quả thí nghiệm cho thấy: chi phí trung bình cho mỗi nhiệm vụ giảm 41% (từ 0,21 USD xuống 0,12 USD), độ trễ trung vị giảm 44% (từ 48 giây xuống 27 giây), lượng Token tiêu thụ giảm 38% (từ 14,2k xuống 8,8k), trong khi chất lượng hoàn thành nhiệm vụ cơ bản giữ nguyên (0,78 → 0,81, do kích thước mẫu nhỏ nên được coi là không có sự khác biệt đáng kể). Về mặt hiệu quả chi phí, chất lượng đạt được trên mỗi USD tăng lên tới 82%, đồng thời số lượng nhiệm vụ hoàn thành trên mỗi triệu Token tăng từ 54,9 lên 92,0.

Vì vậy, sau khi mô hình trở thành “điện nước than”, thì harness mới là chiếc điều hòa quyết định hóa đơn tiền điện của bạn? Nói cách khác: trước đây có người nói “mô hình là sản phẩm”, bây giờ là “harness là sản phẩm”?

Sắp xếp mô hình

Since harness is so important, shouldn't the subsequent accounting be more detailed?

Một số người chỉ ra rằng chúng ta cần bổ sung mục “thuế harness” vào các benchmark hiện có, đặc biệt khi xem xét rằng khoản thuế này không tăng tuyến tính khi công cụ gọi và thử lại rơi vào vòng lặp.

Sắp xếp mô hình

Nói cách khác, trong cuộc thi agent tương lai, hiệp một là so sánh “có thể làm được hay không”, còn hiệp hai sẽ là so sánh “làm cùng một việc, ai tiết kiệm hơn” – và bí quyết tiết kiệm nằm không ở mô hình, mà ở harness.

Sắp xếp mô hình

Trong quá trình chạy Agent, bạn có từng có trải nghiệm tương tự không? Hãy cùng thảo luận ở phần bình luận.

Bài viết này đến từ tài khoản WeChat “Machine Heart” (ID: almosthuman2014), tác giả: Machine Heart

Tuyên bố miễn trừ trách nhiệm: Thông tin trên trang này có thể được lấy từ bên thứ ba và không nhất thiết phản ánh quan điểm hoặc ý kiến của KuCoin. Nội dung này chỉ được cung cấp cho mục đích thông tin chung, không có bất kỳ đại diện hay bảo đảm nào dưới bất kỳ hình thức nào và cũng không được hiểu là lời khuyên tài chính hay đầu tư. KuCoin sẽ không chịu trách nhiệm về bất kỳ sai sót hoặc thiếu sót nào hoặc về bất kỳ kết quả nào phát sinh từ việc sử dụng thông tin này. Việc đầu tư vào tài sản kỹ thuật số có thể tiềm ẩn nhiều rủi ro. Vui lòng đánh giá cẩn thận rủi ro của sản phẩm và khả năng chấp nhận rủi ro của bạn dựa trên hoàn cảnh tài chính của chính bạn. Để biết thêm thông tin, vui lòng tham khảo Điều khoản sử dụngTiết lộ rủi ro của chúng tôi.