ChainThink thông báo, ngày 1 tháng 8, công ty cơ sở hạ tầng AI Agent Composio mở rộng thử nghiệm, kết nối cùng một Kimi K3 vào 6 khung Agent và hoàn thành 26 nhiệm vụ giống nhau.
Đối tượng so sánh lần này là khung chạy, mô hình nền tảng đều là Kimi K3. Kết quả kiểm tra cho thấy, Kimi Code hoàn thành 21 nhiệm vụ, đứng đầu; Hermes hoàn thành 20 nhiệm vụ;
Pi Agent và Claude Code đều hoàn thành 19 nhiệm vụ; OpenCode hoàn thành 18 nhiệm vụ; Codex hoàn thành 17 nhiệm vụ.
Theo ước tính giá chính thức của Kimi K3, Hermes và Pi Agent có chi phí trung bình mỗi nhiệm vụ thấp nhất, lần lượt là 0,39 USD và 0,40 USD;
Claude Code có giá 1,47 USD, khoảng 3,8 lần giá của Hermes. Về tốc độ, thời gian trung vị để Pi Agent hoàn thành một nhiệm vụ là 161,7 giây, trong khi Claude Code là 347,6 giây.
Kết quả kiểm tra cho thấy, khi thay đổi khung làm việc trên cùng một mô hình, số lượng nhiệm vụ thành công chênh lệch nhiều nhất 4 nhiệm vụ, chi phí trung bình chênh lệch gần 4 lần và thời gian tiêu tốn chênh lệch hơn 2 lần.
