ChainThink melaporkan, pada 1 Ogos, syarikat infrastruktur AI Agent, Composio, memperluaskan ujian dengan menghubungkan Kimi K3 yang sama ke enam kerangka Agent dan menyelesaikan 26 tugas yang sama.
Perbandingan kali ini dilakukan terhadap kerangka kerja, dengan model dasar semuanya Kimi K3. Hasil ujian menunjukkan bahawa Kimi Code menyelesaikan 21 tugas, menduduki tempat pertama; Hermes menyelesaikan 20 tugas;
Pi Agent dan Claude Code masing-masing menyelesaikan 19 tugas; OpenCode menyelesaikan 18 tugas; Codex menyelesaikan 17 tugas.
Berdasarkan anggaran harga rasmi Kimi K3, Hermes dan Pi Agent mempunyai kos purata terendah setiap tugas, masing-masing sebanyak $0.39 dan $0.40;
Claude Code berharga $1.47, kira-kira 3.8 kali ganda Hermes. Dari segi kelajuan, masa median tugas tunggal Pi Agent ialah 161.7 saat, manakala Claude Code ialah 347.6 saat.
Ujian menunjukkan bahawa apabila menukar kerangka kerja di bawah model yang sama, bilangan tugas berjaya berbeza sehingga 4, kos purata berbeza hampir 4 kali ganda, dan masa yang diambil berbeza lebih daripada 2 kali ganda.
