Pesan ChainThink, 22 Juli, Artificial Analysis memperbarui daftar AA-Briefcase, Kimi K3 mendapat skor 1543 Elo, hanya di bawah Claude Fable 5 dengan 1574, dan lebih tinggi dari GPT-5.6 Sol dengan 1501, Claude Sonnet 5, dan Claude Opus 4.8.
AA-Briefcase memerlukan model untuk mencari informasi dari hampir 2.000 email, rekaman Slack, dan dokumen perusahaan, serta menyampaikan tabel, presentasi, dan prototipe antarmuka, mencakup 4 proyek jangka panjang dan 91 tugas rahasia.
Dalam hal rincian, tingkat kelulusan persyaratan objektif K3 adalah 51%, lebih rendah dari 56% Fable 5; skor kualitas analisis adalah 1754, sedikit lebih tinggi dari 1744 Fable 5.
K3 memiliki kesenjangan utama dalam presentasi produk jadi, lebih rendah daripada GPT-5.6 Sol dan Opus 4.8. Dari segi biaya, K3 menghabiskan rata-rata 10,57 dolar AS per tugas, sekitar 10 kali lipat dari Kimi K2.6;
Rata-rata menyelesaikan 83 putaran, menghasilkan 120.000 token, memakan waktu 56,4 menit, atau sekitar 2,5 kali lebih lama daripada Fable 5 untuk menyelesaikan tugas sejenis.
