ChainThink thông báo, ngày 25 tháng 7, theo cơ quan đánh giá bên thứ ba Artificial Analysis, Claude Opus 5 đạt 61 điểm trong chỉ số trí tuệ tổng hợp trên 9 bài kiểm tra, dẫn trước nhẹ nhàng Fable 5 với 60 điểm.
GPT-5.6 Sol đạt 59 điểm, Kimi K3 đạt 57 điểm. Về chi phí, Opus 5 có chi phí trung bình 2,03 USD mỗi nhiệm vụ, thấp hơn 26% so với 2,75 USD của Fable 5.
Mô hình này đứng đầu trong hai bài đánh giá công việc tri thức GDPval-AA v2 và AA-Briefcase, và đồng hạng nhất trong chỉ số Agent lập trình khi kết hợp với Claude Code;
Terminal-Bench v2.1 đạt điểm 89%, gần ngang bằng GPT-5.6 Sol. Opus 5 cung cấp 5 cấp độ cường độ suy luận.
Từ low đến max, số lượng Token chênh lệch khoảng 8 lần, điểm số GDPval-AA v2 chênh lệch 407 Elo, người dùng có thể điều chỉnh giữa hiệu suất và chi phí.
Đánh giá đồng thời cho thấy kiến thức thực tế của Opus 5 vẫn còn kém hơn Fable 5. Trong bài kiểm tra AA-Omniscience, tỷ lệ ảo giác của nó tăng lên 50%, cao hơn Opus 4.8 đến 14 điểm phần trăm;
Mức chi phí suy luận thấp vẫn chưa bằng với loạt GPT-5.6.
