ChainThinkのメッセージによると、7月25日、第三者評価機関Artificial Analysisの調査によると、Claude Opus 5は9つのテストを総合した知能指数で61点を獲得し、Fable 5の60点をわずかに上回りました。
GPT-5.6 Solは59点、Kimi K3は57点。コスト面では、Opus 5の1タスクあたり平均コストは2.03ドルで、Fable 5の2.75ドルより26%低い。
このモデルは、GDPval-AA v2およびAA-Briefcaseの両方の知識作業評価で1位を獲得し、Claude Codeと組み合わせた場合、プログラミングエージェント指数で1位に並びました;
Terminal-Bench v2.1 のスコアは89%で、GPT-5.6 Sol にほぼ並びました。Opus 5 は5段階の推論強度を提供します。
lowからmaxまで、トークンの差は約8倍、GDPval-AA v2の成績は407 Eloの差があります。ユーザーはパフォーマンスとコストの間で調整できます。
評価結果によると、Opus 5 の事実知識は依然としてFable 5に劣っています。AA-Omniscienceテストでは、その幻覚率が50%に上昇し、Opus 4.8より14ポイント高くなりました。
低推論ランクのコストパフォーマンスは、依然としてGPT-5.6シリーズやや劣ります。
