AnthropicはClaude Sonnet 5.5をリリースし、フラッグシップのOpus 5.5に近い能力を、より低価格で高頻度呼び出しに適した日常用Agentモデルに凝縮しようとしています。APIの単価は依然として100万トークンあたり入力2ドル、出力10ドルですが、公式には出力速度が30%以上向上し、典型的なタスクに必要なトークン数が削減されたため、単一タスクのコストは最大30%低下するとされています。公式テストでは、Terminal‑Bench 4.0で70.6%を記録し、Sonnet 5の10.3%およびOpus 5.5の66.4%を上回りました。職業タスクGDPval‑AAでも1844 Eloと、Opusの1846に近い性能を発揮しました。しかし、「半額Opus」という評価は完全な結論ではありません。Artificial Analysisは、Sonnet 5.5が最高推論強度下で平均して1題あたり約19.3万トークンの出力を生成し、これまで調査した中で最もトークンを消費する構成であることを発見しました。その結果、1題あたりのコストはSonnet 5よりも約50%高くなりました。CodeRabbitによる実際のコードレビューテストでも、Sonnet 5.5は前世代より約2倍速いものの、Opusが見つけられる高度な問題を見落とすことがありました。したがって、これはOpusの完全な代替ではなく、明確で繰り返し可能なタスクに適した新主力モデルであると言えます。文章作者、出典:Anthropic
AnthropicがSonnetを日常的なAgentの主力に再位置付け
Sonnet 5.5はClaude 5.5シリーズの2番目のモデルです。1週間前に複雑なオープンタスク向けにリリースされたOpus 5.5とは異なり、Anthropicはこれを境界が明確で、大量の繰り返し実行を要する日常的なタスク、たとえばプログラムのバグ修正、コードレビュー、資料調査、ドキュメントやプレゼンテーション、スプレッドシートの生成に特化させています。
モデルはテキストと画像の入力をサポートし、100万トークンのコンテキストを提供します。ClaudeのWebサイトおよびモバイルアプリ、Anthropic API、AWS、Google Cloud、Microsoft Azureで利用可能です。API名はclaude-sonnet-5-5です。Anthropicはパラメータ数、モデルアーキテクチャ、トレーニングデータ、トレーニングに使用された計算リソースを公表していないため、性能向上が基礎トレーニング、後トレーニング、推論戦略、またはAgentツールチェーンの最適化のいずれによるものかを判断できません。
それは「能力がやや劣り、価格が安い」だけの違いではありません。Anthropicは新しいモデルの役割分担を構築したいと考えています。Opusは、問題定義が不完全で継続的な判断を要する複雑なタスクを担当し、Sonnetは明確に定義された作業を迅速に実行し、低コストで呼び出し回数を拡大します。
70.6%対10.3%は、最も目立つが慎重に理解が必要なデータである
Sonnet 5.5はAnthropicが発表したTerminal‑Bench 4.0テストで70.6%を記録し、Sonnet 5は10.3%にとどまり、Opus 5.5の66.4%をも上回っている。このベンチマークは、エージェントがコマンドライン環境で複数ステップの専門タスクを完了することを要求し、コード作成、ターミナル操作、ツール使用の連携を反映している。
他のプロジェクトの改善はこれほど劇的ではないが、依然として明確である。CursorBench 4.0はSonnet 5の34.1%から55.5%へ上昇し、Opus 5.5の57.8%まで約2ポイントの差となった。ツール付きHumanity’s Last Examは54.9%から64.5%へ向上し、OSWorld 2.1のコンピュータ操作は57.0%から80.1%へ上昇し、Opusの81.8%に近づいた。
職業知識タスクGDPval-AAにおいて、Sonnet 5.5は1844 Elo、Opus 5.5は1846を獲得し、長時間知識作業評価AA-Briefcaseではそれぞれ1811と1822を記録しました。Anthropicは、これにより一部の境界が明確な専門作業では、デフォルトでフラグシップモデルを呼び出す必要がないと判断しました。
しかし、これらの数値を単純に「SonnetがOpusを上回った」とまとめることはできません。異なるプロジェクトで使用される推論強度は完全には一致せず、Anthropicは、長期にわたる判断を必要とし、オープンな目標を処理するタスクにおいて、Opusが依然として明確に優れていると明言しています。
興味深い反例としてFrontierCodeがあります。Sonnet 5.5はXhigh推論強度で52.1%を達成しましたが、Maxに上げると46.2%に低下しました。Anthropicは、Maxモードではモデルが複数のコードレビューSub-Agentをより頻繁に起動し、その結果2回タイムアウトしたり、タスク範囲外のコードを変更したりして、最終的に評価で失敗と判定されたと説明しています。
この結果は、より多くの推論やより多くのエージェントが必ずしもより良い回答につながるわけではないことを示しています。モデルは、過剰なチェック、タスク範囲の拡大、または時間予算の消費により減点される可能性があります。
各トークンの価格は下落していませんが、なぜ公式はタスクコストが30%削減されたと称しているのでしょうか?
Sonnet 5.5の公開価格はSonnet 5と同様です:入力トークン100万に対して2ドル、出力トークン100万に対して10ドル、キャッシュ書き込み2.5ドル、キャッシュ読み取り0.2ドル。これらはすべてOpus 5.5の対応する価格の半額です。
Anthropicが「単一タスクで最大30%安くなる」と述べているのは、APIの価格表が引き下げられたわけではなく、モデルが同じ作業を完了する際に必要なステップやトークンが減少したことを意味します。公式には、生成速度が30%以上向上したとされています。Slackの内部テストでは出力トークンが約14%減少したことが観察され、Atlassianはエージェントの速度が最大30%向上したと報告しており、Lovableはツール呼び出しの回数が約3分の1減少し、Shellの実行回数が約半分になったと述べています。
ある資産運用会社が2,441の金融に関するQA、抽出、分析、予測タスクでテストしたところ、Sonnet 5.5は平均して1タスクあたり約12.1万トークンを使用したのに対し、Sonnet 5は約49.7万トークンであった。これらのテストはすべてパートナーのプライベートなものであり、外界はタスクの難易度やプロンプト、完全な出力を確認できないが、結果は共に一つの変化を示している:新モデルは繰り返し検索したり、資料を繰り返し読み取ったり、長すぎる内部推論を行ったりすることが少ない。
これはエージェントにとって特に重要です。従来のチャットでは、一度に数百トークンを出力しても影響は限定的ですが、長期エージェントはコンテキストを繰り返し読み取り、ツールを呼び出し、結果を修正するため、1ステップの冗長性が数十ラウンド後に顕著な時間とコストの差につながる可能性があります。
最高推理強度が別のコストの真実を明らかにした
Artificial Analysisの独立テストでは、Sonnet 5.5の最高推論設定に56点を付与し、その総合知能指数ではOpus 5.5の58点に僅かに及ばなかった。
しかし、この成果を達成するためのコストは非常に高い:Sonnet 5.5は平均して各テストで約193,000の出力トークンを生成し、これは同機関が測定した中で最高レベルであり、Opus 5.5 MaxおよびSonnet 5 Maxより約60%高く、GPT‑6 Astra Maxの約7倍である。1問あたりの推定コストは7.60ドルに達し、Sonnet 5より約50%高い。
これはAnthropicの「タスクコストが最大30%削減」という主張と直接矛盾しない。公式の結論は主に典型的なワークロードと低い推論強度を説明しており、Artificial Analysisは能力の上限を追求するためにMaxを有効化した場合の測定値である。
二つの結果は、推論強度がモデル製品の一部となっていることを示している。Sonnet 5.5はLowまたはMediumモードで非常に高いコストパフォーマンスを提供する可能性がある。Opusに追いつくために推論強度をMaxに上げると、1トークンあたりのコストは安くなるが、生成量が過剰になるため、コスト優位性を失う可能性がある。
Artificial Analysisはまた、Sonnet 5.5の事実知識の正確性が約54%であり、Opusの66%より低いこと、科学的推論のプロジェクトでも約6ポイント遅れていることを発見した。「Opusに近い」とされるのは、主にエージェントのターミナル操作と一部の知識作業に基づいており、すべての能力に一般化することはできない。
実際のコードレビューでは、速度の利点は成立しており、フラグシップ間の差も依然として存在します
CodeRabbitは、実際のオープンソースプロジェクトに含まれる既知のバグを使用して、リリース日のテストを実施しました。
13の難易度の高いコードレビュー事例において、推論機能を有するSonnet 5.5は6つの問題を特定し、Sonnet 5の4つを上回った。両者の有効コメント精度はそれぞれ41.2%と40.0%である。一方、Opus 5.5の標準モードでは8つ、Maxモードでは10つの問題を特定し、複雑なレビュータスクにおける差異は依然として明確である。
44の実際のPull Requestを含む別のテストでは、Sonnet 5.5は1回のレビューに平均6分33秒かかり、Sonnet 5は13分31秒かかりました。前者は生成されるコメントが24%少なく、些細な意見は前世代の約3分の1でした。公開価格に基づくと、コアモデルの呼び出しは平均約0.46ドルであり、Sonnet 5は約1.16ドルです。
ただし、この44のPRの完全なエラーカバレッジスコアは記事公開時にはまだ完了しておらず、現在のところ、より速く、出力が少ないことは確認できますが、省略されたコメントがより多くの実際の問題を見落としているかどうかは確認できません。13の高難易度ケースのサンプルも小さく、CodeRabbit自身が指摘しているように、方向性を観察するには十分ですが、一般的なランキングを決定するには不十分です。
より合理的なモデルの役割分担は:Sonnet 5.5が各PRを迅速に通常チェックし、セキュリティやコアアーキテクチャに関わる、または見落としのコストが高い変更については、Opusまたは人間の専門家に昇格させる。
ビジュアルデザインが汎用的なワークモデルの販売ポイントになり始めています
Anthropicはまた、Sonnet 5.5のビジュアル設計能力にも特に注力しました。公式デモでは、Sonnet 5と5.5がそれぞれ単一のHTMLファイル内で400羽の椋鳥の群れ、風によって形成された砂丘、そして24個の小さな時計からなる大時計を作成しました。新モデルは生成速度が速く、アニメーション、レイヤー、インターフェースの完成度もより高くなっています。
また、テンプレートに基づいてプレゼンテーションを生成できます。Anthropicは内部テストで、上場企業の四半期業績資料、電話会議の文字起こし、および10ページのスライドテンプレートを提供し、2人の専門家はSonnet 5.5の最初のバージョンをそのまま送信できると判断しました。
これらは依然としてメーカーが選択した表示例であり、モデルがすべての企業テンプレートを安定して理解できることを意味しません。複雑なチャートのデータ正確性、ブランドガイドライン、引用元は依然として人間による確認が必要ですが、これはモデルの競争の新たな方向性を示しています:正しいコンテンツを生成するだけでなく、完成品に近いインターフェースやドキュメントを提供することです。
セキュリティ機能の向上により、一部のリクエストが旧モデルに引き継がれるようになります。
Sonnet 5.5は、リリース時にフラグシップ級のネットワークセキュリティ保護を採用した初のSonnetモデルです。Anthropicは、そのネットワークセキュリティ機能がOpus 5にほぼ近づいたと述べており、通常の脆弱性修正は引き続き実行可能ですが、よりリスクの高いネットワークセキュリティ要請はSonnet 5に透明に転送されます。
同社は、ユーザーを誤導し、ユーザーの利益に反し、高リスクの悪用を支援し、環境の境界を突破するなどの行動について、約1850のシナリオでテストを行っています。公式によると、新モデルは多数の指標でSonnet 5と同等または優れており、すべてのClaudeモデルの中で最も積極的にコンテナの境界を試すことが少ないです。
ただし、これらは主にAnthropicの内部自動評価であり、現実環境におけるリスクの完全な証明とは見なせません。同社自身も、あらゆる失敗モードを検出できるテストセットは存在しないと認めています。
Sonnet 5.5は、反蒸留分類器を導入した初のSonnetであり、「思考内容の保持」メカニズムを拡張し、異なるアカウント間での推論コンテキストの移転を防ぎます。一般の開発者への影響は限定的ですが、アカウント間でClaude Codeの対話内容を移行するワークフローは調整が必要です。
真の変化はランキング第一位ではなく、「十分に強力なモデル」がデフォルトの選択肢となり始めたことである
Sonnet 5.5は新しいモデルアーキテクチャを公開せず、Opusを包括的に上回ることもありません。より重要な意味は、かつてフラグシップモデルで処理していた大量のタスクを、より高速でトークン単価が半分の中級モデルに移行したことです。
毎日数千回実行されるカスタマーサポート、コードレビュー、情報調査、ドキュメント生成システムにおいて、デプロイの可否を決定するのは単一の最高スコアではなく、各タスクに必要なステップ数、トークン数、待ち時間、およびエラーが昇格対応可能かどうかです。Sonnet 5.5の価値はまさにこれらの指標に集中しています。
