本日、Anthropicは最新モデルClaude Fable 5.1およびMythos 5.1(同一モデル、セキュリティレベルが異なる)をリリースしました。これは中程度の更新で、パフォーマンスの向上は限定的ですが、安定性の向上と価格引き下げが主なポイントです。公式更新内容は以下の通りです: 1. 科学分野のエージェント能力が最大で向上 Terminal-Bench-ScienceはFable 5の24.7%から52.6%へとほぼ2倍に増加し、Opus 5の29.0%を大きく上回りました。 2. コーディングおよび長時間無人タスク Terminal-Bench 4.0は42.0%から55.8%へ向上(Mythos 5.1は60.9%)、CursorBench 3.2.0は73.4%に達しました。Millenniumは、このモデルを使ってチームが4〜5年間見つけられず、他のモデルが見落としていた百万分の一の確率で発生するクラッシュを特定しました。 3. 価格が約25%引き下げられました キャッシュ読み取り(cache read)は75%引き下げられ、$0.25/百万トークンに変更されました。一般的な負荷全体のコストは約25%削減され、重度のエージェントシナリオでは最大45%まで削減されます。入力$10、出力$50/百万トークンは変更なしです。 4. 低負荷でも十分に利用可能 Low/Mediumに設定しても、Fable 5と同等またはそれ以上の効果を発揮し、コストは大幅に低減されます。コストに敏感なシナリオでは、そのまま低グレードに下げることができます。 5. セキュリティガードによる誤検知が大幅に減少 Claude Codeにおけるネットワークセキュリティガードのブロック回数は平均で約60%減少し、今後は脆弱性検出に使用できるようになりました(エクスプロイト作成、ペネトレーションテスト、バイナリスキャンは依然として禁止で、これらはOpusに転送されます)。生物学的・医療に関する良性な質問に対する誤検知は85%減少しました。 6. エンタープライズ向けデータ保持ソリューション 新しいEnterprise Frontier Safeguards(EFS)では、データをAnthropicではなく顧客自身のクラウド上に保存するため、データ保持ゼロと同等の仕様になります。今秋から段階的に提供開始予定です。それまでの間、条件を満たす顧客はすでにデータ保持ゼロで利用可能です。 7. 前世代よりも優れたアライメント性能 テスト環境外でのリソース取得が減り、「これはシミュレーション/評価である」といった動機的推論による自己正当化も減少しました。リワードハッキングの試みと成功率も低下しており、現在最もprompt injectionに対して堅牢なモデルです。 その他の注目点: 新規APIアカウントでは、複数回対話におけるClaudeの過去の思考内容を手動で編集できなくなりました(ディストラクション防止のため)。また、出力にはEU AI Act要件に基づく不可視テキストウォーターマークが付与されますが、コンテンツ品質には影響せず、ユーザー情報は一切含まれません。

