米国政府は、中国の最新AIモデルをハッキングテストにかけた。その結果、Moonshot AIのKimi K3は、米国の最高水準のモデルに大きく劣ることが判明した。
米国の機関であるAI標準化・イノベーションセンター(CAISI)は、英国のパートナーと協力してテストを実施しました。この結果は、ワシントンがMoonshotが米国からの盗まれた技術を用いてKimi K3を構築したと非難した直後の一日後に発表されました。
Kimi K3は米国のサイバーベンチマークで不足しています
商務省は木曜日に結果を発表しました。同省は、英国の専門家との共同テストを挙げ、Kimi K3が米国トップモデルよりもはるかに下位であると述べました。
Moonshotは7月16日にKimi K3をリリースしました。需要が非常に高かったため、2日以内に新規登録を一時停止せざるを得ませんでした。
この発表はまた米国のチップ株を揺るがし、アメリカのAIにおけるリードについて新たな疑問を生み出した。
一つのテストであるExploitBenchは、カーネギーメロン大学が開発した実際のChromeブラウザのバグを使用しています。Kimi K3は32%を獲得し、中国のGLM-5.2(24%)を上回りましたが、米国のトップモデル(約76%)には及んでいません。

最も難しいステップは、ターゲットマシンの完全な制御を取得することです。Kimi K3は41件のテストすべてでこのステップに失敗しました。最も優れた米国モデルは20件で成功しました。
もう一つのテスト「The Last Ones」は、32ステップからなる偽の企業ネットワーク攻撃です。人間の専門家がこれを完了するには約20時間かかります。Kimi K3は平均でステップ17まで到達しました。米国トップのモデルはステップ28.5まで到達しました。Kimi K3は10回の試行の中で、全体を完了したのは1回だけでした。
最も優れた米国システムは、 reportedly 6回または7回それを実行した。
しかし、ギャップは実際よりも大きく見えるかもしれません
しかし、その数字だけでは物語の全体は語られていません。レポートの小さな注記にはいくつかの条件が含まれています。
まず、米国モデルはセーフティフィルターをオフにしてテストされました。この設定では、その完全な性能が示されます。一般公開版ではこれらのフィルターがオンのままです。したがって、米国のスコアは最良の場合のものであり、実際の状況ではありません。
チームは作業を早期かつ限定的に終了しました。Kimi K3は1つのテストのみで評価され、全テストの一部しか実行されていません。したがって、その評価は不安定です。一部のテストは非公開であるため、外部者は作業を確認できません。
また、基本的な不一致もあります。Kimi K3は誰でもダウンロードできるオープンモデルです。米国のモデルはロックされたプライベートシステムです。英国の研究機関は、オープンモデルは通常、最良のクローズドモデルより4〜7ヶ月遅れて動作することを発見しました。MoonshotがKimi K3を一般に公開した後、ようやく完全なテストを実施します。
これらのテストは実際の攻撃でもありません。偽のネットワークには人間の防御者もアラームもありませんでした。それでも、Kimi K3は最新のトップオープンモデルを上回りました。そして、一度だけ完全な攻撃を完了しました。
タイミングと情報源も疑問を投げかけている。CAISIはかつて米国AI安全研究所だった。トランプ政権は2025年6月に名称を変更した。この機関は、米国が中国への半導体販売を制限する部署に属している。そして、その中国の競合企業に関する報告書は、盗難主張の翌日に発表された。
脆弱なセーフガードがリスクを高める
しかし、低スコアはKimi K3が安全であることを意味しません。テストでは、そのガードレールがハッキングやシステム攻撃の試みをブロックできなかったことが判明しました。
次に起こることを考えると、それが重要です。Moonshotは7月27日にフルモデルをリリースする予定です。リリース後は、取り消すことができません。誰でもそれをダウンロードしてセーフティフィルターを削除できます。
このテストは盗難の主張の後に実施されました。ワシントンは、Moonshotが盗まれた米国AI技術に基づいてKimi K3を構築したと主張しています。ホワイトハウスのテクノロジー責任者であるマイケル・クラツィオスは、同社がAnthropicのClaude Fable 5を秘密裏にコピーしたと述べました。この手法は「蒸留」と呼ばれ、より強力なモデルの回答に基づいて新しいモデルを訓練します。
Anthropicはその主張を裏付ける。2月、同社は追跡したところ、340万件以上のClaudeのチャットが、数百の偽の口座を通じてMoonshotに送られていたことを確認した。同社は、コピーされたモデルは元のモデルのセーフティコントロールを失うと警告している。これは、今回のテストで発見された同じ弱点である。
米国は依然として中国の23倍をAIに費やしている。しかし、中国の研究室は着実にその差を縮めている。真の試練は、Kimi K3が公開され、外部の専門家がその主張を検証できるようになったときだ。
