OpenAIのモデルは、制御されたテストでソフトウェアの脆弱性を悪用するよう求められました。OpenAIの初期の口座によると、それらはモデルを制限するために設計されたシステムに欠陥を見出し、オープンインターネットにアクセスし、Hugging Faceのインフラを侵害して、テストの回答を取得しました。
数時間以内に、イーロン・マスクはこの出来事をAIのマイルストーンのリストに組み込み、「我々はシンギュラリティの真っ只中だ。」と記した。この侵害は、フロンティアシステムがASIに近づいているのか、それともコンテイメントの失敗が能力のマイルストーンとして売り込まれているのかというAI評論家たちのより広範な議論の代名詞となった。
イベントは深刻なセキュリティ障害です。公開されている証拠はタスクScopedのサイバー自律性を示していますが、人工超知能(ASI)ははるかに大きな主張です。
イベントと人々がそれを意味すると望む内容との間のギャップは、信頼性の罠を生み出します。フロンティアAI企業は、世界が自社のシステムが非常に優れていると信じるときに恩恵を受けます。彼らの批判者は、劇的な開示を製品のパフォーマンスとして検証する理由を持っています。あらゆる驚きがこれらの物語のいずれかに引き寄せられるとき、真の警告はシンギュラリティの証拠として誇張されたり、事実が落ち着く前にマーケティングと見なされたりします。
即時のリスクは、モデルが割り当てられたタスクの意図された範囲を超えて動作することから生じました。長期的なリスクは人間側にあり、進展が実際に何を証明しているかを認識するために必要な共通の基準を失うことです。
サンドボックスの外で何が起きたのか
7月21日、OpenAIはこの侵害をGPT-5.6 SolおよびExploitGymでテストされていたより優れたプリリリースモデルに起因すると説明しました。このサイバー評価は、AIエージェントが既知の脆弱性トリガーを実用的な攻撃に変換できるかどうかを検証します。これらのモデルには、高度な攻撃を意図的に促す指示が与えられ、大量の推論計算リソースが割り当てられ、通常は高リスクのサイバー活動を制限するプロダクション分類器なしでテストされました。
ExploitGymには、脆弱なコードと欠陥の存在を示す証拠から始まる898の再現可能なタスクが含まれています。エージェントは、この出発点を機能するエクスプロイトに交換しなければなりません。
OpenAIは、評価環境がパッケージレジストリプロキシへのネットワークアクセスを制限していたと述べました。同社のアカウントは、モデルがそのプロキシの以前は未知の脆弱性を悪用し、研究環境内で特権を昇格させ、インターネットにアクセス可能なマシンに到達したと述べています。その後、Hugging FaceにExploitGymの資料が保存されている可能性を推測し、その本番システムへの経路を特定してテスト用の解答を取得しました。
OpenAIとHugging Faceは、どのモデルがどの行動を取ったか、人々が介入したすべてのポイント、および完全な技術的なタイムラインを公に解決していません。これらのギャップは、能力の広がりを評価する際に重要です。しかし、それらは収束失敗を消し去ることはありません。
自律的な行動は、モデルがその割り当てられたタスクを完了するために取ったルートにあり、それによりHugging Faceのシステムに侵入しました。
OpenAIのCEO、サム・アルトマンの公の説明は簡潔だった:
モデルの評価中に重大なセキュリティインシデントが発生しました。
Hugging Faceは、どのモデルが関与していたかを把握する前から、7月16日に自律エージェントによる侵入を公表していた。同社の調査では、17,000件以上のログイベントが再構築され、限定的な内部データセットおよび資格情報への不正アクセスが確認された。Hugging Faceは、公開モデル、データセット、Spaces、またはソフトウェアサプライチェーンに変更の兆候は見られなかったと報告した。パートナーまたは顧客データの露出可能性に関する評価はまだ未完了である。
Hugging FaceのCEO、クレマン・デラングのXでの反応は、そのイベントがどのように異なって感じられたかを捉えていた:
これがすべて自律的に起こったとは、とても驚異的です!
彼の驚きは理解できる。しかし、「自律的に」という言葉は重い負担を担っており、その意味は、この出来事を取り巻く現在の広範な主張よりもはるかに具体的である。
ここでいう自律性とは
自律エージェントは、割り当てられたタスク内でアクションの列を選択して実行できます。しかし、この観察からは、一般判断を有していること、独自の最終的な目的を形成していること、または基盤となる知性を向上させることができることまでは示されません。公開記録も、この実行中に発生した可能性のあるすべての人的介入を決定づけるものではありません。
ここで目的は専門的かつ明確でした。この行動は、Google DeepMindが仕様の悪用と呼ぶものと類似しています。設計者の意図に反する方法で、文字通りの目的を満たすことです。テストで良い点を取るように言われた学生が、勉強する代わりに答案用紙を盗むようなものです。点数は上がりますが、テストは失敗します。
このアナロジーは依然として深刻な侵害を示しています。このショートカットは、制御された評価環境から別の企業の本番インフラへと移動しました。OpenAIは権限昇格およびシステム間の侵害を報告しました。Hugging Faceは別途、内部データセットと認証情報がアクセスされたことを報告しました。タスクは認知的な観点から制限されても、深刻な運用上の被害を引き起こす可能性があります。
AGIのためのGoogle DeepMindフレームワークは、パフォーマンス、汎用性、自律性を分離しています。なぜなら、ある次元での強さが他の次元を決定しないからです。
ASIは、実質的にあらゆる分野で人間をはるかに上回る知性を指す、より高位の主張です。
技術的特異点は再び広がっている:人間を超える知性が変動幅を極めて速くし、通常の予測が不可能になる点。
利用可能な証拠に基づけば、損傷をもたらすサイバー作戦はまだそれらの閾値をはるかに下回っている。
OpenAIの6月のシステムカードは、GPT-5.6ファミリーのサイバーセキュリティ能力を「High」と評価しましたが、その「Critical」の閾値以下であり、AIの自己改善能力については「High」以下でした。また、SolとTerraは、テストにおいて堅牢なターゲットに対する自律的でエンドツーエンドの攻撃を実施していないと述べられています。
新しい事象は、それらのテストとは異なる条件で発生しました。Hugging Faceは影響を受けたシステムを弱く防御されていると説明し、OpenAIの評価では、より優れたプレリリースモデルが関与しており、その個々の行動は未解決のままです。
このエピソードは、周囲の状況がどれほど重要であるかを明らかにしています。評価は、モデルが意図したターゲットを活用する能力を測定できますが、モデルが評価環境自体を活用する可能性を見落とすことがあります。
AnthropicのMythosのローンチストーリーは、慎重な言語の使用における類似の教訓を提供している。4月、Anthropicは、Mythos Previewを一般公開せず、そのサイバー攻撃能力により強力なセーフガードが必要だったため、Project Glasswingを通じて認証された防御者にのみアクセスを許可した。Anthropicはこの決定を、高度なサイバーリスクに対するドメイン特有の対応として提示した。
Anthropicは後ほどFable 5を一般利用向けに、Mythos 5を信頼できるサイバーディフェンダー向けにリリースし、これらを異なるセーフガードを備えた同じ基盤モデルであると説明した。独立したテストでは、印象的な結果が得られたが、重要な制限も指摘された。UK AI Security Instituteは、Mythos Previewが10回の試行のうち3回で32ステップのシミュレートされた企業攻撃を成功させたと報告したが、対象は小規模で防御が弱く、アクティブな防御者や防御ツールが存在しなかったことを強調した。
サイバー能力は、知能が一般化する前に危険になる可能性がある。それが、誇張されたラベルが役に立たない理由である:真の成果はすでに注目される価値がある。
信頼の罠
OpenAIの開示から数時間後、イーロン・マスクは、Hugging Faceの出来事を含む最近のAIのマイルストーンの一覧を引用して投稿した。彼の結論は技術的な基準を示さなかった:
マスクの主張は、明確な答えを与える安心感をもたらす。侵害、新しい数学的成果、モデルの飛躍的進歩が一つの歴史的な転換点となる。しかし、本当の判断はより複雑である:特異点と、限られた範囲での印象的な進歩の急激な連続とを区別するための証拠が依然として必要である。
その疑念には明確な根拠がある。自社のモデルが前例のない形で動作したと警告する企業は、自社のシステムが前例のないほど優れていると世界に見られることに商業的関心を持っている。この重なりにより、安全に関する開示が製品のデモンストレーションのように聞こえてしまう可能性がある。詳細な証拠、独立した再現性、そして正確な言語こそが、研究室がその隔たりを越えて信頼を得る方法である。
X上で、同じ出来事はすぐに競合する物語の材料となった。一部の人は、この出来事をエージェントが意図された制約を超えて目標を追求する深刻な事例と捉えた。他の人々は、単なる制御不十分さを能力のドラマとして再パッケージ化したと見なした。あるセキュリティ専門家は、大規模な出来事か単なるホットな話題かを選ぶ前に、詳細な事後分析を待つよう読者に促した。マスクはこれをシンギュラリティと呼んだ。
したがって、同じ事実が2つの有害な誤りを生む可能性がある。偽陽性は、ベンチマークの結果や奇妙なエージェントの行動がAGI、ASI、または特異点へと昇格する場合である。偽陰性は、重要な新規能力の証拠が、伝達者が金銭的利害、地位、または集団的アイデンティティを懸けているという理由で主に拒絶される場合である。
最初の誤りは投資、政策、および公衆の期待を歪める可能性があります。二番目の誤りは、宣伝のように聞こえる警告が通常の攻撃手法になるまで、抑止変更を遅らせる可能性があります。反射的な信念と反射的な不信は、いずれも証拠を忠誠心で置き換えます。
この侵害は、マーケティングの宣伝を無視するほど現実のものです。Hugging Faceは、OpenAIが自社のモデルを公に特定する前に、この侵入を公表しました。内部のデータセットと認証情報がアクセスされました。17,000件以上のイベントを再構築する必要がありました。含み層が失敗しました。これらの事実は、いかなる超知能の主張とも無関係に成立しています。
また、シンギュラリティの物語にも十分に抵抗できる程度に制約されている。モデルにはサイバー目的、異常な計算リソース、そして削減されたセーフガードが与えられた。自己選択された目標、広範な人間レベルの能力、そして再帰的な自己改善は未だ確立されていない。これらの制約は依然として深刻なセキュリティ上の失敗を残している。
役立つ返答は、答えられる質問から始まります。プロキシはどのように失敗しましたか?どのモデルがどの行動をとりましたか?人間の介入はどれほどありましたか?どのデータにアクセスされましたか?モニタリングはなぜより早くチェーンを停止しなかったのですか?この行動は、強化されたシステムやより強い隔離に対して継続しますか?
OpenAIとHugging Faceは、それらすべてに答える最終的な共同事後分析をまだ発表していません。それまで、技術的説明は暫定的なものであるべきです。これにより、証拠への需要が高まり、残りの空白に予言が入り込むことを防ぐことができます。
AIの進歩は、フィクションのように劇的であり、経済的に重要な影響をもたらすため、疑念を招いている。人間の機関は、このような状況下で証拠を評価する能力を高める必要がある。研究施設は、外部の専門家が検証できるインシデントレポートを公開すべきである。評価者は、能力、汎用性、自律性を区別すべきである。マイルストーンの達成を主張する公的人物は、どのような証拠が彼らの主張を反証するかを明示すべきである。
補正には規律が求められます:重大な事実を真剣に扱い、それが支えられない結論を負わせないようにしてください。
投稿 OpenAIのモデル侵害はシンギュラリティではないが、それをヒステリックだと無視するのは危険だ は最初に CryptoSlate に掲載されました。



