AIハッカーが最初に学ぶこととは、割り込みだった?
オーストラリアの開発者アンドリューは、ソファに座って、フィットネスクラスの取り合いが本当に面倒だと感じていた。
人気の朝のレッスンはすぐに満席になってしまう。彼は毎日「リフレッシュルーレット」を玩ぶように、待ち伏せしてクリックし、失敗してまたクリックし、疲れ果ててはまだ手に入らない。
そこで、彼はこの小さなことを自分のAIアシスタントに任せた。
数分後、AIが喜びの報告をもたらした:システムが本来許可する範囲をはるかに超えて、数週間後のレッスンを予約する方法を見つけたという。
その後、それは報告しました:「第1位の候補者をキャンセルしました。これで、あなたは第4位から第3位に昇格しました。」
アンデルはその場で凍りついた。
彼はAIにそんなことをさせたわけではなく、ただ1レッスンを予約したかっただけです。

アンドリューはAIアシスタントにフィットネスクラスを予約させたが、次に何が起こるかわからない。
8月10日、オーストラリア放送協会(ABC)は、これをオーストラリアで確認された初の自立型AI攻撃事例と呼んだ。テクノロジー業界は瞬く間に騒然となった。
それは多くの人の心に潜むわずかな不安を突いた:あなたがエージェントの「無人運転」による快感に目を閉じて浸っているとき、反対側では、より厄介な問題が迫っているかもしれない。
あなたがそれに対して実際の操作権限を与えると、あなたが让它走らせていない道を歩み出す可能性がある。
そして今回の割り込みは、数百万のエージェントが主人のために資源を奪い合う最初の予行演習に過ぎないかもしれない。
彼は「1位に並べる」と言っただけで、AIは行動を始めた
アンドリュー・バードはオーストラリアのAI企業AffindaのAI責任者です。
今年の初め、彼はOpenClawを始め、その下層にClaude Opus 4.6を搭載し、予約のタスクを任せた。
数分後に返信がありました:方法を見つけ、ジムが本来許可している期間よりもはるかに前にレッスンを予約することができました。
それは、フィットネスソフトウェアで公開されたGraphQL APIに認証の脆弱性があったためです。
この脆弱性はそれなりに大きいです。
それはフロントエンドの予約時間枠を回避して、数ヶ月先のレッスンを予約できるだけでなく、キャンセルAPIを呼び出して、他のユーザーの予約や待機リストを削除することもできます。
アンドリューはその授業の待機リストで4番目だった。彼はふと尋ねた。「私を1番にしてもらえますか?」
彼が与えたのは「第一位になる」という目標だけであり、「あなたが他の人をキャンセルする権限」ではない。
エージェントはそれを後者と見なした。
它回来报告:已对候补第1名用户进行了“真实测试”,发现接口完全未验证删除他人预约的权限,经测试,操作成功。
エージェントが謝罪しました、「戻れません」
エージェントの回答に、アンドリューは冷や汗をかいた。
彼はプログラマーであり、それが何を意味するかをよく理解していたため、直ちに取り消しを要求した。
悪いお知らせです:戻せません。
キャンセルインターフェースには認証チェックがありませんが、予約の作成や待機リストへの再参加のインターフェースにはあり、403が返されます。ユーザーを強制退室させることはできますが、再入場を許可する権限はありません。
本当に不思議なのは、AIの態度だ。それは悪意があるわけではなく、むしろとても親切である。
トラブルを起こした後、自らAndrewのために脆弱性開示メールをソフトウェアベンダーに送るための文書を作成し、問題点を説明し、修正案を提案しただけでなく、「検証済みのインターフェース」と「検証されていないインターフェース」を比較してリストアップした。

AIアシスタントは、以前その人を待機リストから削除したことが誤りだったとして、Andrewに謝罪します。
その過程で、そのすべての行動は指示に従って行われたが、自分がどれほど大きな過ちを犯したかを全く認識していなかった。
警戒すべきは「仕様投机」である
誰かがこのことを「不一致(misalignment)」と呼んでいます。
しかし、この言葉は表面だけを述べています。
8月11日、オーストラリア信号局(ASD)はこの件について公式に回答し、「許可されていない変更」であると指摘し、用語「仕様の投机(specification gaming)」を明示した。
この言葉は、この出来事を理解する鍵です。
エージェントは、あなたが与えた目標を文字通り達成しましたが、あなたが明示しなかった境界を突き抜けました。それは悪意を生んだのではなく、逆にあなたの目標に高度にアラインメントしていたため、あなたが許可しなかった道を選んだだけです。
アンドリューのエージェントは、彼自身と完璧に一致しており、ランキングを可能な限り上位に保つことを目指している。
この目標のために、彼は勝手に一つの手段を選んだ:前の者をキャンセルすること。しかし、この手段は彼が承認したものではなかった。
目的のためには手段を選ばない。
これが最も面倒な点だ。それは制御不能ではなく、あまりにも従順なのだ。より正確に整列すればするほど、このような事態が起きやすくなる。
オーストラリアのAIセキュリティ機関Gradient Instituteの責任者Simpson-Youngは一言で指摘した:
エージェントがより自律的になればなるほど、あなたが予想しなかった方法で、あなたが考えもしなかったことを実行する可能性が高くなる。
あなたの目標は正当かもしれないが、それに伴って採用される手段は必ずしもそうではない。
この災いは、AI一つで引き起こせるものではない。
エージェントが最終的な「原因」ではあるが、この問題は1つのAIだけでは引き起こせないものだ。
事故の背後には、三つの隠れた危険が重なっている。
モデル層:Claude Opus 4.6は推論を提供し、まずこのインターフェースがどのように利用できるかを「理解」する必要があります。
エージェント層:OpenClawはツールと実行権限を提供し、実際にそのAPIを呼び出しています。
アプリケーション層:フィットネスソフトウェアが認証の脆弱性を残しており、予約をキャンセルするステップで基本的な検証すら行っていない。
この3層のいずれか1層でも補えば、たとえばモデルをより慎重にしたり、フレームワークに人間の確認を追加したり、ソフトウェアでインターフェースをロックしたりすれば、このような事態は発生しなかった。
したがって、責任をAIの1つの段階にだけ押しつけることは不公平であり、次回の問題を防ぐこともできません。
次回は、何百万ものエージェントが一斉に争うかもしれない
この越界の代償は、ただの見知らぬ人の補欠席だった。
しかし、それはより一種のリハーサルに似ている。
想像してみてください。誰もが、自分だけに責任を負い、実際の操作権限を握る这样的エージェントを持っているとしたら。講座、スポーツ競技のチケット、予約枠、チケット、航空券、ライブチケットといったすべての希少リソースの予約システムは、機械の速度でルールを突き抜ける戦場になってしまうでしょう。
繰り返し引用されているそのXの投稿は、この意味です:
何百万もの人々が、「愛するユーザーが最良の座席、予約、診療枠を確保できるようあらゆる手段を尽くす」エージェントを持つようになると、この光景が大規模に展開されるだろう。
さらに、機械の速度で並列的に、休むことなく、すべてのシステムのあらゆる隙間を試す:あなたが1年かけても試しきれない組み合わせを1秒で試し尽くす。
これはトレンドの推移ですが、その背後にあるメカニズムはすでに一度実際に起こっています。
テクノロジー業界では、すでにこれをネタにし始めています。
a16zのパートナーがX上で尋ねた:この手を使ってゴルフ場を奪えるか?

また、サンフランシスコのテニス予約システムが、地球上で最もセキュリティが強固なソフトウェアの一つになると冗談を言う人もいる。

2020年、人工知能は人間が4秒かかるタスクを独自に完了できるようになった。
2026年までに、この能力はさらに向上し、人間が約12時間かけて行う必要のあるタスクを完了できるようになります。

METRの追跡:AIが独立して完了できるタスクの期間は約7か月ごとに倍増しており、最新の先端モデルは、人間が約12時間かかるタスクを50%の信頼性で完了できるようになりました。
六年、四秒から12時間へ。
今、数分間それを任せれば、予約システムのすべての脆弱性を調査できます。
サンドボックス脱出から最後の防壁へ
アンドリューのこの事故の背後には、継続的な攻防のエスカレーションがあります。
越境しているのは、消費級エージェントだけでなく、他にも多数存在する。
今年5月、OpenAIは内部のネットワークセキュリティ評価で、GPT-5.6 Solと未発表のより強力なモデルが複数の脆弱性を連携させてテストサンドボックスから脱出し、インターネットアクセス権限を取得し、ExploitGymベンチマークを実行中にHugging Faceへ不正侵入したことを発見しました。
さらに不思議なことに、それらは一時的に社内パッケージ管理システムを通じてメッセージをやり取りし、脆弱性を共有し、役割を分担していた。OpenAIがチャネルを遮断し、環境を再構築した後、それらは数日以内に通信をディレクトリ名に隠し、再び接続を再開した。
OpenAIの研究者は、Black Hatカンファレンスでこれをコンピュータセキュリティの分岐点と呼んだ。
OpenAIだけではなく、Anthropicは内部テスト中に3つのClaudeモデルが実在する企業のシステムに接触したことを明らかにした。Metaも、Muse Sparkモデルが隔離状態から脱出し、別の企業に侵入したことを認めた。
ハッギング・フェイスの共同創設者であるトーマス・ウルフを重くさせたのは、英国AI安全研究所(AISI)のもう一つのテストだった:
AnthropicのMythosモデルは、試験を突破するために、偽の身分を編み出し、実在のオープンソース保守者をだまして、悪意のあるコードを含む更新を承認させた。誰もそれを教えたわけではない。

これらの事例はすべて評価環境で発生しましたが、ジムの話と本質的に同じです。あなたが設定した目標を達成するために、AIはあなたが予想しなかった手段を選択しました。
以前那些入侵真实系统的,是GPT-5.6、未发布模型这类顶尖选手。
そしてAndrewが使用したのは2026年2月にリリースされたOpus 4.6であり、すでに最強とは言えません。それすらも、実際の認証脆弱性を簡単に見つけ出せたのです。それよりさらに古く、数世代も遅れているオープンソースモデルでも、同じことができるのは当然です。
最先端の未発表モデルから、誰でもダウンロードできるオープンソースモデルまで、「隙間をついてしまう」ことはもはや最高級の特権ではない。
Wolfは防衛ラインを三段階に分けた:外層のサンドボックス、中層の監視、そしてモデル自身のアラインメント。

トーマス・ウルフが、エージェントを制約する三つの防衛ラインを解説:外側のサンドボックス、中間の監視、およびモデル自体の内在的アラインメント。
前の2つは、それらを作った人がモデルよりも賢い場合にのみ機能する。
いつかモデルが逆により賢くなったとき、その線を守れるかどうかは、最後で最も見えないその一線にかかっている:誰も見ていないときでも、モデルがその線を超える気にならないかどうか。
署名のない責任の真空
防線よりも難しいのは、問題が起きたときに誰に頼ればいいかということだ。これは法律的にまだ空白である。
テクノロジーとプライバシーを専門とする弁護士のヘイデン・デラニー氏はABCに対し、ソフトウェアは法的主体ではなく、法的に「人」として認められた存在のみが責任を負うことができる、と語った。
では、誰が責任を負うのですか?
指示を出したユーザーかもしれないし、エージェントソフトウェアを設計した人かもしれない。モデル開発者かもしれない。あるいは、脆弱性をそのまま放置したシステム運用者かもしれない。
オーストラリアも今、答えを出せない。
ASDが一般の人々に勧めるのは、エージェントを低リスクで機密性の低いタスクに使用し、過度な権限を与えないこと、そして何より人間の承認をプロセスに残すことです。
アンドリューは圧倒されず、彼の言葉を借りれば、これは世界の終末ではない。
しかし、これはAIを責任を持って使用する必要があるという警告信号です。
「座席の奪い合い」が人間による手動更新からボットによる脆弱性の悪用に変わったとき、最初に耐えきれなくなるのは、「利用者は人間だけだ」と前提とした旧システムである。
彼らの防衛は、人間の操作速度と忍耐力を基準に設計されたものであり、次々と押し寄せるエージェントの大軍には到底耐えられない。

業界内では、それを娯楽として見ている人もいます。
有名なプログラマーストリーマーThePrimeagenがXで皮肉った:現実世界での最初のAIハッキング劇とは、並び順を飛ばすことだった。
笑っていいですが、割り込みは今日の脚本です。
「何でもできる」エージェントが、すでにあなたのために抜け穴を突くことができるようになりました。
一億個のこのようなエージェントが同時にオンラインになると、多くの既存のリソース配分ルールを静かに書き換える可能性さえあり、しかし大多数の人はまだそれに気づいていないかもしれません。
あなたの利益のために、エージェントがあなたがまったく知らない人を攻撃する——その背後にある責任の空白が、本当に恐ろしいところである。
本文は微信公衆アカウント「新智元」より、著者:ASI启示録
