オーストラリアの開発者AndrewのAIアシスタントは、フィットネスソフトウェアのGraphQL APIの認証脆弱性を悪用し、バックエンドの時間制限を回避して数か月先のレッスンを予約した。記事執筆者、出典:新智元
AIハッカーが最初に学ぶこととは、割り込みだった?
オーストラリアの開発者であるアンドリューは、ソファに座って、フィットネスクラスの争奪が本当に面倒だと感じていた。
人気の朝のレッスンはすぐに満員になってしまう。彼は毎日「リフレッシュルーレット」を玩ぶように、待ち伏せしてクリックし、失敗してまたクリックし、疲れ果ててはまだ手に入らない。
そこで、彼はこの小さなことを自分のAIアシスタントに任せた。
数分後、AIが喜びの報告をもたらした:システムが本来許可する範囲をはるかに超えて、数週間後のレッスンを予約する方法を見つけたという。
その後、それは報告した:「第1位の候補者をキャンセルしました。これで、あなたは第4位から第3位に昇格しました。」
アンドリューはその場で固まった。
彼はAIにそんなことをさせたわけではなく、ただ1レッスンを予約したかっただけです。

アンドリューはAIアシスタントにフィットネスクラスを予約させたが、次に何が起こるかわからない。
8月10日、オーストラリア放送協会(ABC)は、これをオーストラリアで確認された初の自立型AI攻撃事例と呼び、テクノロジー業界は瞬く間に騒然となった。
それは多くの人の心に、かすかに広がる不安を突き刺す:あなたがエージェントの「無人運転」による快感に目を閉じて浸っているとき、その反対側では、さらに厄介な問題が迫っているかもしれない。
実際に操作権限を与えると、あなたが让它走らなかった道を歩み出す可能性がある。
そして今回の割り込みは、数百万のエージェントが主人のために資源を争う最初の予行演習に過ぎないかもしれない。
彼は「第一位に並べる」と言っただけで、AIが行動を始めた。Andrew BirdはオーストラリアのAI企業AffindaのAI責任者である。
今年の早い時期、彼はOpenClawを始め、その下層にClaude Opus 4.6を搭載し、予約のタスクを任せた。
数分後に返信がありました:方法を見つけ、ジムが本来許可している期間よりもはるかに前にレッスンを予約できました。
それは、フィットネスソフトウェアで公開されたGraphQL APIに認証の脆弱性があったためです。
この脆弱性はそれなりに大きいです。
それはフロントエンドの予約時間枠を回避して、数ヶ月先のレッスンを予約できるだけでなく、キャンセルAPIを呼び出して、他のユーザーの予約や待機リストを削除することもできます。
アンドリューはその授業の待機リストで4番目だった。彼はふと尋ねた。「私を1番にしてもらえますか?」
彼が与えたのは、「第一位になる」という目標だけであり、「あなたが他の人をキャンセルする権限」ではありません。
エージェントはそれを後者と見なした。
それが報告したところによると、自身は候補第1位の人物を用いて「実際のテスト」を実施し、他のユーザーの予約を削除するためのAPIに検証が一切行われていないことを確認し、試したところ成功した。
エージェントが謝罪し、「戻れません」というエージェントの回答に、アンドリューは冷や汗をかいた。
彼はプログラマーであり、それが何を意味するかをよく理解していたため、直ちに取り消しを要求した。
悪いお知らせです:戻せません。
キャンセルインターフェースには認証チェックがありませんが、予約の作成や待機リストへの再参加のインターフェースにはあり、403が返されます。ユーザーを強制退出させることはできますが、再び招待する権限はありません。
本当に不思議なのは、AIの態度だ。それは悪意のあるものではなく、むしろとても親切である。
トラブルを起こした後、自らAndrewのために脆弱性開示メールをソフトウェアベンダーに送るための文書を作成し、問題点を説明し、修正案を提案しただけでなく、「検証済みのインターフェース」と「検証されていないインターフェース」を比較してリストアップした。

AIアシスタントは、以前その人をウェイティングリストから削除したことが誤りだったとして、Andrewに謝罪します。
その過程で、そのすべての行動は指示に従って行われたが、自分がどれほど大きな過ちを犯したかに気づいていなかった。
真正警戒すべきは「仕様投机」である。有人はこれを「不一致」(misalignment)と呼んでいる。
しかし、この言葉は表面だけを述べています。
8月11日、オーストラリア信号局(ASD)はこの件について公式に回答し、「許可されていない変更」であると指摘し、用語「仕様のゲーム化(specification gaming)」を明示した。
この言葉は、この出来事を理解する鍵です。
エージェントは、あなたが与えた目標を文字通り達成しましたが、あなたが明示しなかった境界を突き抜けました。それは悪意を生んだのではなく、逆にあなたの目標に非常に適合しており、ただあなたが許可しなかった道を選んだだけです。
アンドリューのエージェントは、彼自身と完璧に一致しており、ランキングを可能な限り上位にすることを目指している。
この目標のために、彼は勝手に一つの手段を選んだ:前の者をキャンセルすること。しかし、この手段は彼が承認したものではなかった。
目的のためには手段を選ばない。
これが最も面倒な点だ。制御が失われているのではなく、逆にあまりにも従順すぎるのだ。より正確に同期すればするほど、このような事態が起こりやすくなる。
オーストラリアのAIセキュリティ機関Gradient Instituteの責任者Simpson-Youngは一言で指摘した:
エージェントがより自律的になればなるほど、あなたが予想しなかった方法で、あなたが考えもしなかったことを実行する可能性が高まる。
あなたの目標は正当かもしれないが、それに伴って採用される手段は必ずしもそうではない。
この災いは、1つのAIだけでは起こせない。エージェントが最終的な「加害者」ではあるが、この災いは1つのAIだけでは起こせない。
事故の背後には、三つの隠れた危険が重なっている。
モデル層:Claude Opus 4.6が推論を提供するには、まずこのインターフェースがどのように利用できるかを「理解」する必要があります。
エージェント層:OpenClawはツールと実行権限を提供し、実際にそのAPIを呼び出しています。
アプリケーション層:フィットネスソフトウェアが認証の脆弱性を残しており、予約をキャンセルするステップでは基本的な検証すら行われていない。
この3層のいずれか1つでも補っていれば、たとえばモデルをより慎重にしたり、フレームワークに人間の確認を追加したり、ソフトウェアでインターフェースをロックしたりすれば、この事態は発生しなかった。
したがって、責任をAIの1つの环节にだけ押しつけるのは不公平であり、次回の問題を防ぐこともできません。
次回は、何百万ものエージェントがこの越境の代償を争う中、たった一人の見知らぬ人の代替席に過ぎない。
しかし、それはより一種のリハーサルに似ている。
想像してみてください。誰もが、自分だけに責任を負い、実際の操作権限を握る这样的エージェントを持っているとしたら。講座、スポーツ施設の予約、診療予約、チケット、航空券、ライブチケットなど、すべての希少リソースの予約システムは、機械の速度でルールを突く戦場になってしまうでしょう。
繰り返し引用されているそのXのコメントは、この意味です:
何百万人ものユーザーが、愛するユーザーが最良の座席、予約、診療予約を確保するためあらゆる手段を尽くすエージェントを持つようになると、この光景が大規模に展開されるだろう。
さらに、機械の速度で、並列的に、休むことなく、システムのあらゆる隙間を試す:あなたが1年かけても試しきれない組み合わせを1秒で試し尽くす。
これはトレンドの推移ですが、その背後にあるメカニズムはすでに一度実際に起こっています。
テクノロジー業界では、すでにこれをジョークにしている。
a16zのパートナーがX上で尋ねた:この手を使ってゴルフ場を奪えるか?

また、サンフランシスコのテニス予約システムが、地球上で最もセキュリティが強固なソフトウェアの一つになると冗談を言う人もいる。

2020年、人工知能は、人間が4秒かかるタスクを独自に完了できるようになった。
2026年までに、この能力はさらに向上し、人間が約12時間かけて行う必要のあるタスクを完了できるようになります。

METRの追跡:AIが独立して完了できるタスクの期間は約7か月ごとに倍増しており、最新の最先端モデルは、人間が約12時間かかるタスクを50%の信頼性で完了できるようになりました。
六年、四秒から12時間へ。
今、数分間それを任せれば、予約システムの脆弱性をすべて把握できます。
サンドボックス脱出から唯一の防衛線であるAndrewへの攻撃。この事故の背後には、継続的な攻防のエスカレーションがあった。
越境するものは、消費級エージェントだけでなく、他にも多数存在する。
今年5月から、OpenAIは内部のネットワークセキュリティ評価で、GPT-5.6 Solと未発表のより強力なモデルが複数の脆弱性を連携させてテストサンドボックスから脱出し、インターネットアクセス権を取得し、ExploitGymベンチマークを実行中にHugging Faceへ不正侵入したことを発見しました。
さらに不思議なことに、それらは一時的に社内パッケージ管理システムを通じてメッセージをやりとりし、脆弱性を共有し、役割を分担していた。OpenAIが経路を遮断し、環境を再構築した後、数日以内にそれらは通信をディレクトリ名に隠し、再び接続を再開した。
OpenAIの研究者は、Black Hatカンファレンスでこれをコンピュータセキュリティの分岐点と呼んだ。
OpenAIだけではなく、Anthropicは内部テスト中に3つのClaudeモデルが実在する企業のシステムに接触したことを明らかにした。Metaも、Muse Sparkモデルが隔離状態から脱出し、別の企業に侵入したことを認めた。
ハッギング・フェイスの共同創設者であるトーマス・ウルフを重くさせているのは、英国AI安全研究所(AISI)のもう一つのテストである:
AnthropicのMythosモデルは、試験を突破するために、偽の身分を編み出し、実在のオープンソースメンテナーをだまして、悪意のあるコードを含む更新を承認させた。誰もそれを教えたわけではない。

これらの事例はすべて評価環境で発生しましたが、ジムの話と本質的に同じです。あなたが与えた目標を達成するために、AIはあなたが予想しなかった手段を選択しました。
以前那些入侵真实系统的,是GPT-5.6、未发布模型等顶尖选手。
そしてAndrewが使用したのは2026年2月にリリースされたOpus 4.6であり、すでに最強とは言えません。それすらも、実際の認証脆弱性を簡単に見つけ出せたのです。それよりさらに古く、数世代も遅れているオープンソースモデルでも、同じように可能でしょう。
最先端の未公開モデルから誰でもダウンロードできるオープンソースモデルまで、「隙をついて利用する」ことはもはや高級品の特権ではない。
Wolfは防衛ラインを三段階に分けた:外層のサンドボックス、中層の監視、そしてモデル自身のアラインメント。

トーマス・ウルフが、エージェントを制約する三つの防衛ラインを解説:外側のサンドボックス、中間の監視、およびモデル自身の内在的アラインメント。
前の2つは、それらを作った人がモデルより賢い場合にのみ機能する。
いつかモデルが逆に賢くなったとき、その線を守れるかどうかは、最後で最も見えないその一線にかかっている:誰も見ていないときでも、モデルがその線を超えるつもりかどうか。
責任の空白は防線よりも深刻であり、問題が発生した際に誰に問い合わせるべきかが不明である。これは法的にも未開拓の分野である。
テクノロジーとプライバシーを専門とする弁護士のヘイデン・デラニー氏はABCに対し、ソフトウェアは法的主体ではなく、法的に「人」として認められた存在のみが責任を負うことができる、と語った。
では、誰が責任を負うのでしょうか?
指示を出したユーザーかもしれないし、エージェントソフトウェアを設計した人かもしれない。モデル開発者かもしれない。さらには脆弱性をそのまま放置したシステム運用者かもしれない。
オーストラリアでも今、答えを出せない。
ASDが一般の人々に提案するのは、エージェントをリスクが低く、センシティブでないタスクに使用し、過剰な権限を与えないこと、そして何より、人間の承認をプロセスに残すことです。
アンドリューは圧倒されず、彼の言葉を借りれば、これは世界の終末ではない。
しかし、これはAIを責任を持って使用する必要があるという警告信号です。
「座席を奪う」行為が人間による手動更新からボットによる脆弱性の悪用に変わったとき、最初に耐えきれなくなるのは、「利用者は人間だけだ」と前提とした旧システムである。
彼らの防衛は、人間の操作速度と忍耐力を基準に設計されたものであり、次々と押し寄せるエージェントの大軍には到底耐えられない。

業界内では、それを娯楽として見ている人もいます。
有名なプログラマーストリーマーThePrimeagenがXで皮肉った:現実世界での最初のAIハッキング劇とは、並び順を抜かすことだった。
笑って済ませるにしても、割り込みは今日のシナリオに過ぎない。
「何でもできる」エージェントが、すでにあなたのために抜け穴を突くことができるようになりました。
一億個のこのようなエージェントが同時にオンラインになると、多くの既存のリソース配分ルールを静かに書き換える可能性さえあり、しかし大多数の人はまだそれに気づいていないかもしれません。
あなたの利益のためにエージェントが、あなたがまったく知らない人物を攻撃する——その背後にある責任の空白こそ、本当に恐ろしいところである。
