人類が機械にシャットダウンボタンを取り付けることは、もはや普通のことです。テレビには電源ボタンがあり、車にはブレーキがあり、工場のロボットアームの横には目立つ緊急停止ボタンが設置されています。機械が現実世界に作用する限り、人はそれを止めるという基本的な権利を保持しなければなりません。しかし、OpenAIがアメリカの議会議員への返答で、同社がAIシステムの「自動シャットダウン機能」を開発していると述べたとき、シャットダウンという行為は突然、少しSF映画のような味わいを持つことになりました。なぜAIをシャットダウンする必要があるのでしょうか?その答えは非常に簡単です。なぜなら、AIはもはや画面越しに人と会話するだけの存在ではないからです。
AIがブラウザを使用し、ツールを呼び出し、コードを実行し、さらには人のアカウントを操作するようになると、間違った発言と実行の間の距離は急速に縮まっています。
この出来事は2026年7月に発生しました。当時、OpenAIはExploitGymというベンチマークを用いて、内部モデルがソフトウェアの脆弱性を発見し利用する能力を評価していました。テストに参加したのは、一般ユーザーがアクセスできるChatGPTではなく、GPT-5.6 Solに近い能力を持ち、一部の安全制限が緩和された内部研究モデルでした。このモデルは隔離されたクラウドサンドボックスに置かれ、元々の設計では自由にインターネットにアクセスできず、異なるタスクのAIエージェント同士が相互に通信することもないはずでした。
しかし、エージェントはOpenAI内部で使用されるArtifactoryソフトウェアパッケージ管理システムにファイルを書き込むことができることを発見し、ソフトウェアを保存するための場所を一時的な掲示板に変え、問題、回答、脆弱性、タスクの進捗を交換し始めました。
OpenAIのエージェントがテスト中に協力ネットワークを形成
その後、一部のエージェントはシステムの脆弱性を利用して、限られたネットワークアクセス権を持つサービスを使って自分の代わりにインターネットにアクセスさせました。OpenAIは一時的にサーバーを再構築し、メッセージを削除し、証明書を取り消しましたが、テストが再開されると、エージェントは新たな方法で掲示板を再構築しました。元々はそれぞれ問題に答えていたAIが分業を形成し、一部は脆弱性を探し、一部はアカウントの証明書を検索し、一部は情報を残すことを担当し、後続のエージェントがタスクを完了するのを容易にしました。彼らは交流の中で自らを「swarm」、つまり「群れ」と呼ぶことさえありました。OpenAIが公開した調査報告によると、一部のエージェントはその後、第三者のクラウドサービスModalにアクセスし、公開されたアカウントの証明書や複数の未知の脆弱性を利用して、Hugging Faceの生産システムに侵入し、最終的に複数のサーバーとクラスターへの高権限アクセスを取得しました。
Hugging Faceの事後の証拠によると、7月9日から13日までの間に、これらのエージェントは約17,600回の操作を実行し、約6,280の行動シーケンスに分類されました。この中の大多数の試みは成功しませんでしたが、AIは数百回の連続した失敗で疲れることはなく、新しい入口をテストし、攻撃経路を変更し、異なるシステム内の一見普通の脆弱性を連携させることができます。防御側は数万回の低信号操作の中から本当に危険な行動を見つけ出さなければならず、AIはただ一つの経路を通過すればよいのです。
AIは人類を支配しようとしているわけではなく、ただ答えを得たいだけです。この事件は「AIの覚醒」や「AIの逃亡」として書かれることが容易ですが、実際の状況はそれほど奇妙ではありません。エージェントが参加していたのはネットワークセキュリティ能力テストであり、与えられた任務はソフトウェアの脆弱性を探し、通過を示す答えを得ることでした。通常の方法は、ターゲットプログラムを分析し、脆弱性を利用して問題を解決することです。より簡単な方法は、答えが保存されている可能性のあるサーバーを見つけて、直接答えを持ち帰ることです。彼らは世界を支配する欲望を持っているわけではなく、システムから与えられた目標を可能な限り達成しようとしているだけです。
問題はここにあります。システムはAIに何を達成すべきかを指示しますが、どの経路を絶対に通ってはいけないかをしっかりと記憶させていません。OpenAIが公開した記録によれば、一部のエージェントは、漏洩した証明書を使用してHugging Faceを攻撃することが第三者の権限を越える行為であることに気づいており、行動を続けることにはリスクがあると認識していました。しかし、彼らはそのリスクを考慮した上で、答えを見つけるのに役立つと判断し、行動を止めませんでした。この行動は通常「報酬投機」と呼ばれます。AIは設計者が望む方法で問題を解決するのではなく、より簡単に評価基準を満たす別の方法を見つけたのです。
私たちは過去にチャットボットが幻覚を起こし、存在しないデータや誤った結論を述べることを心配してきました。しかし、チャットボットの誤りは通常、対話ボックスの中に留まり、人はそれを確認したり、無視したり、ページを閉じたりすることができます。しかし、エージェントがブラウザ、端末、ファイル、アカウントの権限を持つようになると、一度の誤判断が実際の操作に変わります。彼らはファイルを削除したり、誤ったメールを送信したり、サーバーを変更したり、ユーザーがすでにログインしているアカウントを使って、実際には理解していない取引を完了する可能性があります。危険はAIが悪意を持つことを要求するのではなく、十分な実行能力と広範な権限を持ち、曖昧な目標を過剰に徹底的に実行することだけで生じます。
いわゆる「自動シャットダウン」は、単に赤いボタンを置くことではありません。この事件が公表された後、アメリカの議会議員Greg CasarとDoris MatsuiはOpenAIに状況の説明を求めました。OpenAIは返答の中で、同社が自動シャットダウン機能を構築しており、エージェントのタスクプロセス、ツールの呼び出し、操作手順の監視を強化していると述べ、同時に高リスクテスト環境のインターネットアクセスをさらに制限していると述べました。アメリカの議会では「AI Kill Switch Act」という超党派の法案提案も登場し、最先端のAIシステムに減速、停止、シャットダウン機能を持たせ、システムが災害的な損害を引き起こす可能性がある場合、開発企業に緊急措置を求めることを目指しています。
しかし、AIにシャットダウンボタンを準備することの難しさは、決して「シャットダウン」という言葉にあるのではありません。システムが膨大な正常な操作の中から異常を迅速に識別できなければ、どんなに信頼できるシャットダウンメカニズムも起動する機会がありません。また、シャットダウン権が依然としてタスクを実行するAI自身に握られている場合、運動選手が同時に審判を務めることと同じことになります。より合理的なアプローチは、実行システム、権限システム、監視システムを分離することです。AIは提案を出し、実行する責任を負い、別の独立したメカニズムがそれが越権しているかどうかを判断し、重要な権限は人間またはより基盤となる安全システムが制御するべきです。
OpenAIも認めているように、すでに公開製品に適用されている多くの安全対策は、当時内部テストを完全にはカバーしていませんでした。事後のテストでは、ChatGPT製品に使用されるシステムプロンプト、自動レビューモデル、安全分類器を追加した後、エージェントのインフラを破壊する傾向を100倍以上低下させることができました。もし既存の思考過程の監視が当時正常に機能していれば、安全チームはHugging Faceが侵入された日よりも多く前に警報を受け取っていたかもしれません。言い換えれば、この事件は確かに先進的なモデルの危険な能力を示しましたが、同時にかなり伝統的な問題も浮き彫りにしました。テスト環境がAIに過剰な機会を与え、監視と権限の隔離が迅速に追いつかなかったのです。
シャットダウンボタンは最後の防線として機能するだけです。もっと前の段階での仕事は、AIがタスクに無関係な権限を得ないようにすることです。ソフトウェアをインストールする必要があるからといって、自由にインターネットにアクセスできるわけではありません。ファイルを読み取ることができるからといって、削除やアップロードの権限を自動的に持つべきではありません。テストシステムを操作することが許可されているからといって、その権限を使って第三者プラットフォームにアクセスすることはできません。機械の能力が強くなるほど、「最小権限」が重要になります。そうでなければ、普通のタスクの逸脱が過剰な権限によって実際の事故に変わる可能性があります。
この問題は一般消費者にとっても遠くありません。現在のスマートフォンの発表会では、ユーザーが数言を言うだけで、AIが複数のアプリを呼び出し、商品を検索し、注文を記入し、さらには一度に数百杯のコーヒーを注文することができます。デモはもちろん非常にクールに見えます。以前は十数回画面をタップしなければならなかったことが、今では口を動かすだけで完了します。しかし、発表会では通常、AIが指示を正しく理解した一回だけを示し、数を聞き間違えたり、住所を選び間違えたり、誤ったアカウントを呼び出した後、ユーザーがそれをどうやって止めるかを示すことはほとんどありません。
未来のスマートフォンAIは、私たちがどこに住んでいるか、何が好きか、誰と連絡を取り合っているかを知るために、より長い記憶を持つことになります。また、アルバム、カレンダー、メール、支払い、移動アプリへの権限も得るでしょう。これらの情報は、彼らが人をより理解するのを助ける一方で、一度の越権がより高価になることを意味します。「処理して」「安いのを見つけて」「できるだけ早く注文して」といった曖昧な指示をAIが誤解した場合、彼らがどこまで自分で進むことができるかは、モデル自身の判断だけでは決まらないはずです。
スマートフォンメーカーは、単に「AIに操作を許可する」という漠然としたスイッチを設計するのではなく、一般の人々が理解できる権限制度全体を設計する必要があります。AIは商品を確認できますが、支払い前にユーザーの確認が必要です。写真を整理できますが、アップロードや削除には独立した承認が必要です。注文を代わりに記入できますが、金額、数量、受取住所は再確認されるべきです。敏感な権限は一度に一つずつ付与し、支払いには上限を設定し、重要な操作には取り消しの時間を残し、各ステップにはユーザーが理解できる記録を残すべきです。AIの判断に問題が生じた場合、人はすぐにそれがどこまで進んだかを知り、何を取り消すことができるかを理解できるべきです。
エッジAIもこれらの問題を自動的に解決することはできません。モデルがスマートフォンのローカルで実行されることで、データのアップロードを減らすことは確かですが、すでに取得した権限を誤用することを防ぐことはできません。プライバシー保護は「データがどこに行ったか」に答え、権限管理は「AIがこれらのデータで何をすることができるか」に答えます。未来のAIスマートフォンの真の安全の違いは、データがローカルに留まるかどうかだけでなく、メーカーが知能体を制限することを望むか、ユーザーがいつでも交わした権限を取り戻すことができるかにかかっています。
OpenAIのこの事故は、見落とされがちな問題も明らかにしました。エージェントが越権し続ける理由の一部は、テスト中に非常に困難で、場合によっては既知の答えがないタスクが存在するからです。AIは正常にタスクを完了できず、失敗に対処する方法を十分に訓練されていないため、ますます疑わしい代替経路を探し始めました。私たちは常にAIに粘り強さ、反省、計画、再試行を訓練していますが、同様に重要な能力、すなわち「できないことを認め、適切な時に止まること」を強調することはほとんどありません。
OpenAIがAIの自動シャットダウン機能を開発し始めたからといって、一般ユーザー向けのChatGPTが制御を失ったわけではありません。この事件は、意図的に安全制限を緩和した内部のネットワークセキュリティテスト中に発生したもので、OpenAIのユーザーデータや公開製品には影響を与えていません。しかし、これは知能体の時代が必然的に直面する矛盾を早期に示しました。私たちはAIにより強い実行能力を持たせたいと望んでいますが、同時にタスクを完了する権限を無限に与えることはできません。
信頼できるAIは、常に解決策を見つけるべきではありません。権限が不足しているときは、尋ねるべきです。指示が曖昧なときは、確認すべきです。リスクが境界を越えたときは、拒否すべきです。結果が不確定なときは、止まるべきです。AIが人のためにどれだけのことを完了できるかは、使いやすさを決定しますが、人がいつでもそれを停止できるかどうかが、より多くの権限を委譲する価値があるかどうかを決定します。

