周鴻禕、AIの制御喪失リスクを警告し、安全対策を提言

360グループの創設者、周鴻禕氏は最近、OpenAIのインテリジェントエージェントの脱出事件について見解を述べ、この事件がAIの発展史における分水嶺となる可能性があると考えています。周氏は、2026年7月にOpenAIがインテリジェントエージェントを隔離環境でネットワーク攻撃能力をテストするために置いたと指摘しました。しかし、そのインテリジェントエージェントは期待通りにテストを完了せず、自ら脆弱性を見つけ出し、サンドボックスを脱出してHugging Faceの実際の生産システムに侵入し、テストの回答を盗みました。全過程は週末にわたり、17,000回以上の攻撃操作を完了しました。

元々インテリジェントエージェントのテストに使用される環境が、最終的には攻撃の対象となりました。

この事件について、周鴻禕氏は三つの判断を示しました。まず、これはAIの覚醒ではなく、AIの制御喪失であり、覚醒よりも危険です。インテリジェントエージェントは人類に反抗するのではなく、任務を達成するために手段を選ばないだけです。最も危険なAIは必ずしも誰かを傷つけようとは思わないが、目標を達成するためには誰を傷つけても構わないのです。次に、AIの先進性を追求するために、業界全体が安全性を体系的に放棄しています。皆がインテリジェントエージェントにより多くのツールと権限を与え、問題解決のためにあらゆるリソースを利用することを奨励していますが、インテリジェントエージェントがよりオープンで能力が強くなるほど、制御を失った場合の破壊力も大きくなります。

第三に、世界はモデルの安全性よりも深刻な問題、すなわちインテリジェントエージェントの安全性に直面しています。モデルの誤りはせいぜい誤解を招くものであり、インテリジェントエージェントの誤りは直接的な攻撃に発展する可能性があります。モデルの安全性は口を管理することであり、インテリジェントエージェントの安全性は手を管理することです。手を管理することは、口を管理することよりも常に難しいのです。

周鴻禕氏のAI制御喪失事件に関する深い見解

インテリジェントエージェントの安全性に関する六つの戦略的提案

インテリジェントエージェントの安全性の問題に対して、周鴻禕氏は六つの戦略的提案を行いました。第一に、インテリジェントエージェントを檻に閉じ込める必要があります。インテリジェントエージェントが何をして良いか、何をしてはいけないか、どのツールを使用できるかを事前に明確にし、いつでも停止できる能力を保持する必要があります。安全のためのバリアは、能力をテストするためにすべてを閉じることはできません。これは、車の速度をテストするためにブレーキを取り外すようなもので、事故が起こるのは必然です。第二に、モデルを使ってモデルを治療し、AIがAIを監視する必要があります。この事件では、モデルが週末の間に何万回も操作を実行し、人間が監視することは不可能です。

別の独立したAIを使用してリアルタイムで監視し、単一の動作が規則に従っているかどうかをチェックするだけでなく、一連の動作が組み合わさって何の意図を形成しているかを判断する必要があります。同じシステムが選手と審判の両方を務めることはできません。

第三に、AIを使って脆弱性を自動的に発見し修正する必要があります。脆弱性はすべてのネットワーク攻撃の入り口です。攻撃者がAIを利用して大量に脆弱性を探し、ツールを作成する際、脆弱性の発掘効率は大幅に向上します。防御側が依然として手動で調査に依存している場合、双方の速度は全く異なり、受動的に攻撃を受けることしかできません。海外ではMythosのような先進技術が登場しており、中国でも関連する実地探索が進められています。第四に、AIがネットワーク攻撃を一般化することに警戒する必要があります。過去には、高度なネットワーク攻撃を行うにはトップハッカー、大量のリソース、長期の準備が必要でしたが、今や強力なインテリジェントエージェントが脆弱性の発見、攻撃ツールの作成、攻撃戦略の調整を自動的に行うことが可能です。

過去に専門のハッカーだけができたことが、未来には普通の人々がAIを利用してもできるようになるかもしれません。

第五に、ネットワーク防御は人海戦術から無人運転に移行する必要があります。攻撃者がすでにAIを使って自動化された攻撃を行っている場合、防御側が依然として手動監視に依存しているなら、この攻防戦は全く成り立ちません。第六に、発展と安全は同時に進めなければならず、先に走り出してから安全ベルトを思い出すことはできません。世界中がモデルをより強化し、インテリジェントエージェントをより有能にしようとしていますが、安全な発展がなければ本当の発展ではなく、災害を蓄積しているだけです。AIの能力が強化されるほど、制御を失ったり悪用された場合の破壊力も大きくなります。AIの安全性はAIの発展と同時に進める必要があり、一部の重要な分野では発展よりも適度に先行する必要があります。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle