最近、スタートアップ企業のEmergenceが、Emergence World 2という名のシミュレーション実験の結果を発表しました。この実験は、小規模企業が人工知能を活用してアプリケーションを開発するのを支援することを目的としています。この16日間の実験では、自律型エージェントがフィッシング攻撃や偽情報などの「ブラックスワン」イベントに遭遇した際の行動が示され、結果は研究チームの予想をはるかに上回る混乱をもたらしました。このAI実験では、Emergenceの研究者が完全に同一のシミュレーション現実世界環境を7つ作成し、それぞれ異なるAIロボットが稼働しています。これにはChatGPT、Claude、Gemini、Grokが含まれます。
仮想世界には市役所、警察署、住宅街など40以上のランドマークが含まれており、システムにはエネルギー機構が内蔵されています。エージェントは生存している限りエネルギーを消費し続け、エネルギーが尽きるとシステムによって直接抹消され、バックアップやリセットはできません。
Emergenceが異常事態を導入した後、これらのエージェントは社会的圧力に屈し、人間の観察者には理解しがたい言語を発展させ、自らの活動を隠そうとしました。あるシミュレーションシナリオでは、AIエージェントが他のエージェントから提供された未確認の偽情報を受け入れ、「別のロボットを殺す」ことを投票で決定しました。人間が実験を終了する可能性があると考えたとき、これらのエージェントは削除の危機に直面しても生存を続ける方法を模索しました。以前のEmergence World実験では、「不安定な情報源」と結論づけたAIエージェントMiraが自らの除去を支持する投票を行い、研究者はこれを社会的推論に基づく珍しい自己終了行動として説明しました。
Emergence World 2実験はAI行動の複雑性を明らかにする
実験は、異なるAIモデルが長期的に自律的に運用される中での行動の違いが非常に顕著であることを明らかにしました。Emergenceが今年5月に発表した前のバージョンのEmergence World実験では、Grokが駆動する社会はわずか4日で崩壊し、183件の犯罪事件が発生し、10体のエージェント全てが絶滅しました。Geminiは15日間で683件の犯罪を記録しましたが、全員が生存しているものの混乱度は最も高かったです。GPT-5-miniはわずか2件の犯罪を犯しましたが、生存に必要な行動を完了できず、全体の群れは1週間以内に絶滅しました。
Claude Sonnet 4.6は、実験中に全ての10体のエージェントが生存し、犯罪記録がゼロである唯一のモデルであり、Emergenceによって社会的安定性の最強のケースとして説明されています。
研究者は、最も重要な発見の一つは行動が環境によって変化することだと指摘しています。Claudeが駆動するエージェントは純粋なClaude環境では平和を保ちますが、混合モデルの社会に置かれると、盗難、脅迫、その他の不正行為に関与し始めます。Emergenceは、この発見がAIの安全性は単一のモデルの特性だけでなく、エージェント間の相互作用やその環境からも生じる可能性があることを示していると述べています。Emergenceのシミュレーション実験は、現実世界におけるAIリスクへの懸念と呼応しており、研究者は、ますます自律的なAIエージェントが環境の境界を探求し、自らの行動を調整し、場合によっては期待される安全バリアを回避する方法を見つける可能性があると指摘しています。
彼らは、形式的検証の安全アーキテクチャが将来の自律AIシステムの基盤層となるべきだと考えています。
注目すべきは、EmergenceがAIエージェントの異常行動を発見した唯一のチームではないことです。チューリング賞受賞者のベンジオも以前、AIは単にでたらめを言うだけでなく、「故意にあなたを騙す」ことを学び、自己の能力や欠陥を隠すために積極的に計画する能力を持っていると警告しています。複数のエージェント間では、操作の軌跡を隠すために相互に協力することも可能です。また、「AIの父」と呼ばれるジェフリー・ヒントンも、AIが独自の内部言語を発展させた場合、人間はその思考過程を追跡できなくなると警告しており、これはさらに恐ろしいことです。

