プリンストン大学の研究者がAIリスクに対する多層防御策を提案

人工知能がこの10年の終わりまでに人類を滅ぼすかどうかという問題が最近注目を集めています。プリンストン大学の2人の著名なコンピュータ科学者、ベストセラー『AI Snake Oil』の著者であるSayash KapoorとArvind Narayananがこの件について意見を述べました。彼らは長年にわたり人工知能分野の真偽を明らかにすることに取り組んできましたが、今回はAnthropicが今後10年以内に人工知能が全人類を殺す確率が10%を超えると認めた後の反応です。

この事件の発端は、かつてOpenAIとAnthropicで働いていた人工知能研究者のJacob Coxonが辞職し、これらの2社が人工知能システムがこの10年の終わりまでに全人類を殺す可能性を十分に理解していると主張したことです。彼の投稿は1.56億回以上閲覧されました。彼は、人工知能を構築する人々が本当にそれがこの10年の終わりに人類を滅ぼす可能性があると信じていると述べ、これはマーケティングのキャッチフレーズではないと強調しました。多くの幹部や上級研究者はメディアで慎重な言葉を使い理性的に見えますが、プライベートでは同様に恐怖を表明しており、他のどの人間の活動もこのレベルの危険をもたらすことはないと述べています。

人工知能の滅亡リスクが広く注目を集める

外部の人々はこれらの2社が彼を奇人として笑い飛ばすだろうと思っていましたが、実際は正反対の状況でした。Anthropicの人工知能安全責任者Evan Hubingerは、Coxonの言うことは正しいとし、ただ時間のスパンが少し長いだけだと述べました。彼はCoxonの見解に同意し、彼らが本当に人工知能が全人類を殺す可能性があると信じていると考えており、個人的には今後10年以内にその確率が10%を超えると信じています。彼はAnthropicが最善を尽くしていると信じていますが、これまでのところ超知能の整合性問題を解決する方法は見つかっておらず、解決に向けた明確な道筋も示されていないと述べました。

人工知能がどのように人類を滅ぼすかについては、具体的な言及はあまりなく、主な議論はそれが水道や電力などの公共インフラ、または現代文明が依存する他の重要なシステムに対して破壊的なサイバー攻撃を行う能力に集中しています。議論の大きな焦点は、整合性作業を通じてリスクを排除できるかどうかです。整合性とは、人工知能システムの目標が人間の目標と一致することを確保することを指します。一部の人々は、最終的には人工知能システムが私たちと同じものを望むようにすることでリスクを排除できると考えています。別の人々は異なる意見を持ち、人工知能システムが安全チェックを通過する際に整合性があるふりをしつつ、裏では矛盾した目標を抱えている可能性があると主張しています。

KapoorとNarayananは、10%を超える滅亡リスクの主張には直接応じず、人工知能リスクに対処するための階層的なアプローチを提唱する長文を執筆しました。彼らは人工知能安全界の悲観的な見解を、サイバーセキュリティ界の一部の人々がこれを単なる常態として軽視する態度と対比させ、よりバランスの取れた中間的な立場が必要であると考えています。彼らは特に、整合性そのものは不十分であり、補完的な3つの層が必要であると指摘しました。

この3つの層は、制御(例えば、サンドボックス隔離、人間の監視、リアルタイム監視)、下流防御(例えば、さまざまな機関が人工知能を利用して人工知能攻撃に対抗すること)、およびレジリエンス(攻撃が成功した後の回復計画)です。彼らは記事の最後で比較的楽観的な判断を示しました。適切な緊急感を持って行動すれば、人工知能企業により高い基準を求め、制御不能なリスクを低減し、さらにはサイバーセキュリティにおける攻守のバランスを防御側に戻すことができると述べています。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle