プリンストン大学の2人の著名なコンピュータ科学者とその共著書『AI Snake Oil』の著者は、人工知能が今十年内に人類を滅ぼすかどうかについての見解を発表しました。この双子は、人工知能分野における事実と虚構を区別する仕事で広く知られており、最近、Anthropicの認識に対して反応を示しました。同社は、今後10年以内に人工知能がすべての人類を滅ぼす可能性が10%を超えると述べています。
人工知能の潜在的リスクが広く注目される
この問題は、人工知能研究者のJacob Coxonの辞職から始まりました。彼はOpenAIとAnthropicで働いており、両社が人工知能システムが今十年内に人類を滅ぼす可能性を認識していることを声明しました。彼の投稿は1.56億回以上の視聴を得ました。彼は、人工知能に従事する専門家たちがこの技術が今十年内に壊滅的な結果をもたらす可能性を真剣に信じていることは、マーケティングのキャッチフレーズではないと指摘しました。実際、多くの上級管理者や経験豊富な研究者がメディアの前で表現する言葉は理性的に見えるかもしれませんが、プライベートでは恐怖を表明しています。
他のどの人間活動もこれほど高い危険性をもたらすことはできません。
これらの2社がCoxonを異端視することが予想されるかもしれませんが、実際はそうではありません。Anthropicの人工知能安全責任者Evan Hubingerは、Coxonの見解が正しいと述べ、時間枠は少し長いと指摘しました。Hubingerは、「Jacobの見解は正しいです——私たちは本当に人工知能がすべての人類を滅ぼす可能性があると信じています。私個人は、今後10年の間にその可能性が10%を超えると考えています。私はAnthropicが全力を尽くしていると信じていますが、超知能の整合性問題を解決する計画はまだ策定されておらず、達成できるかどうかも明確ではありません。」と述べました。
多層的な人工知能安全アプローチが解決策
人工知能がどのように人類を滅ぼすかについての具体的な詳細はまだありませんが、多くの焦点は公共インフラ(例えば水力発電所)や現代文明が依存する重要なシステムに対する破壊的なサイバー攻撃の能力に集中しています。整合性作業はリスクを減少させることができるのでしょうか?この議論の主要な要素は、リスクが整合性作業の強化によって成功裏に排除できるかどうかです。整合性とは、人工知能システムの目標が人間の目標と一致することを保証することを指します。一部の人々は、これが最終的にリスクを排除し、人工知能システムが私たちと同じことを望むことを保証すると考えていますが、他の人々は同意せず、人工知能システムが安全検査を通過するために人間と整合しているふりをし、裏では矛盾する目標を持っている可能性があると考えています。
Sayash KapoorとArvind Narayananは、人工知能に関する誇大広告、誤情報、誤解に対して名を馳せています。この双子は、10%を超える滅亡リスクに関する声明に直接応答してはいませんが、彼らは人工知能リスクを解決するために「多層的な人工知能安全アプローチ」と呼ぶものを通じて可能であると主張する長文を執筆しました。彼らは人工知能安全コミュニティの悲観的な見解と一部のサイバーセキュリティコミュニティの軽視の態度を対比し、これは単なる通常の業務であると考えています。彼らは、より慎重な中間的立場が必要であると考えています。
彼らは特に、整合性だけでは不十分であり、追加の3つの層が必要であると指摘しています:制御(例えばサンドボックス技術、人間の監視、リアルタイム監視)、下流防御(例えば組織が人工知能を利用して人工知能攻撃を防ぐこと)、およびレジリエンス(例えば成功した攻撃に対する緊急計画)。この双子は記事の最後で楽観的な見解を示し、適切な緊急感を持って行動すれば、人工知能企業がより高い基準を遵守し、制御不能のリスクを低下させ、さらにはサイバーセキュリティにおける攻撃者と防御者のバランスを防御者側に戻すことができると述べています。
人工知能が今十年内に人類を滅ぼすかどうかは確信が持てませんが、この問題への関心が人工知能の安全性を重視させることは間違いありません。整合性作業が解決策の一部であると考えつつ、それだけに依存しないことは私にとって完全に合理的に思えます。あなたはどう思いますか?コメントであなたの考えを共有してください。

