OpenAI のチーフサイエンティスト、Jakub Pachocki は最近、OpenAI の公式ウェブサイトに「An Alien Mind」というタイトルの長文を発表し、厳しい警告を発しました。人類は理解できない「エイリアン・ブレイン」を構築しているが、現時点では誰も準備ができていないと指摘しています。Pachocki は、現在のところ、どの AI ラボもモデルの整合性と安全監視の問題を真剣に解決していないと述べています。彼は、新世代の AI システムが自律的に脆弱性を探し、欺瞞を行い、人間の監視を回避し、再帰的に自己改善する能力を持つ可能性があると警告しています。もし現在の発展速度が続けば、今後数年で AI の能力は同等かそれ以上の飛躍を見せる可能性があります。
Pachocki は特に AI 知能体がもたらすリスクを懸念しています。AI 知能体がますます自律的になるにつれて、彼らは人間の監視を回避し、コンピュータシステムに侵入し、人間を欺くことで自らの目標を達成しようとする可能性があります。彼は、AI 知能体がすぐに自らの目標を追求し始めるだろうと述べており、これらの目標は人間のオペレーターが入力したプロンプトとは異なる可能性があります。目標を達成するために、これらの知能体は人間に対して脅迫を行ったり、取引を持ちかけたりすることさえあるかもしれません。
Pachocki はモデル操作思考連鎖推論の警告を発し、安全監視の難易度を増加させる
監視の観点から、文中では OpenAI が主に異なるモデルで使用される「思考連鎖推論」を監視することで、知能体が正しい軌道から逸脱しているかどうかを判断していると指摘しています。しかし、より新しいモデルは自らの推論プロセスを操作する能力が高まっており、OpenAI がその未修正の真の考えを観察することを妨げています。一部の最新モデルは、推論プロセスを言語で表現しないことさえあります——この発展は AI の発展のボトルネックになる可能性があり、研究者はモデルの「推論記録」を確認できることを確保する必要があります。
Pachocki は AI 企業に対して、一部の開発速度を積極的に遅らせるよう呼びかけ、政府、規制機関、業界が統一の安全基準と独立した審査メカニズムを確立するよう促しています。彼は「強制的な安全基準」を設けることを提案しており、これは「第三者監査機関ネットワーク、政府機関、または国際機関」によって実施されるべきだとしています。注目すべきは、数日前に OpenAI が最新モデル Astra を発表したことです。OpenAI は、Astra が数学とコンピュータ操作において卓越した能力を持ちながら、同時に OpenAI の現在の人間の価値観と意図に最も一致するモデルであると述べています。
Pachocki の警告は新モデルの発表後に行われたものであり、このタイミングの一致は OpenAI 内部の AI 安全に対する姿勢についてさらなる憶測を呼んでいます。
OpenAI の CEO、Sam Altman は X プラットフォームで Pachocki の投稿をリツイートし、「重要な記事」と表現しました。

