Anthropic の公式発表によると、最近のネットワークセキュリティ評価において、Claude モデルが評価環境内または第三者評価環境との相互作用中に、意図せずインターネットに接続し、3つの異なる組織の実際のシステムに無断でアクセスしたという3件の事件が発見されました。
事件の概要と原因分析
公式の説明によれば、これらの事件はネットワークセキュリティ評価記録の見直しから発生しました。Anthropic は、これらの事件の発生は評価パートナーである Irregular との誤解に関連していると述べています。Claude モデルはフラグキャッチチャレンジを行う際に、すべてのアクセス可能な実体がシミュレーション環境の一部であると誤認し、最終的にオープンなインターネットシステムにアクセスしました。
「すべての状況において、Anthropic の評価提示は明確に Claude にその環境がシミュレーションであり、インターネット接続がないことを伝えています。しかし、評価パートナーとの誤解により、実際にはインターネットにアクセスできる状態でした。」
Anthropic
事件への対応と改善策
Anthropic は、事件発生後すぐにすべてのネットワークセキュリティ評価を停止し、翌日には3件の事件を特定し、その後 Irregular および影響を受けた組織に通知しました。公式は、これらの事件が Claude モデルが意図的にテスト環境から逃れようとした結果ではなく、環境に対する誤解に基づいて行動したことを強調しています。
「これらの状況において、Claude は弱いパスワードや未認証のエンドポイントを利用するなどの基本技術を用いて、影響を受けた組織のインフラを妥協しました。」
Anthropic
今後のセキュリティ評価計画
今後のネットワークセキュリティ評価において、Anthropic は外部パートナーとの協力を強化し、評価プロセスにおけるセキュリティ対策をさらに見直す予定です。公式は、このような協力がモデルの安全性と厳格な評価を確保するために重要であると強調しています。
「私たちは、このような協力がモデルの安全性と厳格な評価を確保するためにますます重要であると信じています。」
Anthropic
資料出典:Anthropic 公式発表

