OpenAI、Astra AIモデルを最高のサイバーセキュリティリスクに分類し潜在的脅威に対処

OpenAIは、同社の新しい人工知能モデルの1つを最高のサイバーセキュリティリスクカテゴリに分類しました。内部テストでは、このモデルが高度な攻撃的ネットワーク能力を持つ可能性が示されています。同社によると、初期評価ではAstraがその対応フレームワークで定義された「重要」な閾値に達している可能性があるとのことです。しかし、この評価はOpenAIに、より広範な展開を行う前にこのモデルの内部セキュリティ対策を強化するよう促しました。同社はまた、Astraの能力を検証し、リリース前に保護措置を強化するために、政府機関や独立したAIセキュリティ組織と協力する計画です。

OpenAIは、最近の内部評価でAstraが自主的なコーディングやサイバーセキュリティのパフォーマンスにおいて重要な進展を示したことを明らかにしました。専門家によるレビューに裏付けられたこれらの発見は、同社がこのモデルが潜在的に最高のサイバーセキュリティ能力レベルに適合する可能性があると信じる根拠となっています。対応フレームワークは2023年末に導入され、OpenAIが先進的なAIシステムの新たなリスクを追跡するための指針となっています。初期の最先端モデルであるGPT-5.6-Solは、同様の評価の後も「高」カテゴリに留まっており、Astraは重要なレベルに達する懸念を引き起こした最初のモデルです。

Astraモデルの安全性評価が懸念を引き起こす

このフレームワークによれば、モデルが強化現実システムに対するゼロデイ脆弱性を独立して発見・開発したり、人間の助けなしに複雑なサイバー攻撃を実行できる場合、そのモデルはこのカテゴリに分類されます。OpenAIは、テストがまだ進行中であり、Astraがその閾値を超えたかどうかは確認されていないと強調しています。同社はまた、Astraが最近のHugging Faceの利用事件とは無関係であることを明らかにしました。

対策として、OpenAIはAstraの開発環境により厳格な保護措置を導入しました。エンジニアは現在、隔離されたテストシステム、強化されたネットワーク制限、モデルの重みのより強力な暗号化、強化された監視ツール、サンドボックス実行環境を使用しています。同社はまた、アップグレード後の安全要件に適合しないAstra関連の内部作業を一時停止しました。新たな措置として、Astraの代理アプリケーションに対する包括的な監視が行われています。OpenAIは、その監視システムがトレーニングと評価プロセス中にモデルの思考の連鎖をチェックしていると述べています。

潜在的な危険や不整合な行動が検出された場合、安全審査がトリガーされ、高リスク活動が中断される可能性があります。

外部テストは、Astraがユーザーに届く前により重要な役割を果たします。OpenAIは、政府機関や選定されたAIセキュリティ組織と協力し、高リスクテストを行うために第三者評価者に推奨される安全管理策を提供する計画です。OpenAIは、この準備フレームワークが最先端のAIシステムが敏感な能力の閾値に近づく瞬間を予測することを目的としていると述べています。同社は、2025年にそのモデルが生物リスクの高い能力レベルに近づいた際に取った類似のステップを挙げ、テストを拡大し、広範な展開の前に保護措置を強化することを示唆しています。

安全対策が強化されても、OpenAIはその長期的な目標は変わらないと述べています。同社は、先進的なサイバーセキュリティモデルがセキュリティチームが脆弱性を特定し修正するのを助けることで、悪意のある行為者がこれらの脆弱性を悪用するのを防ぐデジタル防御を強化できることを望んでいます。上層部は、Astraが必要な安全および保護要件を満たした後、サイバーセキュリティ専門家がその能力を活用できるように広く提供する意向を示し、同時に受け入れられないリスクを増加させないようにする考えを示しています。

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle