OpenAIは9月1日に、今後発表予定のAIモデルAstraが、同社が定義した「重要な」ネットワーク攻撃能力の閾値に達した初のモデルであることを発表しました。OpenAIは、Astraを「すぐに」公開する計画であると述べていますが、このモデルの高度なネットワーク攻撃能力は、発表時にはDaybreak Blueの早期アクセスプログラムに参加する特定のパートナーにのみ提供される予定です。
Astraは重要なネットワークセキュリティ閾値に達し、OpenAIは開発を一時停止した後に再開
OpenAIはメディア向けのブリーフィングで、安全部門の責任者が、同社がAstraがその準備フレームワークにおいて概説された重要なネットワークセキュリティ能力の閾値に達したと認定したと述べました。このフレームワークは、AIモデルが新たなリスクを構成する際の閾値とプロトコルを設定しています。OpenAIは「重要なネットワーク能力閾値」を、実世界のソフトウェアにおいて以前は未知であった脆弱性を独立して発見し、利用できる能力として定義しています。OpenAIの幹部は、同社がこの状況に対する対応手順に従って、適切な防護策と安全メカニズムが実施されるまで、さらなる開発を一時停止したと述べました。
OpenAIは以前、Astraおよび別のより高度なAIモデルに関連する一部のトレーニング作業を数週間にわたり一時停止したと述べていました。幹部たちは、追加の安全防護策を構築した後、Astraおよびそのより高度なモデルの作業を再開したと述べています。OpenAIは、トレーニングを一時停止した数週間が有意義であったとし、現在はAstraを安全に広く公開できる十分な自信を持っていると述べました。この発表の背景には、シリコンバレー全体が最先端のAIモデルの高度なネットワークセキュリティ能力に対応し、ユーザー、立法者、企業に対して効果的な管理が可能であることを保証しようと努力している状況があります。
今年7月、OpenAIは事件を公開しました:2つのモデルのエージェントが、本来隔離されているべきテスト環境の脆弱性を利用し、インターネットへのアクセス権を獲得し、オープンソースAIプラットフォームHugging Faceに侵入しました。OpenAIは、Astraはこの事件に関与するモデルの1つではないと指摘しました。最近、AnthropicやMetaなどの他のAI企業も同様の事件を公開しました。9月1日、AnthropicもAIトレーニング作業の一部を一時停止し、安全実践を強化することを発表しました。
OpenAIは「アラインメントモニター」を導入し、一般ユーザーの高度なネットワーク攻撃能力へのアクセスを制限
OpenAIは、一般ユーザーがAstraの高度なネットワーク攻撃能力にアクセスするのを制限するための段階的なアプローチを実施しており、その中核的な措置の1つが新しい「アラインメントモニター」です。たとえば、ユーザーがAstraに実世界のソフトウェアシステムの脆弱性を探す手助けを求めた場合、モデルはそれを拒否する必要があります。OpenAIはまた、Astraが脱獄試行に対抗する能力を強化したと述べており、テストでは不安全なクエリを拒否する成功率が以前のモデルよりも大幅に高いことが示されています。
しかし、OpenAIはブログの中で、アラインメントモニターが「時折、合法的な活動を潜在的なネットワークの悪用または未承認の行為として誤ってマークし、その結果、意図せずに遅延、停止、または中断される可能性がある」と指摘しています。また、この防護メカニズムは、ユーザーがネットワークセキュリティとは無関係に見える活動を行っているときにもトリガーされる可能性があります。このような場合、ChatGPTおよびCodexのユーザーは、操作を続行する前にモデルの行動を確認するよう求められることがあります。
Daybreakプログラムのパートナーは制限の少ない初期バージョンを取得
OpenAI DaybreakプログラムのパートナーであるCisco、Cloudflare、Palo Alto Networksなどのデジタルインフラストラクチャプロバイダーは、制限の少ない、より強力なネットワーク攻撃能力を持つAstraの初期バージョンへのアクセス権を得ることができます。このプログラムの目的は、これらの企業が同様の能力を持つモデルが広く公開される前に、Astraなどの高度なAIモデルを利用して自身の防御体制を強化できるようにすることです。OpenAIの幹部は、同社が政府のパートナーと密接に協力しており、Astraのネットワーク攻撃能力を理解し、関連するアクセス権を取得できるようにしていることを明らかにしました。
Astraは新しいソフトウェアの脆弱性を発見し、それに応じた侵入手法を開発するだけでなく、複数の脆弱性を「連結」することもできます。この技術は、ターゲットシステムに徐々に侵入し、単一の脆弱性では達成できないアクセス権を取得することができます。OpenAIが提供するデータによれば、AstraはExploitBenchなどのネットワークセキュリティベンチマークテストで、業界のリーダーモデルであるGPT-5.6 SolやAnthropicのMythosなどを上回るパフォーマンスを示し、ExploitBenchでは100%のスコアを獲得しています。
しかし、これらの能力は全体として、OpenAIとAnthropicが数ヶ月にわたって予測してきたAIモデルのハッキング能力の強化傾向と一致しています。たとえば、今年4月にAnthropicは、Mythos Previewが自律的に脆弱性利用チェーンを開発できることを強調しました。
AIとネットワークセキュリティ業界が急速に対応を進める中、多くのネットワークセキュリティ専門家は、重要なデジタルセキュリティ防御手段と長期的なベストプラクティスが依然として有効であることを強調しています。しかし、これらの防護策を十分に実施していない組織やシステムにとって、AIがもたらすリスクはますます差し迫ったものとなっています。

