Anthropic、Fable 5の生物安全対策を強化

Anthropic は公式に、Claude Fable 5 の生物安全対策を更新し、誤報の状況を大幅に減少させたことを発表しました。Fable 5 のユーザーは、ユーザーが生物に関連する問い合わせを行った後に、システムが能力の低いモデルに切り替わる「ダウングレード」の状況が少なくなることを体験するでしょう。テストの結果、この更新により生物関連のダウングレードの状況が約 85% 減少しました。

Fable 5 はより多くの生物関連タスクを支援できる

公式によると、この更新により Fable 5 はより広範な生物タスクの処理を支援できるようになります。ユーザーの日常的な健康や教育に関する問題でのダウングレードの状況は大幅に減少し、例えば実験室の結果の解釈、症状の理解、生物学の学習などが含まれます。医療専門家は、臨床タスクにおいて Fable 5 からのさらなるサポートを受けることができるようになります。

「私たちは、人工知能が生物学と医学に対して積極的な影響を与える最大の機会はここにあると信じており、生物学者が最先端のアクセス権を得るための責任ある方法を構築するために大きな投資を行っています。」

Anthropic

生物安全対策強化の理由

Anthropic は、Fable 5 の導入の目的は、より多くのユーザーがその最先端の能力を迅速に利用できるようにすることだと述べています。しかし、モデルの能力が向上するにつれて、リスクも増加しています。Fable 5 は現在、特定の高度に複雑な生物タスクにおいて専門家を超えることができ、これは研究者に新しい医療治療法の開発などの実質的な支援を提供できることを意味します。しかし、誤った手に渡ると、これらの能力は悪用される可能性があり、例えば生物兵器の開発に利用されることがあります。

「私たちの能力評価は、Fable 5 が悪意のある行為者に対して顕著な向上を提供する可能性があることを示しています。これは、彼らに他の場所では得られない能力を提供できることを意味します。」

Anthropic

生物安全対策の運用方法

Anthropic の生物安全対策は、主に安全分類器を通じて保護されています。これらの小型自動化 AI システムは、Fable 5 が保護された生物タスクを実行するよう要求されているか、有害な出力を生成するよう要求されているかを検出することができます。分類器が起動すると、モデルはユーザーのリクエストを能力の低いモデルである Opus 5 に再ルーティングします。これにより、悪意のあるユーザーに対してあまり助けを提供できません。これが、ユーザーがリクエストがブロックされたときに見るダウングレードの状況です。

正確で堅牢な分類器を開発することは簡単ではありません。分類器が迅速かつ一貫して機能するためには、「範疇内」と「範疇外」と考えられるトピックやクエリを区別できるように学習する必要があります。これには時間と反復が必要で、分類器を調整して誤報や漏報の状況を避ける必要があります。Anthropic はまた、分類器がそれらを回避しようとする行為に対抗できるように要求しており、これにはさらなる研究とテストが必要です。

過去数週間、Anthropic は慎重に分類器のルールを書き直し、さまざまな専門家からのフィードバックに基づいて調整を行いました。これらの更新により、Fable 5 のローンチ時と比較して、分類器が多くの無害な生物関連リクエストに対してトリガーされる状況が大幅に減少することになります。

それでも、さらなる安全対策の改善が必要であり、誤報の状況は依然として存在します。Fable は、潜在的な二重用途リスクを防ぐために、二重用途の専門的な生物学や薬物開発に関するクエリを引き続きブロックします。Anthropic は、研究者が信頼できるアクセスチャネルを通じてその最も強力なモデルを利用できる安全でスケーラブルな方法を開発することを約束しています。

資料来源:Anthropic 公式公告

Nakumura
Nakumura
関連サイト:中文版 / TechRitualThe Base Principle