Anthropic は、ユーザーの福祉に対する人工知能(AI)の影響を探るための独立した研究を資金提供することを目的とした500万ドルの助成プログラムを発表しました。このプログラムでは、助成を受ける研究者に対して直接的な資金、モデルへのアクセス権、技術サポートを提供し、AI業界がそのモデルがユーザーに与える影響を測定するためのオープンソース評価の構築を支援します。
助成プログラムの目的と重要性
Anthropic は、AIシステムが多くの人々にとって仕事、学習、問題解決の中心的なツールとなっており、困難な時期には対話のパートナーや感情的なサポートの源にもなっていると述べています。しかし、業界全体がこれらの対話におけるモデルの行動を適切に保つための明確な基準を策定するために努力している段階です。
「私たちは、独立した評価とベンチマークへの資金提供を通じて、臨床医、心理学者、方法論の専門家など、より多くの人々をこの新興かつ重要な分野に招待したいと考えています。」
Anthropic
福祉の評価における課題
福祉の評価は特に困難な領域です。ほとんどのモデルの行動は単一の回答を通じてその正確性と適切性を判断できますが、福祉の評価にはより多くの背景が必要です。たとえば、困難な状況にあるユーザーは、自傷行為の考えをすぐに共有しないかもしれず、長時間の対話を通じて徐々に明らかにする必要があります。
「正しい対応方法は、私たちのモデルとその使用状況の進化に伴って常に発展する必要があります。」
Anthropic
助成プログラムの具体的な要件
この助成プログラムでは、Anthropic が安全保障チームのガイダンスを共有し、どのような福祉評価が十分に厳密であるかを明確にします。評価は測定内容を明確にし、臨床および主題の専門家が設計と検証に関与し、ユーザーがAIを実際に使用する状況を反映する必要があります。
「私たちが求める評価は、過剰な従属や過剰な拒否のリスクを評価することを含め、予防策と危害をテストできるものであるべきです。」
Anthropic
申請を希望する研究者は、公式ウェブサイトから申請書を入手でき、締切は9月21日で、選ばれた申請者には10月5日に通知が送られます。
資料来源:Anthropic 公式発表

