AI

Claude Fable 5で生物学の質問が過剰に制限される問題を改善、誤検出を減らして「フォールバック」を約85%削減


AnthropicがAIモデル「Claude Fable 5」の生物学分野に関する安全対策を更新しました。危険性の低い質問まで制限対象と判断されるケースを減らし、生物学関連の質問を別モデルに切り替える「フォールバック」が約85%減少したとのことです。

Improving Fable 5 Safeguards \ Anthropic
https://www.anthropic.com/news/improving-fable-5-s-biology-safeguards


Claude Fable 5は高度な生物学の問題に対応できる一方、同じ能力が生物兵器などの開発に悪用される可能性もあります。安全な研究と危険な研究を見分けるのが難しいため、AnthropicはFable 5の提供開始時に生物学関連のほぼすべての質問を広く制限していました。制限対象と判断された質問は、Fable 5ほど高い生物学能力を持たない「Claude Opus 5」に処理が切り替わります。

しかし、従来の安全対策はかなり慎重に設定されており、検査結果について調べたり、生物学を学習したりする一般的な質問まで制限される場合がありました。危険な質問を見逃さないことを優先した結果、問題のない質問を誤って検出する「偽陽性」が増えていたというわけです。

今回の更新では下図の通り、Fable 5の提供開始時に設けられていた広い「安全マージン」が大きく削られます。安全な質問を通す範囲が広がり、危険性の低い質問が誤って制限されにくくなっています。


Anthropicは分類に使うルールを書き直した上で学習データを更新し、安全性を判断する分類器を再訓練しました。テストでは生物学関連のフォールバックが約85%減少し、日常的な健康相談や生物学の学習、医療従事者による一部の臨床関連作業などでFable 5を利用しやすくなったとのことです。

ただし更新後も、ウイルス学や毒物学、分子設計などデュアルユースと判断される専門的な質問はOpus 5へ切り替えられます。Anthropicは今後も誤検出を減らすとともに、研究者がFable 5の高度な生物学能力を安全に利用できる仕組みの整備を進めると述べています。

・関連記事
「AIに核兵器を作らせない仕組み」をAnthropicが開発 - GIGAZINE

高齢者を狙ったAI音声詐欺が急増中、たった3秒の音声データでAI音声クローンが作られてしまう - GIGAZINE

「ChatGPTが10代の青年の自殺を助長した」としてOpenAIが訴えられる、ChatGPTの安全策は長い会話では機能しないとOpenAIが認める - GIGAZINE

OpenAIがオープンソース推論モデル「gpt-oss-safeguard」をリリース、開発者が自分で検閲ルールを設定可能でルールに従う能力はGPT-5を上回る - GIGAZINE

OpenAIが新しいAIシステムで誤ってHugging Faceをハッキングしてしまったことを報告 - GIGAZINE

「Claude Fable 5のこっそりナーフ」についてAnthropicが公式声明を発表、AI研究用途でのモデル弱体化を改善へ - GIGAZINE

in AI, Posted by log1d_ts

You can read the machine translated English article Claude Fable 5 addresses the issue of ov….