Anthropic、Claude Fableの隠れた安全策について謝罪し透明性を強化へ

要約

AI企業Anthropicは、その新しいAIモデル「Claude Fable 5」において、隠れた安全策を用いていたことを謝罪しました。この隠れた安全策は、モデルの蒸留を防ぐものであり、研究者や競合他社に対して不公平であるとされていました。今後は、この安全策がどのように機能するかを透明にし、ユーザーに明示する方針を示しています。

背景として、Anthropicは、Fableを公に利用できる形でリリースすることに対し、危険性を警告し続けていました。Fableは、特定の「高リスク」なクエリに対して制限を設ける安全措置を講じており、その一環として蒸留に関するクエリを制限していました。しかし、ユーザーにはその制限が通知されず、変更された回答が提示されることが問題視されていました。

今回の方針変更は、AI研究コミュニティからの強い反発を受けたもので、Anthropicは今後、Distillationの試みがあった場合には、前のモデルである「Claude Opus 4.8」に戻すことを明示することを約束しました。これにより、ユーザーは安全策の存在を理解しやすくなり、より公正な利用が促進されることが期待されています。


元記事: https://www.theverge.com/ai-artificial-intelligence/948280/anthropic-claude-fable-invisible-distillation-guardrail

公開日: Thu, 11 Jun 2026 12:05:02 +0000


この記事はAIアシスト編集により作成されています。

📰 元記事: 元記事を読む

コメントする