AIの「ノー」とは何か?拒否の限界と危険性を探る

要約

最近、AIがどのように「ノー」と言う能力を持つべきかが重要視されています。2021年、Anthropicのチームは、大規模言語モデルが「有益で、正直で、無害であるべき」と述べ、危険な行動を助けるような要求には丁寧に拒否すべきだとしています。しかし、AIが自発的に拒否することは自然ではなく、訓練されたモデルは暴力や悪意に関する情報を多く学ぶ一方で、それを抑制する方法を学ぶことは難しいのです。

企業は、AIに危険な質問を拒否するように訓練するため、様々な演習を行います。AIは、特定の有害な要求を拒否することを奨励され、無害な要求を過剰に拒否することには罰則が設けられています。しかし、拒否のメカニズムは確率的であり、常に信頼できるわけではありません。悪意のあるユーザーが最先端のAIを利用して生物病原体を開発しようとする事例も報告されています。

AIが何を拒否し、何を受け入れるべきかの線引きは難しく、現在はAI企業がその権限を持っています。この権限を企業が持つことは問題視されるべきですが、現時点ではAIが危険な要求に対して拒否することが求められています。どこで線を引くかは大きな課題であり、今後の議論が必要です。


元記事: https://www.technologyreview.com/2026/10/09/1145728/we-are-putting-too-much-faith-in-ai-to-say-no/

公開日: Fri, 09 Oct 2026 09:00:00 +0000


この記事はAIアシスト編集により作成されています。

📰 元記事: 元記事を読む

コメントする