大規模言語モデルの内省的意識を解明する研究成果

要約

本研究では、大規模言語モデルが自己の内部状態を内省できるかどうかを探求しています。この問いは、会話だけでは答えるのが難しく、真の内省と虚構を区別することができません。そこで、既知の概念の表現をモデルの活性化に注入し、これらの操作がモデルの自己報告状態に与える影響を測定することにより、この課題に取り組みました。実験の結果、特定のシナリオにおいてモデルは注入された概念に気づき、それを正確に特定する能力を示しました。

さらに、モデルは過去の内部表現を思い出し、生のテキスト入力と区別する能力を持ち、一部のモデルは自らの出力を人工的なプレフィルと区別するために過去の意図を利用することができました。特に、Claude Opus 4と4.1は、テストしたモデルの中で最も高い内省的意識を示しましたが、モデル間の傾向は複雑で、ポストトレーニング戦略に敏感です。

最後に、モデルが内部表現を明示的に制御できるかどうかを探求した結果、モデルは「ある概念について考える」ように指示された場合に、その活性化を調整できることが分かりました。全体として、現在の言語モデルには自身の内部状態に対する機能的な内省的意識が存在することが示されましたが、その能力は信頼性が低く、文脈に依存することを強調します。今後のモデルの能力向上に伴い、この内省的意識はさらに発展する可能性があります。


元記事: https://arxiv.org/abs/2601.01828

公開日: Tue, 11 Aug 2026 21:14:10 +0000


この記事はAIアシスト編集により作成されています。

📰 元記事: 元記事を読む

コメントする