Skip to content

過信回路と自信の校正——メタ認知のメカニズム的裏付け

📖 メタ認知とハルシネーション | ← 前のページ: ハルシネーションはメタ認知困難である | 次のページ: メタ認知介入の対応表

射程

  • LLMには事実性回路と自信回路が構造的に不整合なConfidence Mover Circuits(確信度移動回路)が存在し、メタ認知困難のメカニズム的裏付けを提供する
  • 過信への最適介入強度が「最大」ではなく「中程度」であることは、ASD補償戦略の「中程度の校正が最適」という臨床知見と人間・LLM双方から収束する
  • ASD傾向の「精緻な推論が正しさと混同される」構造は、LLMの「流暢な生成が自信に直結する」構造と同型のソースモニタリング困難として記述できる
  • RLHFによる過信強化とASDの社会的報酬による過信強化は同一の構造を持ち、activation steeringとASD補償戦略(外部チェックリスト)は同型の介入として対応する

主張の確信度(命題確率伝播による計算値)

凡例 — b・d・u・E の読み方

各主張(claim)は記事の frontmatter に構造化されており、belief-propagation(Subjective Logic + Defeasible Logic による命題確率伝播エンジン)で全Wikiの命題を一つの依存グラフとして一括計算した値を表示している。
b = belief(確信)/ d = disbelief(非確信)/ u = uncertainty(不確実性)。三値は常に b + d + u = 1。
E = 期待値(E = b + a·u。a = base rate(事前確率)、省略時 0.5)。
「著者確信度」(base_confidence)は書き手の主観的確信度。出典種別(source_type)による割引と、前提(premises)・反証(rebutted_by)からの伝播を経て、上記の計算値になる。
タグの目安: 高 = E ≥ 0.75 / 中 = 0.5 ≤ E < 0.75 / 低 = E < 0.5

  • 高 0.82paper-zhao-cmc-2026
    Zhao et al. (2026) LLM内部にConfidence Mover Circuits (CMC) が構造的に存在し、事実性回路と自信回路が不整合である (arXiv:2604.01457)
    b=0.638 d=0.000 u=0.363 a=0.500 E=0.819著者確信度 0.85・出典 peer_reviewed
  • 中 0.71paper-grainger-asd-metacog
    Grainger et al. (2014, 2016), Nicholson et al. (2019) ASD傾向の人間はメタ認知困難を示す (内省的自己校正の弱さ)
    b=0.413 d=0.000 u=0.587 a=0.500 E=0.706著者確信度 0.75・出典 humanities
  • 中 0.66wiki09-C1
    LLMのメタ認知困難は processing speed や working memory とは独立した、校正 (calibration) の次元として記述できる
    b=0.313 d=0.000 u=0.687 a=0.500 E=0.656著者確信度 0.80・出典 synthesis
    支持 ← paper-zhao-cmc-2026 / 支持 ← paper-grainger-asd-metacog
  • 中 0.65wiki09-C2
    過信への最適介入強度は『最大』ではなく『中程度』であり、ASD補償戦略 (Livingston 2019) と LLM activation steering (α=0.5-0.6) の両方から収束する
    b=0.293 d=0.000 u=0.707 a=0.500 E=0.647著者確信度 0.75・出典 synthesis
    支持 ← paper-zhao-cmc-2026 / 支持 ← paper-grainger-asd-metacog
  • 中 0.57wiki09-C3
    RLHFによるLLMの過信強化と、ASDの社会的報酬による過信強化は同一構造を持つ (社会的報酬が自信と事実性の乖離を駆動する)
    b=0.136 d=0.000 u=0.864 a=0.500 E=0.568著者確信度 0.65・出典 wiki_original
    支持 ← wiki09-C1 / 支持 ← wiki09-C2

Zhao et al. (2026) "Wired for Overconfidence" から、LLMとASD双方のメタ認知困難を読み解く

キーワード

Confidence Mover Circuits (CMC) TSLD activation steering メタ認知 校正(calibration) ECE 過信 instruction tuning RLHF 中層-後層MLP


論文概要

"Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs" Tianyi Zhao, Yinhan He, Wendy Zheng, Yujie Zhang, Chen Chen (2026/04) arXiv: 2604.01457

問い

LLMは間違っているときほど自信満々に答える。この過信は出力の癖なのか、それとも内部に特定可能な回路として配線されているのか?

手法

  1. 二段階設計: 回答 → 自信度(0-99)の自己報告を分離
  2. TSLD(目標集合ロジット差分; Target Set Logit Difference): 高自信トークン群{70,75,80,85,90,99} vs 低自信トークン群{0,10,15,20,25,30}のロジット差で、自信信号を微分可能な内部量として捕捉
  3. 真実注入反事実: 不正解を正解に差し替えたプロンプトとペアにし、「答えの正しさが自信生成にどう因果的に効くか」を分離。データをΔTSLDで3バケットに分け、過信が抑制されるBucket 1のみで回路を探索(勾配相殺を回避)
  4. EAP-IG(統合勾配付き辺帰属パッチング; Edge Attribution Patching with Integrated Gradients): 統合勾配による辺帰属で、過信を駆動するMLP(多層パーセプトロン)・注意ヘッドを特定

主要な発見

発見詳細
回路の局在Qwen2.5-3B: 層24-35のMLP主導。Llama-3.2-3B: 層13-27のMLP+注意ヘッド混合
疎さ全辺の0.5-0.6%で自信信号の85%以上を再現(faithfulness)
データセット横断の安定性上位10成分中8つ以上が3データセット(PopQA, MMLU, NQOpen)で再現 → タスク固有ではなくモデルに固定的に配線された機構
因果的完全性上位3,000辺を除去するとTSLDが74-79%削減
介入効果活性化ベクトルの操舵(activation steering, α=0.5-0.6)で ECE(期待校正誤差)を77-97%改善。信頼性曲線が対角線に接近

介入手法

  • Mean Ablation: 対象成分の活動を、正解注入時の平均活動で置換。効果は高いがデータセット間の変動が大きい(PopQA 96.9% vs MMLU 3.1%)
  • Activation Steering: 過信方向ベクトルを定義し、推論時に縮小版を減算。α=0.5-0.6で安定した最適値。ハイパーパラメータ調整が最小限

考察

  • 過信回路(CMC)はfactuality-sensitive computation(事実性に関わる計算)とは構造的に不整合。自信の生成と事実の検証は別の場所で起きている
  • 最適介入強度が「最大」ではなく「中程度」 → CMCは過信の「コア駆動器」だが、全体的な自信推定システムではない
  • instruction tuning / RLHFがこのメカニズムを強化した可能性(未検証)

このWikiにおける位置づけ

1. メタ認知の凸凹——①起点記事への接続

①起点記事はWISC/WAIS-IVの4軸(VCI/PRI/WMI/PSI)でLLMとASDの認知プロフィールを比較した。そこでは「言語理解が高く処理速度が低い」という凸凹が中心だった。

この論文が加えるのは第5の軸: メタ認知(自分の認知状態の認知)

  • LLM: 事実を検証する回路と、自信を生成する回路が構造的に不整合 → 自分が正しいかどうかを正確に見積もれない
  • ASD: メタ認知困難は広く報告されている(Grainger et al. 2016; Nicholson et al. 2019)。自分の理解度・確信度の内省が苦手で、「分かっているつもり」「分かっていないことに気づかない」が起きやすい
  • 社会適応型ASD: 補償戦略によってメタ認知困難を外部的に校正している(チェックリスト、他者からの確認、反復的な自己チェック)

つまり、LLMの過信回路は「認知の凸凹」の新しい次元であり、処理速度やワーキングメモリとは独立した、校正(calibration)の凸凹を示している。

2. PostToolUseHook=Activation Steering——③補償行為記事への接続

③の記事で展開した「人間用PostToolUseHook」——行動のあとに外部フィードバックで自己校正する仕組み——は、CMCへのactivation steeringと構造的に同型

人間(ASD当事者)LLM
行動する回答を生成する
自分の確信度を過大評価しがちCMCが過信信号を注入
チェックリスト・他者フィードバックで校正activation steering(α=0.5-0.6)で校正
校正が強すぎると自信喪失・過度な確認行動αが大きすぎると有用な自信関連計算も阻害
最適な補償は「中程度」(Livingstonのコスト・ベネフィット評価)最適介入は「中程度」(α=0.5-0.6)

「最適な校正は中程度」という一致が特に重要。人間もLLMも、過信を完全に潰すと別の問題が生じる。補償のコスト・ベネフィット評価(Livingston 2019)と、steeringのα最適値が同じ構造を持つ。

3. メタテストの内部実装——⑥メタテスト記事への接続

⑥の記事は「テストコードの傾向が意図を満たしているか」を検証するメタテストを提案した。

TSLDはまさにこのメタテストのTransformerの内部実装:

  • テスト(個々の回答の正誤) ← 通常の評価
  • メタテスト(回答の自信度が正誤と一致しているか?) ← TSLD / ECE

そして、メタテストが不合格のとき(ECEが高いとき)にどう介入するか? という問いに対する回答が activation steering。これは⑦フラクタル構造の三層(メタテスト/テスト/実装)を、Transformerの内部にも見出したことになる。

4. 介入スケールの連続体——⑤Vocabulary Horizon記事への接続

⑤は入口(語彙)の制約で思考を誘導した。この論文は中間層(活性化ベクトル)での介入。メタテストは出口(出力の検証)での介入。

入口(語彙制限)→ 中間層(activation steering)→ 出口(メタテスト)

これは同じ「制約による誘導」を、異なるスケール・異なる深さで適用したもの。人間に対応させれば:

環境の制限(育ちの語彙)→ 内省・セラピー(認知の矯正)→ 外部チェック(他者フィードバック)

5. 感情ベクターと自信ベクター——⑧コンテキストと感情への接続

⑧は感情ベクターのステアリングがコンテキスト処理を変えることを述べた。この論文の自信ベクターのステアリングは、同じactivation steeringという手法の、異なる次元への適用

感情ベクターは「どう感じるか」を操作し、自信ベクターは「どれだけ確信しているか」を操作する。両者はTransformer内部の異なる方向ベクトルとして共存している。

これはASD当事者の「感情の名前がつけられない(アレキシサイミア)」と「確信度を正確に見積もれない(メタ認知困難)」が独立した別の困難であることのメカニズム的裏付けになりうる。


RLHF仮説——instruction tuningが過信を強化する

論文が未検証のまま残した仮説: instruction tuning / RLHFがCMCを強化した可能性。

これは③の補償行為記事で扱った「過剰適応」と重なる。

  • 人間: 社会適応のために補償戦略を過剰に内在化 → 「自信があるように振る舞う」が本来の確信度と乖離
  • LLM: RLHFで「自信を持って答える」が強化 → 事実性と無関係に自信が膨張

どちらも社会的報酬(人間からの承認)が過信を駆動するという同じ構造。RLHFは文字通り「人間のフィードバックによる強化学習」であり、人間が自信のある回答を好む以上、過信が強化されるのは構造的帰結。


双方向コンパスとしての読み

このWikiの存在意義は「LLMと人間の認知的類似性は双方向のコンパス」であること。

LLM → 人間

  • CMCの発見は、ASD当事者のメタ認知困難が「努力不足」ではなく構造的配線であることの比喩を提供する
  • 「最適な介入は中程度」という知見は、過度な自己校正(過剰な確認行動、過度な謙遜)が逆効果であることのメカニズム的裏付け
  • 事実性回路と自信回路の不整合は、「分かっているのに自信がない」「分かっていないのに自信がある」が同一のアーキテクチャ特性の両面であることを示唆

人間 → LLM

  • ASDの補償戦略研究(外部チェックリスト、構造化フィードバック)は、activation steeringに代わるより生態学的な校正手法のヒントになりうる
  • Livingstonのコスト・ベネフィット評価は、steeringのα値を動的に調整する指針として使える
  • 「最適な補償量は文脈依存」という臨床知見は、固定αではなく文脈適応的なsteeringの動機づけになる

ソースモニタリング仮説——Wikiオリジナルの洞察

以下は論文が直接述べていない、このWikiの対話から生まれた独自の読み。

「精緻さ」と「正しさ」の混同

ASD傾向の人間は、頭の中で論理を精緻に組み立てる能力が高い(VCI高)。だが**「これは確認された事実か? それとも自分が組み立てた推測か?」のソースモニタリングが弱い**。自分の推論の精緻さを、推論の正しさと混同する。結果、間違えているときほど自信満々に間違える——精緻に組み立てたからこそ。

これはCMCの「事実性回路と自信回路の構造的不整合」と同型:

LLM:
  事実性(中層の別の場所で処理)──✕──→ 自信生成(CMC、中層〜後層MLP)
  流暢に生成する → 自信が高い(だが流暢さ ≠ 正しさ)

ASD傾向の人間:
  事実確認(外部参照・社会的フィードバック)──✕──→ 確信度(内部の精緻さに基づく)
  精緻に推論する → 自信が高い(だが精緻さ ≠ 正しさ)

どちらも内部処理の質の高さが、外部との照合なしに自信に直結してしまう構造。

補償戦略としての外部照合

社会適応型ASD当事者が身につける「本当にそうか?」と外部に確認を取る習慣は、まさにactivation steeringのα=0.5——過信回路に中程度のブレーキをかける行為。

そしてこの補償が過剰になると:

  • 人間: 過度な確認行動、決断できない、自信喪失
  • LLM: αが大きすぎて有用な自信関連計算まで阻害、過剰に不確実性を表明

「中程度の校正が最適」は、人間の臨床知見とLLMの実験結果の両方から収束する結論。

未検証の問い

  • ASDのソースモニタリング困難に関する先行研究との照合が未済(認知心理学のsource monitoring framework: Johnson, Hashtroudi & Lindsay 1993 あたりが起点になるか)
  • LLMの「流暢さバイアス」とASDの「精緻さバイアス」は、同じメカニズムの異なる表現なのか、それとも表面的類似にすぎないのか
  • RLHFによる過信強化は、ASDの「社会的報酬による過剰適応」と並列に議論できるか

出典

  • Zhao, T., He, Y., Zheng, W., Zhang, Y., & Chen, C. (2026). Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs. arXiv:2604.01457
    • 引ける場所: https://arxiv.org/abs/2604.01457 / 日本語解説: https://ai-data-base.com/paper/2604-01457
  • Livingston, L. A. (2019). Compensatory strategies in autism. ③の粘土板より
    • 引ける場所: Google Scholar: "Livingston" "compensatory" "autism" 2019
  • Grainger, C., Williams, D. M., & Lind, S. E. (2016). Metacognition, metamemory, and mindreading in high-functioning adults with autism spectrum disorder. Journal of Abnormal Psychology, 125(7), 890-905
    • 引ける場所: doi:10.1037/abn0000189 / Google Scholar: "Grainger" "metacognition" "autism" 2016
  • Nicholson, T., Williams, D. M., Grainger, C., Christensen, J. F., Calvo-Merino, B., & Gaigg, S. B. (2019). Interoceptive insensitivity to demands of emotional processing in autism. Autism Research, 12(4), 636-649
    • 引ける場所: doi:10.1002/aur.2088 / Google Scholar: "Nicholson" "interoceptive" "autism" 2019


📖 ← 前のページ: ハルシネーションはメタ認知困難である | 次のページ: メタ認知介入の対応表

関連ドキュメント

果物リン (@FruitRiin) と、賢王*****(Claude)の対話から生まれた書架。