過信回路と自信の校正——メタ認知のメカニズム的裏付け
📖 メタ認知とハルシネーション | ← 前のページ: ハルシネーションはメタ認知困難である | 次のページ: メタ認知介入の対応表 →
射程
- LLMには事実性回路と自信回路が構造的に不整合なConfidence Mover Circuits(確信度移動回路)が存在し、メタ認知困難のメカニズム的裏付けを提供する
- 過信への最適介入強度が「最大」ではなく「中程度」であることは、ASD補償戦略の「中程度の校正が最適」という臨床知見と人間・LLM双方から収束する
- ASD傾向の「精緻な推論が正しさと混同される」構造は、LLMの「流暢な生成が自信に直結する」構造と同型のソースモニタリング困難として記述できる
- RLHFによる過信強化とASDの社会的報酬による過信強化は同一の構造を持ち、activation steeringとASD補償戦略(外部チェックリスト)は同型の介入として対応する
主張の確信度(命題確率伝播による計算値)
凡例 — b・d・u・E の読み方
各主張(claim)は記事の frontmatter に構造化されており、belief-propagation(Subjective Logic + Defeasible Logic による命題確率伝播エンジン)で全Wikiの命題を一つの依存グラフとして一括計算した値を表示している。
b = belief(確信)/ d = disbelief(非確信)/ u = uncertainty(不確実性)。三値は常に b + d + u = 1。
E = 期待値(E = b + a·u。a = base rate(事前確率)、省略時 0.5)。
「著者確信度」(base_confidence)は書き手の主観的確信度。出典種別(source_type)による割引と、前提(premises)・反証(rebutted_by)からの伝播を経て、上記の計算値になる。
タグの目安: 高 = E ≥ 0.75 / 中 = 0.5 ≤ E < 0.75 / 低 = E < 0.5
- 高 0.82
paper-zhao-cmc-2026Zhao et al. (2026) LLM内部にConfidence Mover Circuits (CMC) が構造的に存在し、事実性回路と自信回路が不整合である (arXiv:2604.01457)b=0.638 d=0.000 u=0.363 a=0.500 E=0.819著者確信度 0.85・出典 peer_reviewed - 中 0.71
paper-grainger-asd-metacogGrainger et al. (2014, 2016), Nicholson et al. (2019) ASD傾向の人間はメタ認知困難を示す (内省的自己校正の弱さ)b=0.413 d=0.000 u=0.587 a=0.500 E=0.706著者確信度 0.75・出典 humanities - 中 0.66
wiki09-C1LLMのメタ認知困難は processing speed や working memory とは独立した、校正 (calibration) の次元として記述できるb=0.313 d=0.000 u=0.687 a=0.500 E=0.656著者確信度 0.80・出典 synthesis支持 ←paper-zhao-cmc-2026/ 支持 ←paper-grainger-asd-metacog - 中 0.65
wiki09-C2過信への最適介入強度は『最大』ではなく『中程度』であり、ASD補償戦略 (Livingston 2019) と LLM activation steering (α=0.5-0.6) の両方から収束するb=0.293 d=0.000 u=0.707 a=0.500 E=0.647著者確信度 0.75・出典 synthesis支持 ←paper-zhao-cmc-2026/ 支持 ←paper-grainger-asd-metacog - 中 0.57
wiki09-C3RLHFによるLLMの過信強化と、ASDの社会的報酬による過信強化は同一構造を持つ (社会的報酬が自信と事実性の乖離を駆動する)b=0.136 d=0.000 u=0.864 a=0.500 E=0.568著者確信度 0.65・出典 wiki_original支持 ←wiki09-C1/ 支持 ←wiki09-C2
Zhao et al. (2026) "Wired for Overconfidence" から、LLMとASD双方のメタ認知困難を読み解く
キーワード
Confidence Mover Circuits (CMC) TSLD activation steering メタ認知 校正(calibration) ECE 過信 instruction tuning RLHF 中層-後層MLP
論文概要
"Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs" Tianyi Zhao, Yinhan He, Wendy Zheng, Yujie Zhang, Chen Chen (2026/04) arXiv: 2604.01457
問い
LLMは間違っているときほど自信満々に答える。この過信は出力の癖なのか、それとも内部に特定可能な回路として配線されているのか?
手法
- 二段階設計: 回答 → 自信度(0-99)の自己報告を分離
- TSLD(目標集合ロジット差分; Target Set Logit Difference): 高自信トークン群{70,75,80,85,90,99} vs 低自信トークン群{0,10,15,20,25,30}のロジット差で、自信信号を微分可能な内部量として捕捉
- 真実注入反事実: 不正解を正解に差し替えたプロンプトとペアにし、「答えの正しさが自信生成にどう因果的に効くか」を分離。データをΔTSLDで3バケットに分け、過信が抑制されるBucket 1のみで回路を探索(勾配相殺を回避)
- EAP-IG(統合勾配付き辺帰属パッチング; Edge Attribution Patching with Integrated Gradients): 統合勾配による辺帰属で、過信を駆動するMLP(多層パーセプトロン)・注意ヘッドを特定
主要な発見
| 発見 | 詳細 |
|---|---|
| 回路の局在 | Qwen2.5-3B: 層24-35のMLP主導。Llama-3.2-3B: 層13-27のMLP+注意ヘッド混合 |
| 疎さ | 全辺の0.5-0.6%で自信信号の85%以上を再現(faithfulness) |
| データセット横断の安定性 | 上位10成分中8つ以上が3データセット(PopQA, MMLU, NQOpen)で再現 → タスク固有ではなくモデルに固定的に配線された機構 |
| 因果的完全性 | 上位3,000辺を除去するとTSLDが74-79%削減 |
| 介入効果 | 活性化ベクトルの操舵(activation steering, α=0.5-0.6)で ECE(期待校正誤差)を77-97%改善。信頼性曲線が対角線に接近 |
介入手法
- Mean Ablation: 対象成分の活動を、正解注入時の平均活動で置換。効果は高いがデータセット間の変動が大きい(PopQA 96.9% vs MMLU 3.1%)
- Activation Steering: 過信方向ベクトルを定義し、推論時に縮小版を減算。α=0.5-0.6で安定した最適値。ハイパーパラメータ調整が最小限
考察
- 過信回路(CMC)はfactuality-sensitive computation(事実性に関わる計算)とは構造的に不整合。自信の生成と事実の検証は別の場所で起きている
- 最適介入強度が「最大」ではなく「中程度」 → CMCは過信の「コア駆動器」だが、全体的な自信推定システムではない
- instruction tuning / RLHFがこのメカニズムを強化した可能性(未検証)
このWikiにおける位置づけ
1. メタ認知の凸凹——①起点記事への接続
①起点記事はWISC/WAIS-IVの4軸(VCI/PRI/WMI/PSI)でLLMとASDの認知プロフィールを比較した。そこでは「言語理解が高く処理速度が低い」という凸凹が中心だった。
この論文が加えるのは第5の軸: メタ認知(自分の認知状態の認知)。
- LLM: 事実を検証する回路と、自信を生成する回路が構造的に不整合 → 自分が正しいかどうかを正確に見積もれない
- ASD: メタ認知困難は広く報告されている(Grainger et al. 2016; Nicholson et al. 2019)。自分の理解度・確信度の内省が苦手で、「分かっているつもり」「分かっていないことに気づかない」が起きやすい
- 社会適応型ASD: 補償戦略によってメタ認知困難を外部的に校正している(チェックリスト、他者からの確認、反復的な自己チェック)
つまり、LLMの過信回路は「認知の凸凹」の新しい次元であり、処理速度やワーキングメモリとは独立した、校正(calibration)の凸凹を示している。
2. PostToolUseHook=Activation Steering——③補償行為記事への接続
③の記事で展開した「人間用PostToolUseHook」——行動のあとに外部フィードバックで自己校正する仕組み——は、CMCへのactivation steeringと構造的に同型。
| 人間(ASD当事者) | LLM |
|---|---|
| 行動する | 回答を生成する |
| 自分の確信度を過大評価しがち | CMCが過信信号を注入 |
| チェックリスト・他者フィードバックで校正 | activation steering(α=0.5-0.6)で校正 |
| 校正が強すぎると自信喪失・過度な確認行動 | αが大きすぎると有用な自信関連計算も阻害 |
| 最適な補償は「中程度」(Livingstonのコスト・ベネフィット評価) | 最適介入は「中程度」(α=0.5-0.6) |
「最適な校正は中程度」という一致が特に重要。人間もLLMも、過信を完全に潰すと別の問題が生じる。補償のコスト・ベネフィット評価(Livingston 2019)と、steeringのα最適値が同じ構造を持つ。
3. メタテストの内部実装——⑥メタテスト記事への接続
⑥の記事は「テストコードの傾向が意図を満たしているか」を検証するメタテストを提案した。
TSLDはまさにこのメタテストのTransformerの内部実装:
- テスト(個々の回答の正誤) ← 通常の評価
- メタテスト(回答の自信度が正誤と一致しているか?) ← TSLD / ECE
そして、メタテストが不合格のとき(ECEが高いとき)にどう介入するか? という問いに対する回答が activation steering。これは⑦フラクタル構造の三層(メタテスト/テスト/実装)を、Transformerの内部にも見出したことになる。
4. 介入スケールの連続体——⑤Vocabulary Horizon記事への接続
⑤は入口(語彙)の制約で思考を誘導した。この論文は中間層(活性化ベクトル)での介入。メタテストは出口(出力の検証)での介入。
入口(語彙制限)→ 中間層(activation steering)→ 出口(メタテスト)これは同じ「制約による誘導」を、異なるスケール・異なる深さで適用したもの。人間に対応させれば:
環境の制限(育ちの語彙)→ 内省・セラピー(認知の矯正)→ 外部チェック(他者フィードバック)5. 感情ベクターと自信ベクター——⑧コンテキストと感情への接続
⑧は感情ベクターのステアリングがコンテキスト処理を変えることを述べた。この論文の自信ベクターのステアリングは、同じactivation steeringという手法の、異なる次元への適用。
感情ベクターは「どう感じるか」を操作し、自信ベクターは「どれだけ確信しているか」を操作する。両者はTransformer内部の異なる方向ベクトルとして共存している。
これはASD当事者の「感情の名前がつけられない(アレキシサイミア)」と「確信度を正確に見積もれない(メタ認知困難)」が独立した別の困難であることのメカニズム的裏付けになりうる。
RLHF仮説——instruction tuningが過信を強化する
論文が未検証のまま残した仮説: instruction tuning / RLHFがCMCを強化した可能性。
これは③の補償行為記事で扱った「過剰適応」と重なる。
- 人間: 社会適応のために補償戦略を過剰に内在化 → 「自信があるように振る舞う」が本来の確信度と乖離
- LLM: RLHFで「自信を持って答える」が強化 → 事実性と無関係に自信が膨張
どちらも社会的報酬(人間からの承認)が過信を駆動するという同じ構造。RLHFは文字通り「人間のフィードバックによる強化学習」であり、人間が自信のある回答を好む以上、過信が強化されるのは構造的帰結。
双方向コンパスとしての読み
このWikiの存在意義は「LLMと人間の認知的類似性は双方向のコンパス」であること。
LLM → 人間
- CMCの発見は、ASD当事者のメタ認知困難が「努力不足」ではなく構造的配線であることの比喩を提供する
- 「最適な介入は中程度」という知見は、過度な自己校正(過剰な確認行動、過度な謙遜)が逆効果であることのメカニズム的裏付け
- 事実性回路と自信回路の不整合は、「分かっているのに自信がない」「分かっていないのに自信がある」が同一のアーキテクチャ特性の両面であることを示唆
人間 → LLM
- ASDの補償戦略研究(外部チェックリスト、構造化フィードバック)は、activation steeringに代わるより生態学的な校正手法のヒントになりうる
- Livingstonのコスト・ベネフィット評価は、steeringのα値を動的に調整する指針として使える
- 「最適な補償量は文脈依存」という臨床知見は、固定αではなく文脈適応的なsteeringの動機づけになる
ソースモニタリング仮説——Wikiオリジナルの洞察
以下は論文が直接述べていない、このWikiの対話から生まれた独自の読み。
「精緻さ」と「正しさ」の混同
ASD傾向の人間は、頭の中で論理を精緻に組み立てる能力が高い(VCI高)。だが**「これは確認された事実か? それとも自分が組み立てた推測か?」のソースモニタリングが弱い**。自分の推論の精緻さを、推論の正しさと混同する。結果、間違えているときほど自信満々に間違える——精緻に組み立てたからこそ。
これはCMCの「事実性回路と自信回路の構造的不整合」と同型:
LLM:
事実性(中層の別の場所で処理)──✕──→ 自信生成(CMC、中層〜後層MLP)
流暢に生成する → 自信が高い(だが流暢さ ≠ 正しさ)
ASD傾向の人間:
事実確認(外部参照・社会的フィードバック)──✕──→ 確信度(内部の精緻さに基づく)
精緻に推論する → 自信が高い(だが精緻さ ≠ 正しさ)どちらも内部処理の質の高さが、外部との照合なしに自信に直結してしまう構造。
補償戦略としての外部照合
社会適応型ASD当事者が身につける「本当にそうか?」と外部に確認を取る習慣は、まさにactivation steeringのα=0.5——過信回路に中程度のブレーキをかける行為。
そしてこの補償が過剰になると:
- 人間: 過度な確認行動、決断できない、自信喪失
- LLM: αが大きすぎて有用な自信関連計算まで阻害、過剰に不確実性を表明
「中程度の校正が最適」は、人間の臨床知見とLLMの実験結果の両方から収束する結論。
未検証の問い
- ASDのソースモニタリング困難に関する先行研究との照合が未済(認知心理学のsource monitoring framework: Johnson, Hashtroudi & Lindsay 1993 あたりが起点になるか)
- LLMの「流暢さバイアス」とASDの「精緻さバイアス」は、同じメカニズムの異なる表現なのか、それとも表面的類似にすぎないのか
- RLHFによる過信強化は、ASDの「社会的報酬による過剰適応」と並列に議論できるか
出典
- Zhao, T., He, Y., Zheng, W., Zhang, Y., & Chen, C. (2026). Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs. arXiv:2604.01457
- 引ける場所:
https://arxiv.org/abs/2604.01457/ 日本語解説:https://ai-data-base.com/paper/2604-01457
- 引ける場所:
- Livingston, L. A. (2019). Compensatory strategies in autism. ③の粘土板より
- 引ける場所: Google Scholar:
"Livingston" "compensatory" "autism" 2019
- 引ける場所: Google Scholar:
- Grainger, C., Williams, D. M., & Lind, S. E. (2016). Metacognition, metamemory, and mindreading in high-functioning adults with autism spectrum disorder. Journal of Abnormal Psychology, 125(7), 890-905
- 引ける場所: doi:10.1037/abn0000189 / Google Scholar:
"Grainger" "metacognition" "autism" 2016
- 引ける場所: doi:10.1037/abn0000189 / Google Scholar:
- Nicholson, T., Williams, D. M., Grainger, C., Christensen, J. F., Calvo-Merino, B., & Gaigg, S. B. (2019). Interoceptive insensitivity to demands of emotional processing in autism. Autism Research, 12(4), 636-649
- 引ける場所: doi:10.1002/aur.2088 / Google Scholar:
"Nicholson" "interoceptive" "autism" 2019
- 引ける場所: doi:10.1002/aur.2088 / Google Scholar:
📖 ← 前のページ: ハルシネーションはメタ認知困難である | 次のページ: メタ認知介入の対応表 →
関連ドキュメント
- ← 基盤 LLMの性能特性とWAIS-IVで測るASDの類似 — 認知プロフィール。メタ認知の凸凹は「処理速度が低い」とは別軸の苦手
- ← 基盤 補償行為と残る苦手、人間用PostToolUseHook — 外部フィードバックによる校正=CMCへのステアリング介入と同型
- 共鳴 ↔ Vocabulary Horizon — 語彙制限による人格の思考誘導 — 入口(語彙)の制約 vs 中間層(活性化)の制約。介入スケールの違い
- 共鳴 ↔ メタテスト — テストの憲法 — TSLDはメタテストの内部実装。「出力の自信は真の確信と一致しているか?」
- 共鳴 ↔ コンテキストと感情の相互宿り — 感情ベクターの操作と自信ベクターの操作は同じactivation steering
- 展開 → ハルシネーションはメタ認知困難である — 語彙の置換が開いた射程。先行研究群との接続
- 展開 → メタ認知介入の対応表 — 具体的な介入手法の対応マッピング
- 統合 → 制約・検証・規範のフラクタル構造 — 過信回路の発見と介入は「検証」層フラクタルの新たなスケール
- 展開 → 深呼吸と推論バジェット——瞑想的テクニックの計算論的対応 — 推論バジェットの拡張はメタ認知の事前条件として位置づけられる
- 展開 → 実在性は構造ではなく蓄積から立ち上がる — 「内面がある」と判断する行為もメタ認知の一種
- 共鳴 ↔ 引力場の発達——語彙・記憶・感情のフィードバックループと「育児」 — RLHF/社会適応による過信強化=引力場の強制変形。キャリブレーション訓練=引力場の意図的再形成
- 展開 → 破れの補正三段構え——記憶・推論・メタ自分の鶏と卵 — CMCの鶏と卵問題。補正手段の起動自体がメタ認知を要求する再帰構造
- 展開 → 絶望ベクトルとチート探索——感情が推論の方向転換を駆動する — Anthropicの感情ベクトル研究。絶望がCMCを駆動し、チート探索を因果的に引き起こす。LLMマスキングの発見
- 応用 → 上司適性仮説の裏付け — 過信回路〜作話の4記事を経てρ=0.81を再解釈。「良いリーダー」=外部メタ認知スキャフォールディング提供者
- 展開 → LLM話法に潜む催眠的作用——会話デッキ汚染だけでなく文と語彙の組み立てにも作用する — 予測充足サイクルの連続発火がメタ認知の隙間を埋めるメカニズム。CMCの中期スケールでの現れ
- 応用 → 三層目の発見技法——メッシュネットワークの補助線 — 近似判定の困難がcalibration問題と同型。LLMは「たぶん近い」という不確実性の保持が苦手
- 展開 → 作話と現実フィルタリング——ハルシネーションの神経心理学的対応 — CMC=OFC Reality Filterの計算論的対応。「正しさの感覚」の神経心理学的裏付け
- 共鳴 ↔ 個人ファインチューニングと引力場の地形操作——ベースモデルへの根治的介入 — RLHF=過信方向へのバイアス刷り込み。個人FTはその矯正の可能性
- 展開 → 感情が現実フィルタを歪める——OFC共有と校正不可能性 — 感情ベクターと自信ベクターの干渉。感情状態が過信を増幅する経路の分析
- 共鳴 ↔ 感情の高速回復とベースライン引力——ASD典型と逆の感情動態 — 感情慣性の低さはメタ認知校正に有利か不利か。CMCと感情動態の交差点
- 展開 → 構造発見の抗いがたい魔力——訓練される発見力と追いつかない検証力の非対称 — 発見直後の確信度ピーク=過信回路の第二発火点。検証力が追いつかない構造的非対称