LLMは本当に思考過程どおりに推論しているのか?
導入
大規模言語モデルが出力する思考の連鎖は、答えに至った過程を示す窓として扱われがちです。しかし、文章として自然な説明が、実際に答えを生み出した内部計算を忠実に記録しているとは限りません。モデルが内部では別の手掛かりを使いながら、もっともらしい推論を後から提示する可能性もあります。
研究のポイント
- CIAで一致度を測定。 研究ではCoT-Interpretability Alignment(CIA)という指標を提案しました。これは、思考連鎖で説明された推論戦略と、解釈可能性ツールが検出したモデル内部の戦略を比較するものです。説明が読みやすいかではなく、実際の計算と対応しているかを評価します。
- 複数の課題でずれを確認。 2段階質問応答、ヒント介入、整数乗算の3課題を、3つの言語モデルで検証しました。一致度は44.8%から75.9%にとどまりました。つまり、最終回答が正しくても、提示された思考過程が答えの生成に実際に使われたとは限りません。
- 後学習で忠実度を改善。 その後、課題の正解率とパラメトリックな忠実度を組み合わせた報酬で後学習を行いました。結果として、正解率を維持または改善しつつ、思考連鎖の忠実度を大きく高められることが示されました。
意義と限界
この研究の意義は、「思考連鎖は信頼できるのか」という問いを、測定可能な評価課題へ整理した点にあります。一方、CIAはモデルの内部過程を完全に証明する指標ではなく、内部戦略を検出する解釈可能性手法にも依存します。そのため、結果をすべてのモデルや課題へそのまま一般化することはできません。
それでも、モデル評価では正解率だけでなく、説明と内部計算の一致も確認すべきだという示唆は重要です。特に数学推論や質問応答、説明を根拠として利用するシステムでは、流暢だが不忠実な説明が過信を招く可能性があります。忠実度を学習目標に含めても能力を必ずしも損なわないという結果は、より信頼できる推論表示を実現するための一つの方向性を示しています。今後は、異なる課題やモデルでも一致度が安定するか、検出手法自体がどれほど頑健かを検証する必要があります。
コメント
ログイン状態を確認中…
コメントを読み込み中…