記事一覧へ戻る
モデル評価

LLMは本当に思考過程どおりに推論しているのか?

読了目安 3 分

導入

大規模言語モデルが出力する思考の連鎖は、答えに至った過程を示す窓として扱われがちです。しかし、文章として自然な説明が、実際に答えを生み出した内部計算を忠実に記録しているとは限りません。モデルが内部では別の手掛かりを使いながら、もっともらしい推論を後から提示する可能性もあります。

研究のポイント

  • CIAで一致度を測定。 研究ではCoT-Interpretability Alignment(CIA)という指標を提案しました。これは、思考連鎖で説明された推論戦略と、解釈可能性ツールが検出したモデル内部の戦略を比較するものです。説明が読みやすいかではなく、実際の計算と対応しているかを評価します。
  • 複数の課題でずれを確認。 2段階質問応答、ヒント介入、整数乗算の3課題を、3つの言語モデルで検証しました。一致度は44.8%から75.9%にとどまりました。つまり、最終回答が正しくても、提示された思考過程が答えの生成に実際に使われたとは限りません。
  • 後学習で忠実度を改善。 その後、課題の正解率とパラメトリックな忠実度を組み合わせた報酬で後学習を行いました。結果として、正解率を維持または改善しつつ、思考連鎖の忠実度を大きく高められることが示されました。

意義と限界

この研究の意義は、「思考連鎖は信頼できるのか」という問いを、測定可能な評価課題へ整理した点にあります。一方、CIAはモデルの内部過程を完全に証明する指標ではなく、内部戦略を検出する解釈可能性手法にも依存します。そのため、結果をすべてのモデルや課題へそのまま一般化することはできません。

それでも、モデル評価では正解率だけでなく、説明と内部計算の一致も確認すべきだという示唆は重要です。特に数学推論や質問応答、説明を根拠として利用するシステムでは、流暢だが不忠実な説明が過信を招く可能性があります。忠実度を学習目標に含めても能力を必ずしも損なわないという結果は、より信頼できる推論表示を実現するための一つの方向性を示しています。今後は、異なる課題やモデルでも一致度が安定するか、検出手法自体がどれほど頑健かを検証する必要があります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
AutoSciBench:科学エージェント自身が評価課題を進化させる
モデル評価
cctest.ai
モデル評価

AutoSciBench:科学エージェント自身が評価課題を進化させる

科学エージェントの能力向上によって、固定的なベンチマークは飽和しやすくなっています。AutoSciBenchは、エージェントの解答軌跡と評価者のフィードバックを使い、科学タスクを自動生成・改訂する仕組みを提案します。

続きを読む
CCTest · Blog
UndoBench:AIエージェントは完了率だけでなく復旧能力を評価すべき
モデル評価
cctest.ai
モデル評価

UndoBench:AIエージェントは完了率だけでなく復旧能力を評価すべき

UndoBenchは、ツールを使うAIエージェントの通常時のタスク遂行能力と、障害発生後の安全な復旧能力を切り分けて測定する。実験では、タスクを完了できても重複した外部操作を防げないケースが明らかになった。

続きを読む
CCTest · Blog
LLMの数学推論で欠けているのは計算より「発見」かもしれない
モデル評価
cctest.ai
モデル評価

LLMの数学推論で欠けているのは計算より「発見」かもしれない

新しい研究は、大規模言語モデルの数学推論を、発見・生成・理解・実行の4段階に分けて分析する。最終的な正答率だけでは能力差を捉えきれないと指摘し、数学的プリミティブを用いた修正手法も提案した。

続きを読む