記事一覧へ戻る
モデル評価

正答率だけでは見えない:SFT・RL・OPDが推論中の信頼度をどう変えるのか

読了目安 3 分

導入

大規模言語モデルの推論能力は、教師あり微調整(SFT)、強化学習(RL)、on-policy distillation(OPD)といった後学習によって向上してきた。だが多くの評価では、最終的な答えが正しいかどうかに注目が集まりがちである。今回の arXiv 論文は、その見方を一歩進め、モデルが推論している最中の「信頼度」がいつ有用なのかを調べている。

著者らの主張は明確だ。思考連鎖における信頼度は、一本の連続したスコアとして扱うべきではない。生成前、生成中、生成後では、同じ信頼度でも意味が変わる可能性がある。

主なポイント

  • 三段階の校正フレームワーク:論文は信頼度を、思考連鎖生成前、生成中、生成後の三段階で評価する。これはそれぞれ、問題の難しさの推定、早期停止、複数推論結果の集約に対応する。
  • 手法ごとに得意な段階が異なる:数学推論ベンチマークでの比較では、OPD は推論前の信頼度が最も有用で、問題難度の見積もりに向いている。SFT は推論中のオンライン信号が強く、早期停止に適している。RL は推論トレース全体の信号が安定しており、答えの集約に向いている。
  • 信頼度は位置に依存する:RL の信頼度は、推論の初期から有用なのではなく、モデルがある推論経路にコミットした後に情報量を持つ。OPD は初期には有効だが、後半では逆校正のような挙動を示す場合がある。
  • PosConf の提案:この観察に基づき、著者らは位置認識型の信頼度利用法 PosConf を提案する。信頼度を常に使うのではなく、相対位置上で信頼できる区間だけを利用するという考え方だ。

意義と影響

この研究は、推論モデル評価の焦点を「正解したか」から「どの時点で自分の正しさを示せるか」へ広げている。これは、トークン予算が限られる推論、複数サンプルによる投票、途中で計算を打ち切るシステムにとって重要である。

論文によれば、PosConf は RL による答えの集約で多数決を 6.1 ポイント上回った。また、厳しいトークン予算下での OPD の早期停止でも、後半の逆校正領域を避けることで最大 4.3 ポイントの改善を示した。

実務的な示唆は大きい。開発者は、モデルの信頼度を推論全体で一様に信頼できる品質スコアとして扱うべきではない。後学習は正答率だけでなく、信頼度が正しさと結びつくタイミングも変える。今後の推論システムでは、段階と位置を考慮した校正が重要な設計要素になりそうだ。

出典:arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
UrbanGround:実スケール都市でマルチモーダルエージェントの空間能力を検証
モデル評価
cctest.ai
モデル評価

UrbanGround:実スケール都市でマルチモーダルエージェントの空間能力を検証

UrbanGroundは、香港全域の3D地理空間データからインタラクティブな都市サンドボックスを構築し、局所的な視覚理解が長距離ナビゲーションに結び付くかを検証する。現在のMLLMは近距離の認識には強い一方、探索が長くなると方向維持や修正に課題を残す。

続きを読む
CCTest · Blog
評価結果は実際に何を証明できるのか
モデル評価
cctest.ai
モデル評価

評価結果は実際に何を証明できるのか

Inspect Evalsを特定コミットに固定して調査した結果、実行可能な評価コードだけでは、指標に結び付いた過去の主張まで再現できないことが示された。機械的に対象となった124ユニットのうち110件は、証拠または意味づけの不足により、決定的な推論へ進む前に停止した。

続きを読む
CCTest · Blog
Video-IFBench、動画マルチモーダルモデルの指示追従を検証
モデル評価
cctest.ai
モデル評価

Video-IFBench、動画マルチモーダルモデルの指示追従を検証

Video-IFBenchは、動画を正しく理解できるかだけでなく、視覚・音声・意味・形式・条件分岐を含む複雑な指示を守れるかを評価する。20以上の近年のMLLMを対象にした評価では、動画における指示追従の難しさが示された。

続きを読む