記事一覧へ戻る
モデル評価

小型言語モデルは「自分の無知」を知っているのか

読了目安 3 分

小型言語モデルは、消費者向けハードウェアでも動かせる低コストな推論手段として注目されている。一方で、重要な疑問が残る。小型モデルは、自分の回答が間違っている可能性を自分で見抜けるのだろうか。

arXivで公開された研究は、30億未満のパラメータを持つ小型言語モデルを対象に、この問題を調べた。単純な正解率の比較ではなく、モデルの不確実性シグナルが正しい回答と誤った回答を区別できるか、さらにその情報をモデル切り替えに利用できるかを検証している。

主な結果

研究では、トークン単位のエントロピー、セマンティック・エントロピー、早期停止、不確実性に応じた大規模モデルへのルーティングなど、7種類の手法を比較した。評価対象は7組のモデルペアと5つの標準的な自然言語理解ベンチマークである。

  • トークン・エントロピーはほぼ機能しない。 データセットとモデルの組み合わせの91%で、平均トークン・エントロピーは正解・不正解を問わずほぼゼロだった。生成確率をそのまま信頼度として読む方法は、小型モデルでは有効性が低い。
  • 意味のばらつきは手がかりになる。 複数回回答を生成し、意味が近い回答をクラスタリングして分布の不確実性を測ると、モデルが回答候補の間で揺れているかを捉えやすくなる。
  • 不確かな質問だけを上位モデルへ送れる。 セマンティック・エントロピーが高い質問を大きな専門モデルにルーティングすると、正解率は最大50ポイント向上した。
  • 異なるモデル系列へのルーティングが有利だった。 SmolLM 360MからPhi-3.5-miniのような別系列のモデルへ送る場合、平均改善は22.0%。同系列内のルーティングは6.8%だった。少なくともこの比較では、アーキテクチャの近さより専門モデルの性能が重要だった。

意義と限界

この結果は、小型モデルを「すべての質問に単独で答えるモデル」としてではなく、推論の第一段階として使う設計を示している。簡単な質問は小型モデルが処理し、意味的な回答の分散が大きい質問だけを強いモデルへ渡す。これにより、品質とコストのバランスを動的に調整できる。

同時に、セマンティック・エントロピーには複数回の生成、クラスタリング、追加の推論コストが必要だ。したがって、実環境での効果はタスクやハードウェア、ルーティング方針に左右される。研究の示唆は、エントロピー手法の価値が単純な計算量削減ではなく、必要な場所に計算を集中させる点にある。

arXiv

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
AIがAI査読者を訓練するとき、科学的判断はどう縮小するのか
モデル評価
cctest.ai
モデル評価

AIがAI査読者を訓練するとき、科学的判断はどう縮小するのか

モデルが生成した査読文を次世代のAI査読者が学習すると、評価の分布と意味的多様性が縮小する可能性がある。研究チームはこの現象を「科学的判断の崩壊」と呼び、TrustReviewerによる緩和策を提案した。

続きを読む
CCTest · Blog
PACT、企業向けAIアシスタントはプレッシャー下でも規則を守れるか
モデル評価
cctest.ai
モデル評価

PACT、企業向けAIアシスタントはプレッシャー下でも規則を守れるか

企業向けAIのリスクは、通常の質問よりも、ユーザーの催促や上司の圧力、便利な違反ショートカットが現れた場面で表面化する。PACTは、規制業務におけるマルチターンのルール遵守能力を評価する。

続きを読む