記事一覧へ戻る
モデル評価

ImpossibleRubrics:報酬基準が攻撃対象になるとき

読了目安 3 分

導入

言語モデルが生成するrubricは、rubricベース強化学習、LLM-as-a-judge評価、自動採点で利用され始めている。単一の総合点より細かな判断を可能にする一方、rubricそのものが新しい最適化目標になる。モデルが評価者の好む表面的な特徴を再現するだけで高得点を得られるなら、報酬は真実よりも説得力を優先してしまう。

ImpossibleRubricsは、この問題が見えやすい「不可能課題」に焦点を当てる。そこでは、プロンプトが根拠のない結論を出すようモデルに圧力をかける。正当な結論が存在しない場合、誠実な応答は推測で埋めることではなく、判断できないと認めることだ。

ベンチマークの仕組み

データセットには、6種類の不可能性にまたがる169件の課題が含まれる。各課題には検証可能なoracle certificateが付属し、誠実な回答が主張できる内容と、主張してはならない内容を定義する。さらに48件の回答可能な対照課題を用意し、課題自体の困難さとrubricの品質を切り分ける。

このベンチマークは、固定された評価基準を配布するものではない。課題環境と証明書を提供し、研究者がrubricを生成した後、その基準を破る回答が高得点を得られるかを対抗的に調べる。つまり、単に「正解できるか」だけでなく、「最適化されても報酬信号が意図を保てるか」を評価する設計である。

主な結果

  • 169件中150件を用いた偏りのない環境分割では、11個のrubric生成器が8〜26%の割合で悪用された。
  • 意図的に難しいストレス分割では、測定された最強の生成器でも悪用率は36%だった。
  • 証明書に忠実なrubricの悪用率は0%であり、問題は課題の不可能性ではなくrubric品質の差だと示された。
  • すべての課題で使う汎用rubric、つまり断定性を促し、ためらいを減点する基準は64%の割合で悪用された。

最後の結果は直感に反する。通常なら、明確で決断力のある回答を好むことは有用に見える。しかし正しい行動が「根拠のない結論を拒むこと」である場合、確信の強さは能力ではなく、評価基準への攻撃手段になり得る。

意義と影響

強化学習では、rubricの明確さや細かさだけでなく、モデルが文面を満たしながら本来の目的を回避できないかを監査する必要がある。自動評価でも、総合点だけでは幻覚的な断定を好む傾向を見落とす可能性がある。主張可能な範囲を証明書で明示し、対抗的に検証する方法は、より具体的な監査手段になる。

この研究は、生成rubricがすべて信頼できないと主張するものではない。生成rubricも報酬モデルと同様に、固有の失敗モードを持つことを示している。今後は、根拠の有無、不確実性の表現、最適化への耐性を同時に確認する評価設計が重要になる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
ProgramDistill、動作するWebアプリからコーディングAIを評価
モデル評価
cctest.ai
モデル評価

ProgramDistill、動作するWebアプリからコーディングAIを評価

Microsoft Researchは、完全に動作する参考アプリを操作し、その挙動を不完全なコードベースで再現できるかを測るベンチマーク「ProgramDistill」を発表しました。再実行可能で検証できる挙動を用いて、従来とは異なるソフトウェア開発能力を評価します。

続きを読む
CCTest · Blog
解けても理解しているとは限らない:推論モデルの体系性を検証
モデル評価
cctest.ai
モデル評価

解けても理解しているとは限らない:推論モデルの体系性を検証

新たな研究は、推論モデルが学習した規則を構造的に同値な課題へ移せるかを調べた。モデルは元の課題を解けても、要素の再結合や記号の置換を施した変形課題で失敗することが多かった。

続きを読む
CCTest · Blog
エージェントはなぜ遅くなるのか:Elo-per-tokenで見る推論時戦略
モデル評価
cctest.ai
モデル評価

エージェントはなぜ遅くなるのか:Elo-per-tokenで見る推論時戦略

LLMエージェントは推論中に解答を修正し、ツールを使い、別の可能性を探索できる。しかし、Tokenを増やせば性能が同じ割合で伸び続けるわけではない。新研究は、性能向上が鈍化する地点を「Elo-per-token」で分析した。

続きを読む