パレート最適から個人の選好へ:PersonTTSが変える推論時スケーリング
大規模言語モデルのテスト時スケーリング(Test-Time Scaling、TTS)は、推論時に追加の計算を割り当てることで、難しい問題に対する推論能力を高める考え方である。複数の解答候補を生成したり、検証や探索を追加したり、十分な確信が得られるまで処理を続けたりすることで、通常は精度の向上を狙うことができる。
しかし、実際の利用で重要なのは精度だけではない。あるユーザーは多少待ってでも高い正答率を求めるかもしれない。一方で、別のユーザーは応答の速さを優先し、さらに別の利用者は推論コストに厳しい上限を設定する。精度、レイテンシ、コストを同時に考えると、「平均的に最も良い戦略」がすべてのユーザーに適しているとは限らない。
論文「From Pareto to Preference」は、この問題を個別化テスト時スケーリングとして定式化する。従来の研究は、精度とコスト、あるいは精度とレイテンシのように、一つの資源軸を中心としたパレート前線を改善することが多かった。これに対して本研究は、ユーザー固有の複数の条件を同時に満たす割合を最大化する実行可能な制御器の発見を目指す。
ここでいう制御器は、テスト時の計算をどのように配分するかを決める方策である。候補をどれだけ生成するか、検証をいつ行うか、追加の探索を続けるか、いつ停止するか、といった判断を担う。重要なのは、単に高精度な制御器を選ぶことではなく、目標ユーザーの要求に合った計算方策を発見することである。
PersonTTSの主な特徴は次の通りである。
- 要求の同時達成を評価:精度、レイテンシ、推論コストを別々に扱わず、組み合わせた条件として評価する。
- 要求に合う初期化:新しいユーザープロファイルに対し、似た要求を持つ過去の探索で得られた制御器を出発点にする。
- 探索手順の再利用:過去の探索経験から手続き的なガイダンスを抽出し、発見エージェントの探索を支援する。
- 対象プロファイルで再評価:経験を再利用しながらも、各候補は必ず新しい対象プロファイルで評価するため、過去の結果をそのまま流用しない。
実験はAIMEとHMMTを対象に行われ、未知のユーザープロファイルと未使用の問題で評価されている。論文要約によれば、PersonTTSは複数の強力なTTSベースラインより高い要求同時達成率を示した。また、候補評価の予算を同じにした場合でも、ユーザー間の経験を再利用することで方策の質が向上し、発見エージェントに必要な時間とコストも大きく削減されたという。
この研究の意義は、TTSの目標を「汎用的な効率曲線を改善すること」から「具体的な選好に合わせて推論方策を選ぶこと」へ広げた点にある。推論サービスでは、異なる料金プランや端末、応答要件に応じて計算量を切り替える設計につながる可能性がある。評価側でも、精度や単独のコストだけでなく、複数の制約を同時に満たせるかを見る必要があるだろう。ただし、要約には具体的な改善幅は示されておらず、異なるモデルやタスク、実運用の負荷で制御器がどれだけ安定して移転できるかは今後の検証課題である。
コメント
ログイン状態を確認中…
コメントを読み込み中…