記事一覧へ戻る
推論・デプロイ

パレート最適から個人の選好へ:PersonTTSが変える推論時スケーリング

読了目安 3 分

大規模言語モデルのテスト時スケーリング(Test-Time Scaling、TTS)は、推論時に追加の計算を割り当てることで、難しい問題に対する推論能力を高める考え方である。複数の解答候補を生成したり、検証や探索を追加したり、十分な確信が得られるまで処理を続けたりすることで、通常は精度の向上を狙うことができる。

しかし、実際の利用で重要なのは精度だけではない。あるユーザーは多少待ってでも高い正答率を求めるかもしれない。一方で、別のユーザーは応答の速さを優先し、さらに別の利用者は推論コストに厳しい上限を設定する。精度、レイテンシ、コストを同時に考えると、「平均的に最も良い戦略」がすべてのユーザーに適しているとは限らない。

論文「From Pareto to Preference」は、この問題を個別化テスト時スケーリングとして定式化する。従来の研究は、精度とコスト、あるいは精度とレイテンシのように、一つの資源軸を中心としたパレート前線を改善することが多かった。これに対して本研究は、ユーザー固有の複数の条件を同時に満たす割合を最大化する実行可能な制御器の発見を目指す。

ここでいう制御器は、テスト時の計算をどのように配分するかを決める方策である。候補をどれだけ生成するか、検証をいつ行うか、追加の探索を続けるか、いつ停止するか、といった判断を担う。重要なのは、単に高精度な制御器を選ぶことではなく、目標ユーザーの要求に合った計算方策を発見することである。

PersonTTSの主な特徴は次の通りである。

  • 要求の同時達成を評価:精度、レイテンシ、推論コストを別々に扱わず、組み合わせた条件として評価する。
  • 要求に合う初期化:新しいユーザープロファイルに対し、似た要求を持つ過去の探索で得られた制御器を出発点にする。
  • 探索手順の再利用:過去の探索経験から手続き的なガイダンスを抽出し、発見エージェントの探索を支援する。
  • 対象プロファイルで再評価:経験を再利用しながらも、各候補は必ず新しい対象プロファイルで評価するため、過去の結果をそのまま流用しない。

実験はAIMEとHMMTを対象に行われ、未知のユーザープロファイルと未使用の問題で評価されている。論文要約によれば、PersonTTSは複数の強力なTTSベースラインより高い要求同時達成率を示した。また、候補評価の予算を同じにした場合でも、ユーザー間の経験を再利用することで方策の質が向上し、発見エージェントに必要な時間とコストも大きく削減されたという。

この研究の意義は、TTSの目標を「汎用的な効率曲線を改善すること」から「具体的な選好に合わせて推論方策を選ぶこと」へ広げた点にある。推論サービスでは、異なる料金プランや端末、応答要件に応じて計算量を切り替える設計につながる可能性がある。評価側でも、精度や単独のコストだけでなく、複数の制約を同時に満たせるかを見る必要があるだろう。ただし、要約には具体的な改善幅は示されておらず、異なるモデルやタスク、実運用の負荷で制御器がどれだけ安定して移転できるかは今後の検証課題である。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
SparseDecoding、生成段階に適応したLLM枝刈りを提案
推論・デプロイ
cctest.ai
推論・デプロイ

SparseDecoding、生成段階に適応したLLM枝刈りを提案

SparseDecodingは、自然文で作成した校正データと実際の生成時の分布が異なる問題に着目する。生成中の活性値を使った枝刈りとN:M疎行列ベクトル積カーネルにより、A100上で最大1.48倍のエンドツーエンド解码高速化を報告した。

続きを読む
CCTest · Blog
TokenRouter:トークン単位のLLMルーティングを支える推論基盤
推論・デプロイ
cctest.ai
推論・デプロイ

TokenRouter:トークン単位のLLMルーティングを支える推論基盤

TokenRouterは、生成中のトークンごとにモデルを切り替えるLLMルーティング向けのサービングシステムです。非同期のモデル別サーバーと遅延バッチ処理により、実行ステップのずれやバッチ投入の遅延に対応します。

続きを読む
CCTest · Blog
SparseEngine、長文脈エージェント向けに疎な推論を中心とした設計を提案
推論・デプロイ
cctest.ai
推論・デプロイ

SparseEngine、長文脈エージェント向けに疎な推論を中心とした設計を提案

SparseEngine は、異なる KV キャッシュ方式を長文脈 LLM エージェントの推論基盤に組み込みやすくするための、疎性優先の推論エンジンです。論文では、スループットやデコード速度の向上に加え、リクエストをまたいだキャッシュ状態の管理を示しています。

続きを読む