記事一覧へ戻る
モデル評価

Ventor-QTest、ホスト型 LLM API をブラックボックス監査

読了目安 3 分

背景

オープンウェイトモデルを第三者の推論 API 経由で利用するケースが増えています。しかし利用者が確認できるのは通常、最終的に返されたテキストだけです。同じモデルやルートが使われているか、推論状態がどの程度一貫しているかは外部から分かりません。平均的なベンチマーク精度も、長い計画や実行の途中で一度だけ起きる重大な逸脱を捉えきれない可能性があります。Ventor-QTest はこの問題を、ホスト型 LLM API のブラックボックス監査として整理しました。

仕組み

この手法は、対象 API が token の確率や logprob を返すことを前提にしません。観測できるテキスト応答から、次の二つの信号を作ります。

  • AFL(Average Fidelity Loss):固定した制約付きコンテキストを複数回送信し、返答テキストの出現回数からカテゴリ分布を再構成します。その分布を使い、帰無仮説によるバイアスを補正したウィンドウ内平均の粗視化 KL 統計量を計算します。反復要求に対する平均的な偏りを表す指標です。
  • EFL(Extreme Fidelity Loss):長系列の処理を独立に複数回実行し、参照結果を中心とした実行単位の surprisal 統計量について、経験的な上側裾を調べます。平均では見えにくい、少数の大きな異常を捉えることが狙いです。

つまり AFL は「普段どの程度安定しているか」を、EFL は「まれに深刻な崩れが起きるか」を測ります。複数段階の判断に依存するエージェント処理では、後者が実用上重要になる場合があります。

実験結果

logprob を取得できる三つのルート条件では、AFL と logprob から求めた粗視化 KL の比較指標に、強い線形の記述的一致が見られました。これは内部確率を公開しない API でも、テキストの反復だけから一定の監査情報を得られる可能性を示します。また、七つのルートスナップショットに対する 20 回の長系列プローブでは、EFL にルート固有のばらつきが確認されました。

AFL と EFL は、GPQA-Diamond の正解率とはルート単位で明確な関連をほとんど示しませんでした。一方、EFL が顕著な条件では、タスクへの露出が増えるにつれて Terminal-Bench の合格率が低下しました。これは因果関係の証明ではありませんが、長期的なタスクの正しさは、短い問題の平均精度より極端な逸脱の影響を受けやすいという仮説を支持します。

意義と注意点

この研究の意義は、ホスト型推論の品質を平均的な安定性と尾部リスクに分けて観測できる点にあります。ルーティング変更やサービススナップショットを監視する際、AFL だけでなく EFL も併記すれば、まれな長系列失敗を見落としにくくなります。

ただし結果は記述的であり、モデル置換やサービス劣化、特定の内部障害を証明するものではありません。テスト用コンテキスト、参照の作り方、反復回数にも依存します。実装は公開されており、他の API やエージェント課題での検証に利用できます。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
FM-Bench、AIエージェントの20年間にわたるサッカー経営を評価
モデル評価
cctest.ai
モデル評価

FM-Bench、AIエージェントの20年間にわたるサッカー経営を評価

FM-Benchは、言語モデルにサッカークラブを20年間運営させ、移籍、契約更新、投資、戦術の判断が長期的にどう作用するかを測定する。結果は、モデルの規模やトークン消費よりも、管理行動の違いが成績を左右することを示した。

続きを読む
CCTest · Blog
StartupBench、実際の業務ワークフローで汎用エージェントを評価
モデル評価
cctest.ai
モデル評価

StartupBench、実際の業務ワークフローで汎用エージェントを評価

StartupBenchは、研究者が想定した課題ではなく、市場で利用実績のあるAIスタートアップ製品のワークフローから端到端の評価課題を作成します。評価対象の最強モデルでも、完全に達成できたのは約30%にとどまりました。

続きを読む
CCTest · Blog
PTXBench、大規模言語モデルのGPUカーネル最適化を検証
モデル評価
cctest.ai
モデル評価

PTXBench、大規模言語モデルのGPUカーネル最適化を検証

PTXBenchは、コードが正しいかだけでなく、指定したPTX命令が実行されるか、そして先端ライブラリに対して実際に高速化できるかを評価する。結果は、アーキテクチャ固有命令の利用と性能向上の間に差があることを示した。

続きを読む