記事一覧へ戻る
モデル評価

VeriPhy:生成動画の物理的信頼性を追跡可能にする評価基盤

読了目安 3 分

生成動画モデルは、ひと目では自然に見える映像を作る能力を急速に高めています。しかし、映像の流暢さは物理的な正しさを保証しません。物体が不自然に移動したり、フレーム間で数が変わったり、指定された動作の順序が崩れたりすることがあります。全体品質を一つの数値で示すだけでは、どの要件に違反したのか、いつ失敗したのかを開発者が把握できません。

VeriPhyはこの問題を、動画評価を検証ワークフローとして設計することで扱います。システムはまず、フレームを見る前にテキストだけでプロンプトを解析し、参照対象、個数、空間関係、運動、イベントの時間などを型付きの物理的義務へ変換します。同時に、どの分析をどの主張のために使うかを定めた実行計画を作り、静的な検証を行います。

実行時には、観測結果が宣言済みの処理だけを起動します。利用される専門器には、セグメンテーションと追跡、カウント、深度推定、OCR、音声イベント検出が含まれます。追跡結果に対しては11種類の型付き物理測定も行われます。各アクションは provenance を持つ証拠レコードを返し、利用可能な値は型付き測定、または学習による状態として明示的にタグ付けされます。

主なポイント

  • プロンプトを先に物理的義務へコンパイルする。
  • 自由なツール呼び出しではなく、宣言済みの分析に限定する。
  • 観測から判定までの証拠の経路を保存する。
  • 「支持」「矛盾」「未知」の三値で不確実性を残す。
  • 物体、空間、時間に関する実際の欠陥記録を評価対象にする。

評価には、1500本の動画と人手で注釈された欠陥記録からなるコーパスが使われました。149本の中核セットには304件の記録があり、VeriPhyは228件を捉えました。同じ動画と主張を使った既存の質問分解型評価器は164件、同じバックボーンに単一のプロンプトで評価させる方式は222件でした。ただし、再現率だけで両者を完全に区別できるわけではありません。VeriPhyの本質的な差は、各判定に証拠レコードと provenance を残し、ケースごとに検証できる点にあります。

この仕組みは、世界モデルの改善にも意味を持ちます。評価器が失敗した対象、関係、時点を示せれば、その診断を生成過程へ戻すための接点になり得るからです。また、証拠不足を自動的に正解や誤りへ押し込めず、「未知」または abstain として扱う設計も重要です。提供された素材だけでは、あらゆる物理法則や複雑な状況をカバーできるとは判断できません。それでも、ブラックボックス的なスコアリングから、制約・ツール・証拠の連鎖を備えた監査可能な評価へ移行するための具体的な方向性を示しています。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Principia、動画モデルが物理法則を理解しているかを関係性で検証
モデル評価
cctest.ai
モデル評価

Principia、動画モデルが物理法則を理解しているかを関係性で検証

動画生成モデルは自然に見える動きを作れても、基本的な物理法則を守るとは限りません。Principia は、同じシーンにある物体同士の関係を使い、カメラ校正に依存せず物理的一貫性を評価します。

続きを読む
CCTest · Blog
S³Gym:LLMは自己テストと自己評価から本当に改善できるのか
モデル評価
cctest.ai
モデル評価

S³Gym:LLMは自己テストと自己評価から本当に改善できるのか

S³Gymは、LLMエージェントが自らの行動を試し、経験を評価し、その結果を次の意思決定に生かせるかを測る対話型ベンチマークです。実験では、改善効果がタスク構造と経験の保存方法に強く依存することが示されました。

続きを読む
CCTest · Blog
ExecRetrievalが示す、コード検索における「似ている」と「正しい」の差
モデル評価
cctest.ai
モデル評価

ExecRetrievalが示す、コード検索における「似ている」と「正しい」の差

ExecRetrievalは、正しい実装とほぼ同じ見た目のバグ実装を同じ検索候補に入れ、コード検索モデルの機能的な識別能力を測定する。上位10件では正解を見つけられても、1位に置く能力には大きな差が残った。

続きを読む