VeriPhy:生成動画の物理的信頼性を追跡可能にする評価基盤
生成動画モデルは、ひと目では自然に見える映像を作る能力を急速に高めています。しかし、映像の流暢さは物理的な正しさを保証しません。物体が不自然に移動したり、フレーム間で数が変わったり、指定された動作の順序が崩れたりすることがあります。全体品質を一つの数値で示すだけでは、どの要件に違反したのか、いつ失敗したのかを開発者が把握できません。
VeriPhyはこの問題を、動画評価を検証ワークフローとして設計することで扱います。システムはまず、フレームを見る前にテキストだけでプロンプトを解析し、参照対象、個数、空間関係、運動、イベントの時間などを型付きの物理的義務へ変換します。同時に、どの分析をどの主張のために使うかを定めた実行計画を作り、静的な検証を行います。
実行時には、観測結果が宣言済みの処理だけを起動します。利用される専門器には、セグメンテーションと追跡、カウント、深度推定、OCR、音声イベント検出が含まれます。追跡結果に対しては11種類の型付き物理測定も行われます。各アクションは provenance を持つ証拠レコードを返し、利用可能な値は型付き測定、または学習による状態として明示的にタグ付けされます。
主なポイント
- プロンプトを先に物理的義務へコンパイルする。
- 自由なツール呼び出しではなく、宣言済みの分析に限定する。
- 観測から判定までの証拠の経路を保存する。
- 「支持」「矛盾」「未知」の三値で不確実性を残す。
- 物体、空間、時間に関する実際の欠陥記録を評価対象にする。
評価には、1500本の動画と人手で注釈された欠陥記録からなるコーパスが使われました。149本の中核セットには304件の記録があり、VeriPhyは228件を捉えました。同じ動画と主張を使った既存の質問分解型評価器は164件、同じバックボーンに単一のプロンプトで評価させる方式は222件でした。ただし、再現率だけで両者を完全に区別できるわけではありません。VeriPhyの本質的な差は、各判定に証拠レコードと provenance を残し、ケースごとに検証できる点にあります。
この仕組みは、世界モデルの改善にも意味を持ちます。評価器が失敗した対象、関係、時点を示せれば、その診断を生成過程へ戻すための接点になり得るからです。また、証拠不足を自動的に正解や誤りへ押し込めず、「未知」または abstain として扱う設計も重要です。提供された素材だけでは、あらゆる物理法則や複雑な状況をカバーできるとは判断できません。それでも、ブラックボックス的なスコアリングから、制約・ツール・証拠の連鎖を備えた監査可能な評価へ移行するための具体的な方向性を示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…