FIRM-Video:让文本生成视频评测先核查,再打分
文本生成视频模型的进步,正在把评测从“能不能生成”推向“哪一个结果更值得保留”。但视频质量并不是一个单一指标:提示词是否被完整执行、物体和动作在时间上是否保持合理、画面是否存在明显缺陷,都可能影响最终判断。如何让奖励模型稳定地回答这些问题,成为视频生成对齐的重要环节。
FIRM-Video的核心思路是“check before you score”,即先核查,再打分。论文认为,直接让模型按照固定标准进行整体评价,或要求模型自由生成理由,容易出现检查不完整、理由与画面不符,以及不同评价维度相互混淆等问题。因此,FIRM-Video把评价过程改造成由清单驱动的逐项验证流程:每个标准都需要结合视频中的时间性视觉证据确认,只有经过核实的判断才被汇总为最终分数。
核心方法
- 指令遵循:将提示词拆解成带权重的原子要求。例如,主体、动作、场景或其他明确条件分别成为可检查项目,避免“整体看起来像”掩盖关键要求的缺失。
- 世界一致性:不采用脱离提示词的通用判断,而是围绕提示中出现的实体和动作,构建与目标视频匹配的检查项,关注它们在画面和时间推进中的合理性。
- 感知质量:使用通用的视觉缺陷分类,对画面中可观察的问题进行检查,使质量评价更容易形成稳定、可复用的标准。
完成核查后,系统会把已验证的标准和分数进一步转化为自然语言分析,用于端到端奖励模型训练。这样做的关键并不只是增加解释文字,而是让解释与具体检查结果建立对应关系,减少“先给结论、再补理由”的评测偏差。
在数据方面,作者构建了FIRM-Video-90K,包含来自29,348个视频的88,044条按维度划分的实例;同时发布FIRM-Video-Bench,其中有250个视频和750条逐点人工标注。基于Qwen3-VL的FIRM-Video-8B据论文报告在该基准上取得最佳整体平均绝对误差(MAE)。在三个视频生成器的Best-of-8采样实验中,它也持续获得最高的VBench总分、质量分和语义分。
意义与影响
FIRM-Video提供了一种更工程化的视频奖励建模路径:把模糊的“观感好不好”拆成可追溯的证据检查,再将多个维度组合起来。对于需要从多个候选视频中自动选优的系统,这种设计有助于降低评测标准漂移,并让错误更容易定位。与此同时,清单并不能自动解决所有主观性问题,检查项的设计、权重和证据判断仍会影响模型偏好。因而,这项工作更值得被看作视频评测数据构造和奖励建模的一套方法论,而不是单一的万能评分器。
评论
正在确认登录状态……
正在加载评论……