Video-IFBench:视频多模态模型不只要看懂,还要听懂指令
导语
视频多模态大模型已经能够完成问答、描述和事件识别,但“看懂内容”并不等于“按要求完成任务”。现实用户往往会同时提出多个条件:既要依据画面和声音提取信息,又要遵守指定格式,还可能要求模型根据视频中的事件选择不同回答路径。传统视频理解基准通常关注答案是否正确,却较少检查模型是否完整执行了指令。
Video-IFBench 正是针对这一缺口提出的评测框架。它把视频理解中的指令遵循单独拆解出来,考察模型能否同时处理内容判断与用户约束。
核心要点
- 四类指令结构:基准包含单任务、多任务、选择和嵌套指令。后几类任务要求模型组合多个操作,或先判断视频内容,再进入相应的条件分支。
- 覆盖视觉与音频信息:约束不仅来自画面,也可以建立在声音等视频内容之上,因此更接近真实的视听理解场景。
- 细化约束维度:研究设计覆盖32种任务类型和39类人工设计的约束类别,既检查语义要求,也检查输出格式等形式要求。
- 半自动构建数据:数据流程结合多模态大模型、程序化处理和人工核验,在控制标注成本的同时构建了约1.5K个样本。
- 面向多模型评测:研究对20多个近期多模态大模型进行了大规模测试,重点观察模型是否能在回答正确之外,完整满足指令。
评测揭示了什么
结果显示,视频指令遵循对当前模型仍然具有挑战。一个突出趋势是,随着指令包含的约束增多,模型更容易遗漏部分要求。语义约束也比简单的格式要求更难处理,因为模型必须准确理解视频内容,并将理解结果映射到用户指定的输出条件中。
条件结构同样暴露出明显问题。当指令要求模型依据视频内容选择正确分支或路径时,模型可能已经识别出部分事件,却没有据此执行后续任务。这说明视频问答中的错误不一定来自“看错了”,也可能来自规划、条件判断和执行链条的不完整。
意义与影响
Video-IFBench 的价值在于,它把“回答能力”和“交互可靠性”区分开来。对于视频助手、内容检索和多模态智能体而言,遗漏一个条件、忽略音频证据或输出格式不合规,都可能让看似正确的答案失去实用价值。该基准提供的任务分类也有助于研究者定位模型究竟是在感知、语义理解,还是指令执行环节出现问题。
不过,约1.5K个样本仍属于相对有限的评测规模,且材料主要介绍了基准设计与总体发现,未披露不同模型的详细分数和排名。因此,它更适合作为衡量视频指令遵循能力的诊断工具,而不是单一的模型排行榜。未来模型评测若只报告视频问答准确率,可能仍不足以反映真实使用体验。
评论
正在确认登录状态……
正在加载评论……