返回文章列表
模型评测

MiniMax-H3能否理解物理世界?一套面向全模态模型的新评测

阅读约 3 分钟

导语

全模态模型的能力边界,不能只用画面清晰度、声音自然度或文本一致性来衡量。更关键的问题是:当每种输入都只提供一部分信息时,模型能否把分散的线索拼起来,判断正在发生什么,并预测下一步可能出现的变化?围绕这一问题,研究者为MiniMax-H3设计了一套面向物理世界推理的评测框架。

评测究竟测什么

与许多视频生成或世界模型测试不同,这项工作刻意避免让提示词直接描述目标视频。测试要求模型处理信息不完整、模态之间互相补充的场景,主要包括四类任务:

  • 隐式提示与多帧:通过不完整的文字线索和多个画面,推断事件背景及其状态变化。
  • 音频—图像推理:将声音中的事件线索与静态视觉信息结合,解决单一模态难以判断的问题。
  • 视频前缀推理:根据已经发生的视频片段,判断后续动态或潜在事件走向。
  • 音频—视频推理:联合环境声音和连续画面,对事件进行更完整的解释。

这些设置的共同点是,模型不能依赖某一个“万能模态”直接找到答案,而必须完成跨模态对齐,并从表面信号中推断隐藏的事件状态。

结果透露了什么

在517个评测实例中,MiniMax-H3的整体成功率为41.97%。分项结果并不均衡:视频决策推理的成功率最高,为56.00%;音频消歧推理最低,为27.40%。这说明模型已经能够在部分视频场景中利用时间信息进行判断,但当声音承担关键的区分作用时,跨模态整合仍不够稳定。

需要注意的是,41.97%并不能简单等同于模型的“世界理解能力分数”。它更像是在一组专门构造、强调信息互补的任务中的表现。评测规模为517个实例,且研究重点是提出新的测试范式,因此结果适合用来观察能力结构和短板,不宜直接与所有视频模型基准横向比较。

意义与局限

这项工作的价值,在于把全模态模型的评价从“能否生成多种内容”推进到“能否利用多种证据进行推理”。对于未来的世界模型、具身智能和多媒体代理而言,真正重要的不是单纯看见或听见,而是理解不同信号之间的因果关联,并据此做出合理预测。

同时,研究也提示,模态数量增加不会自动带来更强推理能力。音频与视觉之间的时间同步、语义对齐和不确定性处理,可能仍是决定性能的核心环节。作者表示,相关测试集及基于大语言模型的自动评测流程正在准备发布,后续开放情况将影响这一方向的可复现性与比较效率。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
RiskChainBench:把隐写消息恢复与网页取证连成一条评测链
模型评测
cctest.ai
模型评测

RiskChainBench:把隐写消息恢复与网页取证连成一条评测链

RiskChainBench 将平台滥用场景中的隐写消息恢复,与基于证据的网页调查放入同一套基准中,检验模型能否从“看懂暗号”走到“找对网站并完成判断”。结果显示,稳定导航和风险研判仍是多模态智能体的主要短板。

阅读全文