返回文章列表
多模态

OneSearch-VL:用证据图统一图像与视频深度研究

阅读约 3 分钟

导语

让模型看懂一张图片,与让模型围绕多张图片或一段视频完成“深度研究”,并不是同一种任务。后者通常需要先定位视觉内容,再识别相关实体,调用搜索或其他外部工具补充事实,最后把分散证据组织成答案。OneSearch-VL试图用一套统一的智能体框架处理这些任务,核心思路是把视觉证据和研究过程显式连接起来。

核心方法:视觉扎根证据图

OneSearch-VL的基础是 Visually Grounded Evidence Graph,即“视觉扎根证据图”(VGEG)。它不是只记录最终答案,而是描述多个环节之间的依赖关系:图片或视频中的局部视觉锚点、由锚点指向的实体及其关系、外部来源支持的事实,以及生成答案时所执行的操作。

这种表示方式解决了多模态研究中的一个常见问题:模型可能找到了看似相关的资料,却无法说明资料对应画面中的哪个对象,也无法保证最终结论确实由视觉证据和检索结果共同支持。VGEG为数据构建、过程监督和细粒度评测提供了共享参照,使研究过程不再只以“答案是否正确”作为判断标准。

从数据到训练与评测

研究团队基于VGEG设计数据引擎,用于构造和核验多图、视频问题,并筛选专家轨迹。在此基础上,项目整理出两个训练资源:

  • OneSearch-VL-SFT-110K,用于监督微调;
  • OneSearch-VL-RL-10K,用于强化学习。

此外,团队从VGEG标注中提取了 Evidence-aware Visual-Grounded Rubric(EVGR)奖励。该奖励重点关注两类能力:回答是否能够追溯到相应证据,以及模型是否真正利用了视觉内容,而不是仅凭语言先验或外部检索结果作答。

评测方面,项目发布了 OneSearch-MI-Bench 和 OneSearch-Video-Bench,并按照VGEG中编码的研究操作组织问题。这样的设计有助于区分模型究竟是视觉定位、实体关联、检索、证据整合还是答案生成环节出现了问题,而不仅仅给出一个笼统总分。

实验结果与意义

素材显示,OneSearch-VL-8B在两个新基准上,相比具备工具访问能力的Qwen3-VL-8B,分别提升20.2和17.6个百分点;同时,它在7个图像基准和VideoDR上也取得了明显提升。这里的重点并不只是模型规模,而是训练目标从“生成一个答案”扩展到了“沿着可解释的证据链完成研究”。

对多模态智能体而言,这种思路具有现实意义。单图、多图和视频任务在视觉操作上差异很大,但它们都需要视觉 grounding、外部信息获取和事实组合。VGEG提供了一种统一的中间表示,可能帮助后续系统更稳定地管理跨模态依赖,也让错误分析和过程评估更加具体。

当然,现有材料主要披露了方法框架、数据规模和基准结果,尚不足以判断其在不同搜索工具、开放域噪声或更长视频上的实际表现。项目代码和数据已公开,后续仍需结合完整论文与复现实验观察其泛化能力。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
Kandinsky 6.0 Video:让视频生成同时具备画面、声音与口型同步
多模态
cctest.ai
多模态

Kandinsky 6.0 Video:让视频生成同时具备画面、声音与口型同步

Kandinsky 6.0 Video 是一组面向文本或图像输入的音视频生成模型,可输出带有同步 44 kHz 音频和唇形匹配的 5 秒视频。其核心是连接视频与音频生成流的双流 CrossDiT 架构,并以开源方式发布代码、权重和 Diffusers 集成。

阅读全文