OneSearch-VL:用证据图统一图像与视频深度研究
导语
让模型看懂一张图片,与让模型围绕多张图片或一段视频完成“深度研究”,并不是同一种任务。后者通常需要先定位视觉内容,再识别相关实体,调用搜索或其他外部工具补充事实,最后把分散证据组织成答案。OneSearch-VL试图用一套统一的智能体框架处理这些任务,核心思路是把视觉证据和研究过程显式连接起来。
核心方法:视觉扎根证据图
OneSearch-VL的基础是 Visually Grounded Evidence Graph,即“视觉扎根证据图”(VGEG)。它不是只记录最终答案,而是描述多个环节之间的依赖关系:图片或视频中的局部视觉锚点、由锚点指向的实体及其关系、外部来源支持的事实,以及生成答案时所执行的操作。
这种表示方式解决了多模态研究中的一个常见问题:模型可能找到了看似相关的资料,却无法说明资料对应画面中的哪个对象,也无法保证最终结论确实由视觉证据和检索结果共同支持。VGEG为数据构建、过程监督和细粒度评测提供了共享参照,使研究过程不再只以“答案是否正确”作为判断标准。
从数据到训练与评测
研究团队基于VGEG设计数据引擎,用于构造和核验多图、视频问题,并筛选专家轨迹。在此基础上,项目整理出两个训练资源:
- OneSearch-VL-SFT-110K,用于监督微调;
- OneSearch-VL-RL-10K,用于强化学习。
此外,团队从VGEG标注中提取了 Evidence-aware Visual-Grounded Rubric(EVGR)奖励。该奖励重点关注两类能力:回答是否能够追溯到相应证据,以及模型是否真正利用了视觉内容,而不是仅凭语言先验或外部检索结果作答。
评测方面,项目发布了 OneSearch-MI-Bench 和 OneSearch-Video-Bench,并按照VGEG中编码的研究操作组织问题。这样的设计有助于区分模型究竟是视觉定位、实体关联、检索、证据整合还是答案生成环节出现了问题,而不仅仅给出一个笼统总分。
实验结果与意义
素材显示,OneSearch-VL-8B在两个新基准上,相比具备工具访问能力的Qwen3-VL-8B,分别提升20.2和17.6个百分点;同时,它在7个图像基准和VideoDR上也取得了明显提升。这里的重点并不只是模型规模,而是训练目标从“生成一个答案”扩展到了“沿着可解释的证据链完成研究”。
对多模态智能体而言,这种思路具有现实意义。单图、多图和视频任务在视觉操作上差异很大,但它们都需要视觉 grounding、外部信息获取和事实组合。VGEG提供了一种统一的中间表示,可能帮助后续系统更稳定地管理跨模态依赖,也让错误分析和过程评估更加具体。
当然,现有材料主要披露了方法框架、数据规模和基准结果,尚不足以判断其在不同搜索工具、开放域噪声或更长视频上的实际表现。项目代码和数据已公开,后续仍需结合完整论文与复现实验观察其泛化能力。
评论
正在确认登录状态……
正在加载评论……