返回文章列表
模型评测

HyperBrowseComp:把多语言、多模态网页搜索变成一场压力测试

阅读约 2 分钟

导语

许多网页问答基准考察的是模型能否从搜索结果中找到一个相对明确的事实,但真实的信息获取往往更复杂:线索可能分散在不同语言的网站、视频、扫描文件、图片或地图中,答案还需要经过多步推理和交叉验证。MBZUAI 团队推出的 HyperBrowseComp,正是针对这类场景设计的压力测试。

核心要点

  • 多语言覆盖:数据集包含 423 道人工编写、人工验证的问题,覆盖 13 种语言,题目由母语者或具备高水平语言能力的作者完成。
  • 强调开放网络证据:每道题都对应一个简洁且可公开验证的答案,但寻找答案可能需要追踪隐蔽信息、连接多步线索,或在不同来源之间进行比对。
  • 引入多模态材料:任务可能要求检查视频、扫描文档、图片和地图,而不只是阅读网页文本。
  • 尽量排除“背答案”:研究者先使用无法联网的模型筛除较容易、可能仅凭参数记忆解决的问题,以提高任务对实际浏览能力的要求。
  • 统一评测协议:研究同时考察模型供应商自带的搜索能力,以及在共享外部检索工具下的表现,并对部分题目进行人工评估,用于理解模型表现和完成任务所需投入。

意义与影响

HyperBrowseComp 的价值,在于把“会搜索”拆解为更接近真实工作的能力组合:理解问题、生成有效检索路径、跨语言发现材料、处理不同媒介中的信息、判断证据相关性,并在长链路探索后给出可核验结论。对于网页浏览智能体而言,单次搜索命中关键词并不等于完成任务;真正的难点是保持持续的信息寻求能力,同时避免被低质量页面、缺失上下文或相互矛盾的线索带偏。

这一基准也提醒评测者,未来的智能体比较不能只看最终答案准确率。搜索调用次数、检索路径、证据覆盖范围以及人工完成同类任务所需的努力,都有助于更全面地衡量系统能力。由于素材未提供具体模型成绩,HyperBrowseComp 当前更适合作为评测框架与研究方向介绍,而不是性能排行榜。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
从模型行为追溯数据来源:合成预训练让表格模型归因变得可验证
模型评测
cctest.ai
模型评测

从模型行为追溯数据来源:合成预训练让表格模型归因变得可验证

一项研究利用带有完整来源链的合成任务,检验哪些预训练数据真正影响表格基础模型的表现。结果显示,行为归因能够指导有效的数据移除,但“来源相似”与“因果贡献”并不总是一致。

阅读全文