返回文章列表
模型评测

让智能体真正“画对”:EASEL如何测试多模态模型的精细工具使用能力

阅读约 3 分钟

导语:从“看懂”到“做准”

多模态模型已经能够回答图片问答、操作网页或调用软件工具,但这些能力并不等于它们可以根据视觉反馈持续完成精细任务。真正困难的地方在于:模型需要从画面中估计位置、颜色、尺度和动作参数,执行一步后重新观察结果,再决定下一步怎么做。任何一次偏差,都可能直接改变最终产物。

论文《Paint What You See》将这种能力概括为“灵巧的视觉工具使用”,并提出 EASEL 基准进行评估。它没有把任务简化成一次性指令,而是要求智能体通过外部绘画工具逐步把画布画成参考图像。

核心要点

  • 参考图重建是主任务。 智能体需要根据目标图像选择绘画动作,并在多轮交互中不断修正结果。工具参数不只是形式上的调用字段,而是直接决定画面质量。
  • 评测覆盖多种精细操作。 除了图像重建,EASEL 还包含区域标注、手写和路径规划等语义任务,用来观察模型在定位、轨迹控制和精确表达方面的边界。
  • 模型的瓶颈不只在视觉理解。 对 25 个模型的评估显示,重建相似度大致停留在 0.40—0.54。轨迹诊断进一步发现,模型经常在早期达到局部峰值,随后无法维持,甚至因后续操作而退化。
  • 数据训练能够带来有限但明确的改善。 研究团队发布了包含 44 万条样本的 EASEL-Data,并采用两阶段课程式设计进行轨迹监督。基于这些数据训练的 EASEL-9B,相比基础模型取得 6.3% 的相对提升,并在所有受测模型中排名第三。

为什么这项工作重要

以往的智能体基准往往关注任务是否完成,例如是否打开了网页、填写了表单或生成了代码。这些指标对高层规划很有价值,却可能掩盖一个关键问题:模型是否能把视觉判断准确转换成连续、可校正的动作。EASEL 把最终结果和中间轨迹同时纳入考察,因此能够区分“知道应该做什么”和“能够稳定地做出来”。

这也解释了为什么一个模型在图像问答中表现良好,到了精细标注或路径规划任务上却可能迅速失效。对于未来的 GUI 智能体、机器人控制和创意软件助手而言,视觉反馈不能只是输入上下文,还必须参与每一步的决策闭环。EASEL-Data 的结果则表明,专门的轨迹监督有助于改善这一能力,但有限的提升也说明,稳定控制、误差恢复和长期规划仍是开放问题。

总体而言,EASEL 提供了一个直观而有针对性的测试:模型是否真的能“看着结果继续做”,而不是只会描述目标或发出一次看似合理的工具调用。随着智能体从回答问题走向操作环境,这类精细、闭环的评测将越来越重要。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
GMA:让移动智能体面对更接近真实生活的复杂任务
模型评测
cctest.ai
模型评测

GMA:让移动智能体面对更接近真实生活的复杂任务

一项新的移动智能体基准 GMA 扩展了应用覆盖和任务复杂度,用七款开源应用与 300 个任务检验模型能否完成从单步操作到多步骤工作流的真实需求。研究显示,任务越复杂,现有智能体的表现下降越明显,而合理的 harness 设计能够改善部分工作流执行效果。

阅读全文
CCTest · Blog
评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计
模型评测
cctest.ai
模型评测

评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计

一项基于固定代码提交版本的审计发现,评测脚本能够定义计算过程,却未必足以支撑与指标绑定的历史性结论。研究对 124 个 Inspect Evals 单元进行盘点,其中 110 个在进入确定性推断前就因证据或语义问题停止。

阅读全文