让智能体真正“画对”:EASEL如何测试多模态模型的精细工具使用能力
导语:从“看懂”到“做准”
多模态模型已经能够回答图片问答、操作网页或调用软件工具,但这些能力并不等于它们可以根据视觉反馈持续完成精细任务。真正困难的地方在于:模型需要从画面中估计位置、颜色、尺度和动作参数,执行一步后重新观察结果,再决定下一步怎么做。任何一次偏差,都可能直接改变最终产物。
论文《Paint What You See》将这种能力概括为“灵巧的视觉工具使用”,并提出 EASEL 基准进行评估。它没有把任务简化成一次性指令,而是要求智能体通过外部绘画工具逐步把画布画成参考图像。
核心要点
- 参考图重建是主任务。 智能体需要根据目标图像选择绘画动作,并在多轮交互中不断修正结果。工具参数不只是形式上的调用字段,而是直接决定画面质量。
- 评测覆盖多种精细操作。 除了图像重建,EASEL 还包含区域标注、手写和路径规划等语义任务,用来观察模型在定位、轨迹控制和精确表达方面的边界。
- 模型的瓶颈不只在视觉理解。 对 25 个模型的评估显示,重建相似度大致停留在 0.40—0.54。轨迹诊断进一步发现,模型经常在早期达到局部峰值,随后无法维持,甚至因后续操作而退化。
- 数据训练能够带来有限但明确的改善。 研究团队发布了包含 44 万条样本的 EASEL-Data,并采用两阶段课程式设计进行轨迹监督。基于这些数据训练的 EASEL-9B,相比基础模型取得 6.3% 的相对提升,并在所有受测模型中排名第三。
为什么这项工作重要
以往的智能体基准往往关注任务是否完成,例如是否打开了网页、填写了表单或生成了代码。这些指标对高层规划很有价值,却可能掩盖一个关键问题:模型是否能把视觉判断准确转换成连续、可校正的动作。EASEL 把最终结果和中间轨迹同时纳入考察,因此能够区分“知道应该做什么”和“能够稳定地做出来”。
这也解释了为什么一个模型在图像问答中表现良好,到了精细标注或路径规划任务上却可能迅速失效。对于未来的 GUI 智能体、机器人控制和创意软件助手而言,视觉反馈不能只是输入上下文,还必须参与每一步的决策闭环。EASEL-Data 的结果则表明,专门的轨迹监督有助于改善这一能力,但有限的提升也说明,稳定控制、误差恢复和长期规划仍是开放问题。
总体而言,EASEL 提供了一个直观而有针对性的测试:模型是否真的能“看着结果继续做”,而不是只会描述目标或发出一次看似合理的工具调用。随着智能体从回答问题走向操作环境,这类精细、闭环的评测将越来越重要。
评论
正在确认登录状态……
正在加载评论……