返回文章列表
AI 智能体

RESOURCE2SKILL:把人类教程转化为可执行 Agent 技能

阅读约 3 分钟

导语

软件 Agent 要真正进入复杂生产环境,瓶颈往往不只是模型能力,而是“会不会做事”。人类已经在教程视频、代码仓库、文档、文章和优秀作品中沉淀了大量操作经验,但这些知识通常面向人阅读和模仿,并不能直接被 Agent 调用。微软研究提出的 RESOURCE2SKILL,正是试图把这些分散的多模态资源,蒸馏成可检索、可组合、可执行的 Agent 技能。

核心要点

  • 技能来源不再局限于文本或轨迹:现有技能库常依赖人工编写、纯文本说明,或从 Agent 执行轨迹中总结。RESOURCE2SKILL 将教程视频、代码仓库、文章和参考成果都纳入技能构建过程。
  • 用分层 Skill Wiki 组织知识:系统把抽取出的技能整理为层级化、多模态的技能维基。每个条目不只是说明文字,还包括代码、视觉示例、元数据和来源追溯,便于 Agent 理解技能边界与使用方式。
  • 保留不同资源的互补信号:视频擅长呈现时间顺序、界面操作和视觉效果;代码能提供可执行的工具调用模式;文章和参考作品则补充概念、风格和设计意图。
  • 推理阶段可检索与组合:当 Agent 面对任务时,可以从 Skill Wiki 中找出相关技能并组合使用。如果现有技能覆盖不足,框架还可以在线获取并构建新技能。
  • 跨领域实验表现稳定:论文报告称,在 PowerPoint、Excel、网页生成、Blender、CAD、UI/UX、音乐制作七个实际创作领域中,RESOURCE2SKILL 相比无技能 Agent 平均总体得分提升 11.9 个百分点,并在 28 个模型—领域设置中均有提升;与强 Agent harness 基线相比,在 26/28 个主要聚合设置中占优。

意义与影响

RESOURCE2SKILL 的价值在于把“互联网知识”重新定义为 Agent 的技能供应链。过去,模型适配新软件环境通常需要大量提示工程、专门工具封装或人工写操作脚本;而该框架展示了另一条路径:从人类已经生产的多模态资料中提取可执行过程知识,并以结构化方式沉淀。

这对软件 Agent 尤其重要。PowerPoint、CAD、Blender 和音乐制作等场景涉及不同界面、工具链和审美判断,很难用单一文本说明覆盖。多模态技能条目让 Agent 同时参考操作步骤、代码模式和视觉目标,理论上更接近人类学习软件的方式。

不过,这项工作仍应被视为“技能工程”的框架探索,而不是完全自动化专家能力的终点。技能质量依赖源材料质量、抽取策略和检索选择;在线获取新技能也会带来可靠性与来源审核问题。即便如此,RESOURCE2SKILL 给出了一个清晰方向:未来 Agent 的能力扩展,可能不只是继续扩大模型,也包括系统性地把人类已有教程和作品转化为可执行知识库。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章