返回文章列表
AI 智能体

Omni-IO Skills:用代理编排让通用智能体获得多模态生产力

阅读约 3 分钟

导语

大语言模型已经能够完成规划、推理和长链条任务,但当工作涉及音频、视频、3D资产或复杂文档时,能力往往需要依赖一组彼此割裂的外部工具。问题不只是“能不能调用工具”,还包括如何拆解任务、传递中间结果、管理依赖,以及在下一轮对话中继续复用此前生成的资产。

Omni-IO Skills给出的答案,是在现有通用智能体外部增加一个可插拔的“代理Harness”。它不替换原有模型的推理和规划核心,而是负责把多模态能力组织成可调度、可复用的执行系统。

核心设计

  • 分层Skills:框架包含27个Skills,覆盖38项代表性任务,面向7类产物模态和理解、生成、推理、检索四类能力。这样,智能体可以通过统一接口选择合适的能力模块,而不必为每种任务重新设计整套流程。
  • 声明式执行图:多资产任务被表达为带依赖关系的执行图。互不依赖的操作可以并行运行,只有在上游产物准备完成后,下游步骤才会启动。这种方式尤其适合“分析视频—生成音乐—制作演示文稿”一类跨模态链路。
  • 持久化Asset Registry:成功生成的中间文件会被登记,并可供后续步骤和跨轮对话复用。资产不再只是一次调用的临时返回值,而成为工作流中的可追踪资源。
  • 可替换后端:不同模型或工具提供商被置于执行后端层。根据论文描述,更换服务主要通过配置完成,有助于降低对单一供应商的绑定。

结果与解读

在UniM-90评测中,接入Harness后,GPT-5.6 Sol的输入支持率从40.00%提升至100%,Claude Sonnet 5则从38.89%提升至100%。两者的Semantic–Quality Coupled Score分别从26.99和27.82提高到74.94和77.78;Strict Structure Score分别达到100.00和99.78。结果说明,扩展代理的瓶颈未必总在基础模型本身,也可能在于缺少统一的能力组合和产物管理机制。

不过,这项工作更像是系统工程路线,而不是证明单个模型获得了新的原生模态理解能力。Skills依赖外部执行后端,整体效果仍取决于工具质量、接口稳定性和任务编排准确度。它的价值在于把这些复杂性集中到Harness层,使基础模型能够以较低改造成本接入不断变化的多模态工具生态。

意义与影响

Omni-IO Skills展示了一条可演进的Agent路线:模型负责理解意图和制定计划,Harness负责把计划转化为可执行、可复用、可并行的资产工作流。随着任务从单轮问答转向长期协作,这种依赖图与资产注册机制可能成为多模态智能体的基础设施。项目同时开放代码和示例工作流,为研究者比较不同技能、后端与编排策略提供了入口。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章