Omni-Decision:用证据账本重构全模态智能体的规划流程
导语
全模态智能体要解决一个复杂问题,往往需要同时观看视频、听取音频、检索网页并调用计算工具。信息来源越多,传统依赖对话历史的工作方式就越容易失控:大量噪声会不断堆积,真正重要的证据被淹没,模型也更难判断下一步应该查什么、验证什么。
论文《Omni-Decision: Evidence-Ledger Planning for Omni-Modal Agents》把注意力集中在这一规划难题上。它提出的核心思路不是继续扩大上下文,而是用一份结构化的“证据账本”替代不断增长的对话记录。
核心方法
Omni-Decision 的账本主要维护三类状态:已经确认的证据、仍然缺失的信息,以及不同记录之间存在的冲突。这样一来,规划器面对的不是从头翻阅所有观测,而是一个持续更新、更加紧凑的任务状态。
系统还引入了批评器。每当感知模块从视频、音频、网页或计算工具返回结果,批评器会先判断其中哪些内容可用,再把经过筛选的信息写入账本,其他噪声则被丢弃。账本因此承担了“信息压缩”和“任务记忆”的双重作用,也帮助规划器明确下一步行动。
论文还记录每次运行中的状态、动作和结果判断,并将这些轨迹用于监督微调与决策级强化学习。换言之,训练目标不只是让模型识别内容,还包括让它学会在证据不完整或相互矛盾时作出更合理的行动选择。
实验信号
作者通过替换不同后端进行受控实验,观察到替换规划器带来的性能下降明显大于替换感知后端。这一结果支持论文的判断:在当前全模态智能体中,如何组织信息、安排步骤和决定何时停止搜索,可能比单纯提升感知能力更关键。
在 OmniGAIA 上,Omni-Decision 报告了 81.4% 的准确率,单题成本约为 Gemini-3.1-Pro 的 43%;在 WorldSense 长视频理解任务上达到 65.0%,与最强端到端模型处于同一水平。素材未提供更详细的消融设置和成本计算口径,因此这些结果更适合作为论文给出的总体性能信号,而不是对所有场景的普遍结论。
意义与影响
这项工作的重要性在于,它把全模态智能体的上下文管理问题转化成了显式的状态管理问题。对于长流程检索、视频问答和跨工具推理,账本结构有望降低历史噪声对后续决策的干扰,也让“缺什么证据”变得更加可追踪。
不过,账本的质量仍取决于批评器的筛选能力,以及规划器对冲突证据的处理能力。如果早期判断错误,压缩后的状态也可能放大偏差。后续评估还需要进一步说明账本在不同模态组合、长任务长度和错误观测下的稳定性。总体来看,Omni-Decision 提供了一条清晰路线:全模态智能体的进步,不只来自更强的感知模型,也来自更可靠的证据组织与决策机制。
评论
正在确认登录状态……
正在加载评论……