返回文章列表
AI 智能体

Gander:把连续多模态交互与智能体能力装进同一套架构

阅读约 3 分钟

导语

多数语音助手仍以“用户说完—模型回答”为基本节奏;而复杂智能体又往往把感知、推理、工具调用和语音输出拆成多个模块。论文《Omni Interaction Agent Technical Report》介绍的 Gander,试图将这两类能力放进一个统一框架,使模型能够持续听、持续看、持续处理任务,并以更接近人与人交流的方式作出反应。

核心要点

  • 面向持续输入的多模态交互:Gander 可以接收视频、语音和文本等流式输入,不再严格依赖完整轮次。用户可以随时打断模型,模型也可以在任务进行中主动给出中间反馈或提出后续问题。
  • “小脑—大脑”协作:架构将实时交互与复杂智能体能力分工。Cerebellum,也就是“小脑”,负责低延迟响应和全模态对话;Brain,则承担复杂推理和更高层次的智能体任务。两者通过工具调用和智能体编排运行时持续连接。
  • 流式 Thinker-Talker:Cerebellum 采用 Thinker-Talker 结构,并把用户输入与模型输出进一步展平为按块排列的令牌流。这样的表示方式意在让输入、思考和回应能够更连续地衔接,减少传统管线中的等待感。
  • 覆盖四类能力评估:论文从对话能力、多模态理解、交互能力和智能体智能四个维度评测 Gander,并报告开展了内部人工评估。不过,当前素材没有提供具体测试集、指标或对比结果,因此不宜据此判断其相对优势。

这项设计意味着什么

Gander 的价值不只在于把视觉和语音接入语言模型,更在于重新组织交互时序。传统系统通常先完成识别,再生成答案;遇到打断、追问或工具执行时,还要在模块之间切换。Gander 的流式令牌表示和双层架构,则试图把低延迟交流与长链路任务执行放在同一运行过程中。

这种思路尤其适合需要边观察边行动的场景,例如实时协作、流程办理、屏幕或环境理解,以及需要多次确认的工作流。Cerebellum 可以维持自然对话节奏,Brain 则处理规划、推理和工具使用,二者分工有助于避免让复杂任务拖慢即时回应。

但这套架构也提出了新的工程问题:实时模块与推理模块如何同步状态,模型如何判断何时插话,工具调用期间如何保持上下文一致,以及主动反馈是否会造成干扰。素材目前只展示了总体设计和评估方向,尚未披露延迟、资源开销、任务成功率等关键细节。因而,Gander 更适合作为一种面向全双工智能体的架构探索,而不是已经得到充分量化验证的最终方案。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章