DeepSeek Harness v0.1.0-rc.8:多模态输入进入代理工作流
导语
DeepSeek Harness 公测刚满一周,项目便发布了 v0.1.0-rc.8。此次版本包含 14 项更新,其中最受关注的是多模态能力:用户现在可以发起原生图片请求,也可以把图片与文字组合后提交给 Harness。值得注意的是,这并不等同于底层纯文本模型突然获得了视觉能力,更准确的理解是,Harness 在输入层和任务编排层增加了对图片的处理路径,让相关模型或后端能够接收这类请求。
核心更新
- 支持图片与图文混合输入:新版允许在请求中直接加入图片,也支持文字和图片共同构成任务上下文。
- 命令可以接收图片:
/goal、/plan等工作流命令不再局限于纯文本描述。用户可以把截图、界面信息或其他视觉材料作为任务输入,再让系统围绕目标进行规划。 - 子 Agent 体系继续扩展:Claude Code 和 Codex 获得进一步接入子 Agent 的能力。这意味着复杂任务可以被拆分给不同代理处理,但素材没有说明具体的调度规则或可用数量,因此不宜过度解读为完整的多代理协作平台。
- Windows 终端体验改善:新版加入持久 PowerShell 会话,减少反复建立终端环境的需要。
- 极简模式默认开启:这可能让首次使用时的界面和操作路径更轻量,但具体交互差异仍需以实际版本为准。
这次更新意味着什么
过去,多模态往往停留在聊天窗口:用户上传图片,模型给出一次性回答。Harness 的变化在于,它把图片放进了更接近开发代理的工作流中。截图可以成为目标描述的一部分,视觉信息也可以参与计划生成,而不是只能作为独立问答的附件。对于代码、界面分析和终端任务来说,这种输入方式更贴近真实使用场景。
不过,能力边界仍然需要区分。Harness 支持图片请求,解决的是工具层面的接入与编排问题;最终能否准确理解图片、是否支持特定图片格式,以及不同后端对视觉输入的处理效果,仍取决于实际连接的模型和服务。因而,当前版本更适合被看作多模态代理工作流的基础设施更新,而不是一次底层模型能力发布。
公测阶段快速加入多模态、子 Agent 和 Windows 会话能力,说明项目正在同时完善输入、执行与开发环境三条链路。后续值得观察的是:图片上下文能否稳定贯穿规划和执行环节,子 Agent 是否具备清晰的职责分工,以及这些功能在不同模型后端之间能否保持一致体验。
来源:OSChina
评论
正在确认登录状态……
正在加载评论……