Occamy-1.0:35B规模模型瞄准协作型智能体的成本拐点
导语
智能体真正投入工作后,难点往往不在一次性回答一个复杂问题,而在于连续完成一串彼此关联的动作:搜集资料、调用工具、编写代码、读写文件,并在出错后恢复流程。每次模型调用都会带来额外的延迟与成本,因此,适合协作型工作的模型不能只看峰值推理能力,还要看它能否稳定、经济地把任务执行到底。
arXiv论文介绍的Occamy-1.0,正是围绕这一问题打造的35B级模型。它以经过后训练的Qwen3.6-35B-A3B检查点为基础,继续进行面向执行任务的训练。论文没有把重点放在扩大参数规模,而是试图让中等规模模型更适合真实工作流中的连续操作。
核心要点
- 训练目标从单轮回答转向完整执行。 研究团队构建了与执行过程相关的数据和环境,并在多个智能体运行框架中收集可回放的长时轨迹。这样,训练信号不仅来自最终答案,也来自任务推进、工具交互和流程恢复等环节。
- 采用分阶段后训练。 论文称,团队通过分阶段方法培养并整合多种互补的执行能力,覆盖状态跟踪、协调、恢复和后续跟进等日常工作中高频但容易被忽视的环节。
- 关注整个任务周期的经济性。 评测覆盖多项协作型工作基准。按照论文给出的评测和定价协议,Occamy-1.0在四个代表性基准的综合表现落在观测到的成本—性能Pareto前沿的低成本拐点附近;在部分任务上,它还可与明显更大的前沿系统竞争。
- 专用化没有明显局限于单一场景。 研究还报告了工具调用、编码和指令遵循方面的支持性评测,意在说明该模型的协作型优化仍保留较广泛的智能体能力。
- 开放程度服务于复现。 团队计划发布模型权重及部分训练数据,为协作型智能体和智能体后训练研究提供基础。
意义与限制
Occamy-1.0传递出的关键信号是:智能体模型的竞争维度正在从“谁最聪明”扩展到“谁能以更低代价稳定完成整段工作”。对于需要大量模型调用的自动化流程,状态管理、工具使用和失败恢复可能比单个高难度推理步骤更直接影响实际可用性。若这一思路在更多环境中成立,中等规模、执行能力经过专门优化的开放模型,可能成为企业内部自动化和研究型智能体的务实选择。
不过,现有素材没有给出各项基准的具体分数、调用价格、延迟数据或与每个对手模型的逐项比较。因此,“低成本拐点”应理解为论文所述评测协议下的观察结果,而不是适用于所有部署场景的普遍结论。模型权重和部分数据的开放,也不等于训练环境、完整数据构成及实际运行稳定性都已完全公开。后续仍需要更多独立复现,以及在真实工具链和长周期任务中的验证。
评论
正在确认登录状态……
正在加载评论……