返回文章列表
AI 智能体

Apodex 1.1:把智能体能力从“会推理”推进到“能持续交付”

阅读约 3 分钟

导语

大语言模型已经能够完成推理、总结和知识合成,但真正的专业工作往往不是一次生成一个答案。研究人员需要查阅资料、处理文件、运行代码、记录中间状态,并在工具失败或信息不完整时调整方案。Apodex 1.1 试图解决的,正是这段持续推进、最终交付并且能够被核验的工作过程。

核心要点

  • 从回答转向持续工作。 Apodex 将“working capability”定义为围绕现实目标持续取得、验证进展的能力。评价重点因此从语言输出本身,延伸到工具使用、状态管理、错误恢复和可验证交付。
  • 环境扩展。 系统扩大了文件处理、信息搜索和代码执行环境的多样性,并强调执行过程与结果的可验证性。这样训练出的智能体,不只是知道应该做什么,也需要在具体环境中完成操作。
  • 智能体协同扩展。 Apodex 1.1 能够把长周期任务拆分为多个子任务,安排不同智能体并行处理,再持续整合异步结果。当新信息改变原定路径时,系统还可以重新规划;用户也能在过程中介入和调整方向。
  • 统一的执行基础设施。 共享执行框架与 AgentOS 用于维护任务状态、工具调用记录和结果来源,帮助多个智能体在同一任务中保持上下文,并为后续复核提供依据。
  • 开放与部署选择。 官方同时提供 Apodex 1.1 在线工作台、35B 参数的 Apodex 1.1 Mini,以及可本地部署的开源研究工作台 FrontierAgent。论文还公布了模型权重和相关代码入口。

意义与影响

Apodex 1.1 的价值不只在于增加一个模型名称,而在于把智能体竞争的重点进一步转向“能否把复杂事情做完”。对科研、金融分析、编程和深度搜索等任务而言,单次回答的流畅度并不能代表工作的可靠性;中间过程是否可追踪、失败后能否恢复、最终结果是否可以验证,同样关键。

论文称,Apodex 1.1 在专业工作、金融、科学研究、数学、编码和搜索等复杂场景中进入领先表现区间,并且使用的模型规模明显小于许多前沿系统。35B 参数的 Mini 版本则为本地运行提供了更现实的入口。不过,现有素材没有给出具体基准分数、任务设置或对比模型,因此这些性能表述仍应结合论文完整实验部分判断。

更值得关注的是,Apodex 把环境设计、任务轨迹和协调记录都纳入训练流程。这意味着未来的智能体系统可能不再只是“模型加工具”,而是由模型、执行环境、状态管理和协作机制共同构成。若这些组件能够在实际使用中保持稳定,长周期研究和专业自动化将有望从演示型代理逐步走向可复核的工作系统。

来源:Hugging Face Daily Papers

评论

正在确认登录状态……

正在加载评论……

相关文章

CCTest · Blog
AgentMercury:把企业业务场景变成可验证的智能体训练世界
AI 智能体
cctest.ai
AI 智能体

AgentMercury:把企业业务场景变成可验证的智能体训练世界

AgentMercury提出了一种面向业务场景的环境合成框架:先构建包含实体、服务、工具和状态的持久化世界,再让任务与交互轨迹自然生成。研究者据此构建了覆盖14个行业、50个国家的4783个可执行环境,并观察到对企业工作流及部分域外基准的提升。

阅读全文