PolicyGuide:让LLM智能体从守住单步动作走向遵循完整流程
PolicyGuide将组织政策编译为工作流图,并在每轮用户交互边界主动校验智能体状态。实验显示,这种从“拦截动作”转向“引导流程”的方法能显著提升客服智能体的合规表现。
阅读全文PolicyGuide将组织政策编译为工作流图,并在每轮用户交互边界主动校验智能体状态。实验显示,这种从“拦截动作”转向“引导流程”的方法能显著提升客服智能体的合规表现。
阅读全文EnvHarness 不再要求研究者从零重建智能体环境,而是通过可插拔组件改造现有环境的行为。配套的 EnvRigger 会根据目标策略的执行轨迹诊断弱点,并自动生成、验证针对性的环境调整。
阅读全文Nvidia研究显示,同一个模型在不同Harness下,长程任务表现可能大幅分化。记忆管理、工具调用和监督智能体,正在成为智能体系统的关键竞争力。
阅读全文Meta AI Research 发布开放权重模型 Muse Glimmer,主打本地运行、视觉理解和多步工具调用。借助 4 位量化与 DFlash 推测解码,它试图把 30B 级智能体能力带到消费级硬件。
阅读全文视频生成的竞争正从单条画面质量,转向对 brief、素材、流程和交付的整体处理能力。MiniMax Design 的出现,体现了模型公司向创作软件层上移的趋势。
阅读全文开源项目 OpenConnector 面向 AI Agent 和应用开发者,试图把分散的 SaaS 账号、认证流程与接口能力纳入统一运行时。它的重点不只是连接更多服务,也包括权限控制、标准化 Actions 和运行审计。
阅读全文Slack正在推出Slack Code,将代码任务、AI代理和团队讨论集中到专属频道中。团队成员可以查看代码变更、预览网页效果,并在上线前提供反馈和审批。
阅读全文Binance推出Agent OS,让开发者可将ChatGPT、Claude Code、Cursor等AI工具接入交易、支付和链上服务。代理能够代用户下单,但风险控制主要依赖用户配置子账户和权限。
阅读全文杰富瑞分析师围绕五类真实办公任务测试了八款全球主流Agent,阿里千问办公在综合表现和隐含Harness评分上排名第一。测试也显示,Agent竞争正从单纯比模型能力转向比任务完成质量与执行成本。
阅读全文Agentic ESOpt提出以进化策略替代部分长程智能体强化学习流程,通过参数空间搜索完成全参数优化,并以较低的训练显存需求适配更大的语言模型。
阅读全文一项跨基准、框架和模型的研究发现,Agent Skills的主要价值并非补充事实,而是把混乱的执行轨迹转化为稳定的操作程序。与此同时,技能检索会随着候选池扩大迅速成为新的瓶颈。
阅读全文一篇新研究提出“智能体事务”概念,尝试把数据库中的ACID原则迁移到会推理、调用工具并修改工作空间的LLM智能体中。其数据智能体在相关基准上较现有方法提升10.6%。
阅读全文UI-Mate提出了一套环境驱动的GUI智能体训练流程,并引入基于上下文示范的任务执行机制。其27B模型在OSWorld-Verified上取得77.0%的成绩,展示了开放权重电脑操作智能体的进展。
阅读全文StateM 把长程智能体的执行过程拆解为持久状态、阶段上下文和可检查的状态转移,在不修改模型权重的情况下显著提升 Terminal-Bench 2.1 成绩。研究还显示,同一套运行时与规则可以迁移到不同模型,并降低高分运行成本。
阅读全文VibeLifeBench 试图补上智能体评测中的一个空白:真实生活任务不是一次性问答,而是持续数周、环境不断变化、规则经常没有明说的长期协作。
阅读全文Ouroboros 将智能体的工具、提示词、上下文组装和核心实现纳入可演化范围,并通过经过审查的提交把改进变成后续运行时的一部分。论文称其在 Terminal-Bench 2.1、OSWorld-Verified 和 CL-Bench 上刷新了多项结果。
阅读全文Cloudflare 发布 Kitesurf,一款面向 AI 代理而非人类用户的云托管浏览器。它强调更低的 CPU 与内存消耗,帮助开发者更高效地构建能浏览网页、填表和执行任务的代理应用。
阅读全文蚂蚁集团开源多智能体协作基础设施 Avernet,社区版率先开放智能体协作网络能力。它试图解决企业场景中智能体发现、协同、治理与经验沉淀的基础问题。
阅读全文这项工作把多模态深度研究代理从静态图片推进到连续视频流,重点解决“先搜文本、后看视觉”和过度依赖参数记忆两个问题。作者用分阶段工具解锁、两阶段训练和新基准,验证了视频原生推理代理的可行性。
阅读全文Skill-α 将 Agent 技能生成改造成一个可逐步评估的编辑过程,用“回滚奖励”判断每次修改是否真正改善下游任务表现。论文显示,它在文档到技能、经验到技能两类场景中均优于启发式和流水线式基线。
阅读全文LongHorizon-Harness 将长程任务执行重新定义为状态管理问题,通过 Manage-Execute-Audit 循环把计划、执行与验证分离,减少错误自评在后续步骤中扩散。
阅读全文