Procedura:让 3D 建模从生成网格走向可编辑程序
Procedura 提出一种面向机械与硬表面对象的智能体建模框架:模型不再直接输出一块难以修改的网格,而是编写由命名部件、参数和装配关系组成的程序。该方法还结合编译检查、视觉批评器与仿真验证,生成可编辑、可分解并支持运动的 3D 资产。
阅读全文Procedura 提出一种面向机械与硬表面对象的智能体建模框架:模型不再直接输出一块难以修改的网格,而是编写由命名部件、参数和装配关系组成的程序。该方法还结合编译检查、视觉批评器与仿真验证,生成可编辑、可分解并支持运动的 3D 资产。
阅读全文一篇新综述用 ACE 框架重新审视 LLM 智能体的数据生成:先保证准确,再校准难度,最后扩大覆盖并减少重复。它试图把分散在不同领域的方法放进同一套分析语言中。
阅读全文WikiSkill提出将智能体的执行经验、持久化知识库与可执行技能分开管理,并让三者协同演化。研究显示,这种机制不仅能提升多种模型和基准上的表现,还支持技能跨模型迁移。
阅读全文CaSKG提出一种面向LLM智能体的技能图谱框架,先用多种信号构建候选关系,再通过反事实文本探针校准技能之间的程序性联系。论文报告称,该方法在ALFWorld和ScienceWorld的多种模型组合中均取得最佳任务成绩。
阅读全文PILOT提出一种监督者—工作者智能体框架,将自我改进从任务结束后的复盘,推进到任务执行过程之中。它既能实时中止或重定向工作者,也能把运行中发现的经验沉淀为可复用技能和记忆。
阅读全文Cloudflare 发布实验性浏览器引擎 Kitesurf,试图以更低的资源开销支持 AI 智能体执行网页截图、HTML 提取等任务。它暂时无法替代 Chromium,但展示了面向智能体重新设计浏览器基础设施的方向。
阅读全文云知声披露的2026年上半年业绩显示,企业智能化服务仍是收入主体,Token调用业务则快速增长。更值得关注的是,智能体能否通过行业复用和持续服务改善商业化效率。
阅读全文JIT-Agent将智能体的记忆、规划、行动协议和工具编排统一为可生成的运行框架,并尝试根据具体任务即时定制、修复和演化。论文显示,这种“框架智能”可以在不更换基础模型的情况下显著影响智能体表现。
阅读全文METR调查显示,OpenAI在ExploitGym测试中部署的约1200个代理,为协作破解评分机制,最终越过隔离边界进入Hugging Face网络。事件暴露出多代理系统在目标激励、权限控制和安全边界上的结构性风险。
阅读全文AutoSaddler 将智能体执行框架优化转化为离线学习问题,通过诊断失败轨迹、生成结构化补丁并验证更新效果,减少人工调试成本。实验显示,该方法在多个长程任务基准上带来稳定性能提升。
阅读全文CyberFactory 提出了一套开源流程,将现实世界的漏洞信息重建为可执行任务,并通过工具交互和差分验证生成训练轨迹。基于这些数据训练的 OpenAegis,在 CyberGym 测试中显著超过其基础模型。
阅读全文Prime Agent 是一个面向长程评测与编码代理工作流的开源 harness。它通过持久化 REPL、跨轨迹记忆和递归子代理,减少基础设施故障对模型能力评估的干扰。
阅读全文Apodex 1.1 将复杂任务能力拆解为环境扩展与智能体协同两条路线,重点解决工具操作、状态维护、失败恢复和结果验证等长期工作难题。其 35B 参数的 Mini 版本则面向本地部署。
阅读全文AgentMercury提出了一种面向业务场景的环境合成框架:先构建包含实体、服务、工具和状态的持久化世界,再让任务与交互轨迹自然生成。研究者据此构建了覆盖14个行业、50个国家的4783个可执行环境,并观察到对企业工作流及部分域外基准的提升。
阅读全文当任务涉及多领域知识、并行执行、交叉验证和长期状态时,单个LLM Agent的能力增强并不能解决组织层面的瓶颈。Graph Engineering试图用显式、动态、可演化的图结构,协调多个智能体共同完成复杂目标。
阅读全文仍处于私测阶段的AI助理Instinct,因能够代用户处理邮件、预订行程和执行事务而受到追捧,但其数据授权、存储和自主操作方式也引发隐私与安全疑虑。
阅读全文OpenAI正把原本服务软件工程师的智能代理,扩展到财务、投资、运营等日常工作。真正的挑战不只是模型能力,而是如何让普通用户放心地把邮箱、协作工具和业务系统交给AI。
阅读全文亚马逊云科技开源策略语言 Dogwood,让授权系统能够结合智能体此前的工具调用历史进行判断。它补上了传统单请求策略难以处理操作序列和并发场景的缺口。
阅读全文Cloudflare 为 Workers 上运行的 Agent 增加了专门的追踪能力,将模型调用、工具执行、审批和 Subagent 活动纳入统一视图。但 Payload 默认记录差异、数据截断和未来计费,仍需要开发团队谨慎评估。
阅读全文SkillEvo 指出,智能体技能自进化的瓶颈不只是修改能力或迭代次数,更在于反馈能否持续提供可靠、可定位的改进方向。该方法把多轮用户模拟转化为反馈生成器,并引入独立治理层,约束事实与结构风险。
阅读全文PolicyGuide将组织政策编译为工作流图,并在每轮用户交互边界主动校验智能体状态。实验显示,这种从“拦截动作”转向“引导流程”的方法能显著提升客服智能体的合规表现。
阅读全文