OpenAI 将新版语音模式带到 ChatGPT 桌面端:从对话走向“指挥代理”
OpenAI 已在 ChatGPT 桌面应用中加入新版语音能力,用户可通过说话来调度 ChatGPT Work、Codex 以及具备电脑使用能力的代理完成任务。相比手机端更偏自然对话的语音模式,桌面端更新强调多步骤操作与人机协作。
阅读全文OpenAI 已在 ChatGPT 桌面应用中加入新版语音能力,用户可通过说话来调度 ChatGPT Work、Codex 以及具备电脑使用能力的代理完成任务。相比手机端更偏自然对话的语音模式,桌面端更新强调多步骤操作与人机协作。
阅读全文AgentDebugX 是一个开源调试框架,试图解决 LLM Agent 失败时“报错点不等于根因点”的常见难题。它将调试组织为检测、归因、修复、重跑的闭环,并提供库、CLI、Web 控制台等入口。
阅读全文DataFlow-Harness 试图弥合自然语言需求与平台化数据流水线之间的断层:不再让智能体只吐出脚本,而是引导其构建可持久保存、可视化编辑的 DAG 工作流。
阅读全文NexForge 试图解决 LLM Agent 训练数据难以规模化的问题:不再围绕固定工具或代码库造题,而是从高层能力需求出发,自动生成可执行任务与专家轨迹。
阅读全文这篇论文的重点不是再造一个更大的通用模型,而是给搜索型工具代理搭建一个“能验证对错”的训练场。研究者希望借助自蒸馏,把代理从自己的轨迹中持续改进。
阅读全文API 调用型智能体要学会“做事”,离不开大量高质量轨迹,但真实环境往往难搭、难扩、难覆盖。新论文提出用 LLM 直接模拟状态化环境,在只有 API 规格的情况下合成训练数据。
阅读全文一篇新论文指出,即便谈判中的具体数值被加密,智能体的让步节奏、出价轨迹和收敛模式仍可能暴露私有约束。研究提出一种自适应随机谈判策略,在保护行为隐私的同时尽量维持成交率与效用。
阅读全文微软研究提出 RESOURCE2SKILL,尝试从教程视频、代码仓库、文章和参考作品中抽取可复用技能,让软件 Agent 不再只依赖手写提示或自身轨迹学习。
阅读全文Cura 1T 不是把通用大模型简单“加一点医疗语料”,而是围绕医疗场景的多项能力做分阶段自我进化。它试图同时覆盖问诊、临床推理、图文诊断和 EHR 工具使用。
阅读全文Sakana AI 等研究者提出 Recursive Harness Self-Improvement(RHI),把智能体运行框架视为可迭代优化的提示级规范。论文显示,少量迭代就能改善低推理强度智能体的表现,并降低推理成本。
阅读全文Kimi K3 正式发布后很快登陆模型广场,并在前端代码与多项 Agent 基准上获得关注。它最受讨论的,不只是参数规模,更是长任务执行、编程和网页/表格操作的综合表现。
阅读全文一项面向 107 家企业的调研显示,AI Agent 已经被接入真实系统和数据,但身份、隔离与权限控制明显滞后。超过一半企业经历过已确认的安全事件或险些出事的近失事件。
阅读全文1Password 推出面向 Claude 的浏览器集成,让用户在授权后把登录凭据安全交给 AI 代理使用。它的关键卖点不是让模型“知道”密码,而是在不暴露密码和一次性验证码的前提下完成网页登录。
阅读全文arXiv 新综述《Self-Improvements in Modern Agentic Systems》将自我改进智能体视为可从经验中积累能力的自适应系统。论文重点不在某个单点算法,而在梳理模型、提示、记忆、工具与控制逻辑如何共同被更新。
阅读全文一篇 arXiv 论文提出面向 Agentic AI 的原生保险框架,把自主性、权限暴露、治理成熟度等因素纳入承保和定价。它试图回答:当 AI 代理能调用工具、改变外部环境并影响第三方时,风险该如何被量化和约束。
阅读全文Ai2 在 Hugging Face Blog 介绍了海事 AI Agent Shippy 的工程架构。它的核心启示是:真正可用的 Agent,关键不在“模型更聪明”,而在工具、权限、评测和边界设计是否可靠。
阅读全文一篇新论文将 Agent 优化方法从“一次性提分”拉到持续学习场景中检验。结果显示,只有把回归控制纳入优化循环的方法,才更可能在新任务到来后继续累积收益。
阅读全文一篇 arXiv 论文提出 DVM-HALL 模型与 NHAS 指标,试图描述人类、AI 代理与品牌之间正在形成的新型忠诚关系。其重点不再只是用户偏好,而是把信任、授权和可验证执行风险纳入同一框架。
阅读全文一篇 arXiv 新论文提出 Experience Memory Graph,将 LLM 智能体的失败恢复建模为图匹配与图编辑路径检索。其目标是在测试时避免反复试错,用一次执行完成纠错引导。
阅读全文SPyCE提出一种技能与策略共同进化的训练框架,把多步视觉推理轨迹提炼成可复用的层级技能库。它试图弥合强化学习只看标量奖励、记忆方法只做测试时检索之间的缺口。
阅读全文一篇 arXiv 新论文系统回顾了 21 个 AI Agent 权限系统方案,并对 5 个商业 Agent 的权限处理方式进行对比。论文指出,真正面向用户差异化需求的权限机制,仍是 Agent 安全中的关键缺口。
阅读全文