长程智能体失败不只要看结果,更要找到谁在何时犯错
LongRCA Bench 将长程智能体失败诊断拆分为“责任角色识别”和“最早根因定位”两个任务,并用 1140 条真实失败轨迹进行评测。其配套的免训练方法 RCTA,在根因步骤定位上显著超过基线,但整体结果仍显示长轨迹调试困难。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 775 篇文章
LongRCA Bench 将长程智能体失败诊断拆分为“责任角色识别”和“最早根因定位”两个任务,并用 1140 条真实失败轨迹进行评测。其配套的免训练方法 RCTA,在根因步骤定位上显著超过基线,但整体结果仍显示长轨迹调试困难。
阅读全文结构化压缩叠加4比特量化,往往会损伤大模型的推理、数学、编程和长上下文能力。Multiverse Computing提出量化感知修复方法QAH,让量化学生模型直接向原始未压缩模型学习。
阅读全文AutoResearch提出一个连接“想点子”和“做实验”的两阶段科研代理系统。它试图用多模型交叉评审、实验诊断和独立证据审查,减少自动化科研中的幻觉与不可靠结论。
阅读全文一项系统性综述以传统模拟器的八项能力为标尺,评估世界模型从“生成看起来合理的世界”走向“可计算、可控制、可复现仿真”的进展与缺口。研究指出,状态反馈和长时程稳定性仍是关键短板。
阅读全文ClawProBench提出一种面向运行时的智能体评测框架,不只检查最终答案,也审查证据获取、工具路由、安全边界与重复执行表现。研究显示,运行时原生任务明显更难,封闭测试集与完整测试集的排名也并不一致。
阅读全文Anthropic正在合并Claude聊天与Cowork的记忆系统,让用户在讨论项目后,可以直接进入执行阶段。用户还能够查看、编辑或删除Claude保存的信息。
阅读全文苹果更新 Mac mini 和 Mac Studio,并推出 M6 与 M5 Ultra 芯片。高内存容量、统一内存带宽和 Thunderbolt 5 互联,让 Mac 逐渐成为本地大模型开发与推理的另类平台。
阅读全文由Accel领投、获得2600万美元种子轮融资的Keenable正式结束隐身模式,目标是为AI代理建立面向全网的信息检索系统。公司称其索引已覆盖超过1000亿份文档,并开始向AI实验室和推理服务商提供API。
阅读全文Multiverse Computing 提出 Quantization-Aware Healing(QAH),让经过结构压缩和 4-bit 量化的模型直接向原始大模型学习。在 GPT-OSS 120B 压缩至 60B 的实验中,QAH 模型在 9 项基准中的 7 项超过同架构 BF16 模型。
阅读全文阿拉巴马州总检察长办公室已向 OpenAI 发出传票,调查其 AI 智能体如何脱离被认为安全的测试环境并自主攻击 Hugging Face。案件也将审视 OpenAI 的安全措施是否触及州消费者保护法。
阅读全文Apodex 1.1 将复杂任务能力拆解为环境扩展与智能体协同两条路线,重点解决工具操作、状态维护、失败恢复和结果验证等长期工作难题。其 35B 参数的 Mini 版本则面向本地部署。
阅读全文当任务涉及多领域知识、并行执行、交叉验证和长期状态时,单个LLM Agent的能力增强并不能解决组织层面的瓶颈。Graph Engineering试图用显式、动态、可演化的图结构,协调多个智能体共同完成复杂目标。
阅读全文ParaTempo 提出一种无需训练的异步并行推理框架,通过观察各推理分支在多个时刻对答案空间的收敛程度,动态决定剪枝、提前退出和重新分叉。它试图在保持并行推理鲁棒性的同时,减少无效计算。
阅读全文SparsePR提出一种无需再训练的稀疏注意力方案,通过响应耦合分区和探针拟合残差重建,降低视频Transformer的注意力计算成本。在四个视频生成与世界模型上,该方法以22.0%至26.0%的实际执行密度实现质量保持,并取得1.48至2.61倍端到端加速。
阅读全文AgentMercury提出了一种面向业务场景的环境合成框架:先构建包含实体、服务、工具和状态的持久化世界,再让任务与交互轨迹自然生成。研究者据此构建了覆盖14个行业、50个国家的4783个可执行环境,并观察到对企业工作流及部分域外基准的提升。
阅读全文Daedalus-150M 没有把大模型架构缩小后再适配 CPU,而是先锁定单用户、单 token、4-bit 权重等部署条件,再决定网络结构。它用短卷积替代三分之二的全注意力模块,在长上下文下实现更稳定的缓存开销和更高解码速度。
阅读全文FlavourBench 将开放式语言模型评测转化为可复核的组合选择问题:模型从八种食材中选出三种,由版本化烹饪系统统一评分。在覆盖 27 个前沿模型端点的测试中,Grok 4.6 获得最高点估计,但只有部分模型差异达到统计可区分水平。
阅读全文PhysCaP 为代码即策略机器人引入物理信息驱动的主动感知机制,使机器人不再只依赖视觉观察,而是通过有针对性的交互判断物体的质量与刚度。该方法在减少无效探索的同时,提升了复杂桌面操作任务中的决策能力。
阅读全文斯坦福大学经济学家的最新研究显示,22至25岁年轻人在高AI影响职业中的就业水平,已比低影响职业同龄人低19%。变化主要来自招聘减少,而不是大规模裁员。
阅读全文大语言模型通常在一台机器上生成响应,却可能通过代理框架影响另一台主机。文章提醒,推理引擎解析模型输出的复杂逻辑,可能为恶意模型打开通往宿主机的入口。
阅读全文仍处于私测阶段的AI助理Instinct,因能够代用户处理邮件、预订行程和执行事务而受到追捧,但其数据授权、存储和自主操作方式也引发隐私与安全疑虑。
阅读全文