Agent 优化能否持续叠加?Terminal-Bench 2.0 给出更严苛答案
一篇新论文将 Agent 优化方法从“一次性提分”拉到持续学习场景中检验。结果显示,只有把回归控制纳入优化循环的方法,才更可能在新任务到来后继续累积收益。
阅读全文Claude API 中转站避坑指南、检测原理与大模型 API 实测经验
共 811 篇文章
一篇新论文将 Agent 优化方法从“一次性提分”拉到持续学习场景中检验。结果显示,只有把回归控制纳入优化循环的方法,才更可能在新任务到来后继续累积收益。
阅读全文一篇 arXiv 新论文提出,将李雅普诺夫特征指数作为物理信息密集奖励,用于训练强化学习智能体稳定垂直运动下的倒立摆。实验中,智能体不仅找到了经典 Kapitza 摆式的振荡稳定方式,还进一步将支点运动阻尼到严格直立状态。
阅读全文一篇 arXiv 论文提出 DVM-HALL 模型与 NHAS 指标,试图描述人类、AI 代理与品牌之间正在形成的新型忠诚关系。其重点不再只是用户偏好,而是把信任、授权和可验证执行风险纳入同一框架。
阅读全文一篇新提交至 arXiv 的论文提出 TRACE,用冻结参考模型估计状态价值,并把最终答案信号转化为工具调用级别的奖励。它试图缓解长程智能体强化学习中“只看成败”的稀疏奖励问题。
阅读全文一篇面向 ABAW11 多任务学习挑战的论文提出:在人脸情感分析中,与其强行使用统一架构,不如针对效价-唤醒、表情类别和面部动作单元分别选择特征融合与后处理策略。
阅读全文一篇 arXiv 新论文将经验贝叶斯变分自编码器扩展到药物计量学场景,用于同时建模肿瘤体积变化、患者脱落时间以及基因协变量。研究显示,半机理混合解码器在保持预测能力的同时,也能给出更接近传统非线性混合效应模型的治疗效应解释。
阅读全文一篇新论文提出 VisionScreen,将语言建模中的 Screening 机制扩展到图像识别,让视觉 token 能显式排除低相关图像块。作者认为,这为 ViT 依赖 softmax 相对权重的特征聚合方式提供了另一种路径。
阅读全文这篇 arXiv 论文提出一种结构感知的音乐到舞蹈生成框架,把编舞拆解为可解释的“原子动作”序列,再生成连贯的人体运动。相比只把动作看作连续信号的方法,它更强调节奏、结构和可控性。
阅读全文一篇 arXiv 新论文提出 CAVE-ABSA,用约束感知的生成与验证流程,为方面级情感分析构造更可靠的反事实样本。它关注的不是整句情绪翻转,而是只改变目标方面的情感,同时尽量保留其他方面与句子结构。
阅读全文一篇 arXiv 论文提出 CF-Net,用视觉、音频与文本三路信息识别视频中的 ambivalence/hesitancy(矛盾与犹豫)。它的重点不是捕捉典型表情,而是建模不同模态之间的细微不一致。
阅读全文这篇 arXiv 论文提出 DeltaMerge-LowRes,尝试用“语言 delta + 任务 delta”的方式降低低资源语言任务适配成本。核心发现是,不同合并规则会显著影响模型保留语言能力、执行任务和校准置信度的方式。
阅读全文一篇新论文提出 PlumeQuant,用于检查成像光谱仪发布的甲烷羽流产品在掩膜、质量增强、羽流长度、排放率和不确定性之间是否一致。研究指出,仅凭公开的标量指标并不能唯一确定羽流边界,这会影响对弱羽流和模糊羽流的解读。
阅读全文一篇新的 arXiv 论文改进了多面体 Dikin walk 的理论混合时间界限。作者证明,使用缩放后的 Lee–Sidford 度量时,指数采样可在 warm start 条件下达到 d^2.25 次迭代混合。
阅读全文一篇已被 ACM MM 2026 接收的论文提出 Peak-End-Net,将心理学中的“峰终定律”引入视频美学评价,让模型更关注视频中的高光时刻与结尾体验。
阅读全文一篇 arXiv 新论文提出 HealthClaw,一个面向个人长期健康管理的开源 Agent 架构。它试图让健康 AI 不再只回答当下问题,而是在受控记忆中持续更新用户习惯、偏好、指标和风险。
阅读全文一项 arXiv 新研究提出两阶段无监督聚类方法,用于处理心脏 PET/MRI 的多模态数据,并为致心律失常性左室心肌病患者生成自动化健康报告。该方法在患者数据和数值仿真队列中,较好复现了心脏影像医生的观察结果。
阅读全文一篇 arXiv 新论文提出 SIVA-RL,用“干预后的实际效果”而不是“干预类型”来指导视觉对齐。该方法旨在减少视觉语言模型答对却未真正看图的情况。
阅读全文arXiv 新论文提出 VAIOM,一种用于一小时外汇 K 线下一期收益概率建模的 decoder-only Transformer。它把连续金融特征作为输入,同时用离散收益桶作为输出目标,试图弥合金融数据与“next-token”范式之间的差异。
阅读全文一篇新论文把“组织能从审计对象选择中反推举报者”的风险形式化,并提出基于持续计数的私密审计机制。研究显示,简单随机响应在这一场景下几乎无法比均匀随机审计更有用。
阅读全文PyTorch-Triton 3.7 带来 Triton Plugin Extensions,让自定义编译器 Pass、MLIR 方言和 DSL 扩展可以在运行时加载。Meta 的 TLX 也因此进入上游 Triton 使用路径,面向 H100 与 AMD MI350 提供更细粒度的 GPU 内核控制。
阅读全文