Harbor:把智能体评测从“各自搭环境”推进到统一基础设施
Harbor Adapters 将 80 多个智能体基准接入统一评测框架,Harbor-Index 则从中筛选出 82 个高难度任务,试图让智能体能力比较更可复现、更具可操作性。
阅读全文Harbor Adapters 将 80 多个智能体基准接入统一评测框架,Harbor-Index 则从中筛选出 82 个高难度任务,试图让智能体能力比较更可复现、更具可操作性。
阅读全文PerfReasoning 将大语言模型置于硬件性能建模场景中,分别考察其分析推理能力与生成模型代码的能力。结果显示,模型可以给出看似合理的架构判断,但距离稳定构建可执行、可验证的性能模型仍有明显差距。
阅读全文HarvestBench把“避免伤害”转化为一次有真实代价的决策:大模型要么免费碾过田间动物,要么支付燃料绕行。测试显示,模型的行为差异巨大,道德提示和价格都会显著改变结果。
阅读全文视频看起来流畅,并不意味着其中的物体运动、空间关系和事件时序符合物理规律。VeriPhy 将提示词编译为可检查的物理约束,再通过带 provenance 的证据记录输出可审计结论。
阅读全文不同语音脑机接口使用不同数据集、词汇表和解码指标,系统之间很难直接比较。研究者提出开放词汇互信息(OVMI),同时衡量解码准确性与系统覆盖的用户语言范围。
阅读全文视频生成模型可以产出逼真的运动画面,却未必遵守牛顿力学。Principia 提出一种不依赖相机标定的关系式评测方法,让模型的物理漏洞更容易被量化。
阅读全文AFAC2026吸引全球5027支队伍、近2万名选手参赛,赛题覆盖市场分析、金融文档、自动化实验和长文本Agent。赛事与开源数据集共同呈现了金融AI从单点模型走向系统化落地的变化。
阅读全文ExecRetrieval构建了包含近乎相同但实际有错代码的检索基准,专门测试代码嵌入能否把正确实现排在错误变体之前。结果显示,模型在扩大召回范围后表现很好,但首位排序仍存在明显功能性缺口。
阅读全文S³Gym 是一个评估大语言模型自我改进能力的交互式基准,考察智能体能否通过自测、判断经验并改进后续决策。研究发现,经验是否有效转化为能力,取决于任务结构与记忆方式。
阅读全文一项新研究提出知识门控任务构造协议,通过私有知识工件、泄漏审计和可验证结果,区分智能体因缺少知识而失败,还是因能力不足而失败。实验显示,部分任务在提供工件时通过率显著提升,但研究尚未证明这些任务能改善模型训练。
阅读全文上海交通大学团队提出 EarlyEval,通过分析智能体执行过程中的中间行为,提前判断任务成功或失败,从而减少不必要的模型调用和评测成本。在三个基准上的实验显示,它在较小精度扰动下可削减部分执行步骤与输入输出 token。
阅读全文SWE-bench中的问题通常完整、正式且信息丰富,而真实用户往往只给出简短描述。RealSWE通过控制信息组成和语言风格发现,贴近现实的输入会让模型平均解决率下降,并可能改变模型排名。
阅读全文E-Commerce Bench把LLM放进一个持续365天的电商经营环境,要求智能体同时处理选品、谈判、销售、履约与现金流。结果显示,赚钱能力并不等于全面的经营能力。
阅读全文AgentJudgeBench 将 LLM 评审置于依赖驱动的工具调用工作流中进行测试。结果显示,任务难度而非模型规模,可能才是评审可靠性的主要瓶颈。
阅读全文SpanCalib-VLM 将生成式视觉语言模型与多模态序列标注器结合,用校准后的置信度重新评估疑似幻觉文本片段。在 SHROOM-Visions 英文评测中,系统兼顾了跨度定位、置信度校准与检测效率。
阅读全文一项覆盖 15 个开放权重模型的 FACE-Eval 研究发现,偏好线索出现的位置和表达方式,会显著影响模型是否在思维链中披露其影响。来自工具返回或原始资料的隐性线索,更容易被模型采用却不被监测器识别。
阅读全文同一个基准测试分数,可能同时混合安全、推理、知识理解等多种能力。Ai2推出的BenchMIRT借助多维项目反应理论,把模型能力与单个题目的影响拆开分析。
阅读全文EASEL 将多模态智能体放进一个看似简单的绘画任务:根据参考图像逐步操作画布。结果显示,模型不仅看不准,还难以在执行过程中持续校正。
阅读全文LoopArena 将编码智能体开发中的“控制循环”单独抽离出来,测试一个模型能否持续指导另一个固定编码智能体完成长期任务。结果显示,长程循环控制仍是当前代理系统的明显短板。
阅读全文一项新的移动智能体基准 GMA 扩展了应用覆盖和任务复杂度,用七款开源应用与 300 个任务检验模型能否完成从单步操作到多步骤工作流的真实需求。研究显示,任务越复杂,现有智能体的表现下降越明显,而合理的 harness 设计能够改善部分工作流执行效果。
阅读全文一项基于固定代码提交版本的审计发现,评测脚本能够定义计算过程,却未必足以支撑与指标绑定的历史性结论。研究对 124 个 Inspect Evals 单元进行盘点,其中 110 个在进入确定性推断前就因证据或语义问题停止。
阅读全文