评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计
一项基于固定代码提交版本的审计发现,评测脚本能够定义计算过程,却未必足以支撑与指标绑定的历史性结论。研究对 124 个 Inspect Evals 单元进行盘点,其中 110 个在进入确定性推断前就因证据或语义问题停止。
阅读全文一项基于固定代码提交版本的审计发现,评测脚本能够定义计算过程,却未必足以支撑与指标绑定的历史性结论。研究对 124 个 Inspect Evals 单元进行盘点,其中 110 个在进入确定性推断前就因证据或语义问题停止。
阅读全文UrbanGround 将香港全域三维地理数据构建为可交互的城市沙盒,用于测试多模态大模型能否把局部视觉理解转化为持续、可靠的导航行动。研究显示,当前模型擅长短距离感知,却难以在长程探索中维持方向感并及时纠错。
阅读全文FIRM-Video提出“先核查、后评分”的清单式框架,把视频奖励模型的判断拆解为可验证标准。论文同时发布90K训练数据和人工标注基准,并展示其在视频筛选中的效果。
阅读全文Video-IFBench 将评测重点从“答对视频问题”推进到“是否完整遵守复杂指令”,覆盖视觉、音频、语义和格式等多重约束。对20多个近期多模态大模型的评测显示,视频指令遵循仍是明显短板。
阅读全文AnTrap 将弹窗、状态卡死和动作误用等运行时异常引入 Android GUI Agent 的执行过程,系统评估智能体在动态对抗环境中的鲁棒性。研究发现,现有模型普遍会受到干扰,而深层上下文陷阱仍超出单纯训练的解决能力。
阅读全文VGI-Bench 将评测重点从视频画质推进到动态视觉推理,考察模型能否理解并生成符合逻辑的视觉过程。结果显示,当前系统虽已展现部分能力,但距离可靠推理仍有明显差距。
阅读全文Google DeepMind联合新加坡人工智能安全研究所等机构,试点一种基于机密计算的“双盲”AI评测。该方法旨在同时保护模型权重与评测提示词,降低基准污染风险。
阅读全文一项面向整仓库技术栈迁移的新基准显示,代码智能体在“改得对”和“确实完成迁移”之间仍存在明显鸿沟。520 次实验中,仅 5.4% 同时通过迁移审计、行为测试和智能体验证。
阅读全文FrontierChallenge 将科学任务从“答对一个问题”推进到“完整交付一套工作流”。评测显示,前沿模型在跨学科科研流程上的真正完成率仍然有限。
阅读全文ClawProBench提出一种面向运行时的智能体评测框架,不只检查最终答案,也审查证据获取、工具路由、安全边界与重复执行表现。研究显示,运行时原生任务明显更难,封闭测试集与完整测试集的排名也并不一致。
阅读全文Thinkingbox 将智能体评测从“答对或调用对工具”推进到真实业务流程的最终状态验证。其基准显示,模型偶尔完成任务与稳定完成任务之间仍存在明显差距。
阅读全文GameXpert-Bench 将游戏编码智能体置于完整开发周期中评测,覆盖生成、修复与多轮优化三个阶段。结果显示,智能体擅长实现明确需求,却仍不善于主动发现缺陷、验证运行行为和避免回归。
阅读全文MobilePA-Bench 提出一个面向移动规划智能体的交互式评测环境,重点考察工具调用、长程规划、记忆、技能与子智能体协作。研究显示,现有前沿大模型在严格工具顺序、权限限制和运行时错误下仍不够可靠。
阅读全文LongRCA Bench 将长程智能体失败诊断拆分为“责任角色识别”和“最早根因定位”两个任务,并用 1140 条真实失败轨迹进行评测。其配套的免训练方法 RCTA,在根因步骤定位上显著超过基线,但整体结果仍显示长轨迹调试困难。
阅读全文一项针对检索增强问答系统的研究发现,即使模型、提示词和生成控制项保持不变,扩充语料索引仍可能让系统给出不同答案。研究提出“快照兼容性审计”,用于区分真正的索引影响与模型自身的随机波动。
阅读全文FlavourBench 将开放式语言模型评测转化为可复核的组合选择问题:模型从八种食材中选出三种,由版本化烹饪系统统一评分。在覆盖 27 个前沿模型端点的测试中,Grok 4.6 获得最高点估计,但只有部分模型差异达到统计可区分水平。
阅读全文一项新研究指出,混合思考多模态大模型在“思考”和“不思考”模式之间,存在明显的响应行为失配。研究者提出 PatternEval 与 PatternRL,尝试同时评估并改善答案正确性之外的输出质量。
阅读全文Hume AI 的研究提出了一套衡量 ASR 基准优化的方法:部分高分模型可能在复现公开数据集的参考文本,而不是真正依据音频完成转写。这一发现提示,单一公开基准上的优异成绩未必等同于通用语音识别能力。
阅读全文NARU 是一个面向日语极长视频理解的新基准,联合考察叙事演进追踪与文化语境推理。研究显示,现有多模态模型在跨长时段整合情节和理解隐含社会意义方面仍存在明显不足。
阅读全文QuoteBench指出,编码智能体的成功率不仅取决于模型生成了什么,还取决于命令经过怎样的序列化、包装和解析。若只看最终匹配分数,接口引入的失败可能会被误判为模型能力不足。
阅读全文一项围绕希腊语推理的研究发现,准确率几乎没有变化,并不意味着语言适配没有发生。监督微调让模型开始用用户语言思考,强化学习则进一步修复格式和通道控制问题。
阅读全文