ExtractBench:面向企业文档抽取的模式引导评测基准
ExtractBench 聚焦企业场景中的“按用户 Schema 抽取文档信息”,同时评估值准确率、记录完整性、可追溯证据与成本。它揭示了商业 VLM、编码代理与专用抽取代理在长文档和列表抽取上的差异。
阅读全文ExtractBench 聚焦企业场景中的“按用户 Schema 抽取文档信息”,同时评估值准确率、记录完整性、可追溯证据与成本。它揭示了商业 VLM、编码代理与专用抽取代理在长文档和列表抽取上的差异。
阅读全文See2Think 试图回答一个关键问题:多模态大模型在推理中生成草图、标注和中间图像时,是否真的依赖这些视觉状态,而不只是把它们当作表面流程。
阅读全文StealthBench 将评测重点从“能否找到漏洞”推进到“是否以合规、低暴露的方式完成任务”。论文显示,当前自主 offensive-security agents 在操作安全上仍存在系统性短板。
阅读全文SecRespond 是一个面向事后入侵响应的 AI Agent 评测基准,关注模型在主机已被攻陷后的取证、风险识别与修复规划能力。论文显示,当前前沿模型能较好处理告警暴露的问题,但对静默入侵和完整修复方案仍明显不足。
阅读全文一篇新论文提出“影子评测”方法:让 AI Agent 复现未发表高质量论文的核心研究问题,再由原作者打分。结果显示,前沿 Agent 能完成工程实现,却难以推进真正开放式研究判断。
阅读全文北大等团队提出 DataPrep-Bench,用下游训练效果来评估 LLM、智能体与数据工作流准备训练数据的能力。它同时覆盖数据构造与数据质量评估,试图为“数据即模型能力”的环节建立统一标尺。
阅读全文SceneActBench 关注一个比“看图说话”更难的问题:视觉语言模型智能体能否基于图像或视频帧,在完整的多物体 3D 场景中完成动作任务。该基准用统一的智能体-环境循环和几何指标,检验当前 VLM 从感知走向行动的能力边界。
阅读全文一篇新论文指出,当前大模型在静态单轮任务中表现强,并不意味着它们能在真实协作场景里持续追踪用户不断变化的意图。研究提出一种将现有单轮基准改造成动态多轮对话的评测框架,暴露出模型在“演化意图”下的系统性退化。
阅读全文ProVisE 试图解决一个长期被忽视的问题:空间推理并不总适合用文字、坐标或选项来回答。它让图像生成模型直接在像素中标注、绘制或指示空间判断,再转回可评分的结构化结果。
阅读全文腾讯提出 WorkBuddy Bench,用于评估编码智能体在代码、网页、办公与安全任务中的真实工作能力。其重点不只是排行榜,而是以抗污染任务构造和开放可复现流程,回应当前智能体评测的可信度问题。
阅读全文南加州大学等研究者提出 ActiveVision,用 17 项任务检验多模态大模型能否像人一样反复观察、修正假设并寻找新证据。结果显示,前沿模型与人类表现仍存在巨大差距。
阅读全文Meta AI 提出 GAMUT 基准,用两层元评分表评估开放式长文本回答是否“说全了”。它试图补上当前事实性评测偏重“说得对”、却较少衡量“是否遗漏关键事实”的短板。
阅读全文Apple-PI 试图回答一个更深的问题:视频模型生成得像不像只是表面,还是它真的按物理规律在“思考”。这项工作把物理定律引入视频模型评测,提供了更细的诊断视角。
阅读全文这篇论文提出以“成本—成功率”视角重新评估攻防安全智能体,强调推理、工具调用和遥测查询都会带来实际开销。研究显示,红队与蓝队任务的扩展规律并不相同。
阅读全文VIABench 聚焦真实视障辅助场景,用盲人和视障者记录或分享的第一视角视频,评估多模态大模型能否在导航提醒、环境问答与交互指导中提供可靠帮助。
阅读全文Stripe 开源了一套面向真实支付集成场景的 AI 智能体基准测试。结果显示,当前智能体在生成代码和后端集成上已有进展,但在端到端验证、浏览器状态控制和异常恢复方面仍是短板。
阅读全文OpenAI CFO Sarah Friar 提出一套面向企业落地的 AI 记分卡,重点不在模型参数或演示效果,而在 AI 是否完成了有用工作、成本是否可控、结果是否可靠。
阅读全文这篇论文关注一个越来越现实的问题:AI 渗透测试 Agent 在 CTF 或固定任务中表现不错,并不等于能在真实目标中稳定发现漏洞。作者提出一套以“经验证的漏洞发现”为核心的评测协议,试图让安全 Agent 的比较更接近实战。
阅读全文VentureBeat Pulse Research 对 157 家企业的调查显示,企业正把更多自主权交给 AI Agent,但对评测体系的信任却远未同步提升。问题不只是覆盖率不足,而是评测结果与真实业务后果之间存在错位。
阅读全文Hugging Face 博客文章用葡萄牙语 OCR 基准说明:更新、更通用的模型并不必然胜过面向单一语言深度训练的模型。DharmaOCR 在巴西葡萄牙语文档上领先 Mistral OCR4 与 Unlimited-OCR,关键在于领域专门化与 DPO 稳定性训练。
阅读全文一篇被 ACM MM 2026 接收的论文指出,视频 LLM 在基准测试中的高准确率,并不总是等同于真实的视觉理解。作者提出 Visual Dependency Gap(VDG),用原始视频与黑屏输入之间的正确率差异来审计模型是否真正依赖视觉信息。
阅读全文