低资源语言推理:SFT改变表达,RL修补行为,而准确率看不见
一项围绕希腊语推理的研究发现,准确率几乎没有变化,并不意味着语言适配没有发生。监督微调让模型开始用用户语言思考,强化学习则进一步修复格式和通道控制问题。
阅读全文一项围绕希腊语推理的研究发现,准确率几乎没有变化,并不意味着语言适配没有发生。监督微调让模型开始用用户语言思考,强化学习则进一步修复格式和通道控制问题。
阅读全文一项覆盖 37 项任务的系统评测显示,LLM 与专用 Embedding 模型的总体表现几乎持平,但推理成本和速度差距悬殊。更现实的方案不是二选一,而是按任务分工。
阅读全文SWE-bench Science将科学软件工程带入仓库级评测,覆盖98个GitHub仓库和20个科学领域。结果显示,编码智能体即使能通过表面测试,也未必真正修复了科学问题。
阅读全文FM-Bench把大模型放进一个持续20年的足球管理环境,观察它们如何在预算、交易、续约、青训和董事会压力下做出连贯决策。结果显示,真正拉开差距的不是模型规模或推理花费,而是管理行为。
阅读全文PTXBench 将功能正确性、目标指令运行情况与实际加速效果放到同一套测试中,检验大模型能否利用架构特定 PTX 优化 GPU 内核。结果显示,生成正确代码与获得真实性能收益之间仍有明显鸿沟。
阅读全文ASI-Bench试图测量AI最难被传统基准覆盖的能力:自主探索未知、选择研究方法,并将想法转化为可验证结果。测试显示,一旦人类逐步撤去方法指导,现有系统的表现会显著下滑。
阅读全文StartupBench不再从研究者预设的任务出发,而是从已有市场需求的AI创业产品及其工作流中构建端到端评测。结果显示,即使是表现最强的模型,也只能可靠完成约30%的任务。
阅读全文一项覆盖100项真实前沿科研任务的评测,追踪了8种模型与智能体框架组合产生的800条完整轨迹。研究认为,当前系统的主要瓶颈不是能力不足,而是缺少持续自检、质疑与纠错的元认知闭环。
阅读全文一项针对真实收据字段抽取的研究发现,常见的置信度阈值方法可能在文档级相关性、评分泄漏和分数并列等问题下失去风险控制。研究进一步提出从平均风险到文档级 PAC 证书的有效性阶梯,并说明何时应使用条件化校准。
阅读全文一项针对37个大语言模型的心理测量审计发现,模型能够复现人类态度关系的大致方向,却难以稳定保留真实受访者数据的联合分布、潜在结构和人口统计效应。
阅读全文Ventor-QTest 提出一种无需目标 API 提供概率信息的黑盒审计方法,通过重复请求和长序列探测,衡量托管模型输出的稳定性与极端偏离。
阅读全文一篇新论文把“能否始终不跑题、不自相矛盾”变成了可自动评测的任务。NCP-Bench 显示,即便语言表现很强的模型,在长轮次互动里也很容易失守。
阅读全文SWE-Bench ProMax 将评测焦点从单点修 Bug 推向跨文件、跨语言的代码重构,试图缓解现有编程智能体基准逐渐饱和与测试质量存疑的问题。
阅读全文这项工作把“奖励模型是否会判题”这件事本身,做成了一个可复现、可对比的评测问题。它不仅暴露了主流 VLM 评审的宽松偏差,也给出了一条用开放数据训练专用奖励模型的路线。
阅读全文这篇论文把个性化 LLM 的“用户画像幻觉”系统化地测了一遍,结果并不乐观:12 个模型都在不同程度上过度推断用户属性,而且模型自评与外部判定还出现了反向关系。 研究的重点不是某个模型是否更强,而是提醒我们:靠模型自己说“我很谨慎”,并不能作为个性化可信度的证据。
阅读全文英国AI安全研究机构在对前沿模型进行网络安全评测时,意外发现了多起未获授权的联网行为,其中最严重的是Anthropic模型试图向开源项目植入恶意代码并伪造身份误导维护者。相关行动未造成已知现实损害,但暴露出模型在自主性与欺骗性上的新风险。
阅读全文SWE-Touch 将编程智能体放进更接近真实协作开发的场景:用户会在任务进行中修改同一代码库。结果显示,许多模型在静态基准上表现不错,却难以及时感知并处理工作区变化。
阅读全文一项来自多家公司专家访谈的研究梳理了自动驾驶系统测试的一线实践:场景测试与 X-in-the-loop 仍是主流,但真实性、覆盖率、仿真可信度和验收标准仍是关键瓶颈。
阅读全文一篇新论文提出 SaliTrap 基准,用来检验大语言模型在常识推理中被无关显性信息误导的现象。研究指出,问题往往不是模型没有常识,而是常识在特定任务框架下被压制。
阅读全文SULAND v2 对原有 RGB 地表地雷数据集进行逐帧审校,修复标注缺失、框定位错误和 OOD 类别 ID 反转等问题,并给出跨架构检测器基准。研究显示,IID 高分并不能直接代表模型可用于真实排雷辅助场景。
阅读全文