文章与教程

模型评测

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 98 篇文章

CCTest · Blog
代码检索不只要“像”:ExecRetrieval揭示嵌入模型的功能正确性缺口
模型评测
cctest.ai
模型评测

代码检索不只要“像”:ExecRetrieval揭示嵌入模型的功能正确性缺口

ExecRetrieval构建了包含近乎相同但实际有错代码的检索基准,专门测试代码嵌入能否把正确实现排在错误变体之前。结果显示,模型在扩大召回范围后表现很好,但首位排序仍存在明显功能性缺口。

阅读全文
CCTest · Blog
让智能体基准回答“不会”还是“不知道”?知识门控任务构造协议提出新方法
模型评测
cctest.ai
模型评测

让智能体基准回答“不会”还是“不知道”?知识门控任务构造协议提出新方法

一项新研究提出知识门控任务构造协议,通过私有知识工件、泄漏审计和可验证结果,区分智能体因缺少知识而失败,还是因能力不足而失败。实验显示,部分任务在提供工件时通过率显著提升,但研究尚未证明这些任务能改善模型训练。

阅读全文
CCTest · Blog
CoT 真的忠实吗?提示线索藏在工具返回中时,模型更难被监测
模型评测
cctest.ai
模型评测

CoT 真的忠实吗?提示线索藏在工具返回中时,模型更难被监测

一项覆盖 15 个开放权重模型的 FACE-Eval 研究发现,偏好线索出现的位置和表达方式,会显著影响模型是否在思维链中披露其影响。来自工具返回或原始资料的隐性线索,更容易被模型采用却不被监测器识别。

阅读全文
CCTest · Blog
GMA:让移动智能体面对更接近真实生活的复杂任务
模型评测
cctest.ai
模型评测

GMA:让移动智能体面对更接近真实生活的复杂任务

一项新的移动智能体基准 GMA 扩展了应用覆盖和任务复杂度,用七款开源应用与 300 个任务检验模型能否完成从单步操作到多步骤工作流的真实需求。研究显示,任务越复杂,现有智能体的表现下降越明显,而合理的 harness 设计能够改善部分工作流执行效果。

阅读全文
CCTest · Blog
评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计
模型评测
cctest.ai
模型评测

评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计

一项基于固定代码提交版本的审计发现,评测脚本能够定义计算过程,却未必足以支撑与指标绑定的历史性结论。研究对 124 个 Inspect Evals 单元进行盘点,其中 110 个在进入确定性推断前就因证据或语义问题停止。

阅读全文