文章与教程

模型评测

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 78 篇文章

CCTest · Blog
评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计
模型评测
cctest.ai
模型评测

评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计

一项基于固定代码提交版本的审计发现,评测脚本能够定义计算过程,却未必足以支撑与指标绑定的历史性结论。研究对 124 个 Inspect Evals 单元进行盘点,其中 110 个在进入确定性推断前就因证据或语义问题停止。

阅读全文
CCTest · Blog
UrbanGround:让多模态智能体在真实尺度城市中接受空间能力检验
模型评测
cctest.ai
模型评测

UrbanGround:让多模态智能体在真实尺度城市中接受空间能力检验

UrbanGround 将香港全域三维地理数据构建为可交互的城市沙盒,用于测试多模态大模型能否把局部视觉理解转化为持续、可靠的导航行动。研究显示,当前模型擅长短距离感知,却难以在长程探索中维持方向感并及时纠错。

阅读全文
CCTest · Blog
MobilePA-Bench:把移动端智能体从“会点屏幕”拉回真实任务
模型评测
cctest.ai
模型评测

MobilePA-Bench:把移动端智能体从“会点屏幕”拉回真实任务

MobilePA-Bench 提出一个面向移动规划智能体的交互式评测环境,重点考察工具调用、长程规划、记忆、技能与子智能体协作。研究显示,现有前沿大模型在严格工具顺序、权限限制和运行时错误下仍不够可靠。

阅读全文
CCTest · Blog
长程智能体失败不只要看结果,更要找到谁在何时犯错
模型评测
cctest.ai
模型评测

长程智能体失败不只要看结果,更要找到谁在何时犯错

LongRCA Bench 将长程智能体失败诊断拆分为“责任角色识别”和“最早根因定位”两个任务,并用 1140 条真实失败轨迹进行评测。其配套的免训练方法 RCTA,在根因步骤定位上显著超过基线,但整体结果仍显示长轨迹调试困难。

阅读全文
CCTest · Blog
RAG索引扩容后答案为何变了?一项面向兼容性的重复审计
模型评测
cctest.ai
模型评测

RAG索引扩容后答案为何变了?一项面向兼容性的重复审计

一项针对检索增强问答系统的研究发现,即使模型、提示词和生成控制项保持不变,扩充语料索引仍可能让系统给出不同答案。研究提出“快照兼容性审计”,用于区分真正的索引影响与模型自身的随机波动。

阅读全文
CCTest · Blog
FlavourBench:用可执行烹饪真值重新评估大语言模型
模型评测
cctest.ai
模型评测

FlavourBench:用可执行烹饪真值重新评估大语言模型

FlavourBench 将开放式语言模型评测转化为可复核的组合选择问题:模型从八种食材中选出三种,由版本化烹饪系统统一评分。在覆盖 27 个前沿模型端点的测试中,Grok 4.6 获得最高点估计,但只有部分模型差异达到统计可区分水平。

阅读全文