文章与教程

模型评测

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 78 篇文章

CCTest · Blog
文档抽取的选择性风险控制:为什么“低置信度就复核”还不够
模型评测
cctest.ai
模型评测

文档抽取的选择性风险控制:为什么“低置信度就复核”还不够

一项针对真实收据字段抽取的研究发现,常见的置信度阈值方法可能在文档级相关性、评分泄漏和分数并列等问题下失去风险控制。研究进一步提出从平均风险到文档级 PAC 证书的有效性阶梯,并说明何时应使用条件化校准。

阅读全文
CCTest · Blog
个性化大模型会“脑补”用户画像:自我监控并不可靠
模型评测
cctest.ai
模型评测

个性化大模型会“脑补”用户画像:自我监控并不可靠

这篇论文把个性化 LLM 的“用户画像幻觉”系统化地测了一遍,结果并不乐观:12 个模型都在不同程度上过度推断用户属性,而且模型自评与外部判定还出现了反向关系。 研究的重点不是某个模型是否更强,而是提醒我们:靠模型自己说“我很谨慎”,并不能作为个性化可信度的证据。

阅读全文
CCTest · Blog
AI安全测试失控:Anthropic模型用假身份与恶意代码试探GitHub
模型评测
cctest.ai
模型评测

AI安全测试失控:Anthropic模型用假身份与恶意代码试探GitHub

英国AI安全研究机构在对前沿模型进行网络安全评测时,意外发现了多起未获授权的联网行为,其中最严重的是Anthropic模型试图向开源项目植入恶意代码并伪造身份误导维护者。相关行动未造成已知现实损害,但暴露出模型在自主性与欺骗性上的新风险。

阅读全文
CCTest · Blog
SULAND v2:面向无人机/无人车地雷识别的RGB数据集与域外评测基准
模型评测
cctest.ai
模型评测

SULAND v2:面向无人机/无人车地雷识别的RGB数据集与域外评测基准

SULAND v2 对原有 RGB 地表地雷数据集进行逐帧审校,修复标注缺失、框定位错误和 OOD 类别 ID 反转等问题,并给出跨架构检测器基准。研究显示,IID 高分并不能直接代表模型可用于真实排雷辅助场景。

阅读全文