文章与教程

模型评测

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 78 篇文章

CCTest · Blog
SecRespond:把 AI 安全智能体放进“失陷之后”的真实考场
模型评测
cctest.ai
模型评测

SecRespond:把 AI 安全智能体放进“失陷之后”的真实考场

SecRespond 是一个面向事后入侵响应的 AI Agent 评测基准,关注模型在主机已被攻陷后的取证、风险识别与修复规划能力。论文显示,当前前沿模型能较好处理告警暴露的问题,但对静默入侵和完整修复方案仍明显不足。

阅读全文
CCTest · Blog
SceneActBench:让VLM智能体在看见的3D场景中真正行动
模型评测
cctest.ai
模型评测

SceneActBench:让VLM智能体在看见的3D场景中真正行动

SceneActBench 关注一个比“看图说话”更难的问题:视觉语言模型智能体能否基于图像或视频帧,在完整的多物体 3D 场景中完成动作任务。该基准用统一的智能体-环境循环和几何指标,检验当前 VLM 从感知走向行动的能力边界。

阅读全文
CCTest · Blog
AI 渗透测试 Agent 该如何从靶场走向真实世界评测?
模型评测
cctest.ai
模型评测

AI 渗透测试 Agent 该如何从靶场走向真实世界评测?

这篇论文关注一个越来越现实的问题:AI 渗透测试 Agent 在 CTF 或固定任务中表现不错,并不等于能在真实目标中稳定发现漏洞。作者提出一套以“经验证的漏洞发现”为核心的评测协议,试图让安全 Agent 的比较更接近实战。

阅读全文
CCTest · Blog
视频大模型真的“看懂”了吗?新研究用 VDG 拆穿高分幻觉
模型评测
cctest.ai
模型评测

视频大模型真的“看懂”了吗?新研究用 VDG 拆穿高分幻觉

一篇被 ACM MM 2026 接收的论文指出,视频 LLM 在基准测试中的高准确率,并不总是等同于真实的视觉理解。作者提出 Visual Dependency Gap(VDG),用原始视频与黑屏输入之间的正确率差异来审计模型是否真正依赖视觉信息。

阅读全文