文章与教程

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 811 篇文章

CCTest · Blog
视频大模型真的“看懂”了吗?新研究用 VDG 拆穿高分幻觉
模型评测
cctest.ai
模型评测

视频大模型真的“看懂”了吗?新研究用 VDG 拆穿高分幻觉

一篇被 ACM MM 2026 接收的论文指出,视频 LLM 在基准测试中的高准确率,并不总是等同于真实的视觉理解。作者提出 Visual Dependency Gap(VDG),用原始视频与黑屏输入之间的正确率差异来审计模型是否真正依赖视觉信息。

阅读全文
CCTest · Blog
Boogu-Image-0.1 开源:用 2.08 亿图像挑战统一多模态生成
多模态
cctest.ai
多模态

Boogu-Image-0.1 开源:用 2.08 亿图像挑战统一多模态生成

Boogu-Image-0.1 是一个面向图像理解、生成与编辑的开源统一多模态模型家族,包含 Base、Turbo、Edit 和 Edit-Turbo 等版本。论文强调,在有限算力下,通过数据、训练流程和推理时扩展优化,开源模型仍有机会接近闭源系统表现。

阅读全文
CCTest · Blog
RL 后训练算力该花在哪?一篇新论文拆解模型、搜索、学习与反馈的取舍
强化学习
cctest.ai
强化学习

RL 后训练算力该花在哪?一篇新论文拆解模型、搜索、学习与反馈的取舍

这篇 arXiv 论文讨论了一个常被“总 FLOPs”掩盖的问题:在固定后训练预算下,算力究竟该投向更大模型、更多更新、更多 rollout 搜索,还是更强的奖励反馈?作者提出了面向 GRPO 的 FLOP 记账框架,并用 LoRA 适配的 Qwen2.5 策略模型做了条件性对比。

阅读全文
CCTest · Blog
动态训练能否补上深度伪造检测的现实缺口?BMF 给出公开评测
视觉与视频
cctest.ai
视觉与视频

动态训练能否补上深度伪造检测的现实缺口?BMF 给出公开评测

一篇 arXiv 论文提出 BitMind Forensics:通过开放式对抗竞赛持续刷新训练分布的深度伪造检测系统。其在 19 个公开数据集上的结果显示,动态检测框架在野外图像、视频与生成式媒体评测中明显优于多种静态开源检测器。

阅读全文
CCTest · Blog
KV Cache 也会“偏心”:新论文揭示长上下文推理中的结构角色偏差
记忆与上下文
cctest.ai
记忆与上下文

KV Cache 也会“偏心”:新论文揭示长上下文推理中的结构角色偏差

一篇 arXiv 新论文指出,按注意力累计值淘汰 KV Cache 的方法,在嵌套 JSON 等结构密集文本上可能错误保留大量“结构噪声”。作者提出无需重训的角色条件分配策略,用较小额外开销缓解这一问题。

阅读全文
CCTest · Blog
Hugging Face 披露 AI 代理驱动入侵:防守方也必须进入“机器速度”
AI 安全
cctest.ai
AI 安全

Hugging Face 披露 AI 代理驱动入侵:防守方也必须进入“机器速度”

Hugging Face 披露一起生产基础设施入侵事件,称攻击由自主 AI 代理系统端到端执行,并利用数据处理链路中的代码执行路径取得初始立足点。事件凸显 AI 平台的数据与模型表面已成为关键攻击面,防守也需要可控的本地 AI 能力。

阅读全文
CCTest · Blog
Thinking Machines 发布首个开放权重模型 Inkling:押注“可定制 AI”
开源生态
cctest.ai
开源生态

Thinking Machines 发布首个开放权重模型 Inkling:押注“可定制 AI”

Mira Murati 创立的 Thinking Machines Lab 推出首个自研开放权重模型 Inkling,试图用可下载、可微调的路线挑战通用闭源大模型。它不宣称性能最强,而是把企业定制、成本效率和不确定性表达放在核心位置。

阅读全文