文章与教程

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 775 篇文章

CCTest · Blog
长程智能体失败不只要看结果,更要找到谁在何时犯错
模型评测
cctest.ai
模型评测

长程智能体失败不只要看结果,更要找到谁在何时犯错

LongRCA Bench 将长程智能体失败诊断拆分为“责任角色识别”和“最早根因定位”两个任务,并用 1140 条真实失败轨迹进行评测。其配套的免训练方法 RCTA,在根因步骤定位上显著超过基线,但整体结果仍显示长轨迹调试困难。

阅读全文
CCTest · Blog
SparsePR:用“分区+残差重建”加速视频生成注意力
视觉与视频
cctest.ai
视觉与视频

SparsePR:用“分区+残差重建”加速视频生成注意力

SparsePR提出一种无需再训练的稀疏注意力方案,通过响应耦合分区和探针拟合残差重建,降低视频Transformer的注意力计算成本。在四个视频生成与世界模型上,该方法以22.0%至26.0%的实际执行密度实现质量保持,并取得1.48至2.61倍端到端加速。

阅读全文
CCTest · Blog
AgentMercury:把企业业务场景变成可验证的智能体训练世界
AI 智能体
cctest.ai
AI 智能体

AgentMercury:把企业业务场景变成可验证的智能体训练世界

AgentMercury提出了一种面向业务场景的环境合成框架:先构建包含实体、服务、工具和状态的持久化世界,再让任务与交互轨迹自然生成。研究者据此构建了覆盖14个行业、50个国家的4783个可执行环境,并观察到对企业工作流及部分域外基准的提升。

阅读全文
CCTest · Blog
Daedalus-150M:为普通 CPU 推理反向设计的卷积—注意力混合模型
推理与部署
cctest.ai
推理与部署

Daedalus-150M:为普通 CPU 推理反向设计的卷积—注意力混合模型

Daedalus-150M 没有把大模型架构缩小后再适配 CPU,而是先锁定单用户、单 token、4-bit 权重等部署条件,再决定网络结构。它用短卷积替代三分之二的全注意力模块,在长上下文下实现更稳定的缓存开销和更高解码速度。

阅读全文
CCTest · Blog
FlavourBench:用可执行烹饪真值重新评估大语言模型
模型评测
cctest.ai
模型评测

FlavourBench:用可执行烹饪真值重新评估大语言模型

FlavourBench 将开放式语言模型评测转化为可复核的组合选择问题:模型从八种食材中选出三种,由版本化烹饪系统统一评分。在覆盖 27 个前沿模型端点的测试中,Grok 4.6 获得最高点估计,但只有部分模型差异达到统计可区分水平。

阅读全文
CCTest · Blog
PhysCaP:让机器人通过主动探索理解物体的隐藏物理属性
机器人与物理 AI
cctest.ai
机器人与物理 AI

PhysCaP:让机器人通过主动探索理解物体的隐藏物理属性

PhysCaP 为代码即策略机器人引入物理信息驱动的主动感知机制,使机器人不再只依赖视觉观察,而是通过有针对性的交互判断物体的质量与刚度。该方法在减少无效探索的同时,提升了复杂桌面操作任务中的决策能力。

阅读全文