文章与教程

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 775 篇文章

CCTest · Blog
索尼音乐与华纳起诉 Anthropic:版权训练争议转向“盗版获取”
政策与监管
cctest.ai
政策与监管

索尼音乐与华纳起诉 Anthropic:版权训练争议转向“盗版获取”

索尼音乐出版、华纳音乐出版等公司起诉 Anthropic,指控其通过种子、抓取和下载等方式获取大量受版权保护的作品,并用于训练 Claude。案件延续了生成式 AI 的版权争议,但重点更集中于训练数据的取得方式。

阅读全文
CCTest · Blog
评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计
模型评测
cctest.ai
模型评测

评测结果究竟能证明什么?一项对 Inspect Evals 的可复现性审计

一项基于固定代码提交版本的审计发现,评测脚本能够定义计算过程,却未必足以支撑与指标绑定的历史性结论。研究对 124 个 Inspect Evals 单元进行盘点,其中 110 个在进入确定性推断前就因证据或语义问题停止。

阅读全文
CCTest · Blog
Procedura:让 3D 建模从生成网格走向可编辑程序
AI 智能体
cctest.ai
AI 智能体

Procedura:让 3D 建模从生成网格走向可编辑程序

Procedura 提出一种面向机械与硬表面对象的智能体建模框架:模型不再直接输出一块难以修改的网格,而是编写由命名部件、参数和装配关系组成的程序。该方法还结合编译检查、视觉批评器与仿真验证,生成可编辑、可分解并支持运动的 3D 资产。

阅读全文
CCTest · Blog
UrbanGround:让多模态智能体在真实尺度城市中接受空间能力检验
模型评测
cctest.ai
模型评测

UrbanGround:让多模态智能体在真实尺度城市中接受空间能力检验

UrbanGround 将香港全域三维地理数据构建为可交互的城市沙盒,用于测试多模态大模型能否把局部视觉理解转化为持续、可靠的导航行动。研究显示,当前模型擅长短距离感知,却难以在长程探索中维持方向感并及时纠错。

阅读全文
CCTest · Blog
没有标准答案,模型也能在测试时自我优化:TTPO如何利用共识与分歧
强化学习
cctest.ai
强化学习

没有标准答案,模型也能在测试时自我优化:TTPO如何利用共识与分歧

TTPO提出一种无需人工标签的测试时训练方法:把多数投票结果当作弱监督信号,同时区别对待认同与不认同该结果的推理轨迹。研究显示,这种非对称优化能够降低伪标签错误带来的风险。

阅读全文
CCTest · Blog
Zero-WAM:让机器人通过观看人类视频泛化到未见任务
机器人与物理 AI
cctest.ai
机器人与物理 AI

Zero-WAM:让机器人通过观看人类视频泛化到未见任务

Zero-WAM 将人类操作视频作为机器人策略的上下文提示,使机器人无需更新参数即可尝试训练阶段未出现的操作任务。研究团队还构建了包含 7.42 万组人机配对样本的 HumanGen 数据集,并在仿真测试中验证了方法的跨任务泛化能力。

阅读全文