文章与教程

强化学习

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 34 篇文章

CCTest · Blog
没有标准答案,模型也能在测试时自我优化:TTPO如何利用共识与分歧
强化学习
cctest.ai
强化学习

没有标准答案,模型也能在测试时自我优化:TTPO如何利用共识与分歧

TTPO提出一种无需人工标签的测试时训练方法:把多数投票结果当作弱监督信号,同时区别对待认同与不认同该结果的推理轨迹。研究显示,这种非对称优化能够降低伪标签错误带来的风险。

阅读全文
CCTest · Blog
Agent Lightning v1.0:让强化学习真正适配智能体运行框架
强化学习
cctest.ai
强化学习

Agent Lightning v1.0:让强化学习真正适配智能体运行框架

Agent Lightning v1.0提出“框架原生智能体强化学习”范式,让部署时负责工具调用、上下文管理和流程控制的智能体框架直接参与模型后训练。实验显示,仅用6000个训练样本和有限算力,Qwen3.5-9B在SWE-bench Verified上的成绩从41.8%提升至56.4%。

阅读全文
CCTest · Blog
SAF-OPD:让强化学习与在线蒸馏更稳定地合流
强化学习
cctest.ai
强化学习

SAF-OPD:让强化学习与在线蒸馏更稳定地合流

SAF-OPD 关注一个训练大模型时常见但容易被低估的问题:可验证奖励强化学习与在线蒸馏各有优势,简单相加却可能让训练提前失去探索能力。论文提出的 SAF 通过调节教师信号的强度与时机,在数学推理和代码生成任务中带来更稳定的收益。

阅读全文
CCTest · Blog
GEPO:给混合任务里的大模型强化学习加上“分组熵”调节器
强化学习
cctest.ai
强化学习

GEPO:给混合任务里的大模型强化学习加上“分组熵”调节器

GEPO 是对 GRPO 的轻量改造,核心不是简单压高熵或保低熵,而是按 prompt 分组的熵状态,去做更细粒度的优势项塑形。它试图解决混合任务训练中,不同题型探索需求不一致、导致统一熵控制失灵的问题。

阅读全文
CCTest · Blog
CPO:用“正确性感知”替代单纯熵信号的 RLVR 新思路
强化学习
cctest.ai
强化学习

CPO:用“正确性感知”替代单纯熵信号的 RLVR 新思路

这篇论文提出 Contrastive Policy Optimization(CPO),尝试解决 RLVR 中把熵当作优势塑形信号时无法区分“有益不确定性”和“有害混乱”的问题。它通过比较参考引导生成与普通生成的 token 级分布差异,为训练提供更接近正确性的信号。

阅读全文