文章与教程

强化学习

Claude API 中转站避坑指南、检测原理与大模型 API 实测经验

共 34 篇文章

CCTest · Blog
RL 后训练算力该花在哪?一篇新论文拆解模型、搜索、学习与反馈的取舍
强化学习
cctest.ai
强化学习

RL 后训练算力该花在哪?一篇新论文拆解模型、搜索、学习与反馈的取舍

这篇 arXiv 论文讨论了一个常被“总 FLOPs”掩盖的问题:在固定后训练预算下,算力究竟该投向更大模型、更多更新、更多 rollout 搜索,还是更强的奖励反馈?作者提出了面向 GRPO 的 FLOP 记账框架,并用 LoRA 适配的 Qwen2.5 策略模型做了条件性对比。

阅读全文
CCTest · Blog
用李雅普诺夫指数做奖励:强化学习重新审视倒立摆稳定控制
强化学习
cctest.ai
强化学习

用李雅普诺夫指数做奖励:强化学习重新审视倒立摆稳定控制

一篇 arXiv 新论文提出,将李雅普诺夫特征指数作为物理信息密集奖励,用于训练强化学习智能体稳定垂直运动下的倒立摆。实验中,智能体不仅找到了经典 Kapitza 摆式的振荡稳定方式,还进一步将支点运动阻尼到严格直立状态。

阅读全文