記事とガイド

強化学習

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 34 件の記事

CCTest · Blog
OPD²:推論チューニングで増えた能力だけを蒸留する新手法
強化学習
cctest.ai
強化学習

OPD²:推論チューニングで増えた能力だけを蒸留する新手法

NAVER AI Lab の OPD² は、教師モデルの出力分布をそのまま模倣するのではなく、推論チューニング後の教師とベースモデルの差分を蒸留信号として使う。論文では、数学・科学・コード推論で従来の on-policy distillation を上回ると報告されている。

続きを読む
CCTest · Blog
LongStraw:固定 GPU 予算で 200 万 Token 超の長文脈 RL を実行
強化学習
cctest.ai
強化学習

LongStraw:固定 GPU 予算で 200 万 Token 超の長文脈 RL を実行

LongStraw は、百万 token 級の推論能力と短い文脈に留まりがちな RL 後学習のギャップを埋めようとする実行スタックです。共有プロンプトを勾配なしで処理し、応答分岐を再実行することでメモリ負荷を抑えます。

続きを読む
CCTest · Blog
Ring-Zero:ゼロRLを1兆パラメータへ拡張すると何が起きるのか
強化学習
cctest.ai
強化学習

Ring-Zero:ゼロRLを1兆パラメータへ拡張すると何が起きるのか

Ring-Zero は、人手で注釈した推論データを使わず、検証可能な報酬で推論能力を引き出す zero RL を 1T パラメータ規模で検証する研究だ。大規模化により、サンプル効率や性能上限だけでなく、自己検証や構造化された推論の出現も報告されている。

続きを読む
CCTest · Blog
RL 後学習の計算資源はどこに使うべきか:モデル、探索、学習、フィードバックの配分
強化学習
cctest.ai
強化学習

RL 後学習の計算資源はどこに使うべきか:モデル、探索、学習、フィードバックの配分

この arXiv 論文は、RL 後学習のコストを単一の総 FLOPs だけで語ることの限界を指摘する。固定予算の下で、より大きなモデル、長い学習、rollout 探索、強い報酬フィードバックのどれに計算を割くべきかを検討している。

続きを読む
CCTest · Blog
Lighthouse RL:有望な状態へ戻ることでアナログ回路最適化を効率化
強化学習
cctest.ai
強化学習

Lighthouse RL:有望な状態へ戻ることでアナログ回路最適化を効率化

arXiv の新論文は、訓練中に見つけた高性能な回路設定を「灯台」として保存し、後続の探索のリセット地点に使う Lighthouse RL を提案している。狙いは、アナログ回路サイズ最適化における無駄な探索を減らすことだ。

続きを読む
CCTest · Blog
リャプノフ指数を報酬に:強化学習が倒立振子の安定化を再発見
強化学習
cctest.ai
強化学習

リャプノフ指数を報酬に:強化学習が倒立振子の安定化を再発見

arXiv の新論文は、垂直運動する倒立振子を安定化する強化学習問題に、リャプノフ特性指数を物理情報に基づく密な報酬として用いる方法を提案している。エージェントは Kapitza 振子として知られる振動安定化だけでなく、支点の揺れを減衰させて厳密な直立状態を実現したと報告されている。

続きを読む
CCTest · Blog
TRACE:長期タスクをこなすエージェントにターン単位の信用を割り当てる
強化学習
cctest.ai
強化学習

TRACE:長期タスクをこなすエージェントにターン単位の信用を割り当てる

arXiv に投稿された TRACE は、長いツール利用軌跡に対して密な報酬を与えるための信用割当手法だ。凍結した参照モデルを使い、最終回答の信号を各ツール呼び出しの報酬へ変換する。

続きを読む
CCTest · Blog
SIVA-RL:正答だけでなく視覚証拠への依拠を促す多モーダル強化学習
強化学習
cctest.ai
強化学習

SIVA-RL:正答だけでなく視覚証拠への依拠を促す多モーダル強化学習

arXiv に投稿された SIVA-RL は、画像介入の種類ではなく実際の報酬変化に基づいて視覚アライメントの監督信号を割り当てる手法です。視覚言語モデルが画像証拠に根ざして推論することを狙います。

続きを読む