記事とガイド

強化学習

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 34 件の記事

CCTest · Blog
正解ラベルなしで推論を改善するTTPO、合意と不一致を使い分けるテスト時学習
強化学習
cctest.ai
強化学習

正解ラベルなしで推論を改善するTTPO、合意と不一致を使い分けるテスト時学習

TTPOは、多数決による疑似ラベルをそのまま正解扱いせず、同意する推論と反対する推論に異なる学習処理を適用する。これにより、誤った多数決が教師信号全体を汚染するリスクを抑える。

続きを読む
CCTest · Blog
Co-RL、多様なAI群の協調で教師なし推論を実現
強化学習
cctest.ai
強化学習

Co-RL、多様なAI群の協調で教師なし推論を実現

Co-RLは、パラメータを共有しない複数モデルが互いのフィードバックから報酬を得て学習する強化学習の枠組みです。正解ラベルなしでも、テキストとマルチモーダルの推論性能を高め、自己評価型RLの崩壊リスクを抑えます。

続きを読む
CCTest · Blog
Agent Lightning v1.0、エージェント・ハーネスを強化学習に組み込む
強化学習
cctest.ai
強化学習

Agent Lightning v1.0、エージェント・ハーネスを強化学習に組み込む

Agent Lightning v1.0は、ツール呼び出しやコンテキスト管理を担う実運用のエージェント・ハーネスを、モデルの強化学習に直接参加させる手法を提案する。6,000件の学習例と比較的少ない計算資源で、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。

続きを読む
CCTest · Blog
DAPD:方策蒸留における「特権情報の錯覚」をどう抑えるか
強化学習
cctest.ai
強化学習

DAPD:方策蒸留における「特権情報の錯覚」をどう抑えるか

DAPD は、オンポリシー自己蒸留で起きる性能劣化を、教師と学生の情報条件のズレとして捉え直す研究です。二重のアンカリングにより、推論時に再現できない特権依存の挙動が学生へ移ることを防ごうとします。

続きを読む
CCTest · Blog
SAF-OPD:強化学習とオンポリシー蒸留を安定に組み合わせる
強化学習
cctest.ai
強化学習

SAF-OPD:強化学習とオンポリシー蒸留を安定に組み合わせる

SAF-OPD は、検証可能な報酬による強化学習とオンポリシー蒸留を固定係数で混ぜると、探索が失われる可能性がある点に注目する。教師信号の大きさと投入タイミングを調整し、より安定した後学習を目指す手法だ。

続きを読む
CCTest · Blog
長い CoT の強化学習では、すべての Token に同じ信用を与えるべきではない
強化学習
cctest.ai
強化学習

長い CoT の強化学習では、すべての Token に同じ信用を与えるべきではない

南京大学の論文は、RLVR における token 単位の信用割り当てを再検討している。大きな尤度変化は、推論上の重要性ではなく、表層表現の置き換えやすさを反映している場合が多いという。

続きを読む
CCTest · Blog
RLSVR:オープンエンドなLLMタスクを自己検証可能なRL環境へ
強化学習
cctest.ai
強化学習

RLSVR:オープンエンドなLLMタスクを自己検証可能なRL環境へ

この論文は、数学やコードでは有効な RLVR を、要約や創作のような正解が一つに定まらないタスクへ拡張しようとする。RLSVR はタスク変換によって、環境内のルールと相互作用から自動的に報酬を得る枠組みを提案している。

続きを読む
CCTest · Blog
Molt:エージェント型強化学習向けの PyTorch ネイティブ訓練基盤
強化学習
cctest.ai
強化学習

Molt:エージェント型強化学習向けの PyTorch ネイティブ訓練基盤

Molt は、エージェント型強化学習研究における実装変更の負担を下げるために設計された PyTorch ネイティブの訓練フレームワークです。軽量なコードベースを保ちながら、非同期訓練、多モーダル方策、MoE 方策を扱える点を特徴とします。

続きを読む
CCTest · Blog
ISO:RLVR最適化を「スペクトル固定・フレーム更新」で捉え直す
強化学習
cctest.ai
強化学習

ISO:RLVR最適化を「スペクトル固定・フレーム更新」で捉え直す

この論文は、RLVRによる能力向上が重みの特異値スペクトルの大幅な書き換えではなく、入力・出力側の特異フレームの変化に宿ると主張する。その観察をもとに、固定スペクトル型の最適化スタック ISO を提案している。

続きを読む
CCTest · Blog
SAT:古い rollout に応じて信頼領域を調整し、非同期強化学習を安定化
強化学習
cctest.ai
強化学習

SAT:古い rollout に応じて信頼領域を調整し、非同期強化学習を安定化

非同期強化学習はスループットを高める一方、rollout と学習時点の方策がずれるという問題を抱える。SAT はサンプルの陳腐化度に応じて PPO 風のクリップ区間を調整し、高リスクな更新をより保守的に扱う。

続きを読む
CCTest · Blog
CPO:エントロピーを超える正しさ認識型 RLVR の提案
強化学習
cctest.ai
強化学習

CPO:エントロピーを超える正しさ認識型 RLVR の提案

この論文は、RLVR におけるエントロピー中心の advantage shaping の限界を指摘し、Contrastive Policy Optimization(CPO)を提案している。参照誘導生成と通常生成の token レベルの分布差を使い、より正しさに近い学習信号を作る点が特徴だ。

続きを読む