記事とガイド

強化学習

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 43 件の記事

CCTest · Blog
PLC-DPO:ノイズを含む選好ラベルを補正するDPO
強化学習
cctest.ai
強化学習

PLC-DPO:ノイズを含む選好ラベルを補正するDPO

DPOは比較データの選好が正しいことを前提としますが、実際のデータには逆向きのラベルや差の小さいペア、判断が難しいペアが含まれます。PLC-DPOはポリシーと参照モデルの校正済みマージンを使い、各ペアを通常学習、反転学習、同等扱いへ振り分けます。

続きを読む
CCTest · Blog
Miles v0.1、最先端モデルのポストトレーニングを本番向け基盤へ
強化学習
cctest.ai
強化学習

Miles v0.1、最先端モデルのポストトレーニングを本番向け基盤へ

RadixArkが、最先端モデルの大規模ポストトレーニングを対象とするオープンソース基盤 Miles v0.1 を公開した。ロールアウト、学習、重み同期を一つの構成にまとめ、検証可能性と拡張性を重視している。

続きを読む
CCTest · Blog
ロボットは推論を待てない:SmoothRLが非同期オンライン強化学習を現実の動作に合わせる
強化学習
cctest.ai
強化学習

ロボットは推論を待てない:SmoothRLが非同期オンライン強化学習を現実の動作に合わせる

星塵智能(Astribot)のSmoothRLは、大規模モデルが生成した動作列と、ロボットが実際に実行した動作列のずれを解消するオンライン強化学習フレームワークだ。実行された動作だけを学習対象にすることで、非同期推論に対応する。

続きを読む
CCTest · Blog
オンポリシー蒸留は本当に蒸留しているのか?教師なし適応への転換
強化学習
cctest.ai
強化学習

オンポリシー蒸留は本当に蒸留しているのか?教師なし適応への転換

新たな分析は、オンポリシー蒸留の性能向上が教師モデルの知識移転よりも、低確率トークンの抑制から生じている可能性を示した。この知見をもとに、教師を使わない On-Policy Self-Adaptation が提案されている。

続きを読む
CCTest · Blog
J-Zero:挑戦者・解答者・判定者を共進化させる仕組み
強化学習
cctest.ai
強化学習

J-Zero:挑戦者・解答者・判定者を共進化させる仕組み

KAIST AI が提案する J-Zero は、人手によるラベル付きデータに依存せず、課題生成、問題解答、評価の3役を同時に適応させる枠組みです。検証可能な課題だけでなく、評価が難しい課題にも対応することを目指します。

続きを読む
CCTest · Blog
正解ラベルなしで推論を改善するTTPO、合意と不一致を使い分けるテスト時学習
強化学習
cctest.ai
強化学習

正解ラベルなしで推論を改善するTTPO、合意と不一致を使い分けるテスト時学習

TTPOは、多数決による疑似ラベルをそのまま正解扱いせず、同意する推論と反対する推論に異なる学習処理を適用する。これにより、誤った多数決が教師信号全体を汚染するリスクを抑える。

続きを読む
CCTest · Blog
Co-RL、多様なAI群の協調で教師なし推論を実現
強化学習
cctest.ai
強化学習

Co-RL、多様なAI群の協調で教師なし推論を実現

Co-RLは、パラメータを共有しない複数モデルが互いのフィードバックから報酬を得て学習する強化学習の枠組みです。正解ラベルなしでも、テキストとマルチモーダルの推論性能を高め、自己評価型RLの崩壊リスクを抑えます。

続きを読む
CCTest · Blog
Agent Lightning v1.0、エージェント・ハーネスを強化学習に組み込む
強化学習
cctest.ai
強化学習

Agent Lightning v1.0、エージェント・ハーネスを強化学習に組み込む

Agent Lightning v1.0は、ツール呼び出しやコンテキスト管理を担う実運用のエージェント・ハーネスを、モデルの強化学習に直接参加させる手法を提案する。6,000件の学習例と比較的少ない計算資源で、Qwen3.5-9BのSWE-bench Verifiedスコアを41.8%から56.4%へ引き上げた。

続きを読む
CCTest · Blog
DAPD:方策蒸留における「特権情報の錯覚」をどう抑えるか
強化学習
cctest.ai
強化学習

DAPD:方策蒸留における「特権情報の錯覚」をどう抑えるか

DAPD は、オンポリシー自己蒸留で起きる性能劣化を、教師と学生の情報条件のズレとして捉え直す研究です。二重のアンカリングにより、推論時に再現できない特権依存の挙動が学生へ移ることを防ごうとします。

続きを読む
CCTest · Blog
長い CoT の強化学習では、すべての Token に同じ信用を与えるべきではない
強化学習
cctest.ai
強化学習

長い CoT の強化学習では、すべての Token に同じ信用を与えるべきではない

南京大学の論文は、RLVR における token 単位の信用割り当てを再検討している。大きな尤度変化は、推論上の重要性ではなく、表層表現の置き換えやすさを反映している場合が多いという。

続きを読む
CCTest · Blog
SAF-OPD:強化学習とオンポリシー蒸留を安定に組み合わせる
強化学習
cctest.ai
強化学習

SAF-OPD:強化学習とオンポリシー蒸留を安定に組み合わせる

SAF-OPD は、検証可能な報酬による強化学習とオンポリシー蒸留を固定係数で混ぜると、探索が失われる可能性がある点に注目する。教師信号の大きさと投入タイミングを調整し、より安定した後学習を目指す手法だ。

続きを読む
CCTest · Blog
RLSVR:オープンエンドなLLMタスクを自己検証可能なRL環境へ
強化学習
cctest.ai
強化学習

RLSVR:オープンエンドなLLMタスクを自己検証可能なRL環境へ

この論文は、数学やコードでは有効な RLVR を、要約や創作のような正解が一つに定まらないタスクへ拡張しようとする。RLSVR はタスク変換によって、環境内のルールと相互作用から自動的に報酬を得る枠組みを提案している。

続きを読む
CCTest · Blog
Molt:エージェント型強化学習向けの PyTorch ネイティブ訓練基盤
強化学習
cctest.ai
強化学習

Molt:エージェント型強化学習向けの PyTorch ネイティブ訓練基盤

Molt は、エージェント型強化学習研究における実装変更の負担を下げるために設計された PyTorch ネイティブの訓練フレームワークです。軽量なコードベースを保ちながら、非同期訓練、多モーダル方策、MoE 方策を扱える点を特徴とします。

続きを読む