QwenGyre、超長期エージェント強化学習のGPU待機と軌跡の重複に対応
はじめに
エージェントが短い応答だけでなく、リポジトリの修正や複数段階の作業を担うようになると、オンライン強化学習のボトルネックも変わる。1回のロールアウトが数時間続き、モデルと環境の相互作用が数百回に及び、生成されるトークンが100万近くになる場合、すべての実行が同じ時間で終わることはない。その結果、長い実行を待つ間にGPUが空き、学習全体の効率が下がる。さらに、タスクの分岐によって似た経路が大量に生じると、データ処理と学習コストも膨らむ。
Qwenの論文は、このようなextreme-long、すなわちxlongなタスクを対象とするエンドツーエンドのオンライン強化学習フレームワークとしてQwenGyreを紹介している。狙いは、モデルの推論速度だけでなく、実行と学習をつなぐシステム全体を効率化することにある。
主な仕組み
- GPUの柔軟な再配分。 QwenGyreはロールアウト生成と学習の間でGPUを動的に振り分ける。実行中のタスクを中断せずに資源を移す設計により、ロールアウト時間のばらつきによる待機を抑えようとする。
- 分岐履歴の再構成。 軌跡処理器は分岐した実行の履歴を組み直し、各経路を完全に独立したサンプルとして扱わない。これにより、どの時点で経路が分かれたかを学習処理に反映できる。
- 途中経過のスコア化。 タスクが最後まで終わっていなくても進捗を評価し、長い実行から中間的な学習信号を取り出す。
- 重複経路の削減。 類似した軌跡を重複排除し、非線形な探索によって訓練データの量が制御不能になることを防ぐ。
結果と意味
論文の報告では、Qwen 3.8 2.4Tを使い、1回あたり約700Kトークンのロールアウトを設定した。48ステップ後、NL2RepoBenchの結果は52.5%から58.5%へ上昇し、絶対値で6ポイント改善した。また、複数の訓練データ領域を対象とした評価では、Colocateに対して最大1.85倍、Asyncに対して最大1.78倍の高速化が報告されている。
この研究が示すのは、長期タスク向けエージェントの学習では、モデル性能だけでなく実行基盤も重要だという点だ。実行時間の異なるロールアウト、GPUの待機、似通った分岐軌跡を同時に管理しなければ、計算資源を増やしても効率が伸びにくい。QwenGyreは、スケジューリング、履歴再構成、進捗評価、重複排除を一つの流れにまとめる方向性を示している。
一方、提供された素材には、各機能の個別寄与、追加のスケジューリングコスト、より多くのモデルやタスクでの安定性に関する詳細はない。したがって、数値は論文が示した条件下での結果として捉えるべきで、すべてのxlongタスクにそのまま一般化できるとは限らない。
コメント
ログイン状態を確認中…
コメントを読み込み中…