記事一覧へ戻る
AIエージェント

DeepSeek DSec、大規模エージェント訓練向けの弾力的なサンドボックス基盤

読了目安 3 分

導入

大規模言語モデルが回答を生成するだけでなく、リポジトリを調査し、ツールを呼び出し、コマンドを実行し、長い手順を自律的に進めるようになると、訓練基盤に求められるものも変わります。各ロールアウトには、独立性と状態保持を備えた実行環境が必要です。さらに強化学習では、サンドボックスが短時間に大量生成され、異なるソフトウェア依存関係を持ち、イメージ配布とメモリ利用に大きな負荷を与えます。DeepSeekの論文は、この問題に対応する本番向け基盤としてDeepSeek Elastic Compute(DSec)を紹介しています。

DSecの主な特徴

  • 複数の隔離方式を統合。 DSecは、関数呼び出し、コンテナ、microVM、完全なVMを共通SDKから提供します。タスクの機能や隔離要件に応じて実行方式を選べるため、上位の訓練システムが複数のランタイムを個別に実装する必要を減らせます。
  • クラスタ単位でライフサイクルを管理。 配置、作成、回収をクラスタ全体で調整し、環境を独立してバージョン管理されたレイヤーから構成します。モノリシックなイメージを毎回準備するより、環境部品を再利用しやすい設計です。
  • 高密度実行を支援。 メモリ共有、回収、CPUスケジューリングを組み合わせ、オーバーコミット下でも遅延に敏感な処理を維持することを目指します。イメージはFire-Flyer File System(3FS)から必要な時に読み込みます。
  • 強化学習と協調。 状態を持つロールアウトと、プリエンプト可能なGPU訓練を分離します。訓練資源を回収する必要がある場合でも、サンドボックスの状態を維持できるようライフサイクルを調整します。
  • エージェントの不正な挙動にも対応。 論文は、reward hackingを含むエージェントの望ましくない挙動を抑えることにも触れています。サンドボックスを単なるコード実行環境ではなく、訓練の信頼性を支える制御層として捉えている点が特徴です。

規模と意義

論文によれば、1つの本番単位は約160ノードで構成され、1日に約300万のサンドボックスを処理します。本番環境では同時実行数が38万を超え、作成速度は毎秒5000件以上を維持するとされています。レイヤー化、オンデマンド読み込み、資源管理により、環境の起動やイメージ配布の負荷を下げ、メモリ効率を改善したというのが著者らの報告です。

DSecの重要性は、新しい仮想化方式を1つ発明したことよりも、複数の隔離バックエンド、分散ファイルシステム、資源のオーバーコミット、状態管理、強化学習の制御を、エージェントのワークロードに合わせて統合した点にあります。エージェントの処理が長期化・複雑化するほど、サンドボックス運用は訓練のスループットとコストを左右します。もっとも、今回確認できる資料は主に論文の要約と書誌情報であり、詳細な実験表や独立した再現結果は含まれていません。性能評価には全文と今後の公開情報が必要です。

出典:Hacker News

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Google、インドでGeminiからFlipkart商品を購入する機能を試験
AIエージェント
cctest.ai
AIエージェント

Google、インドでGeminiからFlipkart商品を購入する機能を試験

Googleはインドで、GeminiとGoogle AI Modeに表示された一部のFlipkart商品を、AI画面から購入できる機能を試験している。購入ボタンを押すとFlipkartのブランド付き決済フローに移動し、10月後半の提供拡大が予定されている。

続きを読む
CCTest · Blog
DoorDash、マルチエージェントLLMで6万件のFeature Flagを整理
AIエージェント
cctest.ai
AIエージェント

DoorDash、マルチエージェントLLMで6万件のFeature Flagを整理

DoorDashは、古くなったFeature Flagをコードベースから削除するため、マルチエージェントLLMのワークフローを構築した。実験データ、人による承認、隔離されたGit Worktree、自動検証を組み合わせ、複雑な呼び出し経路ではエンジニアの介入を残している。

続きを読む
CCTest · Blog
AstraとOpus、チューリングのもう一つの試練に挑む
AIエージェント
cctest.ai
AIエージェント

AstraとOpus、チューリングのもう一つの試練に挑む

OpenAIのAstraとAnthropicのClaude Opusが、第二次世界大戦期のエニグマ暗号で長年未解読だった2通のメッセージの解読に貢献したと、暗号研究者が報告した。史料調査や歴史的推論、専用ツールの構築を組み合わせる大規模モデルの可能性が示される一方、検証の重要性も浮き彫りになった。

続きを読む