記事一覧へ戻る
世界モデル

Trace2Env、言語モデルで状態を持つ対話型環境を構築

読了目安 3 分

導入

エージェントを訓練・評価するには、複数回の操作に対して現実的に応答する環境が必要になる。しかし実際のシステムは、非公開だったり、古いソフトウェアだったり、導入が難しかったりする。元の環境を実行可能なプログラムとして作り直す方法は、コストが高く、暗黙の制約や例外的な挙動を取りこぼしやすい。

論文「From Traces to Agentic Worlds」は、別の方向性を示す。環境をプログラムとして再構築するのではなく、言語モデルエージェントに環境の役割を担わせるのである。著者らはこの考え方をagentic language world modelingと呼び、学習を必要としないTrace2Envで実装した。

Trace2Envの仕組み

  • ソースコードではなく操作履歴を使う:アクセスできないシステムでも、過去の行動と観測の軌跡があれば環境の近似を作れる。
  • worldbookを構成する:オフライン処理で、環境スキーマ、行動規則、制約、不変条件、実例、根拠付きの証拠を整理する。単なる長いプロンプトではなく、実行時に検索できる知識基盤である。
  • 状態を継続的に管理する:世界モデルエージェントは各行動について、worldbook、現在のエピソード状態、エピソード記憶を参照し、直後の観測と後続ターンに残る変化を推定する。
  • 推論と状態更新を分離する:共有ランタイムが提案結果を検証し、受け入れた変更だけを反映するため、過去の操作の影響を後続の応答へ引き継げる。

結果と限界

評価対象には、ターミナル、ソフトウェアリポジトリ、AndroidおよびWebアプリ、企業サービス、テキストゲームなど、9種類の環境が含まれる。通常のプロンプトベースの言語世界モデルと比べ、Trace2Envは次の観測の忠実度と、長い対話における一貫性を改善した。さらに、シミュレーション環境を前提にタスクエージェントが生成した行動は、実環境で再生した際にも有効である割合が高かった。これは、もっともらしい返答だけでなく、過去の操作が生んだ結果もよりよく保持できていることを示す。

一方、性能は利用可能な履歴の範囲と品質に左右される。記録にない状態、例外経路、珍しい操作については、信頼できる根拠が不足する可能性がある。そのため、Trace2Envは元システムの完全な代替というより、検証と改善が可能な近似環境として捉えるべきだろう。

意義

この方法は、エージェント環境を作る際の負担を下げる。実サービスに接続できない場合の訓練、安全で再現可能なサンドボックス評価、ツールやAPI、MCPバックエンド、企業業務の状態付きモックなどに利用できる。非公開・旧式・利用不能なシステムのログも、単なる評価記録ではなく、対話型の世界を作る材料になり得る。

今後、エージェントが長期計画を担うほど、環境が過去を記憶し、制約を守り、状態を一貫して引き継げるかが重要になる。Trace2Envは、世界モデルを「次の文章を予測する仕組み」から「行動に継続的な反応を返す環境」へ広げる試みといえる。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
DreamTrue、ロボット世界モデルの動作追従性を高める
世界モデル
cctest.ai
世界モデル

DreamTrue、ロボット世界モデルの動作追従性を高める

DreamTrue は、入力された動作に忠実で、物理的にも妥当な未来映像を生成することを目指す、多視点・異種ロボット対応の世界モデルです。画像空間での幾何補正、反実仮想ポストトレーニング、人手評価に基づく報酬モデルを組み合わせています。

続きを読む
CCTest · Blog
WorldSonus、世界モデルにリアルタイムの空間音響を加える
世界モデル
cctest.ai
世界モデル

WorldSonus、世界モデルにリアルタイムの空間音響を加える

WorldSonusは、動画からリアルタイムに制御可能なステレオ音声を生成する、世界モデル向けのインタラクティブなフレームワークです。論文ではRTF 0.41を報告し、オープンドメインの動画音声生成ベンチマークでも高い性能を示しています。

続きを読む