記事一覧へ戻る
世界モデル

Zing-0.5、テキストとキーボードで操作できる世界モデル

読了目安 3 分

生成動画モデルは、場面を作って見せることには強い一方、ユーザーがその世界を歩き回り、途中で指示を出し、結果を受けてさらに操作するという体験には課題が残ります。Zing-0.5は、生成された世界を「見る」だけでなく「遊ぶ」ことを目指す5Bの自回帰型世界モデルです。

主なポイント

  • キーボードとテキストを統合:モデルは、入力の強さを考慮したキーボード操作、時間的に対応付けられたテキスト指示、共同アノテーション付き動画を同じ系列で学習します。キーボードで移動しながら、テキストで発生中のイベントを変えられる構成です。
  • イベント単位の教師信号:複数のプロンプトからつながった動画を使ってセグメント単位の教師モデルを学習し、ブロック単位の因果モデルへ分布マッチング蒸留を行います。個々のフレームではなく、連続する出来事を保ちながら生成することが狙いです。
  • リアルタイム配信:4ステップ生成と、文脈を維持するストリーミングを組み合わせます。報告された設定では832×480、24 FPSで推論でき、サーバー利用コストはストリーム1分あたり約0.009米ドルと見積もられています。

評価とデモ

158件のWBench Navigationケースで、Zing-0.5は総合スコア81.0、一貫性スコア88.5を記録しました。共同制御のデモでは、ユーザーがナビゲーションを続けながらテキスト指示を入力し、進行中のイベントを変更します。生成を再起動せずに流れを継続できる点が、実行時のテキスト制御を示しています。

意義と今後の課題

Zing-0.5の重要性は、世界の生成と操作を一つの自回帰ループで扱おうとしている点にあります。ゲームのプロトタイプ、探索型ストーリー、身体性を持つエージェントの研究では、キーボードと自然言語を併用するインターフェースが、単一の操作形式より柔軟に働く可能性があります。また、イベントの連続性を学習目標に含める考え方は、世界モデルを局所的な画質だけで評価しないための手がかりになります。

一方、提供された素材には、詳細な学習データ、長時間生成での失敗例、ハードウェア別の比較は記載されていません。そのため、Zing-0.5は長期的一貫性や複雑な世界ルールを解決した完成形というより、プレイ可能な生成世界に向けた公開研究として捉えるのが適切です。重み、推論コード、Zing-SGLangの配信実装が公開されており、今後の再現と比較の土台になります。

出典:Hugging Face Daily Papers

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Pelican-Sim 1.0、ロボット向け汎用ワールドモデルを構築
世界モデル
cctest.ai
世界モデル

Pelican-Sim 1.0、ロボット向け汎用ワールドモデルを構築

Pelican-Sim 1.0は、視覚コンテキストとロボットの行動から将来の観測を予測する、具現化知能向けの汎用シミュレーターです。統一行動空間、行動動画の注入、疎なMoE、少ステップ生成によって、異なるロボットへの制御性と生成効率を高めます。

続きを読む
CCTest · Blog
World in World:凍結した動画世界モデルに柔軟な視点・時間制御を追加
世界モデル
cctest.ai
世界モデル

World in World:凍結した動画世界モデルに柔軟な視点・時間制御を追加

World in World は、動画世界モデルを再学習せず、異なる視覚証拠を推論時に統合するインターフェースを提案する。視点変更、長時間の再訪、人物動作の転送を同じ仕組みで扱うことを目指す。

続きを読む
CCTest · Blog
1枚の画像から実行可能な世界へ:RCWMが再帰的に3Dシーンを構築
世界モデル
cctest.ai
世界モデル

1枚の画像から実行可能な世界へ:RCWMが再帰的に3Dシーンを構築

Recursive Code World Models(RCWM)は、1枚の参照画像から複雑な3D世界を実行可能なコードとして再構成する手法です。全体・局所・全体の再帰ループにより、細部を調整しながらシーン全体の空間関係を維持します。

続きを読む