記事とガイド

世界モデル

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 38 件の記事

CCTest · Blog
PhiZero:物理言語で世界モデルを再設計する試み
世界モデル
cctest.ai
世界モデル

PhiZero:物理言語で世界モデルを再設計する試み

PhiZero は、世界状態の遷移をコンパクトな離散表現として扱う「物理言語」を中心に構築された物理世界モデルです。未来映像を画素空間で直接予測するのではなく、まず物理的な変化を推論し、その後に映像として描画します。

続きを読む
CCTest · Blog
NVIDIA Cosmos-H-Dreams、外科ロボット向け世界モデルをリアルタイム化
世界モデル
cctest.ai
世界モデル

NVIDIA Cosmos-H-Dreams、外科ロボット向け世界モデルをリアルタイム化

NVIDIA は、外科ロボット向けのアクション条件付き生成シミュレータ Cosmos-H-Dreams を公開した。Cosmos-H-Surgical-Simulator の能力を因果的な少ステップ学生モデルへ蒸留し、FlashDreams でストリーミング推論する構成だ。

続きを読む
CCTest · Blog
UniWorld-ViewがWorldScore首位に:1枚の画像から制御可能な新視点動画へ
世界モデル
cctest.ai
世界モデル

UniWorld-ViewがWorldScore首位に:1枚の画像から制御可能な新視点動画へ

兔展智能、北京大学、鵬城実験室が開発した UniWorld-View が、李飛飛氏のチームに関連する WorldScore ランキングで首位に立った。単一画像または単眼動画から、指定したカメラ軌道に沿う新視点動画を生成できる点が注目されている。

続きを読む
CCTest · Blog
ABot-World-0:単一デスクトップGPUで動くリアルタイム世界モデル
世界モデル
cctest.ai
世界モデル

ABot-World-0:単一デスクトップGPUで動くリアルタイム世界モデル

ABot-World-0 は、映像生成をユーザー操作に反応する世界モデルとして再構成する研究です。データ収集、長時間ロールアウトの蒸留、低ビット推論を組み合わせ、単一の RTX 5090 上で 720P のストリーミング生成を目指します。

続きを読む
CCTest · Blog
Masked Visual Actions:動画モデルをロボット向け世界モデルへ近づける視覚的インターフェース
世界モデル
cctest.ai
世界モデル

Masked Visual Actions:動画モデルをロボット向け世界モデルへ近づける視覚的インターフェース

Masked Visual Actions は、動画内の一部だけ見える軌跡として行動を表す手法です。ロボットの動きを与えれば場面の反応を予測し、望む物体運動を与えればそれに合うロボット動作を生成することを狙います。

続きを読む
CCTest · Blog
AlayaRenderer-Flash、生成型ワールドレンダリングをプレイ可能な 30 FPS へ
世界モデル
cctest.ai
世界モデル

AlayaRenderer-Flash、生成型ワールドレンダリングをプレイ可能な 30 FPS へ

AlayaRenderer-Flash は、生成型ワールドレンダリングの速度を 0.56 FPS から 31.54 FPS へ引き上げ、物理エンジンと連携するインタラクティブ環境を実時間に近づけた。テキストだけで動画を作るのではなく、構造化された世界状態から RGB フレームを合成する点が特徴だ。

続きを読む
CCTest · Blog
EvolvingWorld:キャラクターと世界が共進化する文学世界フレームワーク
世界モデル
cctest.ai
世界モデル

EvolvingWorld:キャラクターと世界が共進化する文学世界フレームワーク

EvolvingWorldは、単発の会話生成ではなく、物語の進行に合わせて人物と世界の状態が更新され続ける仕組みを提案する。静的な人物模倣から、長期的な整合性を重視する方向へ踏み出した研究だ。

続きを読む
CCTest · Blog
Masked Diffusion LMはAgent強化学習向けの新しいテキスト世界モデルになるか
世界モデル
cctest.ai
世界モデル

Masked Diffusion LMはAgent強化学習向けの新しいテキスト世界モデルになるか

この論文は、Masked Diffusion Language Modelsをテキストベースの世界モデルとして用いることで、自回帰モデルの左から右への生成バイアスを緩和できると主張している。工具スキーマ、過去の対話、期待される結果などのグローバルな制約を保ちやすい点が焦点だ。

続きを読む
CCTest · Blog
NVIDIA Cosmos 3 Edge、世界モデルをエッジ上のロボットへ
世界モデル
cctest.ai
世界モデル

NVIDIA Cosmos 3 Edge、世界モデルをエッジ上のロボットへ

NVIDIA は Hugging Face 上で、ロボットとビジョン AI 向けの 40 億パラメータ級オープン世界モデル Cosmos 3 Edge を公開した。場面理解、未来予測、シミュレーション、行動生成をエッジデバイスで扱うことを狙う。

続きを読む
CCTest · Blog
DSWorld:データサイエンスAgentが実行前に結果を予測する世界モデル
世界モデル
cctest.ai
世界モデル

DSWorld:データサイエンスAgentが実行前に結果を予測する世界モデル

DSWorld は、データサイエンス向け自律エージェントに世界モデルの考え方を導入し、高コストな実行の前に操作結果を予測する。論文では、RL ベースの訓練を約 14 倍、探索ベース推論を約 3〜6 倍高速化したと報告している。

続きを読む
CCTest · Blog
UniVR:視覚空間で推論・物理・計画を統合的に学ぶ試み
世界モデル
cctest.ai
世界モデル

UniVR:視覚空間で推論・物理・計画を統合的に学ぶ試み

UniVR は、画像テキスト対に頼らず、純粋な視覚デモから複雑な推論、物理ダイナミクス、長期計画を同時に学ぶことを目指す研究です。中核には VR-GRPO と、純視覚評価のための VR-X ベンチマークがあります。

続きを読む
CCTest · Blog
ピクセルから状態へ:インタラクティブ世界モデルはなぜまだゲームエンジンではないのか
世界モデル
cctest.ai
世界モデル

ピクセルから状態へ:インタラクティブ世界モデルはなぜまだゲームエンジンではないのか

新しい arXiv 論文は、生成型ゲームエンジンの議論を「行動・状態・観測」という古典的なゲームループから捉え直している。重要なのは高品質な映像生成だけでなく、ルールに従う状態変化と長期的な一貫性だ。

続きを読む
CCTest · Blog
M⁴World:自動運転シミュレーション向け多視点・多モーダル世界モデル
世界モデル
cctest.ai
世界モデル

M⁴World:自動運転シミュレーション向け多視点・多モーダル世界モデル

arXiv に公開された M⁴World は、周囲カメラ映像と同期 LiDAR を生成しつつ、物体単位の操作を可能にする運転世界モデルです。論文は、制御性と分単位の安定したストリーミング生成を主要な課題として扱っています。

続きを読む