GAE:3D整合性の高い世界生成に向けた幾何ネイティブ潜在空間
導入
近年の動画生成モデルは、写実的なフレームを作る能力を大きく高めています。しかし、各フレームが自然に見えても、カメラが動いたときに物体の形状や空間関係が一貫するとは限りません。GAE(Geometry-Native Autoencoder)は、この問題を生成器の能力不足だけではなく、生成に使う潜在空間の設計にも原因があると考えます。
主なポイント
- 潜在空間そのものを幾何中心にする。 一般的な視覚生成モデルの潜在表現は、色、質感、局所的な見た目を中心に整理されがちです。GAEは幾何基盤モデルの特徴を再パラメータ化し、意味情報と視点をまたぐ構造を、生成に適したコンパクトな表現へまとめます。
- 一つの状態から複数の情報を復元する。 GAEの潜在表現は、RGBの外観、深度、カメラ情報、3D点マップへ共同でデコードできます。つまり、独立した画像列ではなく、複数の観測に対応する統一的なシーン状態を扱います。
- 条件付き生成と組み合わせられる。 この表現の上に条件付きフローモデルを構築し、カメラ軌道を条件として与えます。これにより、生成される動画と視点移動の関係をモデルの入力に明示的に含められます。
- 画質だけでなく幾何も評価する。 生成器と学習手順を固定した比較では、GAEの採用によりRealEstate10KのFVDが12.7%、DL3DVのFVDが23.1%低下しました。RealEstate10Kではカメラ軌道誤差も半分になりました。
意義と今後
GAEの重要な点は、動画モデルに深度出力を後付けすることではありません。生成器が活動する内部表現を、初めから幾何関係を含むものへ変えることです。潜在変数が視点間の構造を保持していれば、生成器は写実的な外観を作りながら、物体やカメラの関係も維持しやすくなります。GAEは、幾何を理解する知覚モデルと、多様な結果を作る生成モデルをつなぐ共通インターフェースと位置づけられます。
この発想は、世界モデル、制御可能な動画生成、新視点合成に応用できる可能性があります。一方で、長時間の動画や複雑なシーンにも同じ表現が拡張できるのか、共同デコードが質感の細部や生成の多様性とトレードオフを生まないかは、今後の検証課題です。それでもGAEは、3D整合性を左右する要因として潜在空間を正面から扱う価値を示しています。
コメント
ログイン状態を確認中…
コメントを読み込み中…