Luce、1枚の画像から再照明可能な3Dアセットを生成
Luceは、形状とPBRマテリアルを統合したマルチモーダルGaussian表現を提案し、1枚の画像から再照明可能な3Dアセットを生成します。PBR Gaussianに加え、テクスチャ付きメッシュと接線空間法線マップも任意で出力できます。
続きを読むLuceは、形状とPBRマテリアルを統合したマルチモーダルGaussian表現を提案し、1枚の画像から再照明可能な3Dアセットを生成します。PBR Gaussianに加え、テクスチャ付きメッシュと接線空間法線マップも任意で出力できます。
続きを読む高徳は、直近12フレームの局所コンテキストだけを使って長い映像から3Dシーンを逐次再構築するモデル「ABot-Recon」を発表した。長期記憶への依存を避け、誤差の蓄積や推論速度の低下、メモリ使用量の増大に対応する設計を採用している。
続きを読むGoogle DeepMindがGemini Omni 1.1 Flashを発表した。シーンの延長、始点・終点フレームの指定、360pプレビュー、4K出力などを備え、動画制作の反復を効率化する。
続きを読むSparsePRは、再学習を必要としない動画生成・世界モデル向けの疎注意手法です。応答結合型パーティショニングとプローブ適合型残差再構成を組み合わせ、品質を保ちながら実行する注意計算を削減します。
続きを読むInfinityEdit は、完成済みの短い動画を逐次書き換えるのではなく、編集指示を受けながら未来の映像セグメントを生成する手法です。履歴、時間的因果性、編集テキストを扱う軽量アダプターによって、ストリーミング動画生成への編集機能の追加を目指します。
続きを読む4DAnyoneは、キャリブレーションされていない単眼の人物動画から、多視点間で一貫した動画を生成し、それを4D Gaussian Splattingへ変換する手法です。増え続ける参照情報と、分割された視点グループ間の不整合を、二つのコンテキスト設計で抑えます。
続きを読むアリババの動画生成モデル Wan 3.0 が公測を開始した。注目点は、doc や ppt、pdf などの文書をそのまま入力できることで、動画生成が表現ツールから業務活用ツールへ広がり始めたことだ。
続きを読む未来フレームを見ず、長さも事前に決めない動画編集は難題です。JoyAI-Video-Editは、自回帰拡散に蒸留を組み合わせ、リアルタイム性とソース忠実度、長期整合性の両立を狙います。
続きを読むInfiniSplat は、1 枚の画像から大きな視点変化に耐える新規視点合成を目指す 3D Gaussian Splatting フレームワークです。固定ピクセル格子に依存せず、幾何に基づくサンプリングと暗黙的なガウス復号を組み合わせます。
続きを読むMotion Beyond Morphology(MBM)は、参照動画と対象物の形態が大きく異なる場合でも、意味のある動きを転写するための新しい枠組みを提案する。固定的な骨格・部品対応ではなく、抽象的な運動表現に注目する点が特徴だ。
続きを読む新論文は、極端にノイズの多い RGB 観測と近赤外(NIR)情報を 3D 空間で融合する 3DarkFusion を提案している。クリーンな RGB 教師データを使わずに、低照度下のカラー画像復元を目指す点が特徴だ。
続きを読むMeshy T2は、自己回帰的にメッシュを逐次生成する従来方式の遅さを避け、Flow Matchingと頂点単位の連続潜在表現でポリゴンメッシュを直接生成する手法です。
続きを読むAI動画生成スタートアップのPippaは、作家のスタイルが使われた生成物に対して収益を分配する仕組みを掲げている。しかし、その基盤には依然として同意なきネット由来データの問題が残る。
続きを読むVideoCoCo は、テキストプロンプトから実行可能な Blender プログラムを生成し、そのシミュレーション草案を写実的な動画へ変換する二段構えの枠組みです。狙いは、テキスト動画生成における物理的一貫性の弱点を補うことにあります。
続きを読むO-VAD は、工業プロセスの動画における異常を、物体の分割・追跡・状態軌跡の推論によって検出する学習不要のフレームワークです。前線の VLM が工業領域で苦戦する理由を、物体レベルの証拠不足として捉えています。
続きを読むNetflix 関連の研究 ID-V2V は、編集済みキーフレームからシーン、照明、スタイルの変更を動画全体へ伝播しつつ、人物の顔立ち、表情、視線、リップシンクを保つことを目指す。
続きを読むこの論文は、3D 条件付きの長尺動画生成で起きる再訪時の見た目の不一致に注目する。過去の潜在表現を KV cache に戻し、深度とカメラ姿勢による幾何対応で注意機構を導くことで、追加学習なしに一貫性を高める。
続きを読むSANA-Video 2.0 は、線形注意の効率性と softmax 注意の表現力を組み合わせた動画拡散 Transformer です。論文では、単一 H100 上で 720p までの高品質動画生成を狙い、長い動画ほど速度面の利点が広がると報告されています。
続きを読むSelf Gradient Forcing は、自回帰型動画拡散モデルで見落とされがちな履歴コンテキストの勾配不足に焦点を当てる手法です。未来フレームの損失を、過去に生成した潜在表現をより有用な KV メモリへ書き込む学習信号として使います。
続きを読むFlowMimic は、動画編集データの収集コストとタスクの狭さという課題に向き合う研究です。画像編集サンプルをリアルタイムで動画編集サンプルへ変換し、画像と動画の能力を相互模倣で近づけます。
続きを読むHOMIEは、人の同一性を保ちながら、物体との関係や動作の整合性も高めることを狙う動画生成フレームワークです。多モーダル大規模モデルの知識を、生成過程へより自然に組み込みます。
続きを読む