ShallowStream:浅い層で索引を作り、深い層で動画を理解する
ShallowStreamは、MLLMの浅い層を使ってストリーミング動画の符号化と検索用インデックスの構築を行い、質問時だけ深い層を活用します。論文では、フレーム単位のプリフィル遅延を最大52.1倍、10秒間のエンドツーエンド遅延を最大11.9倍削減したと報告しています。
続きを読むShallowStreamは、MLLMの浅い層を使ってストリーミング動画の符号化と検索用インデックスの構築を行い、質問時だけ深い層を活用します。論文では、フレーム単位のプリフィル遅延を最大52.1倍、10秒間のエンドツーエンド遅延を最大11.9倍削減したと報告しています。
続きを読むarXivの新しい研究は、動画生成モデルの蒸留と人間の嗜好へのアライメントを単一段階で扱うDM-Alignを提案した。サンプル分布の差から嗜好誘導勾配を作り、従来の強化学習に伴う計算量と不安定性の削減を目指す。
続きを読む長時間動画向けマルチモーダルモデルで、フレーム選択、空間圧縮、予算の再投資を切り分けて検証した研究が発表された。重要なのは単純な高解像度化ではなく、関連する時間情報をより広くカバーすることだ。
続きを読むGoogle DeepMindは、Geminiが動画内の必要な区間を動的に検索・再確認できるAgentic Video Understandingを発表しました。公式ベンチマークでは、トークン使用量を最大88%、分析コストを最大66%削減し、精度を最大7%高めたとしています。
続きを読むLuceは、形状とPBRマテリアルを統合したマルチモーダルGaussian表現を提案し、1枚の画像から再照明可能な3Dアセットを生成します。PBR Gaussianに加え、テクスチャ付きメッシュと接線空間法線マップも任意で出力できます。
続きを読む高徳は、直近12フレームの局所コンテキストだけを使って長い映像から3Dシーンを逐次再構築するモデル「ABot-Recon」を発表した。長期記憶への依存を避け、誤差の蓄積や推論速度の低下、メモリ使用量の増大に対応する設計を採用している。
続きを読むGoogle DeepMindがGemini Omni 1.1 Flashを発表した。シーンの延長、始点・終点フレームの指定、360pプレビュー、4K出力などを備え、動画制作の反復を効率化する。
続きを読むSparsePRは、再学習を必要としない動画生成・世界モデル向けの疎注意手法です。応答結合型パーティショニングとプローブ適合型残差再構成を組み合わせ、品質を保ちながら実行する注意計算を削減します。
続きを読むInfinityEdit は、完成済みの短い動画を逐次書き換えるのではなく、編集指示を受けながら未来の映像セグメントを生成する手法です。履歴、時間的因果性、編集テキストを扱う軽量アダプターによって、ストリーミング動画生成への編集機能の追加を目指します。
続きを読む4DAnyoneは、キャリブレーションされていない単眼の人物動画から、多視点間で一貫した動画を生成し、それを4D Gaussian Splattingへ変換する手法です。増え続ける参照情報と、分割された視点グループ間の不整合を、二つのコンテキスト設計で抑えます。
続きを読むアリババの動画生成モデル Wan 3.0 が公測を開始した。注目点は、doc や ppt、pdf などの文書をそのまま入力できることで、動画生成が表現ツールから業務活用ツールへ広がり始めたことだ。
続きを読む未来フレームを見ず、長さも事前に決めない動画編集は難題です。JoyAI-Video-Editは、自回帰拡散に蒸留を組み合わせ、リアルタイム性とソース忠実度、長期整合性の両立を狙います。
続きを読むInfiniSplat は、1 枚の画像から大きな視点変化に耐える新規視点合成を目指す 3D Gaussian Splatting フレームワークです。固定ピクセル格子に依存せず、幾何に基づくサンプリングと暗黙的なガウス復号を組み合わせます。
続きを読むMotion Beyond Morphology(MBM)は、参照動画と対象物の形態が大きく異なる場合でも、意味のある動きを転写するための新しい枠組みを提案する。固定的な骨格・部品対応ではなく、抽象的な運動表現に注目する点が特徴だ。
続きを読む新論文は、極端にノイズの多い RGB 観測と近赤外(NIR)情報を 3D 空間で融合する 3DarkFusion を提案している。クリーンな RGB 教師データを使わずに、低照度下のカラー画像復元を目指す点が特徴だ。
続きを読むMeshy T2は、自己回帰的にメッシュを逐次生成する従来方式の遅さを避け、Flow Matchingと頂点単位の連続潜在表現でポリゴンメッシュを直接生成する手法です。
続きを読むAI動画生成スタートアップのPippaは、作家のスタイルが使われた生成物に対して収益を分配する仕組みを掲げている。しかし、その基盤には依然として同意なきネット由来データの問題が残る。
続きを読むVideoCoCo は、テキストプロンプトから実行可能な Blender プログラムを生成し、そのシミュレーション草案を写実的な動画へ変換する二段構えの枠組みです。狙いは、テキスト動画生成における物理的一貫性の弱点を補うことにあります。
続きを読むO-VAD は、工業プロセスの動画における異常を、物体の分割・追跡・状態軌跡の推論によって検出する学習不要のフレームワークです。前線の VLM が工業領域で苦戦する理由を、物体レベルの証拠不足として捉えています。
続きを読むNetflix 関連の研究 ID-V2V は、編集済みキーフレームからシーン、照明、スタイルの変更を動画全体へ伝播しつつ、人物の顔立ち、表情、視線、リップシンクを保つことを目指す。
続きを読むこの論文は、3D 条件付きの長尺動画生成で起きる再訪時の見た目の不一致に注目する。過去の潜在表現を KV cache に戻し、深度とカメラ姿勢による幾何対応で注意機構を導くことで、追加学習なしに一貫性を高める。
続きを読む