JoyAI-Echo-1.5、長期音声・映像生成を持続する物語と対話型世界へ
JoyAI-Echo-1.5は、長編動画で人物の外見と声を維持しながら、ユーザー操作に応答するインタラクティブな世界モデルを目指す統合音声・映像生成システムです。
続きを読むJoyAI-Echo-1.5は、長編動画で人物の外見と声を維持しながら、ユーザー操作に応答するインタラクティブな世界モデルを目指す統合音声・映像生成システムです。
続きを読む新たなサーベイは、スマートグラスを単なるカメラやディスプレイではなく、一人称知能の基盤として捉え直す。重要なのは、知覚から行動までのループを、現実の制約下で信頼性と制御可能性を保ちながら維持できるかどうかだ。
続きを読むLAION-BVDは、ウェブから収集した動画URLを基に、約8000万本、総計1000万時間の動画をまとめた公開データセットです。シーン分割、合成キャプション、場面転換フレームの抽出により、動画・音声・画像の事前学習を支援します。
続きを読むDeepSeekはAPIプラットフォームでdeepseek-v4-flash-vision-expを公開し、V4シリーズとして初めて公式に画像入力へ対応した。ツール利用やコーディングAgent関連の評価でも、複数の指標が向上している。
続きを読むDeepSeekは、V4-Flashに視覚機能を加えた実験版「DeepSeek-V4-Flash-Vision-Exp」を公開しました。指定されたモデルIDを通じてAPIから利用でき、テキスト能力を維持したまま画像理解を強化する位置付けです。
続きを読む公開ベータ開始から1週間で、DeepSeek Harnessがv0.1.0-rc.8を公開した。ネイティブ画像リクエストとテキスト・画像の混在入力に加え、サブエージェント、Windowsの永続PowerShell、デフォルトの簡易モードを追加している。
続きを読むMOSS-VLは、視覚言語モデルに「話している間も見続ける」能力を組み込むことを目指したオープンモデル群です。ゲート付きクロスアテンション、対話行動を学ぶデータ、段階的な訓練によって、ストリーミング環境への対応を設計段階から行っています。
続きを読むSPARGen は、空間理解に関わる複数のタスクを、指示条件付きの生成問題として統一する枠組みだ。個別モジュールではなく、同一のネイティブなマルチモーダル生成モデルで空間表現を学習する点に特徴がある。
続きを読むUniSwap は、話者動画における外見と声質の同時置き換えを目指す音声・映像統合フレームワークです。別々のモデルを後段でつなぐのではなく、単一の音声映像拡散 Transformer 内で両方を扱います。
続きを読むEx-Omni-2Dは、会話はできても“姿がない”という現状の多モーダル対話モデルの弱点に挑みます。テキスト、個別化音声、参照条件付き動画を一体で生成する設計です。
続きを読むEvidence-RL は、視覚言語モデルが正答していても、その根拠が本当に画像内の証拠にあるのかを問い直す研究です。CED により、局所的な視覚証拠と回答の因果的な依存関係を訓練時に監査します。
続きを読む画像生成チャットにおける次の編集提案は、会話テキストだけでなく現在の画像に基づく必要がある。論文は、実利用データ、クリックフィードバック、視覚検証器を組み合わせた三段階フレームワークを提案している。
続きを読むKandinsky Lab は、潜在拡散モデル向けの多モーダル tokenizer ファミリー「KVAE」を発表した。音声、画像、動画を対象に、テキスト条件付き生成で使いやすい潜在表現を目指している。
続きを読むこの研究は、単なるモデル提案ではなく、統合型マルチモーダル事前学習の内部で何が起きているかを実験的に整理したものです。知識の流れ、モダリティ間の協調、早期統合、効率的な学習レシピの4点が柱です。
続きを読む3Dを理解、生成、編集に分けず、ひとつの統合フレームワークで扱うという提案です。特に注目点は、学習を支える大規模な3Dマルチモーダルデータの整備にあります。
続きを読むVAD は、マルチモーダル on-policy 蒸留における教師モデルの補正が、本当に画像証拠に基づいているのかを推定する手法です。教師の出力をそのまま模倣するのではなく、視覚的に帰属できる成分から学生モデルの学習目標を再構成します。
続きを読むMage-VL は、動画圧縮に含まれる運動ベクトルや残差信号を視覚トークン化に活用する、ストリーミング向けのマルチモーダル基盤モデルです。全フレームを一様に処理するのではなく、変化が大きく情報量の高い領域に計算を集中させます。
続きを読むClinFusion は、医療向け MLLM の本質的課題を「どれだけ正確に見られるか」と捉える。2D とネイティブ 3D 医療画像の統合理解に加え、放射線科の実務に近い評価を重視している。
続きを読むVisCo は、視覚言語モデルの内部表現能力をそのまま圧縮器として使う視覚 Token 圧縮フレームワークです。外部モジュールを追加するのではなく、少数の memory tokens に画像情報を集約します。
続きを読むTencent Hunyuan の論文は、固定計算予算の下で原生マルチモーダル事前学習をどう拡張すべきかを検証している。言語目標とマルチモーダル目標では、最適な資源配分の振る舞いが異なるという点が重要だ。
続きを読む