EditBridge、原画像に忠実な4K拡散画像編集を実現
EditBridgeは、超高解像度画像編集向けの拡散ブリッジを提案する。低解像度で編集した結果を独立した超解像モデルに任せるのではなく、元の高解像度画像を参照して細部を復元し、計算量も抑える。
続きを読むEditBridgeは、超高解像度画像編集向けの拡散ブリッジを提案する。低解像度で編集した結果を独立した超解像モデルに任せるのではなく、元の高解像度画像を参照して細部を復元し、計算量も抑える。
続きを読むDiffusionGemma は、テキストを1トークンずつ生成するのではなく、256トークンのブロックを並列に反復修正する実験的なオープンウェイト言語モデルです。Gemma 4 を微調整して作られ、速度と能力の新しいバランスを狙っています。
続きを読むこの論文は、画像生成におけるプロンプトの長さではなく、構造化された言語情報が拡散モデルの学習損失にどう関係するかを調べている。著者らはその知見を使い、構造化プロンプトと専用 prompter による生成性能の改善を試みた。
続きを読むExplorative Modeling は、生成結果とデータの対応を複数探索し、最良の候補から学習する新しい生成モデリング手法です。論文は、探索量がパラメータ数・データ量に続く第3の事前学習スケーリング軸になり得ると主張しています。
続きを読むChimera は、高解像度画像や長尺動画の生成で問題になる全注意機構の計算コストを抑えるための、ハイブリッド型視覚拡散バックボーンです。KDA、MLA、短い畳み込み、疎な MoE、そして HeteroP というスケーリング手法を組み合わせています。
続きを読むParallel Decoding Distillation(PDD)は、拡散モデルやフローマッチングモデルの反復サンプリングを減らし、少ないネットワーク評価で高品質な生成を目指す手法です。
続きを読むTBSMは、GANの識別器や拡散モデルの固定されたノイズ除去経路に頼らず、生成サンプルが実データ分布へどう動くべきかを直接学習する枠組みです。
続きを読むソニーの研究チームは、拡散モデルとフローマッチングモデルの推論時誤差を周波数領域で補正する Spectral Alignment(SPA)を提案した。事前に学習したスペクトル先験を使い、中間予測のパワースペクトルを軽量に校正する。
続きを読むこの論文は、拡散言語モデルが明示的な時間ステップなしに、内部でノイズ除去の進行度を表現しているかを検証している。残差ストリームから、時間に対応する潜在信号を読み取れることが示された。
続きを読む新しい研究は、文生画像 Diffusion Transformer における構造的なテキストテンプレートトークンが、単なる飾りではないことを示した。生成中に物体の同一性を保つ暗黙的な意味レジスタとして働くという。
続きを読むMage-Flow は、画像生成モデルの競争力を単純な巨大化ではなく、トークナイザー、バックボーン、学習システムの共同設計で高めようとする取り組みだ。4B規模でテキスト画像生成と指示ベース編集の両方を扱う。
続きを読むDiFA は、拡散モデルの推論時に得られる過去の予測を相関のある観測として扱う、再学習不要のフレームワークです。前向き拡散過程に沿った時間的コンセンサスにより、生成の安定性と細部表現の改善を狙います。
続きを読むDiffGI は、衣服のような薄い殻状・非多様体の 3D 形状を、従来の体積表現ではなく表面中心の 2D ジオメトリ画像として扱う手法です。連続 2D TSDF と可微分 Marching Squares により、2D 潜在空間と 3D 表面損失を直接つなげます。
続きを読むToken Time Continuous Diffusion(TTCD)は、連続空間で動作し、トークンごとに異なる生成時間を導入する拡散型言語モデルです。高速生成時の品質低下を抑え、条件付き生成での改善を狙います。
続きを読むこのサーベイは、離散拡散モデルを「離散状態空間をどう作るか」という観点から整理する。トークン化、語彙の構造、領域固有のアルファベットが、破壊過程から生成品質までを左右するという主張だ。
続きを読むarXiv に投稿された論文は、自動運転向けの天候編集フレームワーク Cyclone を提案している。潜在拡散モデル、循環一貫性制約、画像テキストモデルの知識を組み合わせ、ペアデータなしで多様な天候変換を行う点が特徴だ。
続きを読むarXiv の新論文は、重い裾を持つデータをランダムクロックで条件付けられたガウス混合として扱う HTFM を提案している。希少事象、ロングテール画像、気象場などをより自然に生成することを狙う手法だ。
続きを読むTCAM-Diff は、高解像度 3D 医用画像を直接ボクセル空間で扱う代わりに、三平面表現へ圧縮して拡散モデルで生成する手法だ。事前学習済みデコーダにより、生成特徴を 3D ボリュームへ高速に戻す構成を取る。
続きを読む