記事とガイド

視覚・動画

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 35 件の記事

CCTest · Blog
Luce、1枚の画像から再照明可能な3Dアセットを生成
視覚・動画
cctest.ai
視覚・動画

Luce、1枚の画像から再照明可能な3Dアセットを生成

Luceは、形状とPBRマテリアルを統合したマルチモーダルGaussian表現を提案し、1枚の画像から再照明可能な3Dアセットを生成します。PBR Gaussianに加え、テクスチャ付きメッシュと接線空間法線マップも任意で出力できます。

続きを読む
CCTest · Blog
高徳がABot-Reconを公開、12フレームで万フレーム級の3D再構築
視覚・動画
cctest.ai
視覚・動画

高徳がABot-Reconを公開、12フレームで万フレーム級の3D再構築

高徳は、直近12フレームの局所コンテキストだけを使って長い映像から3Dシーンを逐次再構築するモデル「ABot-Recon」を発表した。長期記憶への依存を避け、誤差の蓄積や推論速度の低下、メモリ使用量の増大に対応する設計を採用している。

続きを読む
CCTest · Blog
SparsePR、分割と残差再構成で動画生成の注意機構を高速化
視覚・動画
cctest.ai
視覚・動画

SparsePR、分割と残差再構成で動画生成の注意機構を高速化

SparsePRは、再学習を必要としない動画生成・世界モデル向けの疎注意手法です。応答結合型パーティショニングとプローブ適合型残差再構成を組み合わせ、品質を保ちながら実行する注意計算を削減します。

続きを読む
CCTest · Blog
InfinityEdit、固定動画から無限ストリーム編集へ
視覚・動画
cctest.ai
視覚・動画

InfinityEdit、固定動画から無限ストリーム編集へ

InfinityEdit は、完成済みの短い動画を逐次書き換えるのではなく、編集指示を受けながら未来の映像セグメントを生成する手法です。履歴、時間的因果性、編集テキストを扱う軽量アダプターによって、ストリーミング動画生成への編集機能の追加を目指します。

続きを読む
CCTest · Blog
4DAnyone:身近な単眼動画から動的な4D人物を再構成
視覚・動画
cctest.ai
視覚・動画

4DAnyone:身近な単眼動画から動的な4D人物を再構成

4DAnyoneは、キャリブレーションされていない単眼の人物動画から、多視点間で一貫した動画を生成し、それを4D Gaussian Splattingへ変換する手法です。増え続ける参照情報と、分割された視点グループ間の不整合を、二つのコンテキスト設計で抑えます。

続きを読む
CCTest · Blog
InfiniSplat:単一画像 3DGS を表面整合型の表現へ近づける新手法
視覚・動画
cctest.ai
視覚・動画

InfiniSplat:単一画像 3DGS を表面整合型の表現へ近づける新手法

InfiniSplat は、1 枚の画像から大きな視点変化に耐える新規視点合成を目指す 3D Gaussian Splatting フレームワークです。固定ピクセル格子に依存せず、幾何に基づくサンプリングと暗黙的なガウス復号を組み合わせます。

続きを読む
CCTest · Blog
形態を超える動画モーション転写:MBM が固定対応からの脱却を提案
視覚・動画
cctest.ai
視覚・動画

形態を超える動画モーション転写:MBM が固定対応からの脱却を提案

Motion Beyond Morphology(MBM)は、参照動画と対象物の形態が大きく異なる場合でも、意味のある動きを転写するための新しい枠組みを提案する。固定的な骨格・部品対応ではなく、抽象的な運動表現に注目する点が特徴だ。

続きを読む
CCTest · Blog
3DarkFusion:暗闇での RGB-NIR 画像復元に 3D-aware モデリングを導入
視覚・動画
cctest.ai
視覚・動画

3DarkFusion:暗闇での RGB-NIR 画像復元に 3D-aware モデリングを導入

新論文は、極端にノイズの多い RGB 観測と近赤外(NIR)情報を 3D 空間で融合する 3DarkFusion を提案している。クリーンな RGB 教師データを使わずに、低照度下のカラー画像復元を目指す点が特徴だ。

続きを読む
CCTest · Blog
VideoCoCo:Blenderコードを動画生成の「過程推論」に使う新アプローチ
視覚・動画
cctest.ai
視覚・動画

VideoCoCo:Blenderコードを動画生成の「過程推論」に使う新アプローチ

VideoCoCo は、テキストプロンプトから実行可能な Blender プログラムを生成し、そのシミュレーション草案を写実的な動画へ変換する二段構えの枠組みです。狙いは、テキスト動画生成における物理的一貫性の弱点を補うことにあります。

続きを読む
CCTest · Blog
O-VAD:工業動画の異常検知を「動画全体」から「物体ごとの状態推論」へ
視覚・動画
cctest.ai
視覚・動画

O-VAD:工業動画の異常検知を「動画全体」から「物体ごとの状態推論」へ

O-VAD は、工業プロセスの動画における異常を、物体の分割・追跡・状態軌跡の推論によって検出する学習不要のフレームワークです。前線の VLM が工業領域で苦戦する理由を、物体レベルの証拠不足として捉えています。

続きを読む
CCTest · Blog
生成動画に「再訪の記憶」を与える:学習不要の一貫性改善手法
視覚・動画
cctest.ai
視覚・動画

生成動画に「再訪の記憶」を与える:学習不要の一貫性改善手法

この論文は、3D 条件付きの長尺動画生成で起きる再訪時の見た目の不一致に注目する。過去の潜在表現を KV cache に戻し、深度とカメラ姿勢による幾何対応で注意機構を導くことで、追加学習なしに一貫性を高める。

続きを読む
CCTest · Blog
SANA-Video 2.0:混合注意機構で高解像度動画生成を高速化
視覚・動画
cctest.ai
視覚・動画

SANA-Video 2.0:混合注意機構で高解像度動画生成を高速化

SANA-Video 2.0 は、線形注意の効率性と softmax 注意の表現力を組み合わせた動画拡散 Transformer です。論文では、単一 H100 上で 720p までの高品質動画生成を狙い、長い動画ほど速度面の利点が広がると報告されています。

続きを読む
CCTest · Blog
Self Gradient Forcing:長尺動画生成の「記憶の書き込み」を訓練する
視覚・動画
cctest.ai
視覚・動画

Self Gradient Forcing:長尺動画生成の「記憶の書き込み」を訓練する

Self Gradient Forcing は、自回帰型動画拡散モデルで見落とされがちな履歴コンテキストの勾配不足に焦点を当てる手法です。未来フレームの損失を、過去に生成した潜在表現をより有用な KV メモリへ書き込む学習信号として使います。

続きを読む
CCTest · Blog
FlowMimic:画像編集データから動画編集を学ぶ新しい枠組み
視覚・動画
cctest.ai
視覚・動画

FlowMimic:画像編集データから動画編集を学ぶ新しい枠組み

FlowMimic は、動画編集データの収集コストとタスクの狭さという課題に向き合う研究です。画像編集サンプルをリアルタイムで動画編集サンプルへ変換し、画像と動画の能力を相互模倣で近づけます。

続きを読む