記事とガイド

視覚・動画

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 39 件の記事

CCTest · Blog
ShallowStream:浅い層で索引を作り、深い層で動画を理解する
視覚・動画
cctest.ai
視覚・動画

ShallowStream:浅い層で索引を作り、深い層で動画を理解する

ShallowStreamは、MLLMの浅い層を使ってストリーミング動画の符号化と検索用インデックスの構築を行い、質問時だけ深い層を活用します。論文では、フレーム単位のプリフィル遅延を最大52.1倍、10秒間のエンドツーエンド遅延を最大11.9倍削減したと報告しています。

続きを読む
CCTest · Blog
GeminiにAgentic Video Understanding、動画の「見る場所」を自律判断
視覚・動画
cctest.ai
視覚・動画

GeminiにAgentic Video Understanding、動画の「見る場所」を自律判断

Google DeepMindは、Geminiが動画内の必要な区間を動的に検索・再確認できるAgentic Video Understandingを発表しました。公式ベンチマークでは、トークン使用量を最大88%、分析コストを最大66%削減し、精度を最大7%高めたとしています。

続きを読む
CCTest · Blog
Luce、1枚の画像から再照明可能な3Dアセットを生成
視覚・動画
cctest.ai
視覚・動画

Luce、1枚の画像から再照明可能な3Dアセットを生成

Luceは、形状とPBRマテリアルを統合したマルチモーダルGaussian表現を提案し、1枚の画像から再照明可能な3Dアセットを生成します。PBR Gaussianに加え、テクスチャ付きメッシュと接線空間法線マップも任意で出力できます。

続きを読む
CCTest · Blog
高徳がABot-Reconを公開、12フレームで万フレーム級の3D再構築
視覚・動画
cctest.ai
視覚・動画

高徳がABot-Reconを公開、12フレームで万フレーム級の3D再構築

高徳は、直近12フレームの局所コンテキストだけを使って長い映像から3Dシーンを逐次再構築するモデル「ABot-Recon」を発表した。長期記憶への依存を避け、誤差の蓄積や推論速度の低下、メモリ使用量の増大に対応する設計を採用している。

続きを読む
CCTest · Blog
SparsePR、分割と残差再構成で動画生成の注意機構を高速化
視覚・動画
cctest.ai
視覚・動画

SparsePR、分割と残差再構成で動画生成の注意機構を高速化

SparsePRは、再学習を必要としない動画生成・世界モデル向けの疎注意手法です。応答結合型パーティショニングとプローブ適合型残差再構成を組み合わせ、品質を保ちながら実行する注意計算を削減します。

続きを読む
CCTest · Blog
InfinityEdit、固定動画から無限ストリーム編集へ
視覚・動画
cctest.ai
視覚・動画

InfinityEdit、固定動画から無限ストリーム編集へ

InfinityEdit は、完成済みの短い動画を逐次書き換えるのではなく、編集指示を受けながら未来の映像セグメントを生成する手法です。履歴、時間的因果性、編集テキストを扱う軽量アダプターによって、ストリーミング動画生成への編集機能の追加を目指します。

続きを読む
CCTest · Blog
4DAnyone:身近な単眼動画から動的な4D人物を再構成
視覚・動画
cctest.ai
視覚・動画

4DAnyone:身近な単眼動画から動的な4D人物を再構成

4DAnyoneは、キャリブレーションされていない単眼の人物動画から、多視点間で一貫した動画を生成し、それを4D Gaussian Splattingへ変換する手法です。増え続ける参照情報と、分割された視点グループ間の不整合を、二つのコンテキスト設計で抑えます。

続きを読む
CCTest · Blog
InfiniSplat:単一画像 3DGS を表面整合型の表現へ近づける新手法
視覚・動画
cctest.ai
視覚・動画

InfiniSplat:単一画像 3DGS を表面整合型の表現へ近づける新手法

InfiniSplat は、1 枚の画像から大きな視点変化に耐える新規視点合成を目指す 3D Gaussian Splatting フレームワークです。固定ピクセル格子に依存せず、幾何に基づくサンプリングと暗黙的なガウス復号を組み合わせます。

続きを読む
CCTest · Blog
形態を超える動画モーション転写:MBM が固定対応からの脱却を提案
視覚・動画
cctest.ai
視覚・動画

形態を超える動画モーション転写:MBM が固定対応からの脱却を提案

Motion Beyond Morphology(MBM)は、参照動画と対象物の形態が大きく異なる場合でも、意味のある動きを転写するための新しい枠組みを提案する。固定的な骨格・部品対応ではなく、抽象的な運動表現に注目する点が特徴だ。

続きを読む
CCTest · Blog
3DarkFusion:暗闇での RGB-NIR 画像復元に 3D-aware モデリングを導入
視覚・動画
cctest.ai
視覚・動画

3DarkFusion:暗闇での RGB-NIR 画像復元に 3D-aware モデリングを導入

新論文は、極端にノイズの多い RGB 観測と近赤外(NIR)情報を 3D 空間で融合する 3DarkFusion を提案している。クリーンな RGB 教師データを使わずに、低照度下のカラー画像復元を目指す点が特徴だ。

続きを読む
CCTest · Blog
VideoCoCo:Blenderコードを動画生成の「過程推論」に使う新アプローチ
視覚・動画
cctest.ai
視覚・動画

VideoCoCo:Blenderコードを動画生成の「過程推論」に使う新アプローチ

VideoCoCo は、テキストプロンプトから実行可能な Blender プログラムを生成し、そのシミュレーション草案を写実的な動画へ変換する二段構えの枠組みです。狙いは、テキスト動画生成における物理的一貫性の弱点を補うことにあります。

続きを読む
CCTest · Blog
O-VAD:工業動画の異常検知を「動画全体」から「物体ごとの状態推論」へ
視覚・動画
cctest.ai
視覚・動画

O-VAD:工業動画の異常検知を「動画全体」から「物体ごとの状態推論」へ

O-VAD は、工業プロセスの動画における異常を、物体の分割・追跡・状態軌跡の推論によって検出する学習不要のフレームワークです。前線の VLM が工業領域で苦戦する理由を、物体レベルの証拠不足として捉えています。

続きを読む
CCTest · Blog
生成動画に「再訪の記憶」を与える:学習不要の一貫性改善手法
視覚・動画
cctest.ai
視覚・動画

生成動画に「再訪の記憶」を与える:学習不要の一貫性改善手法

この論文は、3D 条件付きの長尺動画生成で起きる再訪時の見た目の不一致に注目する。過去の潜在表現を KV cache に戻し、深度とカメラ姿勢による幾何対応で注意機構を導くことで、追加学習なしに一貫性を高める。

続きを読む