記事とガイド

視覚・動画

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 35 件の記事

CCTest · Blog
TimeLens2:動画MLLMに「根拠がいつ起きたか」を示させる
視覚・動画
cctest.ai
視覚・動画

TimeLens2:動画MLLMに「根拠がいつ起きたか」を示させる

TimeLens2 は、動画の時間的グラウンディングを可変数の区間集合として扱い、モデルが出来事だけでなく根拠となる時間帯も示せるようにする研究です。2B、4B、8B の各モデルは Qwen3-VL バックボーンから大きな改善を示しています。

続きを読む
CCTest · Blog
REBASE:背景の影響を消して、学習なしのインコンテキスト分割を改善
視覚・動画
cctest.ai
視覚・動画

REBASE:背景の影響を消して、学習なしのインコンテキスト分割を改善

REBASE は、1枚の注釈付き参照画像から新しい対象を分割する training-free な手法です。参照画像の背景特徴サブスペースを取り除くことで、背景に引きずられた誤った類似度を抑えます。

続きを読む
CCTest · Blog
VideoChat3:汎用動画理解に向けた完全オープンな動画 MLLM
視覚・動画
cctest.ai
視覚・動画

VideoChat3:汎用動画理解に向けた完全オープンな動画 MLLM

VideoChat3 は、オープンソース動画 MLLM の課題である汎化性能、計算コスト、公開範囲の不十分さに取り組むモデルです。4B パラメータ規模で、一般動画、長尺動画、ストリーミング動画を横断する理解能力を狙います。

続きを読む
CCTest · Blog
進化し続けるディープフェイク検出へ:BMF の公開ベンチマーク評価
視覚・動画
cctest.ai
視覚・動画

進化し続けるディープフェイク検出へ:BMF の公開ベンチマーク評価

arXiv 論文は、訓練分布を継続的に更新するディープフェイク検出システム BitMind Forensics を提案している。19 の公開データセットでの評価では、実環境画像、動画、AI 生成メディアに対して静的なオープンソース検出器を大きく上回る結果が報告された。

続きを読む
CCTest · Blog
低リソース満洲語OCRを支えるマルチエキスパート・ルーティング
視覚・動画
cctest.ai
視覚・動画

低リソース満洲語OCRを支えるマルチエキスパート・ルーティング

arXiv の新論文は、満洲語歴史文献の OCR を対象に、視覚スタイルごとに専門モデルへ振り分けるマルチエキスパート方式を検討している。軽量なページ単位分類器が、正書・行書・奏折の半草体を判別する。

続きを読む
CCTest · Blog
VisionScreen:視覚認識に「スクリーニング」を導入する新しい ViT 代替案
視覚・動画
cctest.ai
視覚・動画

VisionScreen:視覚認識に「スクリーニング」を導入する新しい ViT 代替案

arXiv 論文は、言語モデリングで提案された Screening 機構を視覚認識へ拡張する VisionScreen を提案している。すべての画像パッチに相対的な重みを与えるのではなく、関連性の低いパッチを明示的に除外する点が特徴だ。

続きを読む
CCTest · Blog
「原子的な動き」で音楽からダンスを生成する新手法
視覚・動画
cctest.ai
視覚・動画

「原子的な動き」で音楽からダンスを生成する新手法

arXiv の新論文は、ダンスを連続的な姿勢列としてだけでなく、意味を持つ「原子的な動き」の系列として扱う生成フレームワークを提案している。音楽に合わせた構造計画と動作補完を分ける点が特徴だ。

続きを読む
CCTest · Blog
Peak-End-Net:ピーク・エンドの法則で動画美学評価を見直す
視覚・動画
cctest.ai
視覚・動画

Peak-End-Net:ピーク・エンドの法則で動画美学評価を見直す

arXiv に掲載された論文は、心理学の「ピーク・エンドの法則」に着想を得た動画美学評価フレームワーク Peak-End-Net を提案している。モデルは動画全体を均等に扱うのではなく、印象的な瞬間と終わり方に注目する。

続きを読む
CCTest · Blog
TCA-Net:低照度画像強調における輝度・色度融合を見直す
視覚・動画
cctest.ai
視覚・動画

TCA-Net:低照度画像強調における輝度・色度融合を見直す

arXiv に投稿された新論文は、低照度画像強調で輝度ストリームと色度ストリームをどのように再融合するかに注目する。TCA-Net は固定 Top-K ではなく、信頼度しきい値に基づくクロスアテンションを中核に据える。

続きを読む
CCTest · Blog
PiVoT:重いクラッタ下のレーダー点群をリアルタイム追跡する変分推論手法
視覚・動画
cctest.ai
視覚・動画

PiVoT:重いクラッタ下のレーダー点群をリアルタイム追跡する変分推論手法

PiVoT は、ノイズの多いレーダー点群に対して、学習不要で多物体検出と追跡を同時に行う手法として提案された。外部のクラスタリングや検出器に頼らず、位置情報とドップラー計測を扱う点が特徴だ。

続きを読む
CCTest · Blog
高周波テクスチャをアトラスに焼き込む高速 3D Gaussian Splatting 手法
視覚・動画
cctest.ai
視覚・動画

高周波テクスチャをアトラスに焼き込む高速 3D Gaussian Splatting 手法

arXiv の新論文は、高周波の視点非依存テクスチャをコンパクトなテクスチャアトラスへ焼き込む Spatial Texture-Atlas Splatting を提案した。著者らは、3DGS に対して最大 5 倍の高速化を実現し、消費者向けハードウェアで 4K 60FPS のリアルタイム描画が可能だとしている。

続きを読む
CCTest · Blog
RainDancer:RGB-Event 融合とスパイキング動態で動画の雨除去を強化
視覚・動画
cctest.ai
視覚・動画

RainDancer:RGB-Event 融合とスパイキング動態で動画の雨除去を強化

RainDancer は、RGB 動画とイベントカメラの手掛かりを組み合わせる雨除去フレームワークです。単純な融合ではなく、各モダリティ内で雨と背景を分解してから相互作用させる点が特徴です。

続きを読む