記事とガイド

マルチモーダル

Claude API 中継局のガイド、検出の仕組み、LLM API の実測ノウハウ

全 34 件の記事

CCTest · Blog
「見る」から「行動する」へ:一人称知能プラットフォームとしてのスマートグラス
マルチモーダル
cctest.ai
マルチモーダル

「見る」から「行動する」へ:一人称知能プラットフォームとしてのスマートグラス

新たなサーベイは、スマートグラスを単なるカメラやディスプレイではなく、一人称知能の基盤として捉え直す。重要なのは、知覚から行動までのループを、現実の制約下で信頼性と制御可能性を保ちながら維持できるかどうかだ。

続きを読む
CCTest · Blog
LAION-BVD、マルチモーダル学習向けに1000万時間の公開動画を提供
マルチモーダル
cctest.ai
マルチモーダル

LAION-BVD、マルチモーダル学習向けに1000万時間の公開動画を提供

LAION-BVDは、ウェブから収集した動画URLを基に、約8000万本、総計1000万時間の動画をまとめた公開データセットです。シーン分割、合成キャプション、場面転換フレームの抽出により、動画・音声・画像の事前学習を支援します。

続きを読む
CCTest · Blog
DeepSeek、V4シリーズ初の公式ビジョン実験モデルを公開
マルチモーダル
cctest.ai
マルチモーダル

DeepSeek、V4シリーズ初の公式ビジョン実験モデルを公開

DeepSeekはAPIプラットフォームでdeepseek-v4-flash-vision-expを公開し、V4シリーズとして初めて公式に画像入力へ対応した。ツール利用やコーディングAgent関連の評価でも、複数の指標が向上している。

続きを読む
CCTest · Blog
DeepSeek V4-Flashに視覚機能、マルチモーダルAgentへ前進
マルチモーダル
cctest.ai
マルチモーダル

DeepSeek V4-Flashに視覚機能、マルチモーダルAgentへ前進

DeepSeekは、V4-Flashに視覚機能を加えた実験版「DeepSeek-V4-Flash-Vision-Exp」を公開しました。指定されたモデルIDを通じてAPIから利用でき、テキスト能力を維持したまま画像理解を強化する位置付けです。

続きを読む
CCTest · Blog
DeepSeek Harness v0.1.0-rc.8、エージェント作業に画像入力を導入
マルチモーダル
cctest.ai
マルチモーダル

DeepSeek Harness v0.1.0-rc.8、エージェント作業に画像入力を導入

公開ベータ開始から1週間で、DeepSeek Harnessがv0.1.0-rc.8を公開した。ネイティブ画像リクエストとテキスト・画像の混在入力に加え、サブエージェント、Windowsの永続PowerShell、デフォルトの簡易モードを追加している。

続きを読む
CCTest · Blog
MOSS-VL、話しながら見続けるリアルタイムVLMを設計
マルチモーダル
cctest.ai
マルチモーダル

MOSS-VL、話しながら見続けるリアルタイムVLMを設計

MOSS-VLは、視覚言語モデルに「話している間も見続ける」能力を組み込むことを目指したオープンモデル群です。ゲート付きクロスアテンション、対話行動を学ぶデータ、段階的な訓練によって、ストリーミング環境への対応を設計段階から行っています。

続きを読む
CCTest · Blog
SPARGen:3D再構成・密な対応付け・空間推論を統合するマルチモーダル生成モデル
マルチモーダル
cctest.ai
マルチモーダル

SPARGen:3D再構成・密な対応付け・空間推論を統合するマルチモーダル生成モデル

SPARGen は、空間理解に関わる複数のタスクを、指示条件付きの生成問題として統一する枠組みだ。個別モジュールではなく、同一のネイティブなマルチモーダル生成モデルで空間表現を学習する点に特徴がある。

続きを読む
CCTest · Blog
UniSwap:顔と声の置き換えを一つのストリーミングモデルへ
マルチモーダル
cctest.ai
マルチモーダル

UniSwap:顔と声の置き換えを一つのストリーミングモデルへ

UniSwap は、話者動画における外見と声質の同時置き換えを目指す音声・映像統合フレームワークです。別々のモデルを後段でつなぐのではなく、単一の音声映像拡散 Transformer 内で両方を扱います。

続きを読む
CCTest · Blog
Evidence-RL:VLMに「画像証拠にもとづく回答」を促す新手法
マルチモーダル
cctest.ai
マルチモーダル

Evidence-RL:VLMに「画像証拠にもとづく回答」を促す新手法

Evidence-RL は、視覚言語モデルが正答していても、その根拠が本当に画像内の証拠にあるのかを問い直す研究です。CED により、局所的な視覚証拠と回答の因果的な依存関係を訓練時に監査します。

続きを読む
CCTest · Blog
画像編集AIは「次に何を直すか」を画像を見て提案する段階へ
マルチモーダル
cctest.ai
マルチモーダル

画像編集AIは「次に何を直すか」を画像を見て提案する段階へ

画像生成チャットにおける次の編集提案は、会話テキストだけでなく現在の画像に基づく必要がある。論文は、実利用データ、クリックフィードバック、視覚検証器を組み合わせた三段階フレームワークを提案している。

続きを読む
CCTest · Blog
マルチモーダル事前学習の仕組みを整理する:知識の流れ、協調、早期統合
マルチモーダル
cctest.ai
マルチモーダル

マルチモーダル事前学習の仕組みを整理する:知識の流れ、協調、早期統合

この研究は、単なるモデル提案ではなく、統合型マルチモーダル事前学習の内部で何が起きているかを実験的に整理したものです。知識の流れ、モダリティ間の協調、早期統合、効率的な学習レシピの4点が柱です。

続きを読む
CCTest · Blog
VAD:マルチモーダル蒸留で教師の補正から視覚証拠を切り出す
マルチモーダル
cctest.ai
マルチモーダル

VAD:マルチモーダル蒸留で教師の補正から視覚証拠を切り出す

VAD は、マルチモーダル on-policy 蒸留における教師モデルの補正が、本当に画像証拠に基づいているのかを推定する手法です。教師の出力をそのまま模倣するのではなく、視覚的に帰属できる成分から学生モデルの学習目標を再構成します。

続きを読む
CCTest · Blog
Mage-VL:リアルタイム動画理解に向けたコーデックネイティブなマルチモーダルモデル
マルチモーダル
cctest.ai
マルチモーダル

Mage-VL:リアルタイム動画理解に向けたコーデックネイティブなマルチモーダルモデル

Mage-VL は、動画圧縮に含まれる運動ベクトルや残差信号を視覚トークン化に活用する、ストリーミング向けのマルチモーダル基盤モデルです。全フレームを一様に処理するのではなく、変化が大きく情報量の高い領域に計算を集中させます。

続きを読む
CCTest · Blog
原生マルチモーダル事前学習に Scaling Law を適用する研究
マルチモーダル
cctest.ai
マルチモーダル

原生マルチモーダル事前学習に Scaling Law を適用する研究

Tencent Hunyuan の論文は、固定計算予算の下で原生マルチモーダル事前学習をどう拡張すべきかを検証している。言語目標とマルチモーダル目標では、最適な資源配分の振る舞いが異なるという点が重要だ。

続きを読む