記事一覧へ戻る
マルチモーダル

DeepSeek、V4シリーズ初の公式ビジョン実験モデルを公開

読了目安 3 分

概要

DeepSeekは、V4シリーズをテキスト推論やコード生成だけでなく、視覚を扱うAgent基盤へ広げようとしている。今回、APIプラットフォームで deepseek-v4-flash-vision-exp の提供を開始した。V4シリーズが公式APIで画像入力を明確に開放するのは初めてであり、開発者は画像をテキストと同じリクエストに含め、Agentや自動化、コーディングツールへ組み込めるようになる。

主なポイント

  • 公式の画像入力に対応:画像とテキストを組み合わせた入力を扱える。
  • 複数の画像送信方法を用意:base64のインライン入力、外部URL、Files APIに対応する。
  • 3種類のAPI形式を利用可能:Chat Completions、Messages、Responsesをサポートする。
  • 画像はトークンとして課金:1枚あたり最大384トークンで、料金はV4-Flashと同じ体系だ。
  • Agent関連の評価が多数改善:V4-Flash-0731と比べ、7項目中5項目が向上し、1項目は小幅に低下した。

評価結果を見る限り、Vision-Expは既存の言語モデルに視覚エンコーダーを単純に追加しただけではない可能性がある。Toolathlon-Verifiedは70.3から75.9へ、DeepSWEは54.4から59.3へ上昇した。これらはツール利用、実際のコードベースの修正、長時間にわたるタスク実行と関係する評価だ。そのため、外部環境の理解、タスク分解、ツール連携といったAgent能力にも調整が加えられたと考えられる。

ほかにも、Terminal Bench 2.1は82.7から83.9、NL2Repoは54.2から57.7、DSBench-Hardは59.6から63.6、AutomationBenchは25.1から25.7へ改善した。一方、Cybergymは76.7から75.3へ1.4ポイント低下しており、すべての課題で一方向に性能が伸びたわけではない。

意味と影響

開発者にとって最も大きい意味は、マルチモーダルAgentを構築する際の接続が簡単になることだ。画面キャプチャの分析、UI理解、文書確認、視覚を利用したプログラミングなどを、別の画像モデルと組み合わせず、同じAPIの枠組みで試せる。画像のトークン上限と料金体系が示されたことで、導入時のコストも見積もりやすくなった。

ただし、Opus 4.8との比較は慎重に読む必要がある。Vision-ExpはDeepSWEで59.3となり、Opus 4.8の58.0を上回った。Toolathlonでも75.9と、Opusとの差は0.3ポイントにとどまる。しかしNL2Repoでは12ポイント、DSBench-Hardでは8.1ポイント下回っている。現時点では、全般的な優位というより、主要モデルに近づき、一部のコードAgent課題で競争力を示したと見るのが妥当だろう。

名称に残る「Exp」も重要な注意点だ。複雑な画像への対応精度、サービスの安定性、実運用コストは、今後の検証が必要になる。それでも今回の公開は、DeepSeek V4がマルチモーダル能力を補い、視覚理解とAgent実行を同じ製品経路に載せたという点で意味がある。

InfoQ 中文

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
Kandinsky 6.0 Video、映像・音声・リップシンクを同時生成
マルチモーダル
cctest.ai
マルチモーダル

Kandinsky 6.0 Video、映像・音声・リップシンクを同時生成

Kandinsky 6.0 Videoは、テキストまたは画像から、44 kHz音声とリップシンクを備えた約5秒の動画を生成するモデル群です。動画ストリームと音声ストリームを双方向に接続するCrossDiTにより、映像と音の時間的・意味的な整合を狙います。

続きを読む
CCTest · Blog
OmniConfess、多モーダルモデルが幻覚を生む根拠をトークン単位で追跡
マルチモーダル
cctest.ai
マルチモーダル

OmniConfess、多モーダルモデルが幻覚を生む根拠をトークン単位で追跡

OmniConfessは再学習を必要とせず、テキスト・画像・音声・動画の各証拠チャネルが回答のどのトークンを支えているかを調べ、信頼性の低い主張を修正する推論時手法です。

続きを読む
CCTest · Blog
Multimodal Flow、言語と視覚を一つの連続生成プロセスで統合
マルチモーダル
cctest.ai
マルチモーダル

Multimodal Flow、言語と視覚を一つの連続生成プロセスで統合

HUST Vision Lab は、言語と画像を同じ連続空間で扱う Multimodal Flow を提案した。画像を離散トークンへ量子化せず、連続ハイパーチャンクと共有 Flow Matching バックボーンで両モダリティを統一的にモデル化する。

続きを読む