記事一覧へ戻る
マルチモーダル

DeepSeek、V4シリーズ初の公式ビジョン実験モデルを公開

読了目安 3 分

概要

DeepSeekは、V4シリーズをテキスト推論やコード生成だけでなく、視覚を扱うAgent基盤へ広げようとしている。今回、APIプラットフォームで deepseek-v4-flash-vision-exp の提供を開始した。V4シリーズが公式APIで画像入力を明確に開放するのは初めてであり、開発者は画像をテキストと同じリクエストに含め、Agentや自動化、コーディングツールへ組み込めるようになる。

主なポイント

  • 公式の画像入力に対応:画像とテキストを組み合わせた入力を扱える。
  • 複数の画像送信方法を用意:base64のインライン入力、外部URL、Files APIに対応する。
  • 3種類のAPI形式を利用可能:Chat Completions、Messages、Responsesをサポートする。
  • 画像はトークンとして課金:1枚あたり最大384トークンで、料金はV4-Flashと同じ体系だ。
  • Agent関連の評価が多数改善:V4-Flash-0731と比べ、7項目中5項目が向上し、1項目は小幅に低下した。

評価結果を見る限り、Vision-Expは既存の言語モデルに視覚エンコーダーを単純に追加しただけではない可能性がある。Toolathlon-Verifiedは70.3から75.9へ、DeepSWEは54.4から59.3へ上昇した。これらはツール利用、実際のコードベースの修正、長時間にわたるタスク実行と関係する評価だ。そのため、外部環境の理解、タスク分解、ツール連携といったAgent能力にも調整が加えられたと考えられる。

ほかにも、Terminal Bench 2.1は82.7から83.9、NL2Repoは54.2から57.7、DSBench-Hardは59.6から63.6、AutomationBenchは25.1から25.7へ改善した。一方、Cybergymは76.7から75.3へ1.4ポイント低下しており、すべての課題で一方向に性能が伸びたわけではない。

意味と影響

開発者にとって最も大きい意味は、マルチモーダルAgentを構築する際の接続が簡単になることだ。画面キャプチャの分析、UI理解、文書確認、視覚を利用したプログラミングなどを、別の画像モデルと組み合わせず、同じAPIの枠組みで試せる。画像のトークン上限と料金体系が示されたことで、導入時のコストも見積もりやすくなった。

ただし、Opus 4.8との比較は慎重に読む必要がある。Vision-ExpはDeepSWEで59.3となり、Opus 4.8の58.0を上回った。Toolathlonでも75.9と、Opusとの差は0.3ポイントにとどまる。しかしNL2Repoでは12ポイント、DSBench-Hardでは8.1ポイント下回っている。現時点では、全般的な優位というより、主要モデルに近づき、一部のコードAgent課題で競争力を示したと見るのが妥当だろう。

名称に残る「Exp」も重要な注意点だ。複雑な画像への対応精度、サービスの安定性、実運用コストは、今後の検証が必要になる。それでも今回の公開は、DeepSeek V4がマルチモーダル能力を補い、視覚理解とAgent実行を同じ製品経路に載せたという点で意味がある。

InfoQ 中文

コメント

ログイン状態を確認中…

コメントを読み込み中…

関連記事

CCTest · Blog
DeepSeek V4-Flashに視覚機能、マルチモーダルAgentへ前進
マルチモーダル
cctest.ai
マルチモーダル

DeepSeek V4-Flashに視覚機能、マルチモーダルAgentへ前進

DeepSeekは、V4-Flashに視覚機能を加えた実験版「DeepSeek-V4-Flash-Vision-Exp」を公開しました。指定されたモデルIDを通じてAPIから利用でき、テキスト能力を維持したまま画像理解を強化する位置付けです。

続きを読む
CCTest · Blog
DeepSeek Harness v0.1.0-rc.8、エージェント作業に画像入力を導入
マルチモーダル
cctest.ai
マルチモーダル

DeepSeek Harness v0.1.0-rc.8、エージェント作業に画像入力を導入

公開ベータ開始から1週間で、DeepSeek Harnessがv0.1.0-rc.8を公開した。ネイティブ画像リクエストとテキスト・画像の混在入力に加え、サブエージェント、Windowsの永続PowerShell、デフォルトの簡易モードを追加している。

続きを読む
CCTest · Blog
MOSS-VL、話しながら見続けるリアルタイムVLMを設計
マルチモーダル
cctest.ai
マルチモーダル

MOSS-VL、話しながら見続けるリアルタイムVLMを設計

MOSS-VLは、視覚言語モデルに「話している間も見続ける」能力を組み込むことを目指したオープンモデル群です。ゲート付きクロスアテンション、対話行動を学ぶデータ、段階的な訓練によって、ストリーミング環境への対応を設計段階から行っています。

続きを読む