DeepSeek は DeepSeek-V4-Flash 系に視覚理解を足した実験モデル DeepSeek-V4-Flash-Vision-Exp を API と Hugging Face 向けに公開した。呼び出しは model='deepseek-v4-flash-vision-exp'。テキストのみのエージェント系能力は V4-Flash-0731 と同程度とし、画像を含むエージェントベンチでは大きく伸ばす。コンテキストは 100 万トークン、最大出力は 38.4 万。画像は寸法に応じてトークン化し入力として課金(1 枚あたり最大 384 トークン)。第三者横断の Intelligence Index 系掲載は執筆時点で見当たらない。

画像入力は base64、外部 URL、Files API に対応。オープンウェイト側は tokenizer・参照推論実装と safetensors が Hugging Face にあり、vLLM / SGLang での提供手順も案内されている。

#評価(ベンダー)

ベンチVision-ExpV4-Flash-0731Opus-4.8
Terminal Bench 2.183.982.785.0
NL2Repo57.754.269.7
ApexBench (Pass@1)36.526.2†39.4
Agents’ Last Exam27.325.2†25.7
Chartography64.365.0
ZeroBench (Pass@5)35.034.0

† ApexBench / Agents’ Last Exam では V4-Flash-0731 が入力のマルチモーダル要素を無視した値。

#API 価格の比較

モデル入力 cache hit(オフピーク $/1M)入力 cache miss(オフピーク $/1M)出力(オフピーク $/1M)
deepseek-v4-flash-vision-exp0.0070.220.66
deepseek-v4-flash0.0070.220.66
deepseek-v4-pro0.0220.661.98

Vision-Exp は V4-Flash と同単価。ピーク時はオフピークの 2 倍(UTC 月〜金の 01<00>–04<00> と 06<00>–10<00>)。

#参考文献