DeepSeek 上线多模态视觉模型 V4-Flash-Vision-Exp,API 定价不变、图片 token 消耗减半
8 月 21 日,DeepSeek 正式上线多模态视觉模型 DeepSeek-V4-Flash-Vision-Exp,开放 API 服务。该模型定价与 V4-Flash 文本模型一致,单张图片 token 消耗不到竞品一半,纯文本能力不降级,多模态 Agent 能力接近 Opus-4.8。实测中,模型能根据截图快速生成游戏和网页代码,但默认 thinking 模式会耗尽输出预算,需手动关闭。
事件概述
2026 年 8 月 21 日,DeepSeek 正式发布多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,并同步开放 API 服务。开发者可通过设置 model='deepseek-v4-flash-vision-exp' 调用,支持 base64 内联、外部 URL、Files API 三种图片传入方式。模型名中的“Exp”表明其仍为实验版本。
核心信息
- 定价与 V4-Flash 一致:一张图片最多占用 384 个 token,无额外视觉处理溢价。作为对比,GPT 和 Claude 处理同等分辨率图片通常消耗 800 到 1100 个 token,DeepSeek 的 token 开销不足竞品一半。这得益于其“Thinking with Visual Primitives”框架,将视觉元素压缩为空间坐标式原语,而非拆分图像 patch。
- 纯文本能力不降级:官方称其在 Agent、推理、世界知识等纯文本基准上与 V4-Flash 正式版持平,并非为视觉能力牺牲文本性能的特化模型。
- 多模态 Agent 能力接近 Opus-4.8:在需要视觉理解的 Agent Benchmark 上,相比纯文本版 V4-Flash 有大幅提升。
- 同步上线 Files API:该接口不收费,开发者可先上传图片获取 file_id,在请求中直接引用,同一图片多次调用无需重复传输,适合反复分析同一批图片的 Agent 工作流。
实测表现
实测中,将《牛来》电影经典“妈妈”特写截图输入模型,模型准确识别了牛的橙色配色、皱眉、厚嘴唇和“既凶又委屈”的表情,并保留画面底部“妈妈”字幕,输出为 SVG + CSS 渲染的卡通牛形象,全程 35 秒,消耗 384 token。
将《牛来》两头牛面对面的截图输入后,模型提取了牛的配色和基本形态,用 CSS 绘制出像素风奔跑牛角色,并生成包含天空、草地、障碍物和计分系统的可交互跑酷小游戏 HTML,从输入到输出完整游戏用时 36 秒。
在更贴近真实工作流的测试中,将一张支付产品 Landing Page 设计稿截图输入,模型 26 秒输出完整响应式 HTML 页面,渐变背景、导航栏布局、按钮样式、代码区语法高亮颜色均精确匹配,还自主添加了 hover 动效和入场动画,展示了视觉理解与代码生成叠加后的实际价值。
测试中复现了一个关键问题:在默认 thinking 模式下,推理 token 会耗尽全部输出预算。一次场景理解测试中,2001 个 completion token 全部为 reasoning token,实际输出为零。关闭 thinking 模式(设置 reasoning_effort: "none")后,同一测试从 23 秒缩短至 7.9 秒,输出完整且质量上乘。该问题已连续两个版本出现,开发者处理视觉任务时应关闭 thinking 模式或设置足够大的 max_tokens。
产品选择与布局
DeepSeek 选择先在 Flash 上试水视觉能力,而非旗舰 Pro。Flash 为 284B 参数 MoE 模型,推理成本远低于 1.6T 参数的 Pro。每张图片至少占用 384 token 输入预算,若叠加在 Pro 定价上成本会迅速膨胀,Flash 的低价基底使多模态调用在经济上可行。
从时间线看,DeepSeek 的多模态布局依次推进:4 月底灰度识图模式,5 月大范围开放网页端,6 月全量上线 App,8 月 Harness 框架支持多模态,同一天 Flash Vision API 开放。模型名带“Exp”后缀,说明尚未正式 GA,但开发者等待多模态 API 的局面已经结束。
