DeepSeek低调上线V4 Flash Vision Exp:多模态仍是配角,Agent推理才是主线

2026/08/24 20:17阅读量 2

DeepSeek于2026年8月21日上线多模态视觉理解模型DeepSeek V4 Flash Vision Exp,未发布技术报告、未开源。该模型基于V4-Flash,测评重点放在Agent基准而非传统视觉任务,延续了梁文锋“多模态不是主线、而是服务Agent与推理的组件”的判断。发布前OpenAI开源了Codex Harness,DSH也刚更新rc.8版本,此次行动更像是一次产品姿态的调整与回应。

事件概述

2026年8月21日,DeepSeek上线DeepSeek V4 Flash Vision Exp,官方将其定位为多模态视觉理解模型。与V4 Flash、V4 Pro不同,该模型没有附带技术报告,也没有开源,官方仅公布了性能表和演示案例。

从命名和架构看,DeepSeek V4 Flash Vision Exp基于V4-Flash搭建,核心推理逻辑沿用DeepSeek此前提出的“视觉原语”方案。该方案来自DeepSeek、北京大学、清华大学联合研究论文《Thinking with Visual Primitives》,论文于4月30日发布,5月1日被删除,但机制已应用于6月上线的Vision模式。

核心信息

  • 基准选择透露真实定位:官方公布的成绩集中在Agent基准,如Terminal Bench 2.1得分83.9、DeepSWE得分59.3,而非传统视觉模型常用的MMMU、MathVista、DocVQA、ChartQA、OCRBench。这被解读为DeepSeek的关注点不是“看图答题”,而是“看完图把任务继续做下去”。

  • 多模态仍是“组件”而非“主线”:梁文锋此前在多模态问题上表示,多模态对C端产品重要,但对智能上限而言只是组件,不是主线本身。DeepSeek V4 Flash Vision Exp的表现方式与这一判断一致:多模态能力被用来强化Agent和推理链路,而不是单纯展示图像理解能力。

  • DSH更新与“两条腿”路线:8月19日,DeepSeek主力产品DSH更新rc.8版本,提升Agent多模态能力。一条路线是“原生直通”,当底层模型支持视觉输入时,图片直接送入模型;另一条是“工具层视觉”,对纯文本模型自动降级为OCR、颜色统计、像素扫描等结构化工具链,社区称之为“伪视觉”。在V4 Flash Vision Exp之前,DSH自身没有视觉模型,主要依赖社区插件或外部视觉模型转写。

值得关注

  • 社区实测显示,DeepSeek V4 Flash Vision Exp无法识别梁文锋本人的一张代表性照片,在复杂图表理解、中文场景处理上表现偏弱,部分用户还反馈图片输入影响上下文缓存。整体评价接近“效果一般”,官方更像是在正式版前先给用户“尝一口”。

  • 发布前一日,OpenAI开源了Codex Harness,将多模态放在Agent运行时的核心位置:模型可直接接收截图和界面,在同一条任务链中完成理解、工具调用和结果修正。相比之下,DSH在V4 Flash Vision Exp之前只能基于“模型处理过的图片”推理,原生视觉输入可以降低信息损耗。DeepSeek此时上线Vision Exp模型,带有明显的回应意味。

  • DSH的“最后一公里”正由社区补足。大二学生Benson Wang开发了DSH Desktop,提供“一键安装”的桌面版,上线几天即获1.8万GitHub星标;其还在推进手机版anywhere DSH,计划通过iOS和Android连接桌面端。官方团队已关注DSH-better-sidebar、awesome-dsh-plugins等第三方项目,未来DSH可能吸纳社区成果并上线官方插件市场。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。