DeepSeek发布多模态模型V4-Flash-Vision-Exp:跑分亮眼但实测识人与复刻能力存疑

2026/08/25 17:33阅读量 2

DeepSeek推出首个多模态视觉模型V4-Flash-Vision-Exp,延续低价策略并原生支持图片输入。尽管官方跑分显示其多模态Agent性能接近Anthropic Opus 4.8,但用户实测发现其在人脸识别、复杂梗图理解及网页代码复刻等任务中存在明显短板,如将创始人误认、Token消耗过高及细节丢失严重。该模型以“实验版”形式开放,旨在通过开发者真实场景测试收集问题,为正式版迭代提供依据。

事件概述

DeepSeek正式发布首个多模态视觉模型 DeepSeek-V4-Flash-Vision-Exp。该模型原生支持图片输入,旨在补齐DeepSeek在多模态领域的短板。模型以“实验版(Exp)”形式低价开放,核心策略是通过降低使用门槛,鼓励开发者和用户在真实工作流中进行测试,从而收集反馈以优化后续正式版本。

核心信息

1. 定价与基础能力

  • 低成本策略:延续了DeepSeek一贯的低价路线。每张图像最多折算为384个输入Token。在高峰期,约0.01元人民币即可处理8张图片。
  • 技术底座:基于轻量级的V4-Flash架构(284B总参数,13B激活参数),而非更重的V4-Pro,以控制视觉处理带来的额外算力成本。

2. 官方表现 vs 实测落差

  • 官方数据:在需要视觉理解的Agent Benchmark中,其多模态Agent成绩接近Anthropic的顶级模型Opus 4.8,保留了原有的推理和世界知识能力。
  • 用户实测反馈
    • 人脸识别失败:在识别知名人物时出现严重错误,例如将DeepSeek创始人梁文锋误认为美团王兴或字节跳动张一鸣;将时代少年团合照判定为AI生成的假图。
    • 复杂任务效率低:在执行Three.js三维场景生成任务时,相比Gemini 3.7 Flash,Token消耗高出近15倍,耗时多出3.5倍,且频繁出现自我纠错和断联。

3. 深度实测对比
针对“截图复刻网页”这一高价值多模态编码任务,对DeepSeek V4-Flash-Vision-Exp、智谱GLM-5.3及月之暗面Kimi K3进行了对比测试:

  • DeepSeek V4-Flash-Vision-Exp:能搭建出网页整体框架(如流程图位置、文字区块),但色块边缘简化、小图标丢失、排版错位,距离“一比一复刻”差距较大。
  • GLM-5.3 & Kimi K3:表现更优。GLM-5.3生成的页面结构清晰,模块未拥挤;Kimi K3不仅还原结构,还实现了原图的色块渐变和发光效果,层次更接近原图。
  • 梗图理解:在包含马斯克、梁文锋及奥尔特曼的合成梗图中,模型虽能识别部分人物外貌,但未能准确解读图片背后的政治/商业隐喻,甚至将奥尔特曼误判为AI陪衬。

值得关注

  • 发布策略分析:DeepSeek选择先发布“Exp”版本而非直接替代原有纯文本模型,与其此前发布V3.2-Exp验证稀疏注意力机制(DSA)的策略一致。这种“边用边测”的模式允许稳定用户继续使用旧版,同时让尝鲜者暴露潜在Bug。
  • 未来迭代方向:目前的短板主要集中在细粒度视觉识别(人脸、微小图标)、语义深层理解(梗图逻辑)以及长上下文下的代码生成稳定性。正式版需重点解决这些问题以提升竞争力。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。