DeepSeek 发布多模态模型 deepseek-v4-flash-vision-exp,补全 Agent 视觉能力
2026/08/21 18:23阅读量 3
DeepSeek 上线实验性多模态模型 deepseek-v4-flash-vision-exp,在保持 V4-Flash 文本能力基础上新增视觉理解,面向 Agent 任务场景推出,并同步发布 Files API 以降低图像重复调用成本。模型多模态基准成绩接近 Opus-4.8,定价延续 V4-Flash 体系。
事件概述
DeepSeek 推出面向 Agent 场景的多模态实验模型 deepseek-v4-flash-vision-exp,已上线 DeepSeek API 平台。开发者可通过设置 model='deepseek-v4-flash-vision-exp' 访问。
该模型在保持 DeepSeek-V4-Flash 文本能力(Agent 能力、推理能力、世界知识)基础上,新增视觉理解能力,支持图片输入,并在多模态 Agent 基准测试中较 V4-Flash 有明显提升,表现接近 Opus-4.8 等高端模型。
核心信息
- 调用方式:支持混合文本与图片输入,图片可通过 Base64、外部 URL 或 Files API 提供;可通过 Chat Completions、Messages 及 Responses API 调用。
- 定价体系:延续 V4-Flash 价格标准,图片按 token 计费,每张图片最高折算为 384 tokens。百万 tokens 输入价格:缓存命中时空闲时段 0.05 元、高峰时段 0.10 元;缓存未命中时空闲时段 1.5 元、高峰时段 3 元。输出价格空闲时段 4.5 元、高峰时段 9 元。高峰时段为北京时间每日 9:00–12:00 与 14:00–18:00。
- Files API:同步上线,开发者可先上传图片文件,再通过 file_id 在多次请求中复用,避免重复上传。支持 JPEG、PNG、GIF、WebP 格式,单文件最大 64 MiB,单用户存储上限 25 GiB,最多保存 10000 个文件。
- 生态支持:DeepSeek Harness 0.1.1 版本已原生支持该模型,可直接将图像理解接入现有 Agent 工作流。
值得关注
此次更新重点不在图像生成或视觉娱乐,而是聚焦多模态 Agent 任务执行——让 Agent 能读取截图、分析文档、识别界面问题并辅助内容生产。多模态能力与文件管理能力的补齐,使 DeepSeek 的模型体系向真实办公、开发等复杂场景进一步延伸。
