Kimi K3与DeepSeek V4-Flash:原生多模态的时机与代价

2026/08/04 14:32阅读量 3

Kimi K3 与 DeepSeek V4-Flash 的先后发布,让国产大模型的路线分野变得清晰:前者以 2.8 万亿参数和原生多模态主打“大而全”,后者以 2840 亿参数和纯后训练路线证明 Coding/Agent 能力仍可快速提升。文章梳理了原生多模态对 Agent 长链任务的价值、与文本/Coding 能力的资源竞争,以及各厂商在“什么时候给模型加上眼睛”上的不同选择。

事件概述

今年 7 月,月之暗面发布的 Kimi K3 与 DeepSeek V4-Flash 正式版,展示了两种不同的通用基模路线:K3 走“超大参数 + 原生多模态”,DeepSeek 则在不扩大规模和加入视觉的情况下,用后训练继续提升 Coding/Agent 能力。围绕“视觉应不应该成为模型的原生能力”,各方在价值、时机和训练代价上存在明显分歧。

核心信息

  • Kimi K3 总参数 2.8 万亿,每个 token 激活约 1040 亿参数,支持 100 万 token 上下文,定位为同时覆盖视觉、Coding 和 Agent 能力的“水桶模型”。发布后曾以 1679 分登顶 Arena Frontend Code 榜单。浏览器开发平台 Puter 曾在其测试网页中制造 5 处视觉偏差,K3 对照目标页与运行页截图全部找出且没有误报;月之暗面将这种“写代码后看截图再修改”的方式称为 vision in the loop。
  • K3 采用 early fusion(早期融合)路线:在约 15 万亿混合图文 token 上按固定比例联合预训练;视觉编码器 MoonViT-V2 约 4 亿参数,从零训练,不依赖 SigLIP 初始化,视觉表示直接进入下一 token 预测目标。技术报告称,这一做法在保持视觉效果的同时提高了训练稳定性。
  • DeepSeek V4-Flash 正式版总参数 2840 亿,每 token 激活 130 亿,分别约为 K3 的十分之一和八分之一;未调整架构和参数规模,重点做后训练。在多项 Coding 和 Agent 评测中,它明显超过预览版,也超过此前的 V4-Pro 预览版;在 Arena WebDev 榜单得分一度升至 1577,接近 GLM-5.2,前面只剩 K3、Claude Fable 5、GPT-5.6 Sol 等少数模型。这被看作“不加入视觉、不扩张参数规模,后训练仍能显著提升核心任务能力”的例证。
  • 阿里和字节同样在推进原生多模态:Qwen3.8-Max 总参数 2.4 万亿、每 token 激活 950 亿,同时承载原生视觉、Coding 和 Cowork 能力;Doubao-Seed-2.1 也将视觉理解和多模态输入列为主要功能。DeepSeek、智谱和腾讯混元的最新通用基座则仍以文本输入为主。

原生多模态为什么重要

  • 有研究员指出,长链任务如果只通过代码层反馈,误差会不断累积;视觉反馈更准确,也更贴近用户意图。Agent 可以查看自己生成的页面或运行结果,再决定下一步怎么改。
  • 纯文本模型也能通过外接 OCR 或专用 VLM 获得视觉能力,经 Agent 框架或 MCP 接入。但这种模块化方案需要先把画面压成文字再传递;原生多模态模型的视觉输入与语言主干之间通信通道更宽,在长链任务中反馈链路更短,也能在视觉强化学习中把视觉结果纳入同一条训练轨迹。
  • OpenAI 今年 1 月的企业使用报告显示,研发岗位最常使用的三类 ChatGPT 工具中,图片上传排在搜索和数据分析之后,位列第三。

资源与代价

  • 加入视觉并非简单的接口扩展。图文数据会与文本、代码、数学和推理共同争夺模型容量,不同训练目标可能互相干扰。Kimi K2.5 技术报告中的消融实验显示,若在训练中后期才加入视觉数据,文本能力会先下降再逐步恢复。
  • 统一原生多模态的资源付出往往大于 1+1;苹果 MM1 技术报告也显示,视觉编码器、图像分辨率和视觉 token 数量都会影响模型效果,更高分辨率和更多视觉 token 通常带来更高训练与推理开销。对只需读取几个字段的任务,通用模型反复查看整张图片未必比 OCR 或专用模型更划算。
  • 基模厂商是否选择原生多模态,不完全由技术结论决定,也受创始人判断、团队研究背景、产品场景和训练成本影响。K3 发布后,月之暗面附近出现以“多模态”为关键搜索词的猎头。

值得关注

  • 业内对“视觉是模型理解世界的必要部分,还是只是完成任务的一种工具”尚未达成共识。Ilya Sutskever 曾把文本称为“世界的一种投射”,认为模型持续学习文本仍可能获得对世界的理解;Yann LeCun 则认为绝大多数人类知识没有以文本形式表达,模型最终需要从图像、视频和现实交互中学习。
  • 6 月底,智谱首席科学家唐杰在 X 平台征集“下一版 GLM 必须加入哪些新功能”,评论区反复出现的答案之一是“视觉”。有业内人士表示,智谱与腾讯混元的下一代通用基座都可能进一步向原生多模态迈进。
  • 多位业内人士认为,Coding 仍是进入牌桌的门槛;多模态不会取代 Coding 成为竞争中心,眼下排名、产品和商业化压力仍更多落在 Coding/Agent 能力上。Coding 与 Agent 的排名在几周或几个月内就会变化,而模型从语言走向世界需要更长的进化周期;前者决定能否跟上眼下速度,后者或许决定最终抵达的位置。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。