都怪Kimi

2026/07/20 10:36阅读量 2

月之暗面发布Kimi K3大模型,2.8万亿参数、开源、多模态,在编程和长程推理上达到全球顶尖水平。市场有人将其视为科技股暴跌的罪魁祸首,但分析指出K3实际上是算力需求进一步膨胀的信号,预示着AI应用繁荣的到来。

事件概述

2026年7月16日,月之暗面发布Kimi K3大模型,参数规模达2.8万亿,开源、多模态,上下文窗口超过100万。在Artificial Analysis智力指数排全球第3,Arena Frontend Code排全球第1;Terminal-Bench 2.1得分88.3,接近GPT-5.6 Sol的88.8;FrontierSWE得分81.2,超过GPT-5.6 Sol的71.3。消息发布后,华尔街部分观点认为K3戳破了全球算力扩展泡沫,加剧了高位科技股的抛售。

核心信息

K3并非省算力,而是更高效利用算力
-K3采用KDA混合线性注意力,将大部分注意力计算复杂度从平方级降为线性;在48亿参数实验中,KV缓存削减75%,100万上下文解码吞吐量提升至6倍。
-注意力残差机制让深层模型保持长期推理方向感,在长周期软件工程任务中表现突出。
-高稀疏度MoE:896个专家模块,每次只激活16个,依赖Stable LatentMoE在低维隐空间做路由。
-整体扩展效率较前代K2提升约2.5倍。

市场恐慌的逻辑漏洞
-有人认为开源模型用更少算力达到顶尖性能,会颠覆英伟达、Anthropic等公司的估值叙事。但K3体量依然是重型基建:仅4比特浮点精度权重就需要超过1.5TB HBM显存,推理需要64卡以上超节点。
-定价对比:K3每百万Token输入3美元、输出15美元,缓存命中0.3美元;Anthropic Fable 5输入10美元、输出50美元。开源低价的逼近确实动摇闭源高毛利结构(如Anthropic推理毛利率>75%),但这不是价值消失,而是价值从基础设施层流向应用层。

K3对算力需求的影响
-K3在默认最高思考强度下思维链偏长,Token消耗更高。应用普及后,单次调用Token消耗会更惊人,推理计算规模将以远超训练计算的速度膨胀。
-顶尖开源模型将激发更多Agent应用,每个深层调用都会产生巨量推理需求,算力不仅不会过剩,反而会在应用侧爆炸式增长。

值得关注

  • 代际差距快速缩小:从K2.6到K3,Arena Code从第18名跃至第1名。国产模型与海外前沿的代际差距已从12-18个月缩短至3个月以内。
  • 工程化挑战:K3需要64卡以上超节点部署,暂不是普通企业可随意消费的基础设施。缓存保留仅10分钟,指令模糊时容易过度主动,输出速度62TPS低于同档中位数72TPS。
  • 结论:K3验证了更大参数、更复杂架构仍然有效,Scaling Law再次被证实。各方不仅不会收手,反而会加速投入。算力与应用的双轮驱动将开启新一轮繁荣周期。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。