一个月9款旗舰模型密集发布,大模型进入“月抛”时代?
2026/08/04 18:16阅读量 2
7月内9款旗舰大模型扎堆发布,头部模型能力差距明显收窄,开源模型进入第一梯队。竞争已从单一通用能力比拼扩展到代码、Agent、参数效率和价格等多个维度;Kimi K3、Grok 4.5、混元Hy3超出预期,GPT-5.6 Sol、Claude Opus 5保持领先但突破有限。后训练技术成熟使“最强模型”领先窗口缩至数周,开源与闭源之争正改变行业竞争规则。
事件概述
7月成为近一年少见的大模型发布高峰,一个月内9款旗舰模型扎堆登场。从月初腾讯混元Hy3发布正式版并开源,到月末Anthropic发布Claude Opus 5,其间Kimi K3、Qwen3.8-Max预览版、Grok 4.5等陆续发布。Artificial Analysis综合智能指数显示,头部模型分差明显收窄,“最强模型”的领先周期大幅缩短。这轮发布中,Kimi K3、腾讯混元Hy3等选择开放权重,Kimi K3在Code Arena前端编程榜排名第一,超过GPT-5.6 Sol和Claude Fable 5,开源模型开始直接与闭源模型竞争。
核心信息
竞争维度不再只是“谁更聪明”
- 代码能力是当前最明显的争夺方向。OpenAI强化编程与复杂推理,Anthropic押注代码理解与安全审计,Grok 4.5强调速度和低成本,并与AI编程工具Cursor绑定。Kimi K3的代码能力提升明显,正在接近头部闭源模型。
- Agent成为另一个争夺重点,但实际仍不成熟。开发者反馈,当前智能体短板主要不在工具调用,而在任务调度;例如Codex的Ultra模式开启大量子代理后,重复读取同一文件、重复分析,Token消耗增加但有效工作未同步提升。
- 参数规模与推理效率形成两条路线:一是继续扩大参数规模换能力,二是通过MoE架构用更小的激活参数实现接近旗舰的效果。
- 价格成为直接竞争变量。海外厂商采用差异化定价,Grok 4.5输出价格仅为Opus系列的四分之一;国内厂商则持续下调API价格以扩大开发者用户。
7月模型表现分层
- 超出预期:Kimi K3采用MoE架构、总参数达万亿级,发布当天以1679分登顶Code Arena前端编程榜,较前代K2.6的第18名跃升17位,一周后进入Arena综合榜全球Top 10。但它在Artificial Analysis知识可靠性测试中幻觉率由39%升至51%,输出速度约33 Token/s,能力优势集中在前端开发、UI设计和产品表达。Grok 4.5发布后进入智能指数前列,以速度和性价比获得开发者认可;xAI与Cursor的数据合作帮助优化其编程体验。腾讯混元Hy3总参数295B、激活参数仅21B,以不到旗舰五分之一规模接近更大模型成绩,但SWE-Bench Pro得分57.9,与Claude Opus 4.8的69.2分仍有差距。
- 保持第一梯队但惊喜有限:GPT-5.6 Sol强化复杂推理与智能体编程,在Terminal-Bench 2.1测试中达88.8%,Ultra模式提升至91.9%;Claude Opus 5性能接近Fable 5,价格仅为后者一半。开发者会用它解决复杂问题,但因成本较高,更像按需调用的“专家”。
- 反馈分化:Gemini 3.6 Flash智能指数得分与前代持平,开发者认为提升不明显,但多模态理解与日常体验仍受认可;Qwen3.8-Max预览版效果不稳定,存在思考过深、最终未给出有效方案的问题,实际表现待正式版验证。
开发者已按任务搭配模型
不同模型开始围绕场景形成分工。例如有开发者以GPT-5.6负责日常开发,Grok 4.5快速完成需求,Kimi K3处理产品和前端场景,Claude Opus 5解决复杂问题;也有开发者用Claude模型做规划、GPT-5.6 Sol执行。
值得关注
- 迭代加快的原因:后训练优化技术成熟,模型升级不再需要从头训练,版本更新带来的领先窗口可能只有数周。发布时间本身已成为竞争的一部分。
- 7月集中发布有节点因素:世界人工智能大会在7月举行,国内厂商集中发布;海外头部公司也选择此时更新,争夺开发者生态与商业主动。
- 开源与闭源之争升温:高性能开源模型分流闭源API和订阅收入的风险更加现实。基础设施企业更希望模型开放以带动部署需求,模型公司则倾向闭源以维持收入;国内厂商开放权重也被视为争取开发者生态、云服务和商业化入口的手段。
- 后续观察指标:8月预计将有DeepSeek V4正式版、Fable 5.1、GPT-6等发布。真正值得关注的是:开源模型能力上限能推到哪里、API价格是否继续下探、Agent能否出现稳定付费场景,以及开源模型能否进入更多企业私有化部署。
