张一鸣的10万亿参数大模型:还能跑赢时间吗?

2026/08/15 11:26阅读量 3

字节跳动创始人张一鸣在Seed全员会上明确反对用蒸馏方式追赶对手,坚持自研与长期主义,但豆包大语言模型目前仅列全球第21位,与领先模型的差距被CEO梁汝波公开承认有所拉大。字节将筹码押在参数最高达10万亿的超大模型上,同时面临数据耗尽、核心人才流失、高额算力成本与商业化乏力等压力。

事件概述

  • 2026年7月底,字节跳动Seed团队全员会,创始人张一鸣罕见出席并明确表态:“不要用别人的输出,换一时的榜单排名。”他反对通过蒸馏竞品模型来追赶,主张“为长期目标牺牲一部分短期利益”。
  • 在此之前,Seed内部至少三次讨论是否采用蒸馏路线,分别发生在DeepSeek-R1发布后、Blackwell芯片部署后和Kimi K3发布后;张一鸣每次都投了否决票。
  • 目前豆包大语言模型在全球LLM排行榜仅列第21位,Kimi K3列第2位,阿里Qwen 3.8 Max列第4位。字节CEO梁汝波在年中全员会上承认:“大语言模型和海外领先模型的差距有所拉大。”

10万亿参数的豪赌

  • 据英国《金融时报》报道,字节正在预训练一个参数规模最高可达10万亿的超大模型,体量是Kimi K3的三倍以上,对标Anthropic最先进的Mythos系统。项目由Seed Foundation负责人项亮主导,目前处于预训练初期,完整周期预计3至6个月,能否正式发布仍是未知数。
  • 数据是最大瓶颈。DeepMind 2022年的Chinchilla论文指出,参数规模翻倍,训练数据量也应同步增加。Epoch AI估算,全球公开的人类高质量文本约300万亿Token,可能在2026年至2032年间耗尽。
  • 字节已将数据团队整合升格为一级部门“AI数据与安全”,但原负责人傅越被传离职,给“教材供应”蒙上阴影。
  • 资金投入方面,2025年字节全年资本开支超1500亿元,其中约900亿元用于AI算力采购;2026年被曝超过2000亿元。
  • 豆包App月活3.45亿,日均Token调用量达180万亿;单次推理成本中硬件折旧占58%、电力消耗占29%,每天算力消耗达数千万元。豆包日收入不足百万元,主要来自电商佣金;视频生成模型Seedance年化收入约20亿美元(约135亿元),单月超10亿元,刚好能抵消豆包的算力成本。

成绩与短板

  • 字节在AI视频生成领域做到全球顶尖,Seedance 2.0原生支持多模态混合输入,火山引擎MaaS收入的一半以上由其贡献。
  • 但通用基座能力仍是短板,包括长文档理解、逻辑推理、代码生成、复杂任务拆解,而这些恰恰是B端客户看重的方向。
  • 商业侧出现“偏科”:2026年夏的WAIC上,字节放弃独立官方展台,仅以第三方合作微弱露出;同一时期却在ChinaJoy为抖音直播和朝夕光年设置超大展台,布展面积超过腾讯。

组织与人事动荡

  • 2025年6月,豆包大语言模型团队负责人乔木因合规问题被辞退;此后顾全全离职创业,傅越离职,周畅从阿里“挖角”过来并引发竞业诉讼。
  • 成立近十年、数千人规模的飞书被“一夜拆分”:产品团队并入豆包,GTM团队并入火山引擎;负责人谢欣改为向豆包负责人赵祺汇报。梁汝波称这是为了“更好地打造面向办公与生产力场景的优质产品”。

商业化与外部风险

  • 2026年5月,豆包启动付费,推出68/200/500元三档会员,但社交平台上出现“豆包笨还收费”的质疑,用户认为可以换用仍免费的大模型产品。
  • 地缘政治方面,利用西方模型输出训练本地模型已成热点问题。Anthropic已连续指控MiniMax、月之暗面、DeepSeek、阿里蒸馏Claude模型,字节不在名单上;有人解读为提前避险,也有人认为是因为字节语言模型能力尚未引起足够警惕。
  • 8月6日,梁汝波在全员会上表示,公司战略要“高度优先,粗主干,优化长期”,否认字节因外部压力才坚持自研。

核心疑问

如果10万亿参数模型在预训练中遭遇瓶颈,高质量数据在2032年前耗尽,“延迟满足”可能变成无限期拖延。张一鸣选择“自己写答案”而非“抄答案”,但问题在于:当答案写完时,考场是否还在。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。