张一鸣拍板字节大模型“绝不蒸馏”:是独立判断还是另辟蹊径?
字节跳动创始人张一鸣在Seed全员会上亲自拍板,禁止大模型蒸馏,连国内开放权重模型也不允许。业内对此观点分裂,有解读为规避TikTok风险,也有认为是其个人长期技术判断。字节CEO梁汝波否认外部压力,并承认大语言模型与海外领先模型差距有所拉大。此举在行业普遍默认蒸馏的背景下,被视为中国AI发展路径多样性的一个样本。
事件概述
8月6日,The Information报道,字节跳动创始人张一鸣在Seed团队全员会上亲自拍板:字节的大模型绝不蒸馏。消息引发行业争议,支持者认为这是正本清源,反对者则认为有沽名钓誉之嫌。
核心信息
禁令覆盖范围超出预期
蒸馏通常分两种:用自家模型训练小模型(无争议)和用其他公司模型的输出训练自有模型(争议焦点)。字节的态度比“不蒸别人”更严格,公开产品证据显示其对“蒸自己”同样保持警惕。2025年8月开源的Seed-OSS-36B系列同时提供了含合成指令数据和不含该数据的两个基座版本,理由是避免预训练中加入合成指令数据影响后续研究。
禁令甚至覆盖国内开放权重模型。据硅星人Pro报道,张一鸣在7月下旬的全员会上否决的不只是蒸馏美国闭源模型,连Kimi K3这类开放权重模型也不能蒸馏。Kimi K3蒸馏并不违反任何服务条款,也不会给TikTok带来监管风险,但禁令仍然包含它。
地缘压力被官方否认
外界普遍猜测禁令是为规避TikTok在美国的监管风险,但字节CEO梁汝波在8月6日年中全员会上回应称:“外部报道说我们是因为外部压力才坚持自研的,这是瞎猜的。真实原因是希望团队延迟满足感,打好技术基础,这对长期实现AGI很关键。”
行业蒸馏争议时间线
- 2月中旬,OpenAI指控DeepSeek绕过安全防护对GPT系列实施蒸馏。
- 2月23日,Anthropic发博客点名DeepSeek、月之暗面和MiniMax,声称约2.4万个虚假账户与Claude进行了超1600万次交互。
- 6月,Anthropic指控阿里千问团队在44天内用约2.5万账号完成2880万次交互。
- 7月22日,白宫科技政策办公室主任克拉齐奥斯点名月之暗面,称其将Anthropic模型蒸馏进Kimi K3。财政部长贝森特跟进威胁制裁。
不过,多位研究者指出,Fable 5在7月1日才公开可用,K3在7月16日发布,两周内完成蒸馏在技术上说不通,甚至白宫内部人士也承认“核心上说不通”。
字节自身曾与蒸馏有过纠葛
2023年12月,The Verge报道字节秘密使用OpenAI技术开发大语言模型(项目代号Project Seed),随后OpenAI暂停了字节的开发者账户。字节海外发言人回应称,GPT生成数据在早期用于模型注释,已于2023年年中从训练数据中删除。而字节早在2023年4月就引入GPT API调用规范,禁止将GPT生成数据加入训练集。
Seed内部围绕蒸馏至少发生过三次正式争论:第一次在2025年1月,当时DeepSeek-R1刚发布,有人提议引入美国闭源模型输出补齐推理短板;第二次在2025年底,英伟达Blackwell GPU部署拉大算力差距,有人提出“用数据换算力”;第三次在2026年7月,Kimi K3发布后有人提出折中方案——只蒸馏开放权重模型。三次均未获最高层支持。
值得关注
蒸馏在AI行业是普遍默认的工具。Anthropic自己也在博客中承认蒸馏是“广泛使用且合法的训练方法”,其反对的是虚假账户、代理网络等工业级窃取手段。斯坦福用OpenAI输出训练Alpaca、伯克利用ChatGPT对话训练Vicuna时,舆论并未将其定义为“攻击”。
关于“模型坍缩”的担忧(在模型自身生成数据上反复训练导致性能退化)主要适用于极端场景,前沿管线中混合多元教师数据并做好过滤,合成数据仍可大规模使用。真正变化的是蒸馏的可检测性,以及随之而来的政治风险。
张一鸣的禁令被解读为个人技术判断。据多家媒体报道,张一鸣卸任CEO后过去两年深度投入AI学习,旁听Seed核心技术评审,并持续接受研究员“补课”。不蒸馏的决策被认为是其补完AI知识后给出的首个重大技术判断,旨在坚持长期主义。
中国AI公司的核心能力并非由蒸馏定义。智谱GLM-5.3的能力提升全部来自后训练(大规模强化学习等);DeepSeek被OpenAI首席研究官Mark Chen承认独立发现了通往o1路径上的核心理念;千问则是全球大量开源蒸馏模型的“教师”。
据晚点LatePost报道,字节内部正在讨论训练一款总参数超5万亿的语言模型,由Seed Foundation负责人项亮牵头;《金融时报》说法更激进,称最高10万亿参数且已处于预训练早期。在不蒸馏的前提下,这款模型能否成功,将是检验该决策的关键。
