张一鸣罕见定调:字节AI不得依赖蒸馏,全面转攻自研
2026/08/13 18:38阅读量 2
字节跳动创始人张一鸣在Seed全员会上罕见表态,明确禁止Seed依赖蒸馏其他公司的前沿模型来提升能力;CEO梁汝波随后回应称,这是为了延迟满足、打牢基本功,而非外部压力。字节同时加码自研投入,Seedance与豆包已建立领先优势,但大语言模型、Coding与世界模型仍在追赶。
事件概述
- 2026年7月,张一鸣在ByteDance大模型研发团队Seed的全员会上定下硬规矩:不能依赖蒸馏其他公司的前沿模型来提升自身能力。这是他罕见的公开表态。自2024年下半年起,他每月参加一次Seed核心技术复盘,约一半工作时间和精力都投入在Seed上。
- 8月6日,字节跳动CEO梁汝波在年中全员会上承认,字节的大语言模型目前确实落后,与海外领先模型的差距还在扩大;但他否认“外部压力迫使字节坚持自研”的说法,称真正原因是希望团队学会延迟满足、把基本功打牢。
- 据国内媒体报道,字节内部对利用开源模型进行蒸馏同样严格限制,甚至会通过API检测等方式加强管控。
核心信息
- 知识蒸馏本身是成熟技术,早在2015年就由“深度学习之父”杰弗里·辛顿等人系统推广;过去主要用于压缩模型、降低成本。ChatGPT之后,前沿模型成为核心资产,蒸馏开始卷入知识产权、技术原创和中美AI竞争。
- 张一鸣认为,依赖蒸馏虽然能让团队迅速接近已有目标,却难以找到下一个目标。今天学Claude、明天追GPT,排名可能提升,但研究方向、训练方法和评价标准都会跟着别人走,最终很难成为第一个提出新问题的人。
- 自研体系方面,2025年初,原Google DeepMind研究副总裁吴永辉加入字节,负责Seed基础研究;Seed Edge计划则专门研究周期更长、结果更不确定的AGI课题,取消了季度OKR和半年考核,并获得单独算力支持。吴永辉推动信息共享、鼓励发表论文,其加入后的三个月内,Seed发布论文数量超过2024年全年。
- 产品层面,7月31日发布的Seedance 2.5一次可生成30秒视频,并能同时参考最多50个图片、视频和音频素材;应用已进入工业培训、汽车设计和机器人仿真等场景。豆包截至2026年3月月活达3.45亿(千问1.66亿、DeepSeek 1.27亿),日均Token调用量从2024年5月的1200亿增至2026年6月的180万亿,两年多增长约1500倍;2026年6月,豆包开始试水付费订阅,月费从68元到500元不等。
追赶中的差距
- 8月6日字节年中会上,梁汝波给出“反差成绩单”:豆包保持竞争力、Seedance继续领先,但大语言模型与海外领先模型之间的差距扩大了。
- 据《金融时报》8月7日报道,字节正在预训练一个参数规模最高可能达到10万亿的新模型,规模超过Kimi K3的三倍;项目仍处早期阶段,最终规模和能力尚未确定。
- Coding方向:字节2026年在这一方向的投入仅次于世界模型,但仍未形成类似Seedance的领先优势。此前不少内部业务团队因自家Seed-Code模型能力有限而使用不足,AI编程工具Trae早期也接入过DeepSeek、Claude等外部模型。2026年以来,字节开始推动更多内部业务使用Seed模型,希望重建“使用—反馈—训练”的飞轮。
- 世界模型:字节直到2025年才小范围组建研究团队。2026年,吴永辉定下目标:年底前至少发布一版世界模型,性能对标Google Genie 3。截至2026年初,内部评测显示,字节世界模型综合性能距离全球领先水平还有约10%的差距。
值得关注
张一鸣这次“关掉捷径”,同时给寻找新答案的人留下时间和算力,本质上是让字节从“大力出奇迹”的追赶模式,转向面对没有现成答案的前沿探索。2012年做推荐引擎时,字节可以说“不会但可以学”;但今天的AI前沿已经没有多少现成答案可以照着学,字节需要自己写下答案。
