字节AI转向自研与数据:接受短期落后,赌一个生态闭环

2026/08/15 20:31阅读量 2

字节跳动创始人张一鸣在Seed全员会上明确表示不会把模型蒸馏当作提升AI能力的捷径,CEO梁汝波也定调“接受短期落后,坚持长期优化”。字节随后成立AI数据与安全一级部门、整合超千人数据团队,并讨论训练超5万亿参数模型;豆包通过会员、抽佣和并入飞书团队加速商业化。字节正以自研和数据飞轮绕开行业普遍的蒸馏路线,赌AI成为下一代超级入口后的长期生态。

事件概述

字节跳动在2026年7月底至8月初密集调整AI战略。创始人张一鸣在Seed全员会上表示,不会把模型蒸馏当作提升AI能力的捷径,即使Seed模型能力暂时落后于国内主要竞争对手;CEO梁汝波在8月5日全员会上进一步定调:大语言模型坚定自研,接受短期落后,坚持长期优化,动作不变形。

核心信息

  • 拒绝蒸馏成为明确政策:字节早在2023年就规定不得将GPT生成数据加入训练集;2025年DeepSeek-R1发布后,Seed内部曾讨论是否蒸馏,被管理层否决;在Kimi K3能力接近海外闭源旗舰后,内部倾向蒸馏的声音增多,张一鸣最终公开表态。Seed已出台新政策,禁止蒸馏K3等开放权重模型,并追溯排查疑似行为。
  • 组织与算力投入:字节新成立一级部门“AI数据与安全”,整合超千人数据团队,与Seed、Flow、抖音等并列,为所有大模型提供跨模态数据服务;同时讨论训练参数规模超5万亿的模型,若落地将成为国内已知最大模型。
  • 数据成为核心变量:EpochAI测算,语言模型训练将在未来五年耗尽人类公开文本数据,高质量语言数据可能提前至2026年枯竭。Anthropic 2025年为强化学习数据拨出超10亿美元预算,OpenAI全年数据开销约10亿美元、内部预测2030年增至80亿美元。字节2026年数据预算已超千万美元且可随时追加,优势在于字节旗下产品积累的多模态真实行为数据。牛津、剑桥等机构的联合研究也指出,反复用AI生成数据训练会导致原始数据分布尾部信息消失,带来不可逆能力退化。
  • 商业化加速:豆包以3.82亿月活排名AI原生App第一,同比增速172.1%,随后推出68/200/500元三档会员;自8月10日起,经豆包跳转至抖音来客成交的部分订单执行独立费率,酒店订单综合费率约12%,部分生活服务类订单约18%,豆包已被列为独立渠道,AI带来的交易开始单独计价;飞书产品团队并入豆包,打通生活与办公场景,并强化桌面Agent;Seedance 2.0年化收入已达20亿美元(约143亿元人民币)。

值得关注

字节放弃“蒸馏”这一短期追赶手段,本质是避免继承其他模型的能力框架,保留从零定义原生多模态模型的空间。其打法变为:以豆包在C端蓄水,以本地生活和办公场景在B端收费,以Seed与火山引擎在底层支撑模型和算力,形成“数据—模型—场景—收入”的闭环。这一选择的前提是接受大语言模型暂时落后,但字节押注的是AI成为下一代超级入口后的长期生态能力。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。