字节成立“AI数据与安全”一级部门,10万亿参数大模型仍在押注
字节跳动将分散的大模型数据团队收拢为新的“AI数据与安全”一级部门,与Seed、Flow、抖音等平级,并由王赢磊接任负责人。与此同时,有报道称字节正在预训练参数规模最高可达10万亿的超级AI模型,张一鸣明确反对蒸馏外部模型。该调整折射出大模型行业面临的高质量数据短缺问题。
事件概述
字节跳动近期将分散在多个业务线的AI数据团队收拢,组建新的“AI数据与安全”一级部门,与Seed、Flow、抖音等平级。原负责人傅越将离职,由原TikTok平台责任团队负责人王赢磊接任。
与此同时,金融时报援引知情人士消息称,字节正在预训练一个参数规模最高可能达到10万亿的超级AI模型。该模型仍处于早期阶段,最终规模尚未确定;若实现,将成为全球参数量最大的AI模型之一。
核心信息
- 组织调整:新部门的前身之一是傅越2023年成立的Global Data。随着大模型业务扩张,集团数据中台DMC、Flow旗下AIDP、Seed内部各团队都建立起数据相关职能,字节内部因而出现多套并行的大模型数据团队。此次整合将这些团队收拢并升格为一级部门。
- 模型计划:10万亿参数目标意味着继续押注Scaling极限,但“喂”给模型的将不只是GPU,还需要大量高质量数据。
- 自研路线:张一鸣在Seed全员会上明确表示,字节愿意为长期目标牺牲短期利益,即使阶段性落后,也不应依靠蒸馏竞争对手模型来补差距,需要独立准备训练数据。
- 投入规模:仅Seedance的数据评测团队就有上千人;今年字节在世界模型和Coding等方向的数据预算已达千万美元级,且可以继续追加。
行业背景
高质量数据短缺已成为大模型继续扩张的共同瓶颈。DeepMind于2022年在Chinchilla研究中发现,模型参数规模翻倍时,训练数据量也应同步增加。但Epoch AI估算,全球公开人类文本约相当于300万亿Token,按当前增长速度可能在2026年至2032年间被充分利用;若模型为降低推理成本而进行更长时间的过度训练,这一时间可能提前。
大厂正在以多种方式获取稀缺数据:Google与Reddit签订每年约6000万美元的内容授权协议;OpenAI与News Corp达成多年合作;部分公司直接雇佣工程师、博士等专业人员参与训练数据生产。Anthropic则通过内部代号“Project Panama”的项目批量采购并扫描实体书,为此投入数千万美元。此前Anthropic还曾从影子图书馆下载数百万册盗版书籍。2025年法院认定使用书籍训练AI本身可以构成合理使用,但保存盗版书籍面临侵权风险;Anthropic最终同意支付15亿美元和解,该协议于今年7月获美国联邦法院批准,成为已知规模最大的美国版权诉讼和解之一。
值得关注
字节一边计划最高10万亿参数的模型,一边拒绝蒸馏外部模型的捷径,使高质量数据成为必须单独投入的关键环节。此次组织升格也表明,数据工作正从过去的外包标注生意,变成与算法、算力并列的独立工程体系。
