字节成立AI数据与安全一级部门,为超大模型备战数据

2026/08/12 11:02阅读量 2

字节跳动近期新设“AI数据与安全”一级部门,与Seed、Flow等平行,同时调整负责人。此举正值其被曝预训练最高10万亿参数模型之际,反映字节在反对蒸馏外部模型、坚持自研路线的背景下,将数据工程提升至战略级投入。

事件概述

字节跳动近期成立新的一级部门“AI数据与安全”,与Seed、Flow、抖音等部门平行。原AI数据与安全负责人傅越即将离职,由原TikTok平台责任团队负责人王赢磊接任。

此次调整的时间点值得关注。据金融时报援引知情人士报道,字节正在预训练一个参数规模最高可能达到10万亿的超级AI模型,目前仍处于早期阶段,最终规模将在后续训练中确定。若实现,该模型将成为全球参数量最大的AI模型之一。

核心信息

  • 新部门由傅越2023年成立的Global Data等团队整合而来。Global Data曾服务TikTok等国际业务,后承担Seed模型训练的数据采购和质量管控。此外,集团数据中台DMC、Flow旗下AI数据平台AIDP,以及Seed内部各模型方向的数据团队也被陆续收拢,最终升格为一级部门。
  • 字节在数据上的投入规模可观。仅Seedance的数据评测团队就有上千人,一名算法工程师背后往往对应十余名数据人员;今年字节在世界模型和Coding等方向的数据预算已达千万美元级,且可继续追加。
  • 张一鸣在Seed全员会上明确反对通过蒸馏外部模型来追赶,认为字节“愿意为长期目标牺牲一些短期利益”,即使阶段性落后也不应依赖蒸馏竞争对手模型。

背景与挑战

字节面临的问题也是整个大模型行业的共性难题。DeepMind 2022年的Chinchilla论文指出,模型参数与训练数据量需同步增长;而Epoch AI估算,全球公开的人类文本约相当于300万亿Token,按当前增速可能在2026年至2032年间被充分利用,若进行更长时间的“过度训练”,时间还会提前。

公开数据不足,大模型公司开始转向采购与生产稀缺内容:

  • Google与Reddit签署每年约6000万美元的内容授权协议;OpenAI与News Corp达成多年合作,使用华尔街日报等媒体内容。
  • Anthropic启动内部代号“Project Panama”的项目,批量采购数百万册实体书,切脊扫描数字化,为此花费数千万美元。此前Anthropic还曾从影子图书馆下载盗版书籍,2025年法院认定使用书籍训练AI可构成合理使用,但保存盗版书籍面临侵权风险。为结束集体诉讼,Anthropic同意支付15亿美元和解,今年7月美国联邦法院正式批准,成为已知规模最大的美国版权诉讼和解之一。

对字节而言,一边是最高10万亿参数的模型计划,一边是拒绝蒸馏走捷径,模型继续Scale最终要靠高质量数据支撑。数据工程已成为与算法、算力并列的战略投入方向。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。