BAT等大厂重做AI预训练:数据质量成模型性能瓶颈
国内头部AI厂商近期密集启动预训练返工,核心原因在于早期粗放式的数据策略导致模型性能遭遇瓶颈。脏数据、标注规则模糊及评测集污染等问题,使得万亿参数模型表现甚至不及小规模模型。行业正从追求数据规模转向治理数据质量,但面临预算分配不足、高质量产能稀缺及内部数据流转受阻等多重挑战。
事件概述
近期,包括BAT在内的多家国内AI模型厂商集中启动“预训练返工”计划。这一现象的根源在于数据质量问题:部分团队此前投入大量算力训练万亿参数模型,但最终落地效果被规模仅为其1%的小模型超越。经排查,主要原因为语料库中混入大量垃圾信息、重复内容及来源不明的清洗包,导致模型陷入低分陷阱。此外,数据标注规则不清、评测集污染以及因数据受限导致的性能瓶颈,迫使多家企业推倒重来并重建数据团队。
核心问题分析
1. “多即好”误区与脏数据代价
早期行业普遍存在“数据量越大越好”的认知偏差,缺乏成熟的大规模数据治理体系。为凑齐数千亿至万亿token的语料,抓取了大量网页垃圾和机器生成页。例如,某中部基模公司将技术博客整批灌入训练,发现其中大量段落被重复数万次,导致模型在评测中出现复读现象,造成数万卡时的算力浪费和版本作废。脏数据不仅浪费资金和人力,更严重延误了产品的时间窗口。
2. 考核机制与组织协同缺失
数据团队的考核若仅关注数量而非信息密度和干净程度,会鼓励团队用垃圾数据凑数,反而降低模型智能度或导致训练崩溃。同时,数据团队与预训练团队之间缺乏有效的话语权制衡和需求反馈机制,独立考核往往导致混乱。例如,腾讯混元团队曾因标注规则定义不清但验收线过高,生产出大量不可用数据,最终不得不重新清洗。
3. 场景数据优势失效
互联网时代积累的本地生活、社交、电商等场景数据,在通用大模型竞争中并未形成显著壁垒。相比Google等拥有海量场景数据的巨头,Anthropic、OpenAI及国内新兴厂商凭借更纯粹的高质量通用数据迅速追赶,行业站在同一起跑线上竞争。
行业现状与挑战
1. 预算与产能的双重挤压
尽管大厂整体资金雄厚,但在单模型训练预算中,数据投入占比极低(估算约为10%,远低于算力的40%)。以专家长程任务数据为例,美国市场单条调研价格高达数千至上万美元,而国内支付能力有限。此外,高质量数据产能稀缺,正规渠道供应不足。
2. 隐蔽的数据获取手段
由于公开爬取数据质量下降,部分厂商通过API中转站截留用户交互轨迹,进行数据蒸馏。这种“Token转发”模式虽能产生收益,但更重要的是能收集到比公开语料更接近训练需求的有效样本。然而,受限于合规性及平台用户量,此类数据沉淀规模有限。
3. “数据飞轮”尚未闭环
业内公认的护城河是“数据飞轮”——模型越强,用户越多,回流的高质量数据越多,进而提升模型。但目前真正跑通该闭环的企业寥寥无几。主要堵点包括:
- 组织壁垒:部门间数据墙破除艰难,内部数据流转不畅。
- 人才匮乏:缺乏具备数据清洗、管道搭建及工程能力的专业人才。
- 内生数据不足:AI Coding领域市场份额被Claude、Codex等海外模型占据;AI办公场景尚处初级阶段,沉淀的轨迹数据单薄且复杂度低。
结论与展望
预训练返工仅是行业补课的第一波阵痛。高质量数据的积累没有捷径,需要长期的时间投入、定力以及组织层面的系统性支持。未来一两年内,预计仍会有更多“推倒重来”的案例出现。真正的行业分野,将取决于谁能率先打通从用户行为到模型训练的数据通路,完成数据基建的重构。
