基础模型未死,角色已变:大模型训练逻辑正在系统性重构
2026/08/16 16:36阅读量 5
OpenAI O1发布后,后训练与强化学习在大模型能力形成中的权重显著提升,基础模型从知识压缩载体转向能力基底。预训练数据构成随之大幅调整,代码取代网页文本成为主力,合成数据重要性上升,同时“中训练”作为衔接环节出现。
事件概述
Arcee AI 预训练负责人 Varun Singh 在一期分享中提出“The Base Model Is Dead”的观点,核心结论是:大模型训练体系正在发生系统性变革,基础模型(Base Model)的角色已从知识压缩载体转变为复杂能力的前置基底。
核心信息
- 训练算力分配转变:GPT-3 时代,预训练效果基本决定模型能力上限,后训练仅做行为调整,强化学习作用有限。如今,有团队在预训练与后训练的算力投入上已大致接近,后训练开始真正影响模型的最终能力。
- 基础模型角色变化:基础模型不再需要在预训练阶段掌握完整复杂任务,只需储备 Python、代码结构、API 调用、Git、文件系统等“原子能力”(Atomic Skills),复杂任务的组合与涌现交由后续强化学习完成。
- 预训练数据大幅调整:GPT-3 时代,网页和维基百科数据约占预训练数据的 85%;当前部分新模型中该比例已降至 15% 左右,代码成为占比最大的数据来源。训练数据开始围绕 Coding、长程任务等目标能力进行有目的的设计,问答、对话及接近 Agent 任务的数据也提前进入预训练,合成数据的重要性随之上升。
- 中训练(Mid-training)环节出现:预训练与后训练的数据分布差异较大,直接跳转可能让模型难以适应,对 MoE 模型而言还可能影响专家负载平衡。中训练作为过渡阶段,让模型提前适应长上下文、推理轨迹、Agent 交互记录等后训练数据形态,使前后阶段切换更加平滑。
值得关注
大模型训练各阶段的边界正日益模糊,可粗略分为监督学习与强化学习两大范式:前者建立知识、表征与基础能力,后者通过环境探索和反馈组合能力。基础模型并未“死亡”,它仍然是重要的起点,只是不再承载全部智能。
