基础模型未死,角色已变:大模型训练逻辑正在系统性重构

2026/08/16 16:36阅读量 5

OpenAI O1发布后,后训练与强化学习在大模型能力形成中的权重显著提升,基础模型从知识压缩载体转向能力基底。预训练数据构成随之大幅调整,代码取代网页文本成为主力,合成数据重要性上升,同时“中训练”作为衔接环节出现。

事件概述

Arcee AI 预训练负责人 Varun Singh 在一期分享中提出“The Base Model Is Dead”的观点,核心结论是:大模型训练体系正在发生系统性变革,基础模型(Base Model)的角色已从知识压缩载体转变为复杂能力的前置基底。

核心信息

  • 训练算力分配转变:GPT-3 时代,预训练效果基本决定模型能力上限,后训练仅做行为调整,强化学习作用有限。如今,有团队在预训练与后训练的算力投入上已大致接近,后训练开始真正影响模型的最终能力。
  • 基础模型角色变化:基础模型不再需要在预训练阶段掌握完整复杂任务,只需储备 Python、代码结构、API 调用、Git、文件系统等“原子能力”(Atomic Skills),复杂任务的组合与涌现交由后续强化学习完成。
  • 预训练数据大幅调整:GPT-3 时代,网页和维基百科数据约占预训练数据的 85%;当前部分新模型中该比例已降至 15% 左右,代码成为占比最大的数据来源。训练数据开始围绕 Coding、长程任务等目标能力进行有目的的设计,问答、对话及接近 Agent 任务的数据也提前进入预训练,合成数据的重要性随之上升。
  • 中训练(Mid-training)环节出现:预训练与后训练的数据分布差异较大,直接跳转可能让模型难以适应,对 MoE 模型而言还可能影响专家负载平衡。中训练作为过渡阶段,让模型提前适应长上下文、推理轨迹、Agent 交互记录等后训练数据形态,使前后阶段切换更加平滑。

值得关注

大模型训练各阶段的边界正日益模糊,可粗略分为监督学习与强化学习两大范式:前者建立知识、表征与基础能力,后者通过环境探索和反馈组合能力。基础模型并未“死亡”,它仍然是重要的起点,只是不再承载全部智能。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。