唐杰谈Scaling Law新标尺:从数参数到算算力,FLOPs才是智能的关键
智谱创始人唐杰发文指出,参数量不能单独决定模型能力,行业评价标尺正从“数参数”转向“算算力”。他引用Switch Transformer、Chinchilla等研究,并通过GLM-5.3与5.2的控制变量实验证明,增加后训练与强化学习能在不增参数的情况下显著提升能力。
事件概述
智谱创始人唐杰在社交媒体发布长文《Thoughts About Scaling Law》,质疑“参数越多,模型越强”的行业惯性认知。他认为,参数量只是知识容量的上限,真正决定智能水平的是FLOPs(浮点运算次数),即模型实际消耗的算力。行业评价模型的标尺,正在从“数参数”切换到“算算力”。
核心信息
-
总参数、激活参数与FLOPs的区别:总参数类似图书馆藏书量,决定模型能装下多少知识;激活参数是单次推理实际调用的参数规模,在MoE架构下可能仅占总参数的极小比例;FLOPs衡量每次“思考”消耗的真实算力,才是能力与成本的真实标尺。
-
万亿参数实验早有伏笔:2021年Google Brain的Switch Transformer用MoE架构训练出1.6万亿参数的Switch-C,但每次只激活极少专家。它相比T5-XXL预训练快4倍,在SuperGLUE、Winogrande等知识类任务上领先,但在ARC Challenge这类多步推理任务上反而落后T5-Base 2.7分,说明扩大总参数带来的是“记住更多”,而不是“想得更深”。
-
Scaling Law的演进:2020年OpenAI Kaplan团队认为参数增长应快于数据;2022年DeepMind的Chinchilla实验推翻该结论,提出固定算力下最优配比约为每参数20个Token,参数与数据应同步增长。唐杰进一步指出,Chinchilla只优化“训练一次、评测一次”,未计入推理成本;若将高频推理纳入目标函数,最优解会向“更小模型、训练更久”漂移。2025年Roberts等人研究也表明,每参数Token数的最优值随任务类型变化,推理类任务过度增加总参数反而可能降低能力。
-
GLM-5.3实证:GLM-5.3与上一代GLM-5.2共用完全相同的基座、架构和753B总参数、40B激活参数,仅增加一个月长时域环境Scaling和强化学习后训练,AA评测指数就从53分升至60分,说明在参数规模足够时,能力提升主要来自后训练等非参数变量。
值得关注
对模型厂商而言,继续用总参数做营销会透支行业信任,更应公开激活参数、推理FLOPs和任务实测表现。对投资人而言,尽调重点应从参数量转向激活参数、每Token推理FLOPs以及目标场景下的Token参数比。对使用方而言,选型时需警惕“大而失真”的参数量宣传,实际应关注模型能“想多深”,而非仓库“有多大”。
回看近五年,行业从堆参数转向补数据,如今又纳入推理成本与后训练,说明最优Scaling会随任务、架构和使用方式不断变化,衡量能力的重点正转向算力的分配与使用效率。
