缩放定律(Scaling Law)是一组从实验里总结出来的经验规律,描述模型的训练损失(可以粗略理解为预测误差)如何随三个量的增加而下降:参数量、训练数据量、投入的算力。关键结论是这个下降是平滑且可预测的,在很宽的范围内呈幂律关系。
这件事的意义在工程上比在理论上更大。它意味着你可以先用一批小模型跑实验,拟合出曲线,再外推预测「如果我花十倍算力训一个大模型,损失大概会落在哪」。过去几年动辄数亿美元的训练投入,前提就是这条曲线让投资变得可估算,而不是纯赌博。
先用一句话抓住它
缩放定律是说:模型的性能不是靠灵光一现,而是随着「参数、数据、算力」三者增加,沿着一条能提前算出来的曲线稳定变好。
打个比方。如果你观察到「机器每多加一倍产能,单位成本按固定比例下降」,你就能在建厂之前算出多大规模最划算,而不用一家一家试过去。缩放定律给大模型训练提供的正是这种事前测算能力。
两条关键结论
第一条(2020 年,Kaplan 等):损失与参数量、数据量、算力分别呈幂律关系,而且在很大范围内不见拐点。它还有个当时很反直觉的推论——在算力固定时,训练一个大模型但不训到收敛,往往比训练一个小模型到收敛更划算。
第二条(2022 年,Chinchilla):前一条低估了数据的重要性。DeepMind 通过大规模实验重新拟合后发现,在给定算力预算下,参数量和训练 Token 数应当大致等比例增长。按这个结论,当时很多大模型其实是「参数过多、数据喂得不够」,用同样的算力训一个更小但数据更多的模型,效果反而更好。
Chinchilla 这个结论直接改变了整个行业的做法:后来的模型普遍参数没有一路狂涨,而是把更多预算花在数据量和数据质量上。
从「训练缩放」到「推理缩放」
早期的缩放定律讲的都是训练侧。近两年出现了第二条轴:推理时计算。同一个模型,让它在回答时生成更长的思维链、并行采样多条路径再择优、或者反复自我检查,难题上的准确率也会随投入的推理算力提升。
这条轴改变了成本结构。以前算力主要花在训练一次、然后无限次便宜地推理;现在难题的推理本身也在吃算力,推理模型的定价和延迟都因此和普通模型不同。
数据这一侧的天花板
缩放定律里数据是硬约束,而高质量文本不是无限的。这带来几条现实后果:
- 数据质量的权重上升。同样的 Token 数,经过去重、清洗、配比优化的数据集,效果差别很大。
- 合成数据成为重要补充,尤其在代码、数学、以及缺乏真实数据的机器人和物理场景里。但用模型生成的合成数据训模型,需要严格控制质量,否则会引入误差累积。
- 多模态成为扩数据的方向之一:图像、视频、音频里还有大量未被充分利用的信息。
容易误解的地方
「损失下降就等于产品变好」——缩放定律预测的是训练损失,不是你关心的业务指标。损失和下游能力相关,但不是一一对应;同一条损失曲线上的两个模型,在指令遵循、安全性、工具使用上可能差很远,那些主要来自后训练阶段。
「幂律意味着无限提升」——幂律的另一面是收益递减:每提升一点都要指数级增加投入。同时,缩放定律本身是经验拟合,不保证在任何区间外仍然成立。
「缩放定律说的是越大越好」——恰恰相反,Chinchilla 之后的主流理解是「在预算内配平」。而且面向部署时目标完全不同:小语言模型、量化、蒸馏追求的是在够用的前提下把成本压到最低。
「缩放定律保证通向 AGI」——这是争论最大的地方。缩放能持续改善的是下一个 Token 的预测;它是否等价于持续改善推理、规划和真实世界的可靠性,目前没有定论,详见 AGI。
它对使用者意味着什么
普通使用者不需要记公式,但有两个判断很实用。一是模型代际差通常大于同代不同厂商的差别:与其纠结同一档位里选谁,不如确认自己用的是不是当前代。二是参数量不再是有效的比较指标:MoE 模型的总参数和激活参数不是一回事,训练数据量和后训练质量也没写在参数里,看实测和自建评估比看规格表可靠。