Scaling 不再是堆数字

目录

聊大模型,多数人开口第一句还是参数多大。这件事本身就该被问一句:参数量单独拿出来,到底说明什么?过去几年这个行业用真金白银验证了答案——几乎说明不了什么。参数量必须跟另外三件事放在一起看:模型有多少数据、算力花在了哪、谁在什么条件下运行它。

三版账本,一版比一版接近真相

Scaling Law 这几年的演进,本质是账本换了三次。2020 年,Kaplan 等人算出一个比例:参数增长应该比数据增长快得多,大约 2.7 比 1。整个行业照此办理,模型越做越大,万亿参数一度被当成进步的必经之路。2022 年,Hoffmann 等人拿四百多个模型重做实验,结论反转:算力最优的分配接近每个参数 20 个 Token,算力继续增加时,参数和数据应该以差不多的速度一起增长——这就是 Chinchilla Scaling Law。回头看过往那一批最大的模型,恰恰是算力分配最失衡的一批:参数堆得太快,数据没跟上,钱花了,效果没跟上。

第三次换账本发生在模型上线之后。Chinchilla 考虑的是一个模型训练一次、拿去评测的成本结构,但今天的大模型上线后每天被调用几十亿次,推理成本远远大于那次训练。把这笔账也算进去,最优解就往更小、训练更久的模型移动——训练贵一点没关系,每次回答省下来的算力是真金白银。

到了 MoE 时代,简单的比例公式彻底不够用了。新的研究把两个此前被混为一谈的东西拆开:总参数量决定模型能装下多少知识、事实和长尾信息;激活参数和每次前向计算的有效深度决定长程推理能力。需要记忆的任务更吃参数量,需要推理的任务更吃数据。甚至出现了更反直觉的结论:在每参数 Token 数固定时,继续增加总参数可能让推理变差,而激活更多专家反而稳定提升推理能力。

一次控制变量实验

这套逻辑有个现成的验证案例。GLM-5.3 与上一代 GLM-5.2 的基座完全相同:总参数 753B,激活 40B,硬件一行未动。但 AA 指数从 53 分升到 60 分,编程体感被普遍评为国产第一梯队。升分靠的是什么?喂更高质量的数据、优化训练方法——不改硬件,只改数据与算法。这相当于一次控制变量实验:当参数和激活完全锁死,分数的增量只能来自数据侧,而它确实来了。

这才是本篇的结论:大模型到底有多聪明,早就没法被一个总参数量概括了。Scaling 依然在继续,没有停;但它已经从一个越堆越大的数字,变成了寻找最优解的游戏。钱不再花在把数字变大上,而是花在把账算对上——算力往哪个维度分配,比堆了多高更决定成败。

Fengyu WANG
Fengyu WANG

市场 × 投资 × 工程——一个人,一套底层逻辑。