聊大模型,多數人開口第一句還是參數多大。這件事本身就該被問一句:參數量單獨拿出來,到底説明甚麼?過去幾年這個行業用真金白銀驗證了答案——幾乎説明不了甚麼。參數量必須跟另外三件事放在一起看:模型有多少數據、算力花在了哪、誰在甚麼條件下運行它。
三版賬本,一版比一版接近真相
Scaling Law 這幾年的演進,本質是賬本換了三次。2020 年,Kaplan 等人算出一個比例:參數增長應該比數據增長快得多,大約 2.7 比 1。整個行業照此辦理,模型越做越大,萬億參數一度被當成進步的必經之路。2022 年,Hoffmann 等人拿四百多個模型重做實驗,結論反轉:算力最優的分配接近每個參數 20 個 Token,算力繼續增加時,參數和數據應該以差不多的速度一起增長——這就是 Chinchilla Scaling Law。回頭看過往那一批最大的模型,恰恰是算力分配最失衡的一批:參數堆得太快,數據沒跟上,錢花了,效果沒跟上。
第三次換賬本發生在模型上線之後。Chinchilla 考慮的是一個模型訓練一次、拿去評測的成本結構,但今天的大模型上線後每天被調用幾十億次,推理成本遠遠大於那次訓練。把這筆賬也算進去,最優解就往更小、訓練更久的模型移動——訓練貴一點沒關係,每次回答省下來的算力是真金白銀。
到了 MoE 時代,簡單的比例公式徹底不夠用了。新的研究把兩個此前被混為一談的東西拆開:總參數量決定模型能裝下多少知識、事實和長尾信息;激活參數和每次前向計算的有效深度決定長程推理能力。需要記憶的任務更吃參數量,需要推理的任務更吃數據。甚至出現了更反直覺的結論:在每參數 Token 數固定時,繼續增加總參數可能讓推理變差,而激活更多專家反而穩定提升推理能力。
一次控制變量實驗
這套邏輯有個現成的驗證案例。GLM-5.3 與上一代 GLM-5.2 的基座完全相同:總參數 753B,激活 40B,硬件一行未動。但 AA 指數從 53 分升到 60 分,編程體感被普遍評為國產第一梯隊。升分靠的是甚麼?餵更高質量的數據、優化訓練方法——不改硬件,只改數據與算法。這相當於一次控制變量實驗:當參數和激活完全鎖死,分數的增量只能來自數據側,而它確實來了。
這才是本篇的結論:大模型到底有多聰明,早就沒法被一個總參數量概括了。Scaling 依然在繼續,沒有停;但它已經從一個越堆越大的數字,變成了尋找最優解的遊戲。錢不再花在把數字變大上,而是花在把賬算對上——算力往哪個維度分配,比堆了多高更決定成敗。