智谱唐杰复盘Scaling Law:万亿参数是全行业一起走过的弯路
快链头条 2026-08-19 15:11:59
动察 Beating AI 快讯,智谱联合创始人唐杰发长文复盘 Scaling Law。过去几年,大模型一发布,大家最爱问「多少参数」。但在唐杰看来,参数早就不能单独解释模型能力。数据有多少、算力花在哪、模型以后怎么用,同样重要。
行业已经为此走过一次弯路。2020 年,Kaplan 等人的 Scaling Law 认为,算力增加后,参数应该比训练数据增长得更快。GPT-3、Gopher、MT-NLG 都沿着这个方向越做越大,行业一路冲向万亿参数。
2022 年,Chinchilla 重新做实验,发现问题恰恰出在这里。很多大模型做得太大,数据却喂得不够。继续加算力时,参数和数据应该一起增长。唐杰回头看,那轮万亿参数竞赛,就是整个行业一起走过、后来又掉头的弯路。
但 Chinchilla 算的仍然只是训练这笔账。模型真正上线后,会被反复调用,长期推理成本越来越重要。把这部分也算进去,最优方案又会变化。模型可以小一些,再用更多数据训练得更充分。后来 Llama-2-7B、Gemma-2-9B 等模型,已经在往这个方向走。
再往后,MoE 又把问题变复杂了。总参数更多,通常代表能装下更多知识;每次真正参与计算的参数和计算深度,则更影响推理能力。两者不能混为一谈。到 2025 年,新的研究进一步发现,不同任务连最合适的 Scaling 方法都不一样。记忆更吃参数,推理更吃数据;在 MoE 里,一味增加总参数甚至可能拖累推理,增加实际参与计算的专家反而更有效。
漏洞挖掘就是一个很直观的例子。发现新漏洞,不是多背几条 CVE 就够了。真正难的是把二十步推理一路走到底,中间不能断。参数多,未必就能想得更深。
GLM-5.3 是唐杰这次拿出的验证。它和 GLM-5.2 使用同一个基座、同一套架构,总参数和激活参数都没变。团队只继续训练了一个月,重点扩大长程任务环境和强化学习,能力依然明显提升。这一次加的不是参数,而是后训练。
唐杰最后的判断很明确。Scaling 远没有结束。模型规模、预训练数据、每次计算投入多少算力、后训练做多深,都还有空间。只是每一代模型的瓶颈不同,最该加码的地方也会变。
大模型下一轮竞争,比的可能不再是谁的参数最多,而是谁更知道算力该花在哪。
快链头条登载此文本着传递更多信息的缘由,并不代表赞同其观点或证实其描述。
文章内容仅供参考,不构成投资建议。投资者据此操作,风险自担。
投资有风险,入市须谨慎。本资讯不作为投资理财建议。