RecodeX 重构消息,智谱联合创始人唐杰发文复盘Scaling Law,指出参数规模已不能单独解释模型能力,数据量、算力分配和后训练同样关键。他回顾2020年Kaplan等人的研究推动行业冲向万亿参数,但2022年Chinchilla实验发现参数与数据应同步增长,万亿参数竞赛实为弯路。唐杰还提到,考虑推理成本后,更优方案是较小模型配合更多数据训练,MoE架构下总参数与激活参数需区分,不同任务适用不同Scaling方法。他以GLM-5.3为例,称其与GLM-5.2同基座同架构,仅通过一个月后训练(扩大长程任务环境和强化学习)即实现能力提升,未增加参数。唐杰判断Scaling未结束,但每代模型瓶颈不同,下一轮竞争关键在于算力分配。