RecodeX 重构消息,一名开发者基于约1.63亿参数的GPT-2风格模型验证Chinchilla缩放定律。实验对比了以Chinchilla最优20 tokens/参数训练的基准模型、双倍token过训练模型,以及按相同计算量将参数量和token数等比例放大(约2.26亿至2.36亿参数、约46.1亿token)的新模型。结果显示,放大后的模型测试损失分别为3.280和3.293,优于过训练模型的3.325,提升约1%。作者认为结果在方向上支持Chinchilla启发式规则,但差异较小,尚不能完全排除噪声影响。