RecodeX 重构消息,8月26日晚,阿里与智谱几乎同时发布两款名称带“Flash”的模型。Qwen3.8-Flash-Next主模型125B参数,另含51B N-gram Embedding,每Token仅激活6B参数,开放权重;GLM-5.3-Flash总参数320B,激活18B,采用MIT许可证开源。两者均通过架构优化降低推理成本,瞄准Agent日常主力模型生态位。

此前DeepSeek-V4-Flash于8月1日上线,日Token量两周内从约3万亿冲至18万亿,但8月16日涨价后日Token量跌至峰值一半以下,OpenCode平台空出近10万亿Token日需求。智谱匿名模型Ox Alpha六天内在OpenCode处理44万亿Token,OpenRouter七天调用量23.2万亿Token居首。Qwen API定价每百万Token输入0.16美元、输出0.47美元。