RecodeX 重构消息,智谱确认,其匿名模型Ox Alpha在OpenRouter上线6个完整自然日处理了23.2万亿Token,是同期DeepSeek-V4-Flash的2倍多,且全部推理算力由中国国产AI芯片提供。智谱称,在相同国产硬件上将端到端推理性能优化至最初的3倍,硬件效率和单Token成本已接近主流英伟达GPU。OpenCode此前称后台有能力提供每天100万亿Token的免费额度。SemiAnalysis特别指出,这一规模此前被认为只有顶级实验室和英伟达GPU才能支撑,而此次全程使用国产芯片。
智谱GLM-5.3 Flash推理全跑国产芯片,23.2万亿Token流量验证
后续报道
智谱GLM-5.3-Flash国产芯片集群完成大规模测试
RecodeX 重构消息,8月26日晚间,智谱宣布其GLM-5.3-Flash模型在正式发布前,以匿名模型Ox-Alpha(中文社区称“牛来”)在OpenCode和OpenRouter平台进行大规模测试,迅速成为当周最受欢迎模型,创下双平台调用量新高。所有请求流量均由国产芯片集群提供算力支持,该集群通过自研高带宽互联网络连接,并采用生产级EPD分离式架构。智谱表示,与初始基线相比,端到端服务性能提升3倍,硬件效率和单token成本已达到与主流英伟达GPU相当的水平,证明国产芯片可高效支撑前沿模型推理需求。