RecodeX 重构消息,MarkTechPost报道,FreeToken作为边缘原生MoE推理引擎正式发布,可在单台工作站GPU上运行753B参数的GLM-5.2模型。该引擎通过测量带宽,将MoE缓存未命中在PCIe填充与CPU执行间拆分,从而在本地解锁前沿模型运行能力。
FreeToken引擎发布:单工作站GPU运行753B参数GLM-5.2
AI 辅助判断积极AI 看多仅供信息参考,不构成投资建议
原始信息来源Marktechpostmarktechpost.com
查看原文 ↗RecodeX 重构消息,MarkTechPost报道,FreeToken作为边缘原生MoE推理引擎正式发布,可在单台工作站GPU上运行753B参数的GLM-5.2模型。该引擎通过测量带宽,将MoE缓存未命中在PCIe填充与CPU执行间拆分,从而在本地解锁前沿模型运行能力。