RecodeX 重构消息,Prime Intellect发布Prime Inference,这是一个兼容OpenAI接口的推理服务平台,用于在英伟达Blackwell上部署前沿开源模型,支持无服务器与预留两种服务模式。其GLM-5.3部署采用Dynamo、vLLM及NVFP4 KV压缩技术,每个预填充组可服务66个会话,单用户生成速度达101 tok/s。