RecodeX 重构消息,推理项目SGLang新增NVFP4和DFlash2配方,支持在单张RTX 5090上运行Qwen3.8-27B模型,项目报告吞吐量为每秒206.1个token。该方案由Ying Sheng和Banghua Zhu主导开发,旨在提升单GPU环境下的推理效率。