RecodeX 重构消息,开源项目 Narwhal 在 Hacker News 的 Show HN 板块发布,其定位为面向大语言模型推理的服务方案,核心能力是在预填充(prefill)与解码(decode)阶段之间以秒级速度迁移 GPU 资源。该方案通过动态调配 GPU 在两类计算负载间的分配,以提升推理阶段的硬件利用率。
Narwhal 发布 LLM 推理调度方案 可在数秒内切换 GPU 预填充与解码
AI 辅助判断积极仅供信息参考,不构成投资建议
原始信息来源Hnrssgithub.com
查看原文 ↗