RecodeX 重构消息,元脑服务器面向大模型推理场景推出支持Mooncake KV缓存共享的G3.5层全闪方案。该方案以元脑全闪服务器NF5286为核心,与Mooncake缓存组件及推理框架的缓存感知调度协同,为推理集群提供独立于计算节点、可按业务需求单独规划的KV Cache共享空间。上下文需求增长时可单独扩展缓存资源;GPU节点扩容、调整或维护时,缓存资源也不必完全随计算节点变化。