RecodeX 重构消息,英伟达最新论文提出跨模型KV缓存复用方案。研究显示,同一家族且KV结构匹配的不同尺寸模型间,缓存存在线性关系,通过500段1024 Token文本校准即可映射。以Qwen3-14B切换至32B为例,32K上下文重新计算需约7秒,而转换缓存仅约0.28秒,提速约25倍。该技术有望让小模型负责长上下文读取,大模型直接生成,降低模型路由的重复计算成本。
英伟达新研究让KV缓存跨模型复用,切换快25倍
AI 辅助判断积极AI 看多仅供信息参考,不构成投资建议
原始信息来源区块律动theblockbeats.info
查看原文 ↗