RecodeX 重构消息,英伟达研究人员提出一种跨模型KV缓存迁移技术,通过线性映射将源模型的预填充KV缓存直接转换至目标模型,避免模型切换时重新计算整个对话,从而降低多LLM工作流的计算成本与延迟。实验显示,在兼容模型对上,该线性映射过程比重新计算快2.7至25倍,同时保留目标模型独立准确率的98%。该技术适用于长上下文、多轮智能体应用场景。
英伟达研究:线性映射实现跨模型KV缓存迁移,提速最高25倍
AI 辅助判断积极AI 看多仅供信息参考,不构成投资建议
原始信息来源Feedburnerventurebeat.com
查看原文 ↗