原创报道
2026.05.28 00:35 约 6 分钟 AI人工智能 持续阅读

Tensormesh 融资 2000 万美元:AMD、CoreWeave、NVIDIA 三大芯片/算力巨头联手投资,只为解决 AI 推理中最烧钱的「KV Cache」问题

项目速览
项目名称 Tensormesh
融资轮次 早期融资
融资金额 2000万美元
投资方 AMD Ventures, CoreWeave, NVentures, Valley Capital Partners, Laude Ventures

当 AI 公司们抱怨 GPU 不够用、算力太贵时,很少有人意识到一个残酷的事实:大语言模型推理过程中,超过 60% 的 GPU 显存被一种叫做 KV Cache(键值缓存)的中间计算状态占据。当一个 LLM 处理用户的提示词时,Transformer 架构中的注意力机制会为每个 token 生成 Key 和 Value 向量——这些向量必须被缓存在显存中,以便后续 token 生成时能「回看」之前的上下文。以 GPT-4 级别的模型为例,一个 32K context 的推理请求的 KV Cache 可能占用 数 GB 显存——当数百个并发用户同时使用时,KV Cache 的内存需求就成了比模型权重本身更大的显存消耗项。Tensormesh 的全部使命就是解决这一个问题。该公司刚刚获得了 2000 万美元的融资。

关键信息 详情
公司 Tensormesh
CEO Junchen Jiang
总部 美国旧金山
融资金额 $2000 万
投资方 AMD VenturesCoreWeaveNVenturesNVIDIA)、Valley Capital Partners、Laude Ventures
核心产品 Tensormesh Inference — KV Cache 加速推理优化平台
目标市场 企业级 AI 推理基础设施

为什么 AMD、NVIDIA 和 CoreWeave 这三家「死敌」同时投资了同一家公司?

这轮融资最引人注目的不是金额,而是投资人的组合:AMD Ventures(AMD 的风投部门)、NVentures(NVIDIA 的风投部门)和 CoreWeave(NVIDIA GPU 云平台,与 AMD 和 NVIDIA 都存在供应商/竞争关系)。这三家在芯片和算力市场上是直接竞争对手,却罕见地同时投资了同一家公司。这种「死敌共投」的现象在创投史上极为罕见,背后传递的信号是:

  • 跨平台通用性:Tensormesh 的 KV Cache 优化技术对所有硬件平台都有价值——它不是绑定 NVIDIA CUDA 或 AMD ROCm 的专有方案,而是一个可以在任何 GPU 上运行的推理优化层
  • 非竞争性价值:Tensormesh 提升的是推理效率而非芯片销量——对 NVIDIA 和 AMD 来说,客户因为 Tensormesh 在同样的 GPU 上获得更高的推理吞吐量,反而会增强对各自硬件的满意度和粘性
  • 行业级痛点共识:当竞争对手都认同这是一个必须解决的问题时,这个问题的真实性和紧迫性就无需质疑

KV Cache 的技术深度解析

要理解 Tensormesh 的价值,需要先理解 KV Cache 为什么是 LLM 推理的最大瓶颈。在 Transformer 的自注意力机制中,每一层都需要计算 Query、Key、Value 三个矩阵。对于自回归生成(一个 token 一个 token 地生成),之前生成的所有 token 的 Key 和 Value 向量都需要被保存以供后续 token 的注意力计算使用——这就是 KV Cache。

关键问题在于 KV Cache 的大小与三个变量成正比关系:上下文长度 × 模型层数 × 注意力头维度。随着 context window 从 4K 扩展到 128K 甚至 1M,KV Cache 的大小呈线性增长。Tensormesh 的技术核心可能涉及以下一个或多个方向:

  • KV Cache 压缩:通过量化或稀疏化减少每个缓存条目的内存占用
  • 跨请求缓存复用:识别不同推理请求之间可共享的 KV Cache 片段,避免重复计算(类似 HTTP 缓存的命中优化)
  • 分级存储:将不活跃的 KV Cache 从 GPU 显存卸载到 CPU 内存或 SSD,按需重新加载
  • 注意力机制优化:如 Grouped-Query Attention (GQA)、Multi-Query Attention (MQA) 的工程化实现

竞争格局

  • vLLM(开源):UC Berkeley 推出的开源 LLM 推理引擎,其 PagedAttention 算法是 KV Cache 管理的业界标杆。Tensormesh 需要在 vLLM 的基础上提供显著的增量价值
  • TensorRT-LLM(NVIDIA):NVIDIA 官方的 LLM 推理优化工具,深度集成 CUDA 和 Tensor Core。但它是 NVIDIA 专属的
  • SGLang(Stanford):斯坦福推出的高性能推理框架,以其 RadixAttention 算法在 KV Cache 复用上取得突破
  • Anyscale / Ray:分布式推理框架,在多 GPU/多节点推理调度上有优势

风险与挑战

  • 开源替代的速度:KV Cache 优化是学术界和开源社区最活跃的研究方向之一。vLLM、SGLang 等开源项目的迭代速度极快,Tensormesh 的商业化方案需要持续保持技术领先
  • 模型架构演进的不确定性:如果未来的 LLM 架构(如 State Space Models、Linear Attention 等)大幅减少或消除对 KV Cache 的依赖,Tensormesh 的核心价值主张可能被架构变革颠覆
  • 客户的 DIY 倾向:大型 AI 公司(OpenAIAnthropic、Google)通常有强大的内部推理优化团队,可能更倾向于自研而非采购第三方方案

RecodeX 极客视点
当 AMD 和 NVIDIA 这对死敌同时给一家初创公司写支票时,你就知道这家公司踩中了一个真正的行业痛点。Tensormesh 的 KV Cache 优化本质上是在 GPU 硬件和 LLM 软件之间插入了一个智能中间层——它让现有的 GPU 资源产出更多推理算力,对芯片厂商来说是「让我的芯片更有竞争力」的杠杆,对 CoreWeave 来说是「让我的云服务更具成本优势」的利器。但 Tensormesh 面临的最大风险不是来自竞争对手,而是来自底层架构的演进——如果 Transformer 不再是主导架构,KV Cache 优化赛道可能整体消失。这是一个典型的「timing bet」——赌 Transformer 架构在未来 3-5 年内仍然是 LLM 的主流。

订阅 RecodeX 创投情报 每日融资动态与原创深度报道,直达邮箱
RECODEX PARTNERSHIP
你的项目,下一篇值得报道
RecodeX 为 AI×Web3 早期项目提供从深度报道到融资撮合的全链路服务。三档方案,按阶段匹配。