一个陪伴机器人连续三天听同一个孩子讲恐龙故事,却始终记不住他最喜欢的物种是三角龙。一位AI客服刚刚跟用户确认了退货订单号,下一轮对话又问“请问您的订单号是什么”。一群智能体在同一个任务流中协作,但各自的记忆池彼此隔离——A知道用户住在北京,B还在推送上海的天气。
这些失效场景的根源并非大模型不够聪明。当前的基座模型在单次推理任务中表现已足够惊艳,问题出在跨会话、跨任务、跨模态的持续理解能力上。大模型没有“过去”,每一次对话都是新的开始。这就是AI记忆(Memory)要解决的问题——不是简单的数据存储,而是让AI具备追踪动态变化的用户状态与环境信息的能力,并在恰当的时间主动调用这些信息。
2026年,一家成立仅数月的创业公司试图将记忆层从基座模型中剥离,做成独立的基础设施。专注多模态长记忆的丘脑智能于近日完成数千万元种子轮融资,投资方为深圳一线基金及产业资本。公司推出的原生多模态记忆基座 MemAura,已与 20 多家行业头部客户完成数据闭环验证。
| 字段 | 内容 |
|---|---|
| 公司 | 丘脑智能 |
| 轮次 | 种子轮 |
| 金额 | 数千万元人民币 |
| 投资方 | 深圳一线基金及产业资本(具体名称未披露) |
| 总部 | 未披露 |
| 创始人 | 张源 |
| 官网 | https://www.omnimemory.ai/ |
用仿生架构做AI的“海马体”,记忆的本质不是存储而是决策
MemAura 的技术路线与主流方案存在根本差异。当前业界在处理长期记忆时,主流做法是将历史对话全量塞入上下文窗口,或采用基于知识图谱的检索增强生成(GraphRAG)将文本向量化后按相似性召回。这两种方案的共同问题在于:前者导致推理成本随对话长度线性膨胀,后者仅能应对简单的一问一答场景,无法捕捉信息之间的时序关系与因果链条。
丘脑智能创始人兼CEO张源对记忆的价值定位有一个明确判断:“如果只是简单的存储,传统数据库和存储系统早已能够实现,完全不需要AI记忆。但是真正让Memory发挥价值的点在于,它能做出一系列判断:是否写入记忆、哪部分写入记忆、召回什么样的记忆、在回答什么样的问题的时候应该主动发起召回等。”
MemAura 的做法是构建一套仿生记忆处理机制,模仿人类海马体对记忆的编码与整合方式。处理流程分为三步:首先是事件识别,模仿人类记忆机制,保留关键信息并过滤噪声;随后对过滤后的信息进行编码;第三步是隐私与非隐私记忆的分区隔离。架构上采用冷热存储策略——高频访问的数据使用热存储保证快速检索,低频数据使用冷存储以节约资源。
这套设计思路将成本控制内嵌到了架构层。根据公开数据,MemAura 在输入侧 Token 消耗上降低了 40% 至 49%,记忆检索延迟控制在 400 毫秒以内,端到端首次回答可做到 1 秒以内,综合准确率可达 80% 以上。以当下客服场景 10 秒左右的延迟、陪伴场景 2 秒左右的延迟作为参照,MemAura 的响应速度实现了一个数量级的领先。
技术路线本身经历过一次关键转向。公司第一代方案为时空知识图谱 STKG,将时间、空间置于物理层,多模态感知信息置于感知层,并构建认知层进行前向推理。该方案在 LoCoMo 与 LongMemEval 两个基准上取得了 SOTA。但团队发现,对于客户而言,达到一定临界值后,Benchmark 的分值提升意义有限,延迟和 Token 支出才是商业化的硬约束。因此,公司转向第二代仿生记忆架构,模仿海马体编码与认知地图、皮质层整合的方式重构记忆体系。
目前团队正在实验室探索第三代方案,方向包括通过 E2P(Embedding-to-Prefix)技术以及对 Transformer 架构进行微调,目标是在实验室环境下实现大幅节省 Token 支出以及偏好抽取领域近似持续学习的效果。从 STKG 到仿生架构再到神经网络层基因改造,技术迭代的密集程度反映了团队对记忆架构底层范式的持续追问。
发布全球首个多模态长记忆基准,用对照实验明确基模与记忆层的分工
2026 年 5 月,丘脑智能联合英伟达 AI Technology Center、香港科技大学、香港中文大学发布了 MEMLENS——全球首个多模态长记忆基准。该基准已经开源,并进入 Hugging Face AI 领域 Daily Paper 前三。
MEMLENS 将 27 个视觉语言大模型和 7 个 Memory Agent 首次置于同一套多模态数据下,按照 32K、100K、128K、256K 四档标准上下文长度进行了完整的对照实验。实验得出三项核心发现:视觉语言大模型倾向于将内容全量塞入上下文窗口,长度增加后表现急剧下降;Memory Agent 表现相对稳定,但会因记忆架构设计缺陷在写入阶段损失大量视觉与多模态数据。随着上下文长度增长,两类模型均更易产生幻觉,面对缺乏证据的问题时倾向于给出自信但不准确的回答。部分针对 Memory 的后训练方法在训练后削弱了模型拒绝回答的能力,反而增加了幻觉风险。
这套实验将一个产业级的争论推向台前:基座模型厂商是否应该自己把记忆能力做进模型内部?如果基模内化了记忆层,独立的 Memory 公司还有没有存在的必要?MEMLENS 的结论指向一个基于实证的分工方案——基模负责视觉感知、图文对齐和底层推理,记忆企业负责跨模态信息检索、证据组织和状态更新。两者的任务域不同,模型结构也需各自优化,内化反而可能拖累对方的性能。
张源对此的判断更为直接:“基模厂商不会吃掉 Memory 层,主动智能会率先发生在 Memory 企业。”她的推演逻辑是,不同厂商的基模基因和训练语料各有差异,用户在多模型间切换会产生记忆孤岛。AI 从通用走向个性化,需要一个持续学习用户状态的中间层——以用户为中心的第三方记忆层必然独立于基模之外。
把记忆封装成场景化的ADK,不让定制化吃掉毛利
MemAura 的商业模式采用 API 调用量与场景授权组合收费。客户按需选择不同层级的记忆能力。一个值得关注的商业策略是,公司不是按技术模块销售,而是将 Memory 能力按照场景地图的权重封装成不同的 ADK(智能体开发包)供客户选择接入。
这一做法的产业背景是,不同场景对记忆能力的侧重点差异极大。张源举例说明,面向 3 至 5 岁儿童的陪伴型产品与面向 18 至 25 岁用户的陪伴型产品,其记忆建模的要求截然不同。如果为每个客户做深度定制,作为一家早期创业公司,工程交付成本和边际人效将侵蚀利润结构。“我们不想做更高的定制化,因此,我们把 Memory 能力按照场景地图的权重,封装成了不同的 ADK,客户可以选择 ADK 接入。”张源在采访中这样解释。
ADK 本质上是一套标准化的纵向场景解决方案,而非横向的功能模块拆分。它将不同场景的参数权重预置在打包方案中,客户无需自行理解记忆系统的底层逻辑即可接入。这种封装策略在商业上有两层意义:一是缩短销售与部署周期,二是防止定制化需求将产品拖回项目制模式。
目前,MemAura 的客户主要集中在两类场景:出货量较大的陪伴硬件(陪伴机器人、智能终端品牌、小米系家庭机器人等),以及垂类 Agent 场景(AI 客服、数字员工)。据公开信息,公司已与 20 多家行业头部客户完成了数据闭环验证。张源透露,目前客户大部分仍聚焦在纯文本或文本加语音的模态组合上。随着多模态技术的成熟,将有更多具身场景的客户接入。
万亿赛道里估值不到20亿的少数玩家,国内直面竞争尚未出现
AI 记忆赛道目前的竞争烈度反常地低。公开信息显示,行业内的创业者寥寥,估值最高的公司不到 20 亿元。丘脑智能被认为在国内当前没有明确的直面竞争对手。硅谷方向,可以观测到的项目如 Mem0、MemGPT 等开源方案,采用的技术路线多为向量原生或 GraphRAG 架构,与 MemAura 的仿生记忆路线存在架构层差异。
赛道本身的规模预期却相当宏大。张源将多模态长记忆视为“万亿级赛道”,推演依据是:AI 从任务驱动走向状态驱动的过程中,记忆层将从可选项变为刚需。任何与人进行持续交互的 AI 系统——无论是 Agent、具身智能还是数字员工——交互时间越长、任务链条越长、涉及模态越丰富,记忆所扮演的角色就越关键。
张源对终局的判断是:“Agent 的终局不应该是任务驱动的,而是状态驱动的。未来的 Agent 能基于你的历史记忆帮用户做 Planning,自我驱动完成任务。主动智能如果出现,应该会出现在做 Memory 的公司里。”
这一推演还需要一个关键前提:时间维度必须在记忆系统中占据核心锚点。张源认为,时间是多模态记忆缺失的关键锚点,因为时间具有唯一性,记忆无法脱离时间单独存在。这一认知也体现在 MEMLENS 的实验设计中——将长时序证据链留存作为关键评测维度之一。
投资人为何在种子轮下注:长记忆是AI从数字世界迈向物理世界的卡点
本轮投资方的口径展现了清晰的产业判断:“大模型应用已进入深水区,AI Agent 与 AI 硬件的繁荣对‘长记忆’和‘个性化沉淀’提出了极为迫切的需求。丘脑智能团队从类脑技术思路出发,在多模态记忆编码、长时序证据链留存上展现了出色的技术前瞻性,同时展现了毫秒级、低成本商业化落地能力。”
投资逻辑可以拆解为三个递进假设:第一,AI Agent 的繁荣会暴露记忆层缺失的系统性瓶颈,记忆将成为独立且有稀缺性的能力层;第二,现有方案(全量塞入上下文窗口或向量检索)在成本和效果上均不具备大规模商业化的可行性,仿生架构有机会实现差异化替代;第三,先发优势可以转化为数据飞轮——先落地的记忆系统能积累更丰富的用户交互数据,进而训练出更好的记忆模型。
但需要区分的是,上述逻辑中的后两条仍属于“待验证的推演”。目前丘脑智能的 20 多家客户合作属于“数据闭环验证”,尚未披露商业收入的规模数据。从数据闭环验证到规模性营收之间存在工程部署的鸿沟,不是性能指标可以自动跨越的。
资金全部投向研发与团队,但商业化的瓶颈不在技术
本轮融资的资金用途明确锁定在两个方向:核心产品 MemAura 的技术迭代与研发,以及顶尖技术团队的扩充。没有提及市场推广或销售团队扩张的预算分配。这与公司的定位相符——记忆层作为基础设施,其竞争壁垒首先建立在技术性能的持续领先上。
团队构成也呈现出鲜明的技术导向。核心成员来自阿里达摩院、腾讯、商汤、港中文、北大等企业和高校,平均年龄约 26 岁。创始人张源毕业于北京大学,拥有电子与经济双学科背景,曾在一家自动驾驶公司担任 COO,也有过创投行业和具身智能的经历。这种复合背景使她能同时理解技术架构、商业逻辑与产业资源整合。
不过,记忆层商业化面临的核心瓶颈并非技术问题。即便 MemAura 在延迟和 Token 消耗上持续领先,客户是否愿意为独立的记忆层单独付费,仍是一个开放性命题。在现有的 AI 技术栈中,Memory 长期以来被视作基座模型或应用框架的内部组件,而非一个需要外购的独立模块。要让客户完成从“模型自带记忆”到“外挂独立记忆层”的认知迁移,成本说服和效果证伪是两条并行的路径。成本说服侧重于展示外挂方案的 Token 节省能覆盖 API 调用费用;效果证伪则需要证明独立记忆层能提供内置方案无法实现的能力——MEMLENS 的实验设计正是为此服务。
三项结构性风险:基模内化、合规成本与长上下文窗口的替代效应
丘脑智能的商业叙事建立在记忆层独立这一核心前提上。要评估其成立概率,需要正面审视可能打破前提的外部变量。
基模厂商反向整合的可能性是目前市场上投资者最常提出的质疑。如果 GPT 系列或国产头部模型将高性能 Memory 作为内置功能直接提供,独立记忆层的市场空间将被挤压。张源的回应是,Multi-Vendor 环境下基模的多样化反而会强化记忆孤岛问题,用户在不同基模之间切换,需要独立的记忆层来打通信息流。但这个逻辑的成立需要时间窗口——它假设记忆孤岛在用户体感上已足够疼痛时,独立方案才有议价权。
多模态记忆的数据隐私与合规风险是另一个尚未充分展开的课题。MemAura 的仿生架构中包含隐私与非隐私记忆的分区隔离机制,这从技术架构上回应了一部分隐私担忧。但随着监管机构对 AI Agent 数据使用的审查趋严,多模态数据的存储、调用与跨系统流转可能面临更复杂的合规要求,尤其当客户扩展到具身智能和家庭场景时。
长上下文窗口技术的进步也可能改变竞争格局。DeepSeek V4 已经支持 1M Token 的上下文窗口。如果基模厂商持续将上下文窗口拉长,且长窗口的推理成本大幅下降,部分场景对独立记忆层的需求可能被削弱。对此,张源认为 Long Context 和 Memory Agent 并非二选一,而是可以做工程化权衡——上下文窗口本质是临时性工作记忆,依赖前端交互和短期上下文,无法替代跨会话的长期状态追踪。这个判断在技术逻辑上成立,但在极端情况下——比如长窗口的持久化能力增强且成本趋零时——产品形态的边界可能会迁移。
RecodeX 极客视:AI 记忆赛道的核心问题不是记忆有没有用,而是记忆层能不能作为一个独立生意成立。丘脑智能用仿生架构和 MEMLENS 基准为“基模与记忆分立”提供了可验证的证据,在“万亿赛道”的叙事之下,真正的考验在于能否将 20 多家验证客户的合作转为可持续的收入,并在基模厂商动向未明的时间窗口中建立数据护城河。张源说“主动智能会率先发生在 Memory 企业”,这个判断如果成立,丘脑智能就有成为定义赛道者的机会;如果不成立,它至少为行业留下了一套开源的多模态长记忆评测标准。
信息来源
本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。
