当互联网上可公开爬取的文本被大模型公司几近耗尽,训练数据的故事正在从“规模”转向“来源”。一个愈发尖锐的问题是:那些不存在于网页上的动作、触觉和操作序列——一个工人如何折叠衣物、如何把碗碟放进洗碗机、如何打包一件退货商品——是否就是前沿模型和具身智能体下一阶段的增长燃料?2026年9月23日,总部位于圣何塞的 Realset AI 与 Flatkey 共同宣布完成 1000 万美元 A 轮融资。这笔钱要做的不是继续挖掘互联网,而是把摄像机架到真实场所中熟练工人的头上和身后。

Realset AI 的创始人 Hunter Guo 给出的判断很直接:“容易的数据已经没了。剩下的只有物理世界,而物理世界无法被爬取。”据公司披露,Realset AI 的解法是让每一份数据集都始于一个真实的人在真实场所完成一项真实任务。这与过去十年数据标注行业依赖众包标注者的路径形成对比:Realset AI 称其使用专家演示者而非众包标注者,使用真实环境而非仿真,并将去标识化数据交付至美国托管的云存储桶。但需要指出的是,这些说法目前均来自公司新闻稿,尚无独立第三方验证。

本轮融资的另一个主角 Flatkey 则站在 AI 基础设施一侧。据公司披露,Flatkey 于 2026 年 7 月上线,两个月内超过 10000 名开发者采用,开发者通过一个密钥和一个余额可访问超过 100 个官方 AI 模型和超过 1000 个 AI 工具。两家公司由同一位创始人 Hunter Guo 关联,共同完成本轮融资,但各自分得多少金额、投资方是谁,均未披露。

字段 内容
公司 Realset AI 与 Flatkey
轮次 A 轮
金额 1000 万美元
投资方 未披露
总部 美国加利福尼亚州圣何塞
创始人 Hunter Guo
官网 https://realset.ai

Realset 把数据生产拆成三条线:身体、现场与裁判

Realset AI 的产品结构并不复杂,但每一层都指向真实世界数据链条上的一个具体缺口。据公司披露,其产品线分为三部分:Realset Body、Realset Field 与 Realset Judge,三者均运行在 Realset Workspace 之上。

Realset Body 面向物理策略模型,也就是具身智能体。公司称其在家庭、厨房、仓库和轻装配线上采集熟练工人的第一人称与第三人称操作任务,以及双臂遥操作片段,同步记录立体视频、IMU 和动作日志,并交付面向视觉-语言-动作(VLA)训练优化的密集动作级标注。这里的关键词是“动作级标注”。传统图像标注给出的是边界框或语义标签,而 VLA 模型需要的是动作序列与视觉输入之间的对齐。从已披露的信息看,Realset Body 试图把“谁在什么场景下做了什么动作”变成可训练的结构化数据;但公司未披露其采集规模、动作标注的颗粒度标准,也未说明这些数据在真实 VLA 训练中的实际效果。

Realset Field 则把真实工作流程改造成强化学习环境。据公司披露,其环境镜像电子商务运营、客户支持、物流调度和制造 SOP,领域专家在环境中生成轨迹、偏好对和评分标准,奖励来自真实业务结果,并拥有英中双语专家池。这意味着 Realset Field 不是在仿真器里造一个理想化环境,而是把真实业务流程的约束和结果反馈嵌入 RL 训练循环。从已披露的信息可以推断,这种设计试图解决一个具体问题:仿真环境中的奖励函数往往与真实业务目标脱节,导致训练出的智能体在实验室里表现良好、上线后失效。但公司未披露这些环境的具体构建方式、业务结果如何转化为可验证奖励,以及是否有客户使用这些环境训练出可量化提升的智能体。

Realset Judge 承担的是评估环节。据公司披露,其提供评估设计、故障诊断和持续监控,由从事该智能体所替代工作的人员执行,并针对主要故障模式提供定向修复数据。这一设计的逻辑是:评估者必须理解任务本身,而不是只看输出格式。但同样,公司未披露评估者的规模、行业分布或任何客户案例。

“专家演示者”模式绕开众包,但规模化和一致性是未验证的假设

Realset AI 最鲜明的定位差异,是把数据生产从“标注问题”重新定义为“采集与质量问题”。Hunter Guo 在新闻稿中称:“你必须把摄像机架到一个正在做真实工作的熟练人员身上,结构化他们做了什么,再让懂这份工作的人来检查。这是一个采集和质量问题,不是标注问题。”这句话构成了 Realset 商业叙事的核心。

从产业链角度看,这一判断有其逻辑基础。众包标注平台擅长处理大规模、低上下文依赖的任务,例如图像分类或文本情感标注。但当任务涉及物理操作、业务流程或专业判断时,众包标注者往往缺乏执行任务本身的经验,标注质量的上限受制于标注者对任务的理解。Realset 用“专家演示者”替代“众包标注者”,理论上可以提升数据的任务相关性和动作合理性。

但这里存在一个明显的待验证假设:专家演示者的供给能否规模化。一个熟练的仓库打包员或轻装配线工人,其时间成本远高于众包标注者,且这类人群通常有全职工作,能否被组织成稳定的数据生产网络,公司未披露任何运营数据。此外,专家演示本身存在个体差异——两个熟练工人折叠衣物的方式可能不同,哪种方式才是“正确”的演示?Realset 未披露其如何处理演示者之间的动作一致性,也未说明是否存在标准化的任务协议或质量审核阈值。从已披露的“独立质量审核”这一事实看,公司至少设置了一道审核关卡,但审核标准、通过率和返工率均未披露。

另一个值得注意的约束是数据合规。Realset 称其将去标识化数据交付至美国托管的云存储桶。这意味着数据采集涉及真实场所和真实人员,面部、声音、环境标识等信息的去标识化处理是合规底线。公司未披露去标识化的具体技术手段,也未说明在家庭、厨房等私密场所采集数据的授权机制。对于一家以真实世界数据为核心资产的公司而言,合规成本可能比采集成本更高,而这一点在新闻稿中几乎没有被提及。

开源基准是一把双刃剑:既是行业公共品,也是自我验证的赌注

Realset AI 计划于 2026 年第四季度发布首个面向家庭操作任务的开源基准——Realset Household Manipulation Bench。据公司披露,该基准将评估 π0、OpenVLA、GR00T 和 Octo 等开源 VLA 策略,任务包括折叠、装载、分类和擦拭,每个任务三次试验按成功率评分,结果预计 2026 年第四季度公布。此外,Light Assembly Bench 和 Commerce Ops Agent Bench 在规划中。

这一举动值得拆解。开源基准在 AI 行业并不新鲜,ImageNet、GLUE、MMLU 都曾扮演过类似角色:它们既是衡量模型能力的公共标尺,也是发布者建立行业话语权的工具。Realset 选择在 A 轮阶段就承诺开源基准,其战略意图可以从两个层面理解。第一,它试图把“真实世界数据”从公司私有资产转化为行业公共议题,从而定义什么是“实验室之外的有效性”。第二,它把自身的数据生产能力和基准结果绑定在一起——如果基准显示某个 VLA 策略在真实家庭任务中表现不佳,而 Realset 的数据能够改善这一表现,那么基准本身就变成了销售工具。

但风险同样明显。开源基准一旦发布,其任务设计、评分标准和数据采集协议都将接受公开审视。如果基准本身存在偏差——例如任务难度设置不合理、评分标准模糊、或采集场景缺乏代表性——Realset 的公信力将受到直接冲击。更关键的是,基准结果可能并不有利于 Realset 的商业叙事。如果 π0、OpenVLA 等开源策略在基准上表现尚可,那么“真实世界数据稀缺导致模型失效”的前提就会被削弱;如果表现极差,则可能被解读为基准设计过于苛刻或与现实脱节。公司未披露基准数据的采集规模、任务数量或评分者间一致性,这些细节将决定该基准是成为行业参考还是被迅速遗忘。

Flatkey 的聚合生意与 Realset 的数据生意,共享同一个创始人但面临不同的结构性张力

本轮融资的另一个主角 Flatkey 值得单独审视,因为它与 Realset AI 的商业逻辑完全不同,却共享同一个创始人 Hunter Guo。据公司披露,Flatkey 是一个 AI 基础设施平台,开发者通过一个密钥和一个余额可访问超过 100 个官方 AI 模型和超过 1000 个 AI 工具,订阅计划起价为每月 10 美元,按量付费积分可同时覆盖模型和工具。公司称其是任何 OpenAI 兼容客户端的直接替代品:开发者更改基础 URL 即可使现有代码运行。

Flatkey 的商业模式本质上是 AI 模型和工具的聚合分销。据公司披露,其通过批量购买上游容量,将大多数模型定价在官方列表价格的约 80%,部分在促销期间低至 60% 或更低。这一模式的利润空间取决于 Flatkey 与上游模型提供商之间的议价能力,以及开发者是否愿意为“一个密钥”的便利性支付溢价——或者接受 Flatkey 作为中间层带来的潜在延迟、稳定性和数据隐私问题。公司称所有调用都路由到提供商的官方端点,不自托管修改版或量化版模型,这在一定程度上回应了“中间商可能降低模型质量”的质疑,但公司未披露其基础设施的可用性指标或故障处理机制。

更值得关注的是 Flatkey 与 Realset AI 之间的协同关系。从新闻稿看,两家公司被刻意放在同一轮融资中宣布,但各自的产品、客户和资金用途几乎没有交集。Flatkey 面向开发者,Realset 面向前沿实验室和机器人公司;Flatkey 做模型和工具的分发,Realset 做真实世界数据的采集和评估。一个可能的协同场景是:Flatkey 的开发者未来可以通过同一平台访问 Realset 的数据集,从而形成“模型-工具-数据”的一站式基础设施。但这一场景在新闻稿中并未被明确表述,目前只能视为编辑推断。从已披露的信息看,两家公司更像是同一创始人并行推进的两个独立项目,而非一个统一战略的两翼。

1000 万美元在真实世界数据采集这门生意里,能走多远?

本轮融资的金额是 1000 万美元,由 Realset AI 与 Flatkey 共同完成,但各自分得多少未披露。假设这笔钱在两家公司之间平均分配,Realset AI 实际可支配的资金可能只有数百万美元。对于一家需要建立真实工作场所采集网络、扩大专家演示者池、并支持开源基准的公司而言,这笔钱并不宽裕。

真实世界数据采集的成本结构可以从几个维度拆解。第一,硬件成本:立体摄像机、IMU 传感器、遥操作设备,以及数据存储和传输基础设施。第二,人力成本:专家演示者需要按小时或按任务付费,且其技能水平决定了数据质量,这意味着 Realset 不能像众包平台那样通过压低单价来扩张。第三,合规成本:在真实场所采集数据需要获得场所所有者、被采集者以及可能涉及的客户的授权,去标识化处理和法律审查都会产生持续支出。第四,基准开发成本:开源基准的采集、标注、评分和发布本身是一项昂贵的工作,且不直接产生收入。

从已披露的资金用途看,Realset 计划将资金用于扩展采集网络、扩大专家池和支持开源基准,这与上述成本结构基本吻合。但公司未披露任何收入数据、客户数量或合同金额,因此无法判断其商业化进度是否足以支撑后续融资。一个合理的编辑推断是:1000 万美元的 A 轮在 AI 数据基础设施领域属于早期规模,Realset 需要在 12 到 18 个月内证明其数据产品能够被前沿实验室或机器人公司付费采用,否则下一轮融资将面临较大压力。但这一推断的前提——两家公司的资金分配比例——尚未披露,因此结论边界是不确定的。

竞争格局中缺失的对手,恰恰是最大的不确定性

来源材料中未披露 Realset AI 的竞争对手信息。但这并不意味着竞争不存在。真实世界数据采集和评估是一个正在快速形成的赛道,参与者可能来自几个不同方向。

第一类是机器人公司自建的数据采集团队。特斯拉 Optimus、Figure 等公司都在内部采集遥操作数据,这些数据通常不会对外出售,但会直接压缩第三方数据供应商的市场空间。第二类是传统数据标注平台向具身智能方向的延伸。这些平台拥有成熟的标注者管理体系和成本控制能力,虽然缺乏“专家演示者”的定位,但可以通过招募特定技能人群来缩小差距。第三类是仿真平台公司。Realset 明确将仿真视为无法复现真实世界数据的替代方案,但仿真平台在成本、可扩展性和安全性上具有明显优势,且近年来在域随机化和真实感渲染上进展迅速。第四类是开源数据集的竞争。如果前沿实验室选择公开其采集的真实世界数据,Realset 的付费数据产品将面临免费替代品的压力。

从已披露的信息看,Realset 的差异化在于“专家演示者 + 真实环境 + 领域专家评估”的组合,以及即将发布的开源基准。但这些差异化能否构成护城河,取决于一个尚未被验证的前提:前沿实验室和机器人公司是否愿意为外部采集的真实世界数据付费,而不是自己采集。公司未披露任何客户名称或合同,因此无法判断其产品是否已经被市场接受。

资金用途清晰,但商业化路径和验证节点仍然模糊

Realset AI 的资金用途在新闻稿中有明确表述:扩展真实工作场所和工作室环境的采集网络,扩大专家演示者和领域专家池,支持衡量 AI 策略在实验室外是否有效的开源基准。这三项用途都指向供给端能力的扩张,而非需求端的商业化突破。

这构成了一个值得注意的叙事缺口。一家 A 轮公司通常需要在融资公告中展示至少一个可验证的商业化信号,例如付费客户数量、合同金额、或与知名实验室的合作关系。但 Realset 的新闻稿中没有任何客户名称,也没有任何收入或订单数据。其目标客户被描述为“前沿实验室、机器人公司以及数据集成与 AI 解决方案提供商”,这是一个宽泛的类别描述,而非具体的市场验证。相比之下,Flatkey 至少披露了 10000 名开发者的采用数据,尽管这一数据的独立验证同样缺失。

从编辑角度看,Realset 目前最需要回答的问题不是“真实世界数据是否重要”——这一点在行业层面已有相当共识——而是“谁愿意为 Realset 生产的真实世界数据付费,以及付多少钱”。开源基准的发布可能成为一个关键的验证节点:如果基准结果引发行业关注,并带动 VLA 策略开发者对真实世界训练数据的需求,Realset 的商业化路径将更加清晰;如果基准被忽视或批评,公司可能需要重新审视其产品定位。另一个验证节点是 Realset Body 的数据是否被任何公开的 VLA 模型训练所采用,但这一信息目前未披露。

风险不在“真实世界数据是否有用”,而在“谁能以可重复的方式生产它”

Realset AI 的核心假设是:真实世界数据是前沿模型和具身智能体的下一增长点,而生产这类数据需要专门的采集网络、专家演示者和领域专家评估。这一假设在方向上是合理的,但执行层面存在多个未验证的环节。

第一个风险是供给端的可扩展性。专家演示者不是无限供给的资源,且其时间成本和工作意愿限制了采集网络的扩张速度。如果 Realset 无法在短期内建立起足够大的专家池,其数据产品的交付能力将受到制约。第二个风险是数据质量的标准化。真实世界任务天然具有变异性,不同专家演示者的操作方式、速度和习惯差异可能导致数据分布的不一致,进而影响下游模型的训练效果。Realset 未披露其如何处理这一变异性。第三个风险是需求端的付费意愿。前沿实验室和机器人公司是否有预算购买外部真实世界数据,取决于其内部数据采集团队的能力和优先级。如果这些公司认为内部采集更可控、更安全,Realset 的市场空间将被压缩。第四个风险是开源基准的反噬效应。如果 Realset 发布的基准结果显示现有开源 VLA 策略在真实任务上的表现并不差,那么“真实世界数据稀缺导致模型失效”的叙事将被削弱,反而可能降低市场对 Realset 数据产品的紧迫需求。

从已披露的信息看,Realset AI 正在试图定义一个新的数据生产类别,但这个类别的商业可行性尚未被证明。1000 万美元的 A 轮融资为它提供了一段验证窗口,而 2026 年第四季度的开源基准发布将是这段窗口期内最值得观察的事件。

验证边界与可复核指标

本文涉及的“首个、唯一、最大、领先”、订单、出货、性能等表述,如无另行说明,均是公司、创始人或投资方在现有公开材料中的披露口径;RecodeX未在本次采集材料中找到独立审计或第三方测试结论,因而不将其视为已经独立确认的事实。文中的产业协同、竞争位置和商业路径属于基于已披露产品与融资用途的编辑分析,不代表相关结果已经实现。

  • 技术侧应核验第三方测试条件、样本规模、良率、稳定性及与可比方案一致口径的结果;
  • 商业侧应核验去重后的付费客户、可执行合同、收入确认、复购率以及订单转化;
  • 资本与产业协同应以工商股权、关联交易、联合开发、采购或量产文件为准。

RecodeX 极客视:Realset AI 把“真实世界数据”从行业口号变成了一门可拆解的生产生意——采集、环境、评估三条线各有指向,开源基准则试图为“实验室之外的有效性”建立公共标尺。但真正的问题不在于物理世界是否比互联网更难爬取,而在于专家演示者的供给能否规模化、数据质量能否在真实任务的变异性中保持稳定、以及前沿实验室是否愿意为外部采集的数据付费。1000 万美元能买到的是一段验证时间,而不是一个已经被证明的市场。

信息来源

本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。