原创报道
2026.08.04 09:23 约 14 分钟 AI人工智能 新发布

Intelligence 完成 790 万美元种子轮融资:人类偏好数据能否成为 AI 评估的护城河?

项目速览
项目名称 Intelligence
融资轮次 种子轮
融资金额 790万美元
投资方 Index Ventures, Conviction, A*, Valkyrie

当 Yupp —— 那家曾从 a16z crypto 的 Chris Dixon 手里拿到 3300 万美元的人类反馈平台 —— 在今年早些时候突然关闭时,整个 AI 评估赛道都嗅到了一丝寒意。Yupp 不是没有客户,它签下了前沿 AI 实验室;也不是没有用户,130 万注册量放在任何一个消费级产品里都不算差。但它还是死了。死因至今没有公开的验尸报告,但市场从中读出了一个尖锐的拷问:如果连 3300 万美元都烧不出一家可持续的人类反馈公司,那这个赛道究竟是不是个伪命题?

2026 年 8 月 3 日,一家名为 Intelligence 的创业公司给出了一个截然相反的答案。它的产品 DesignArena —— 一个让用户对 AI 生成的视觉设计进行 A/B 排序的众包平台 —— 宣布完成 790 万美元种子轮融资。这个数字本身在当下的 AI 融资语境里不算惊人,但伴随它一起浮出水面的两个数据让整个故事发生了扭转:DesignArena 上线不到一年半,已经积累了 530 万全球用户,并且在种子轮阶段就做到了 6000 万美元年化经常性收入(ARR)。一家还没披露总部、连官网地址都未公开的公司,正在用 Yupp 四倍的用户量和一笔规模小得多的融资,试图证明人类偏好数据可以是一门真正的生意。

字段 内容
公司 Intelligence
轮次 种子轮
金额 790 万美元
投资方 Index Ventures(领投)、Conviction、A*、Valkyrie
总部 未披露
创始人 Grace Li
官网 https://www.intellectdesign.com/

从一个失败的 AI 游戏引擎,到 530 万人使用的“审美竞技场”

Intelligence 的起源故事带有典型的硅谷车库创业色彩 —— 只不过地点换成了大学校园,时间被压缩到了毕业前几周。2025 年,Grace Li 和几个大学朋友正在捣鼓一个 AI 游戏引擎。模型确实能生成运行正常的游戏,但有一个问题始终绕不过去:这些游戏很无聊。一个能跑的俄罗斯方块克隆和一个让人停不下来的俄罗斯方块之间,隔着一段代码无法跨越的距离。Li 的团队意识到,没有任何自动化指标能告诉你一款游戏是否“好玩”。

这个朴素的问题催生了一个更宏大的构想。如果游戏的可玩性需要人类判断,那么所有依赖主观审美、设计感、视觉吸引力的 AI 输出 —— 网页设计、UI 界面、品牌视觉、图像生成 —— 是否都面临同样的瓶颈?DesignArena 由此诞生。它最初是一个内部工具,用来解决团队自身遇到的评估难题,但很快演变成一个面向公众的开放平台。对普通用户来说,使用 DesignArena 的体验接近一个高级的模型路由器:你输入提示词,从网页、图片等十几种视觉格式中选择输出类型,然后面对一连串“A vs. B”的选项,把 AI 生成的结果从最好排到最差。

但这个平台存在一个微妙的用户心理设计。参与排名的用户并不关心背后到底是哪个模型生成了这些设计,用 Li 的话说,“他们只想要自己能拿到的最好的输出”。这种模型无感知的使用行为,恰恰是 DesignArena 商业价值的根基 —— 因为它意味着用户的选择反映的是纯粹的结果偏好,而非对某个特定模型或品牌的忠诚。当实验室付费将这些未经滤镜的偏好数据接入训练管道时,他们得到的是无法通过自动化基准测试获取的信号。

“缺少人类评价数据才是真正的瓶颈”,但这话只说对了一半

Grace Li 在不同场合反复强调同一个判断:“对很多模型来说,在设计领域实现改进所缺失的瓶颈,正是这类数据。”这个叙事在特定语境下是成立的。上周 Hugging Face 遭遇的一起安全事件戏剧性地暴露了自动化基准测试的脆弱性 —— 它们可以被系统性操纵、游戏化,甚至反向优化。相比之下,来自 530 万用户的真实点击和排序行为,至少从理论上更难被大规模伪造。

但“更难伪造”不等于“必然有商业价值”。Yupp 的失败就卡在这个微妙的分界线上。Yupp 同样拿到了前沿实验室的合同,同样宣称自己拥有对模型训练至关重要的偏好数据,同样积累了一个百万级的用户池。然而当它需要在企业合同之外找到一个可持续的增长飞轮时,引擎熄火了。人类反馈市场有一个先天的结构性矛盾:最愿意为数据付费的客户群体极小 —— 通常只有头部的十几家基础模型实验室 —— 但这些客户的需求波动极大。一家实验室可能在一个训练周期内大量采购偏好数据,下一个周期转向其他架构就完全停止下单。

Intelligence 拿出的 6000 万美元 ARR 数据,是它目前最有力的辩护。从指标上看,这意味着有一批前沿实验室确实在以千万美元年费级别的强度持续购买 DesignArena 的数据。公司在创办后约一周就签下了第一家前沿实验室客户,用 Li 的话说,“然后一切就成了历史”。但这段“历史”的具体结构 —— 收入到底集中在几个客户手上、合同条款是否包含最低消费承诺、续约周期有多长 —— 全部未公开。如果这 6000 万美元来自三到五家实验室的一年期合同,那么 Yupp 的幽灵就仍然值站在这个模式的对立面。

Freemium 引擎驱动下的双边市场,以及那个“亚洲仪表盘更偏好极繁主义”的细节

DesignArena 的商业模式本质是一个典型的双边市场。C 端免费:任何用户都可以通过类似 ChatGPT 的对话窗口提交提示词,获得多个模型的生成结果,并通过 A/B 比较进行排序。B 端收费:前沿 AI 实验室购买用户偏好数据的访问权,包括排名结果、地域分布、时间维度的审美变化趋势。平台充当的是匹配引擎,把海量用户的行为数据打包成实验室需要的反馈信号。

这种模式下,平台的数据深度决定了它的定价权。DesignArena 的一个关键架构设计是强制登录:用户必须登录才能获取生成结果。这个机制让 Intelligence 能够追踪同一用户在不同时间的偏好漂移,也能够以洲际粒度描绘审美的地理分布。Li 在采访中提到了一个具体案例:“亚洲地区的网页仪表盘倾向于更极繁主义的设计风格。”这不是一个随口的文化观察 —— 如果 Intelligence 确实拥有足够细粒度的数据来量化这种差异,那么对于一个需要在中国、日韩和东南亚分别部署设计生成模型的实验室来说,这组数据就是真金白银。它可以告诉模型:在东京应该降低视觉密度,在首尔需要在特定元素上增强对比,而不需要实验室自己跑到每个市场做本地化测试。

但这里存在一个反向逻辑。DesignArena 的用户池是否具有代表性?530 万用户听起来很可观,但如果这些用户集中在特定地区、特定年龄段、特定设计审美的群体中,那么他们产生的偏好数据可能会系统性地偏向某些美学标准。AI 实验室如果基于这样的数据调优模型,可能反而放大了偏见而非消除它。Intelligence 尚未公开其用户的地理和人口分布数据,这使得“全球审美图谱”的叙事暂时只能停留在创始人引语的层面。

LM Arena 拿了 1.5 亿,Yupp 死了,这个赛道正在用极端方式筛选幸存者

人类反馈平台这个赛道正在上演一出残酷的优胜劣汰。三个案例几乎构成了一个完整的商业实验对照组。Yupp:3300 万美元融资,130 万用户,从 a16z crypto 拿到顶级背书,最终关闭。LM Arena:在文本评估领域用相似逻辑运作,2026 年 1 月完成 1.5 亿美元 A 轮融资,距离其正式推出付费产品仅四个月。Intelligence:790 万美元种子轮,530 万用户,6000 万美元 ARR,聚焦视觉设计评估。

三条路径的差异在于切入点和资本节奏。LM Arena 做的是文本,这是一个比视觉设计大得多的 TAM(总可寻址市场),但文本评估本身更容易被自动化基准替代 —— 你可以用一组固定的问答对测试语言模型,却很难用同样的方式测试一个网页设计是否“好看”。Yupp 的产品形态与 DesignArena 最为接近,但它的资本节奏被外界普遍认为存在问题:3300 万美元的大额融资在某些情况下反而会扭曲创业公司的激励机制,让团队在真正找到产品-市场契合之前就过度扩张。Intelligence 的 790 万美元种子轮则显得异常保守,尤其考虑到它账上已经有 6000 万美元 ARR 的现金流入。

这种克制可能是有意为之。Index Ventures 在这一轮领投,跟投方包括 Conviction 的 Sarah Guo 和 Mike Vernal。这批投资人有一个共同特征:他们在 AI 基础设施层的布局更倾向于押注“数据作为护城河”的逻辑,而非纯粹的模型能力。对于 Intelligence 来说,用一笔小规模种子轮维持控制权、同时用自身的经营现金流支撑增长,这本身就在向市场传递一个信号 —— 这家公司不会重蹈 Yupp 靠融资驱动增长的覆辙。

为什么 Index Ventures 在这个时间点押注“人类品味数据”?

Index Ventures 的投资逻辑可以从三个递进的层次来理解。第一层是时机。上个月 Hugging Face 安全事件把自动化基准测试的可靠性质疑推到了台前,整个 AI 行业几乎在同一时间意识到,仅靠程序化测试无法保证模型输出的质量,尤其是在主观性极强的设计领域。第二层是市场结构。文本评估已经被 LM Arena 以 1.5 亿美元的规模占领了制高点,但视觉和设计评估的垂直赛道尚未出现一个同等量级的头部玩家。Intelligence 的 6000 万美元 ARR 和 530 万用户,在这个相对细分的领域里已经构成了事实上的先发壁垒。

第三层也是最关键的一层,是对“偏好数据能否形成复利效应”的判断。如果人类偏好数据像搜索引擎的点击率数据一样,使用越多就越精准,越精准就越难被后来者复制,那么 Intelligence 就有可能构建一个类 Google 的数据飞轮。530 万用户每做一次排名,就为这个数据库增加一个数据点;数据越多,平台越能为实验室提供细颗粒度的偏好预测;预测越准,实验室越愿意付费;收入越多,平台越能投入用户增长和留存。这个逻辑如果成立,今天 790 万美元买到的就不是一家 SaaS 公司,而是一个数据垄断的早期期权。

但这个飞轮有一个隐性的断裂点:用户为什么持续回到 DesignArena?如果他们来只是为了生成设计、拿到结果就离开,那么随着模型本身能力的提升,用户对第三方聚合平台的需求可能会下降。当 ChatGPT 或 Claude 本身就能生成足够好的设计时,用户为什么还要跑到 DesignArena 去做 A/B 排序?这个问题的答案是 Intelligence 尚未在公开材料中解释的。现阶段的 530 万用户和 6000 万 ARR 表明飞轮在转,但它是否有惯性,还要看用户留存的长期曲线。

资金用途未公开,但三条可能的暗线决定了这笔钱怎么花

Intelligence 没有在融资公告中说明这 790 万美元的具体用途。这在种子轮并不罕见,但结合这家公司的基本面,有三条暗线几乎必然在支出清单上。第一条是用户端的产品迭代。DesignArena 目前的界面被描述为“ChatGPT 风格”,这在早期阶段降低了用户的使用门槛,但同时也意味着产品形态尚未与通用聊天工具形成足够的差异化。对于一家需要在 530 万用户基础上继续增长的公司来说,把产品从“长得像 ChatGPT”升级为“设计评估的默认入口”,需要投入相当的设计和工程资源。

第二条暗线是数据基础设施。追踪数百万用户跨洲际、跨时间的审美偏好变化,需要的不只是一个排行榜数据库。它涉及用户行为的时序建模、地理标签的隐私合规处理、以及针对不同格式输出(网页、图像、UI 组件)的元数据标准化。如果 Intelligence 想要向实验室出售更高溢价的服务 —— 比如实时偏好预警、细分市场的审美趋势预测 —— 它需要在数据管道上做更多基础建设。第三条暗线更隐蔽但可能最关键:客户端的扩展。6000 万美元 ARR 如果高度集中在少数几家实验室身上,那么任何一家客户的流失都会对收入造成重大冲击。Intelligence 需要把这笔钱的一部分用于扩展客户群,从三五家实验室扩展到十几家甚至更多,并在文本、视频等非设计领域试探数据的复用价值。

Yupp 的尸体就躺在路边,Intelligence 如何证明自己不是下一个?

把 Intelligence 和 Yupp 放在一起比较,并非为了暗示前者必然重蹈后者的覆辙,而是因为这两个案例的对比恰好揭示了人类反馈赛道最根本的生存条件。Yupp 的死亡至少提供了三个负面教训:用户量不等于粘性,130 万人可以注册、使用、然后离开;企业客户合同不等于收入质量,一次性的训练数据采购和持续订阅之间有本质区别;大额融资不等于安全垫,它可能只是推迟了直面商业模式问题的时刻。

Intelligence 现阶段在这三个维度上都给出了更优的指标 —— 四倍于 Yupp 的用户量、6000 万美元的实际收入、小得多的融资规模 —— 但这些优势是否可持续,取决于几个尚未被验证的假设。第一个假设是,视觉设计的人机反馈比文本反馈更有粘性,因为审美的主观性更强、自动化替代更难。第二个假设是,设计领域的模型迭代会持续需要外部偏好数据,而不是随着基座模型能力的跃升将这一需求内部化。第三个假设是,Intelligence 的用户池能够以足够低的成本维持增长,而不需要像消费级产品那样投入巨额营销费用。

目前唯一可以确认的事实是,DesignArena 在不到一年半的时间里,让至少一家前沿实验室相信了它的数据值得付费,而且付到足以贡献千万美元级别的年化收入。这本身已经是 Yupp 穷尽 3300 万美元也没能做到的事。但种子轮阶段的耀眼数据,有时候恰恰是最大风险的来源 —— 因为你必须在所有人的注视下,证明这些数字不是一次性的运气,而是可重复、可扩展、可防御的商业模式。

这个赛道真正的终局之争:人类反馈是过渡产品,还是基础设施级数据层?

所有关于 Intelligence 的讨论,最终都指向一个更根本的问题:在 AI 模型快速演进的背景下,人类反馈数据究竟是一个暂时的解决方案,还是一个长期存在且价值递增的基础设施层?从乐观的立场看,只要 AI 生成的输出还需要被人类消费和评判,偏好数据就永远有市场。而且随着模型在代码、数学等有明确对错标准的领域趋于饱和,设计、审美这类“软”领域的竞争力会越来越依赖于对人类品味的理解,而这种理解不可能通过代码算出来。

从悲观的立场看,基座模型的能力提升本身就在吃掉中间层的价值。如果未来的 GPT 或 Claude 版本能够通过少量的用户交互自动学习偏好,甚至直接内化审美判断力,那么依赖外部众包这一模式存在的 DesignArena 将面临结构性的去中介化风险。LM Arena 在文本领域面对的也是同样的压力,但它用 1.5 亿美元和更早的商业化节奏抢到了一个可能的窗口。Intelligence 的牌是设计这个垂直领域 —— 更窄,但更依赖主观判断;更细分,但自动化替代也更困难。

6000 万美元 ARR 和 530 万用户,放在视觉设计评估这个小赛道上,很可能已经逼近了当前市场的天花板 —— 毕竟世界上愿意为这类数据付费的前沿实验室就那么几家。Intelligence 接下来的增长,要么来自现有客户加大采买力度,要么来自产品线向视频、3D 内容、交互设计等相邻格式的横向扩展,要么来自一个现在还看不到的新需求爆发点。无论走哪条路,790 万美元种子轮对它来说更多是一次资本结构的确认,而非赖以生存的燃料。考虑到这家公司种子轮的收入已经超过绝大多数 A 轮甚至 B 轮创业公司,它真正的独特之处或许在于:Intelligence 可能是当前 AI 生态里极少数不用靠融资故事活着的种子公司。

RecodeX 极客视:当市场还在争论人类反馈是不是一个伪赛道的时候,Intelligence 用 6000 万美元 ARR 交出了一份让它暂时不用参与这场争论的答卷。但 Yupp 的案例提醒我们,耀眼的前期指标和可持续的商业模型之间,隔着用户留存、客户集中度、数据护城河的真实厚度。DesignArena 是否已经找到了人类偏好数据的产品-市场契合,还是仅仅在正确的时机踩中了一个短暂的需求窗口,答案不在于融资公告,而在于 12 个月后 530 万用户中还有多少人在做 A/B 排序,以及那几家前沿实验室的续约合同上。

RECODEX PARTNERSHIP
你的项目,下一篇值得报道
RecodeX 为 AI×Web3 早期项目提供从深度报道到融资撮合的全链路服务。三档方案,按阶段匹配。