原文:Is the promise of “Siri” finally here?

作者:Sabrina Albert & Vivek Ramaswami(Aspiring for Intelligence / Madrona)

来源:SandHill.io #301 推荐阅读 · Industry | RecodeX 编译

为什么 Grok Bot、Town 与 Instinct 突然站上舞台……以及这会不会持续?

当 ChatGPT 刚出现时,围绕“一体化个人 AI 助理”——有些人会称之为真正的 Siri——有过大量讨论。我们都试过 Siri,即便在它最好的日子里,也仍然一般。在“个人助理的 ChatGPT 时刻”之后,成百上千家公司涌现,试图成为下一代 PA(私人助理),却几乎没有真正站住。

但过去几周发生的事吸引了我们的注意——Instinct、Town、Grok Bot 这类公司突然站上舞台,瞄准大众消费者。

  • Instinct 上月高调登場,成为 X 上的宠儿(至少在 VC 圈子里),以 25 亿美元估值融资 3.5 亿美元(Index Ventures、Benchmark、Kleiner Perkins、Conviction、Greenoaks)。它完全没有 app UI。你给它发短信或打电话,它操作一台持久的云桌面,拥有完整账户权限,可订旅行、谈账单、管邮件,甚至有报道称帮人买房。
  • Town 新近完成由 a16z 领投的 5500 万美元 A 轮(Forerunner、First Round、Alt Capital、Conviction),据称“像野火一样”传播。Town 连接邮件/日历/Slack/文档,学习你的语气与模式,并把助理包进拟人化的 Townie 形象。
  • Grok Bot 八月较早发布,是一台始终在线的 agent,拥有自己的云电脑,登录你的工具并无监督地工作,充当能像你或同事一样登录工具干活的 AI 队友。
  • Meta Muse 于 9 月 8 日发布,由 Meta“从零打造,成为安全、可靠、私密且广泛可用的个人 AI agent”,运行在 Muse Secure VM 上。

过去几周我们一直在玩这些产品,想分享一些想法:为什么这些公司突然爆发,以及背后的含义。

Assistant Benchmark 相关推文配图

David Pawlan @DavidPawlan:Assistant Benchmark is live!

为什么是现在?

我们相信这一波之所以可能,是因为过去约 6–9 个月里,模型层若干能力一起成熟,而不是某一个单独突破。

  1. 电脑/浏览器使用(computer/browser use)已足够可靠,可以托付真实账户。Instinct 与 Grok Bot 都操作持久云桌面——在无 API 的情况下登录服务,像人一样点击 UI。一年前这还是新鲜事,现在已是核心产品。
  2. 长程 agent 可靠性(long-horizon agentic reliability)。 多步任务完成(订机票,变更后再改签,再把行程发邮件)要求 agent 在许多工具调用中保持连贯、不脱轨。这直接来自实验室在 2026 年交付的 RL 环境训练,以及更好的工具与基础设施(如 Sail Research)。
  3. 持久记忆成为默认,而非功能开关。 这些公司现在都能跨会话携带上下文,正是这一点把聊天机器人变成感觉“认识你”的东西。
  4. 推理成本下降,使持续运行 agent(查邮件、等待航班变更)在经济上可行,而不只是响应单次提示。
  5. 经由现有界面分发。 以短信/SMS/WhatsApp/iMessage 为界面,去掉上手摩擦。没有新 app 要学,你与系统交互的方式可以像与真正助理交互一样。

但仍未解决的是什么?

模型层跑得很快,但产品化正在暴露一组更大模型本身解决不了的硬问题。

  • 账户访问与认证(Account access & auth)。 这些 agent 大多需要对邮件、日历、银行等服务的常设凭证。尚无成熟的 agent「委托身份(delegated identity)」标准(OAuth 不是为此而建)。今天大多是“把密码/会话给它”或脆弱的限定连接器,两者都不是规模化的真解。Instinct 创始人 Noah Shinn 最近宣布与 1Password 合作,让用户无缝、安全地与 Instinct 共享凭证——对消费者是聪明一手,但一旦接入“工作”相关账户,IT 摩擦就会变得真实。
  • 支付与金融信任。 让 agent 真正成交(预订、购买、谈账单)需要尚不存在的信任与责任框架。卡组织、银行与商户尚未就 agent 发起交易如何授权、争议、投保达成一致。我们预期 Stripe 会更多介入。给 agent 访问 OpenTable 这类预订平台,与给它银行账户信息,是两回事。
  • 数据信任与责任。 据称 Instinct 的条款允许它在你断开账户后仍保留已索引数据,并自任为可约束你签协议的法律代理人。这类细则会在采用扩大时引来监管注意。早期用户已在标记隐私担忧(屏幕/击键记录、明文邮件存储)。
  • Harness(挽具/脚手架)问题。 可靠性不只关乎模型,也关乎周围脚手架:如何沙箱化动作、对风险动作取得人类批准、回滚错误、给用户审计轨迹?Town 把“默认需批准 + 完整审计日志”作为差异化卖点,正因为多数 agent 还没有这些。
  • 商业模式。 这些公司都尚未定下定价。例如 Instinct 目前仍免费。最终为了支撑推理成本(更不用说 VC 投资的预期回报),它们必须想清楚商业计划与最合适的变现路径。
  • 拟人化层的信任。 你如何真正让用户信任这套系统?要把助理拟人化吗?对某些任务你可能信任它,但对更复杂/数据敏感的任务呢?

那么谁会赢?

能把试用变成习惯的,才是真正赢家。眼下试用意愿很高——这些产品免费且几乎无摩擦。人人都有 FOMO,所以想上车。更难的是把最初的好奇变成重复行为。多数消费级 AI 产品死在“我试过一次”与“我每天都用”之间的鸿沟里。

  • 多模态会很重要。 赢家很可能在消费者已经所在之处会面(短信、电话、消息平台),而不是强迫一个全新界面——除非这个界面真正新颖。面向消费者的界面类型会与面向企业的不同。
  • 访问深度将是粘性的真正代理指标。 agent 触达你的真实账户与工作流越多,就越难离开——也越能可信地声称 ROI。我们在观察有多少用户愿意交出真实访问权,而不只是下载 app。
  • 解决真问题胜过做一个好看的 demo。 Demo 时刻很有趣,但能持久的产品是真正做掉某件痛苦事的那些。
  • 消费与 B2B 是根本不同的赛道。 消费者产生长尾、一次性、临时请求。企业用户需要可重复、可审计的工作流。为赢其中一个而建的产品不会自动赢另一个;试图同时服务两者的公司,有在两边都平庸的风险。

结语……

这个空间仍在快速演进,但不可否认我们从其中一些公司看到的增长。更不用说这些产品确实在解决真实需求——很长一段时间我们在问“AI 什么时候能帮我订机票”,而现在它正在发生。

话虽如此,我们也见过其他消费级爆款的快速增长后同样快速衰退。Clubhouse 在 2020 年几个月内从 0 到 1 亿+ 下载,估值接近 40 亿美元,新鲜感消退后断崖下跌。Threads 创下历史上最快注册记录,五天内达 1 亿用户,却在几周内日活跌超 80%。更近的是,OpenClaw 几天内从零到逾 10 万 GitHub stars,短暂成为史上增长最快的开源项目,随后在运行经济性变化与一波安全披露打击后迅速冷却(最终被 OpenAI 收购)。OpenClaw 的熄火并非产品变差,而是由定价事件驱动:一旦推理不再便宜,随便玩玩的用户消失,用量收缩到真正有需求的人。

我们在观察:今天的助理热度有多少在骑同样的补贴。花哨的采用不等于持久的行为改变。所以我们较少看最响的发布,更多看谁在用第一性原理建设——可靠性、信任、安全、能熬过初期炒作周期的定价。

就目前而言——终极赢家是能免费使用所有这些很棒应用与产品的消费者 :)

本文由 RecodeX 编译自 Is the promise of “Siri” finally here?(作者:Sabrina Albert & Vivek Ramaswami(Aspiring for Intelligence / Madrona)),首发于 SandHill.io #301 推荐阅读。译文仅供学习交流,观点不代表本站立场,版权归原作者所有。