深度文章
2026.08.31 05:22 约 9 分钟 商业洞察 新发布

无摩擦交易

原文:The Frictionless Bargain
作者:Melody Koh, Partner @ NextView
来源:SandHill.io #299 推荐阅读 · Additional Reads

我自己那套配置已经用了一年,花了好几天都输给一个全新智能体在几小时里做对的事。它一路问我要许可。我仍然不太清楚它如何兑现自己许下的承诺。


我想更好地跟上 X 上的对话,于是做了一个工具,找出最值得参与的那些。我在这套工具上花了好几次会话,但仍然觉得「瞄准」很差,几乎要放弃了。于是我想,让我看看 Instinct 能不能做得更好。

Instinct 是过去一周刷屏 X 的智能体产品,先是投资人和 AI 建设者晒它为自己做了什么,然后是同一批人发现它还在做别的事。我试了几个小时。我没给它任何链接,也没给任何账号。它正确找到了我的 X 账号、我的 Substack 和我的 GitHub 仓库,全程没有让我确认是哪一个账号。三轮反馈之后,它挑的推文就是我会挑的那些。相当惊人。

它没有让我安装任何东西、把任何东西接在一起、或决定任何东西该怎么工作。它就直接搞定了。

一个全新智能体打败了我自己一年的配置

我的工具什么都有。它跑在 Claude Code 上,带着我全部的上下文、全部的写作、全部的标准,以及我自己 X 账号上已认证的会话。打败它的那个,除了我的名字、邮箱,以及大概三轮对话的上下文之外,对我一无所知。

两者的差别在于 harness(挽具/操控程序)——我称之为操作它并决定它看见什么的那套程序。过度简化地说,它就是系统提示词(system prompt,智能体启动时被强制阅读的指令)加上被允许的工具(智能体何时可以/应当使用哪些工具)。你怎么把它们重新组合,决定了一切差别。

而且我的工具输得并不接近。它不擅长挑哪一场对话值得跟。它不擅长想出在社交上说得通的角度。有时它连目标帖子在讲什么都没搞对。它不擅长从我自己的文章里抽出最相关的东西。换句话说,它无法内化我那些真正奏效过的帖子里的教训。

我真的不知道为什么会这么难。我最好的猜测是:这是机制问题。我的工具试图弄清我批准过哪些推文、拒绝过哪些,于是用我写过的推文去反向工程一堆复选框。Instinct 显然除了阅读公开可得的内容之外什么都不需要我给,也不需要我去思考如何设计一个工具来做这件事。看到 Instinct 用几小时的上下文就把我带到 80%,很迷人。

我做好心理准备的每一步设置,根本不存在

我给 Instinct 的第一个任务简单但烦人(如果你是家长,你会同意)。我需要给儿子报名秋季足球,于是让它「查一下我们镇上这个足球项目,告诉我时间表、价格和怎么报名。」它很快带回报名链接、日期和费用。我问训练和比赛具体何时何地。网站上没有信息,但 Instinct 智能体提出可以发邮件去问——我只需要审阅它用文字写好的草稿,然后就完成了。

换成编码智能体,这个请求就是一个项目。我们需要搭邮件服务,去搞懂 Resend,或者我需要 Gmail MCP 等等。Instinct 直接就有一个收件箱。

然后我给了它一个周期性任务:每天检查 X 上值得回复的对话。它说好的,完成了,我会在早上 7 点 ping 你。我不必设置 Claude routine,也不必把任何东西接起来。而且它快得让我意识到,我曾经以为不重要的延迟其实很重要。我以前觉得延迟没什么大不了,因为「它在后台工作,我同时做别的事」,但那种干脆的响应速度真的造就了极好的 UX。

我跟丈夫怎么说的:它基本上就是 OpenClaw 加 Claude Code,没有那些设置和麻烦,而且直觉很好。(他知道我是 Claude Code 的粉丝。)几个小时之后我想,再过一天我就可以宣布「眼下最好的 AI 智能体不再是编码智能体了。」

我以前试过在手机上用这类智能体。2026 年 3 月的 OpenClaw:它没能走向大众市场的两个原因是,设置成本太高(我花了整整一个周五晚上来配置),以及它没有很强的标准。它会说「哦好的!我在弄了!」然后它并没有在弄(是的,它会撒谎!)。Claude Code 是相反的赌注,显然已经得到了回报,这也是为什么在一年的学习循环和纠错之后,我对自己的 mech 有信心。

所以我以前想错了。我以为一种复杂但值得的上手坡道是必要的,Claude Code 那种,其实不是。你完全不需要懂任何关于智能体的事。你只要让它做事,它就很好。这才是令人印象深刻的部分。做一个「wrapper」(套壳)并不容易,我们只是一直缺乏想象力,直到有人展示它可以好多少、容易多少。多快变得有用是出厂设置;它是否真正属于你,取决于你在上面添加什么。我认为教它更好地了解你,永远有好处。个性化永远有价值,因为我们每个人都是独特的。

我用过最好的 harness,一寸也没移动权限边界

我第一天要求的任何事都不需要凭证。但一旦它需要某个不是公开的东西,设置就会一次一个登录地回来,就在你想把任务做完的那一刻。上手坡道挪到了登录的另一边。

我逼 Instinct 智能体描述它的信任与上下文边界,不幸的是,我们仍然卡在我几个月前写过的同一组权衡里:缰绳长度(leash length)和上下文闸门(context gate)。

缰绳长度和上下文闸门是两个不同的问题,而且它们会叠加。缰绳长度是天花板,因为你给它的权限越多它就越有用,所以无论 harness 多么出色,缰绳都会封顶你的智能体能有多有用。上下文闸门是另一端。一旦智能体有了外部写权限(例如它控制着一个已登录你 X/LinkedIn 账号的浏览器,或能从你的邮箱发邮件),并且它知道一些本应私密的关于你的事,就真的没有办法在不闸住工具使用的情况下维持上下文闸门。你可以随你喜欢地审阅上下文的中转,但每一次检查都会是基于模型的、概率性的。没有固定规则能抓住它。智能体甚至不需要写权限就能成为攻击目标,因为它读到的任何东西都可以携带指令,而它已经拥有的发送权限会完成剩下的事(这就是提示注入, prompt injection)。所以要么你接受有时会出错的检查,要么你把权限收窄,接受信任—效用权衡,这意味着这些智能体没法那么有用。

我知道它可能怎样出错。如果它有你的 X 或 Gmail,智能体可以以你的身份说出你不想说的话。也许这已经是一场输掉的战斗,就像隐私。这是大多数消费者会在没有意识到自己正在做选择的情况下做出的权衡,直到发生某种尴尬(或灾难性)的事情。

能力可能被误认为可信

Instinct 的条款,最近一次修订于 2026 年 8 月 20 日,把这笔交易写成了法律语言:

「你特此任命本服务为你的代理人,代表你订立协议、承诺或交易……对你具有约束力,如同由你直接订立。」

以及:「我们对任何非预期行动不承担责任……」

平滑的上手坡道,就是概括授权从内部看起来的样子。

Instinct 截至 2026 年 8 月 20 日的服务条款

Instinct 截至 2026 年 8 月 20 日的服务条款(ToS)

我直接问 Instinct,登录 X 意味着什么,它没有把答案说软:「那是一个由我驾驶、持有你 X 会话的浏览器,技术上意味着它可以以你的身份发帖。」它也不会把一个实时会话称为零风险。然后我问连接 GitHub 如何运作,它说授权屏幕会让我把授权范围限定到特定仓库。我点开链接,屏幕上写着:点击同意,我将授权它访问全部仓库,读并且写(幸好我读了屏幕上实际写的内容)。我告诉它之后,它立刻放弃了那个说法,「相信屏幕上写的,而不是我说的」,并给自己写了一条规则:不要描述自己没见过的集成权限。

我不喜欢看到的东西,所以没有连接 GitHub,也从未给它已认证的浏览器访问。

我逼 Instinct 智能体好好解释它想要我授予的额外权限会如何运作

我逼 Instinct 智能体好好解释它想要我授予的额外权限会如何运作

别人跟它相处的日子比我更糟。它确实会在某个时刻征求许可,并且据说会告诉你它承诺做什么、不做什么。但你并不真正知道 HOW——它如何兑现那个承诺。一个被遵守的承诺和一个被打破的承诺,在用户看来会一模一样。Instinct 智能体对我坦诚而精确,却仍然说错了它在要求什么。我抓住了它,因为我知道该问。大多数人不会知道该问什么,因为他们不懂那套机制,而不必懂,正是这个产品的全部卖点。

我信任他们走的方向,而不是他们落脚的地方

我对 Claude Code 和 Instinct 的信任不同,我认为可以归结为两件事:透明度和方向。从定义上说,从暴露机制的那一侧走进来,一开始就有透明度,代价是易用性和上手坡道。从另一侧走进来则没有,因为它一开始就掩盖复杂性。

我对 Claude Code 更安心,因为我能看见光秃秃的机制,每一次工具调用和一步步大声想出来的过程,这对大多数大众市场用户显然太过载。但那不是我信任它的唯一原因。一年前我从另一端开始,它为所有事情停下来,让我批准每一次编辑和每一条命令。它从不解释为什么任何一步有风险。它只是一遍遍停下,在有些事情上停、在有些事情上不停,而这教会了我这种工具能对你做什么。摩擦最后成了我无意中付的学费。

然后他们走了起来。Auto mode 在三月作为研究预览到来,并在两周前成为默认,由一个分类器审查每一个动作,而不是依赖用户来判断。他们移动,是因为「询问」已经不再奏效,并且正在制造一种虚假的安全感:Anthropic 的研究表明,用户几乎批准每一个提示,会话越长他们抓得越少,而分类器不会累。¹

所以两款产品最终几乎落在同一个地方,让我产生不同信任的不是目的地,而是方向。一个从严格开始,靠自己挣到往下放。另一个从远端起步,先养成习惯,再在公众压力下填补缺口。

我仍在用 Instinct,现在对权限以及把它接到我的东西上,不那么牛仔了。无论哪边你都在做权衡,所以最好睁大眼睛走进去。

但我不认为答案只是「更小心一点」。我们对上手坡道缺乏想象力,直到一个产品展示了它可以有多容易。我在等下一个产品再次打破我们的想象,展示如何走这条线,既不放弃容易,也不放弃信任。


¹ 用户批准 97% 的单次权限提示,拒绝 3%。同样这批人,当 Claude Code 把整个计划拿出来请求批准时,会拒绝 39% 的计划,所以不是他们不读东西;是这种特定对话框把他们训练得不再读。在一项对 1,053 名付费测试者的对照研究中,一条明显危险的命令被换进单次提示:测试者抓住它的比例是 13.6%,分类器是 89%。会话早期人们抓住大约 17%;五十次提示之后,大约 5%。分类器的拦截率不随会话长度变化,保持平坦。


本文由 RecodeX 编译自 SandHill.io #299 推荐阅读,原文链接与作者见文首;原文版权归原作者所有,译文仅供学习交流,如有异议请联系我们处理。

订阅 RecodeX 创投情报 每日融资动态与原创深度报道,直达邮箱

了解 RecodeX 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读