深度文章
2026.08.31 02:04 约 8 分钟 商业洞察 持续阅读

你不是模型。别按 token 定价。

原文:You are not a model. Don’t price per token.
作者:Tugce Erten & Sarah Wang, A16Z
来源:SandHill.io #299 推荐阅读 · Guides, Case Studies, and Best Practices for Operating

按 token 收费正在成为 AI 公司的默认做法。对大多数 AI 应用来说,这是一个错误。

按 token 定价一开始用对了地方:模型层(model layer)。当 OpenAI 在 2020 年推出 API 时,按模型所消耗的计算量收费,是计量原始推理(inference)的合理方式。然而,两年后 ChatGPT 的亮相,催生了一波建立在这套基础设施之上、但做得远不止于此的应用。这些新产品把专有数据、工具、编排(orchestration)、集成与工作流逻辑组合在一起,代表客户把工作做完。

当一个应用用 token 来为这类工作定价时,它就把模型提供商的成本结构原封不动地搬进了与客户的关系里,并把产品的价值锚定在一个成本持续下降的计量单位上。基于我们的工作经验,把模型层的定价逻辑带进应用层(application layer),往往是一个错误。

相反,我们认为:公司应该在自己能够可靠地衡量、归因并为之辩护的最高价值层上定价。

  • 如果你卖的是模型访问权,就按 token 定价。
  • 如果你把模型变成有用的工作,就按客户能识别的价值单位定价,通常通过积分(credits)。
  • 如果你交付的是清晰且可归因的业务结果,就按结果(outcome)定价。

AI 定价层级示意

把这件事做错,很难挽回。基于 token 的价格会训练客户把应用与原始算力做比较。它把数据、工作流和编排的价值拱手让出;把客户暴露在他们无法预测的技术复杂性里;并可能把供应商锁进薄弱的利润率。积分本身并不能解决这个问题——如果它们不过是成本加成后的 token,它们计量的仍是基础设施,而不是价值。

围绕可识别的工作来定价,效果正好相反。它让价值可读、支出可预测,并让产品改进对双方都具有经济价值。在我们对 50 位技术型 AI 买家的调研中,有 27 人更偏好与可识别工作挂钩的积分,只有 14 人更偏好 token。

买家对定价方式的偏好调研

1. 在你所出售的那一层定价

技术栈的两端相对直白。模型提供商出售推理,可以用 token 计量。有些应用交付的结果足够可观察、可归因,因而可以直接按结果定价。

中间层更难。而大多数 AI 应用就活在这里。

例如,一个客户研究代理(account-research agent)卖的不是搜索次数和模型调用次数。它卖的是一份完成的客户简报。一个编程代理卖的是一次已落地的改动。一个数据平台可能卖的是一次完成的查询、一条流水线,或一次代理运行。应用的工作,就是把这个工作单元之下的复杂性抽象掉。

因为每个品类打包价值的方式不同,并不存在一个普适的 AI 应用计量指标。语音 AI 可能从分钟起步,再走向「已解决的对话」。Copilot 可能从席位起步,再随着代理式工作在成本与价值上制造更大差异,而加入基于用量的定价。

正确的问题不是「AI 的定价指标是什么?」而是:「客户已经理解的价值单位是什么,我们能否持续一致地衡量它?」

2. 客户要的是可读性,不是 token

客户仍会问起 token。通常,他们要的是两件事之一:可比性,或控制权。

第一,买家想要一个共同基准。Token 看起来能让他们把一个专业化应用,拿去和通用模型 API 或内部自建方案比较。但这种比较通常是虚假的精确。每个应用组合了不同的模型、数据、工具和自动化程度。流经一个产品的 token,并不能产出与流经另一个产品的 token 相同的工作。

第二,买家想要分摊支出。财务和 IT 团队需要把 AI 支出追溯到某个部门、项目、客户或发票,而且往往要跨越不断增长的应用组合。要求他们为每一个产品分别预测 token,等于把这些产品本该隐藏的复杂性又造了回来。

这两种需求都合情合理。尽管如此,token 定价带来的摩擦,往往多于清晰。

一位客服负责人可以估算出公司要处理多少通对话。要预测上下文长度、检索量、重试次数、推理时间或输出 token,就要难得多。本该直截了当的 ROI(投资回报率)计算,变成了公司部署的每一个 AI 应用都要单独做一遍算力预测。

更好的答案是:暴露足够的底层用量细节以建立信任,但不要把这些用量变成商业计量单位。向客户展示完成了哪些工作、产能用在了哪里、为什么某些任务消耗得更多。给财务和 IT 他们做预算与内部结算(chargeback)所需的报表。

透明,并不要求计费计量器和底层成本计量器是同一个东西。

在竞争激烈或技术成熟度很高的市场里,公司可能仍需提供 token 透传(token pass-through),尤其是针对异常昂贵或波动剧烈的模型用量。但这应当是混合模式中一个明确的组成部分,而不是产品价值的默认表达方式。

3. 积分应把工作映射到价值,而不是把 token 藏起来

对 AI 技术栈广阔的中间层而言,积分可以是打包可变工作的有效方式。但积分是一种货币,不是价值指标。真正重要的是:积分买到了什么。

一套弱的积分系统,只是把 token 计数换成不透明的内部货币。它藏起了计量器,却没有改进计量器。

一套强的积分系统,映射到客户能识别的工作。它可能使用几个直觉上的力度档:修一个小 bug 比做一个跨多文件的功能更便宜;总结合同中的一个条款比审阅整份协议更便宜;丰富一条记录比跑一套多步骤的客户研究工作流更便宜。

最好的积分系统做三件事:

  • 抽象掉基础设施的复杂性。 客户买的是工作,不是原料。
  • 解释相对力度。 简单工作消耗很少;标准工作消耗可预期的数量;复杂工作消耗更多。
  • 创造商业灵活性。 同一个积分池可以覆盖多种工作负载、代理或自动化,而采购只需管理一份合同。

检验标准是可理解性。买家通常先知道自己的工作量,然后才知道自己的算力负载。如果客户无法用几句话理解积分体系,它就太复杂了。

4. 积分可以保护利润率

积分不只是让用量变得可理解。设计得好,它们还能保护你的毛利率。

在传统 SaaS 里,多一个用户往往只增加很少的边际成本。在 AI 应用里,每个用户都可能产生推理、检索、搜索、工具调用、第三方数据、媒体生成、重试和失败运行。高速增长可以掩盖一个脆弱的生意——如果每一美元新增收入很快就被付给了模型、云或数据提供商。

定价体系需要把两个决策分开:

  • 这项工作值多少? 客户价值、支付意愿和竞争,决定积分池的价格。
  • 交付这项工作要花多少成本? 相对成本与复杂度,决定每项任务消耗多少积分。

这种分离让供应商能够保护利润率,同时保留来自模型路由、缓存、提示优化、更好的基础设施,以及更丰富(而且不断变化!)的专有模型与开源模型组合所带来的利润上行空间。事实上,如果底层模型成本下降,应用甚至可能留住一部分收益——因为客户付的是工作的钱,而不仅仅是在报销公司的算力。

Clay 是一个有用的例子,而且在定价思考上常常走在前面。在一份 2026 年的定价备忘录中,公司写道:它在 2022 年把 Pro 档的积分定错了价,并在该档位亏损运营了数年。它的新模型把用于第三方数据的 Data Credits 与用于编排工作的 Actions 分开。对成本可预测的模型,Clay 保持固定定价;对更波动、更昂贵的推理模型,则按实际 token 成本透传、不加价。换句话说,Clay 对不同层级使用不同的计量器:Actions 对应平台价值,token 透传对应不可预测的模型成本。¹

5. 当价值足够清晰时,走向按结果定价

当产品在完成有价值的工作、但最终业务结果还无法干净地归因时,积分最有用。一旦结果变得可观察、可归因,并且有足够价值来支撑一个稳定价格,计量器就应该再往上移一档。

在这些条件下,按结果定价:一次已解决的支持对话、一个合格线索、一次已预约的会议、一桩已处理的理赔,或追回的一美元。

如果结果还不够可归因,就通过积分按工作单元定价。

如果客户买的是原始模型访问权,就按 token 定价。

许多产品会使用混合模式:席位对应访问权,积分对应可变工作,token 透传对应异常昂贵或不可预测的模型调用,结果费用用在归因干净的地方。多个计量器本身不是问题,但不要在错误的层级使用错误的计量器。

让价值可见

Token 定价会把与客户的对话拉向一条持续下降的成本曲线。对于一款有用性、可靠性以及在工作流中的角色本应持续上升的产品来说,这是一个糟糕的锚点。

更好的路径是:在你能够可靠地衡量、归因并为之辩护的最高价值层上定价。把可变工作翻译成可理解的单位。当灵活性重要时,用积分来打包这些单位。一旦客户能够识别并信任结果,就尽快走向按结果定价。


¹ https://www.clay.com/blog/clay-pricing-memo-internal


本文由 RecodeX 编译自 SandHill.io #299 推荐阅读,原文链接与作者见文首;原文版权归原作者所有,译文仅供学习交流,如有异议请联系我们处理。

订阅 RecodeX 创投情报 每日融资动态与原创深度报道,直达邮箱

了解 RecodeX 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读