任务经济(Task Economy)——数据将成为下一个万亿美元级赛道
Token(Token)经济
今天,当我们谈论 AI 时,Token 已经成为“王者”。
更准确地说,推理(Inference)Token 已经成为衡量 AI 生态增长最重要的指标。
上市公司会公布每月处理了多少 Token 来展示 AI 业务增长;分析师会根据各家模型产生的 Token 数量比较模型的发展情况;企业管理层也会通过 Token 使用量来衡量自己在 AI 上的投入与战略重视程度。
这种现象并不奇怪。
因为 Token 是 AI 智能与计算最基础的计量单位,Token 的增长,本质上就是 AI 世界整体增长的映射。
更重要的是,Token 把复杂的推理过程抽象成了一个统一的计量单位:
- 足够简单(两分钟就能理解)
- 足够统一(长期持续跟踪)
- 足够直观
它就像 AI 世界里的「通用语言(lingua franca)」,无论技术背景如何,人们都可以通过 Token 理解 AI 正在发生什么。
例如:
- 更多人在使用 AI?Token 增长。
- 从普通模型进入 Reasoning 模型?Token 增长。
- 从一次性问答变成 AI Agent?Token 增长。
- Agent 可以后台连续工作数小时?Token 增长。
因此,总 Token 数量不仅因为 AI 用户越来越多而增长,也因为 AI 的基础设施不断演进,使模型越来越「吃 Token」。
例如:
一个连续工作一小时的 Agent,与一个只运行一分钟的 Agent 相比,消耗的 Token 完全不是一个数量级。
这种简单的指标,也构成了今天 VC 和成长型投资者最喜欢的 AI 投资逻辑。
因为:
AI 的普及 + 模型越来越依赖 Token
两股力量叠加后,形成了 Token 数量指数级增长。
这个故事很好理解,也很好相信。
尤其随着:
- 长时任务 Agent
- 后台 Agent
不断出现,人们自然相信 Token 将持续高速增长。
因此也就不难理解:
为什么 Inference(推理)会成为今天最热门的投资方向,越来越多公司都想进入 Inference 基础设施市场。
但是,一个如此耀眼的明星赛道也有副作用。
Inference 太受关注,以至于遮蔽了另一个正在迅速崛起、规模甚至可能更大的 AI 趋势。
这个趋势,就是:
通过数据提升模型能力的市场。
作者把它称为:
Task Economy(任务经济)
什么是 Task Economy?
过去三年,大语言模型经历了三个阶段:
第一阶段:
回答简单问题。
第二阶段:
能进行复杂推理。
第三阶段:
成为真正能够完成现实工作的 Agent,并且能够执行越来越长时间的任务。
早期模型能力提升主要依赖两件事:
- 更多互联网数据
- 更多算力
但如今,这条路径开始遇到瓶颈。
原因有两个:
第一:互联网已经没有太多新增训练数据了。
可用数据几乎已经被训练完。
第二:基础能力已经基本饱和。
简单能力几乎都学会了。
于是,一个新的瓶颈出现:
高质量增量数据(Incremental High-quality Data)。
未来,这些数据不会来自互联网。
而会来自:
Task Economy。
什么叫 Task(任务)?
在强化学习(RL)里,
Task 是模型练习能力的最基本单位。
一次 Task 包括:
- 给模型一个初始状态(Initial State)
- 给它一个工作环境(Environment)
- 让模型完成任务
- 最后通过 Reward(奖励)或者 Verifier(验证器)给它打分
模型会不断重复完成大量 Task。
所有 Task 的评分最终形成训练信号(Training Signal),不断调整模型行为。
严格来说:
Task 指的是 RL 后训练阶段(Post-training)的训练单元。
不过作者这里把 Task 的定义放宽了。
因为今天的数据形式越来越丰富:
不仅仅是 RL。
任何能够提升模型能力的数据,都可以看作一个 Task。
作者也故意不用过去那个已经过时的名字:
Data Labeling(数据标注)
因为:
以前的数据标注只是:
- 给图片画框
- 给 LLM 点赞点踩
如今已经远远不是这样。
今天的数据任务复杂得多,价值也高得多。
一个法律行业的例子
假设训练一个法律 AI。
互联网可以告诉模型:
- 法律知识
- 法条
- 判例
这些都没问题。
但是:
真正优秀律师每天的工作流程,
互联网没有。
例如:
- 如何审合同?
- 如何写诉状?
- 如何准备法庭辩论?
- 如何做尽职调查?
这些经验都存在律师脑子里。
不是网页里。
所以:
为了训练 AI,需要设计大量真实工作任务。
例如:
Prompt:
请审查这份合同。
然后:
把模型放进真实法律数据室。
最后:
由专业律师按照评分标准(Rubric)给模型打分。
这样:
模型不仅知道:
做什么。
更知道:
怎么做。
高质量 Task 越多,
模型能力越强。
Token 对应推理,Task 对应模型提升
作者提出了一个非常重要的对应关系:
Token 对于推理(Inference),就像 Task 对于模型能力提升(Improvement)。
可以理解为:
Token 是 AI 的计算单位。
而:
Task 是 AI 的成长单位。
就像 Token 会随着 AI 普及不断增长一样,
Task 也会随着 AI 能力提升不断增长。
例如:
以前:
只是简单 Preference Label。
后来:
需要专家写 Rubric。
Task 增长。
后来:
需要行业 Agent。
Task 增长。
后来:
Agent 工作越来越长。
Task 增长。
后来:
企业开始大量部署 Evaluation。
Task 再增长。
Task Economy 正在爆炸式增长
作者列举了几个数据:
OpenAI 和 Anthropic
每年数据投入增长 10 倍(10x YoY)。
已经花费数十亿美元,
组织全球专家生产训练数据。
AI 应用公司
越来越多 AI 公司,
未来单家公司在 Task 上的投入将超过:
1 亿美元。
因为:
大家开始意识到:
真正的护城河不是模型,而是数据。
有独特数据,
即使用开源模型,
也能超过通用模型。
Mercor
Benchmark 投资的 Task 平台 Mercor:
2026 年 2 月:
ARR 达到:
10 亿美元。
四个月后:
达到:
20 亿美元 ARR。
增长速度惊人。
与此同时:
整个市场同时发生三件事:
- Task 数量增加
- Task 更复杂
- 专家成本更高
三者叠加,
形成指数级增长。
我们其实才刚开始
作者认为:
今天看到的增长,
只是第一局(First Inning)。
原因很简单:
今天:
Agent 还远远不能替代所有高质量专业工作。
企业今年才开始真正意识到:
数据才是区别于 OpenAI 等基础模型公司的竞争优势。
更重要的是:
未来 AI 想掌握的大部分知识,
其实都不在互联网。
而在人脑里。
作者估计:
未来 AI 所需要的知识,有 99% 仍然存在于人的经验中。
如果:
AI 公司、
企业、
模型实验室,
都想把这些隐性知识(Tacit Knowledge)
转移给模型。
那么:
Task Economy 将持续多年高速增长。
而且参与者会越来越多。
为什么大家还没有意识到 Task Economy?
作者认为主要有两个原因。
第一:
过去,
Task 的购买者几乎只有:
OpenAI、
Anthropic、
Google DeepMind 等 Frontier Labs。
而这些公司极其保密。
没人知道他们到底花多少钱做数据。
今年开始,
越来越多 AI 应用公司、
企业,
开始建设自己的数据。
于是:
Task Economy 会越来越公开。
第二:
Task 缺少像 Token 那样统一的计量单位。
Token 人人都会说。
Task 没有人统一讨论。
所以作者写这篇文章,
就是希望:
以后大家讨论 AI,
除了 Token,
还会讨论:
Task。
Task 也应该成为 AI 世界共同的价值单位。
今天没有 “OpenRouter for Tasks”
今天,
OpenRouter 可以看到:
各模型 Token 使用量。
但是:
没有任何平台能够实时看到:
全球 Task 增长。
作者希望未来有人能建立这样的基础设施。
目前,
Mercor 提供了一张图。
显示:
平台专家工时,
每个季度都在指数增长。
说明:
整个 Task Economy 的增长是真实存在的。
为什么 Task Economy 会成为未来 AI 最大市场?
作者认为:
未来 AI 要自动完成所有电脑上的工作,
必须覆盖:
- 所有软件
- 所有工作环境
- 所有行业
- 所有任务
而这些都需要:
大量数据。
法律、
医疗、
金融、
软件开发、
科研……
每一个行业,
都需要:
- 专家生成的数据集
- Evaluation
- RL 环境
未来:
模型公司、
AI 应用公司、
企业,
都会争夺这些数据基础设施。
谁拥有更多、更好的数据,
谁就拥有未来 AI 的竞争优势。
最终结论
未来几年,
随着 Task Economy 越来越普及,
整个 AI 社区会越来越关注:
模型到底完成了多少 Task,
而不仅仅是多少 Token。
作者最后预测:
就像今天谈 AI,大家首先想到 Token;未来谈 AI,Task 才是真正的王者。
注释(Footnote)
作者最后特别说明:
本文故意只讨论数据驱动(Data)带来的模型能力提升。
事实上,未来 AI 的能力提升还将来自另一个重要方向:
算法创新(Algorithmic Improvements)。
作者并不是认为算法不会继续进步,而只是为了聚焦本文主题——数据,因此没有展开讨论。