寻找人类疲惫之源
从破产的航空公司到二手书籍,人工智能对人类数据的搜寻方式越来越奇怪了。
还记得当初人工智能行业面对“数据从何而来?”这一问题时的答案基本上是:互联网吗?
互联网规模庞大、几乎免费、持续扩张,而且数据还以计算机能够识别的格式存储着。Common Crawl 拥有数十亿页网页,GitHub 存放着各类代码,维基百科则记录着各种事实,而 Reddit 上则满是人们阐述为何其他人是错的观点。
AI 实验室继承了数十年来人类在无意中创造出的成果——他们在将文明数字化的同时,却并未意识到自己正在积累训练数据集。我们编写网站、上传照片、在论坛上回答问题、发布代码、将百科全书数字化,还将几乎所有人类可能进行的活动相关的视频上传到网络。而后,模型便消化了这些数据。
如今,那些容易获取的数据资源已经所剩无几。公共互联网中质量最好的数据早已被大量挖掘,内容发布方纷纷设置了访问门槛,版权诉讼也让随意抓取数据变得成本更高,而网络上也越来越充斥着人工智能生成的劣质内容。
这就形成了一个典型的恶性循环:人工智能需要人类生成的数据来不断提升性能,但与此同时,人工智能却在不断让这类数据更难获取。因此,整个行业不得不沿着数据供应曲线向下发展。而情况也变得越来越奇怪。
本周出现了一个格外奇怪的例子:Google 出价 1000 万美元购入已经破产的 Spirit Airlines 的内部业务数据,以便用于人工智能训练。据称这些数据包括大约 1 亿封电子邮件和 5 亿条 Microsoft Teams 消息,还有各类文档、电子表格、日历信息以及其他内部业务记录,但顾客信息和信用卡数据并不包含在内。

先暂且不去探讨那笔交易中的奇怪之处。Google 其实并不想要 Spirit 的飞机或机场登机口,它也无意经营一家廉价航空公司,这或许是很明智的决定。它只是想了解这类航空公司的运营模式而已。
Google 正在翻阅一家破产航空公司的各类资料,因为其中蕴藏着数亿个关于人们如何协作、决策、处理问题、纠正错误并完成任务的实例。随着基础模型越来越依赖公共知识,私人经验则显得愈发珍贵。
对于知识工作者而言,或许再没有比这更贴切的写照了:最终我们都会化为尘土,而我们的 Teams 聊天记录却会被输入到 LLM 中。
Spirit 航空只不过是这场更广泛竞争中的一个体现而已。硅谷也重新重视起了书籍的作用。
法庭文件中提到,Anthropic 内部的“Panama 项目”其实是一项大规模行动,其目的是获取实体书籍、拆开书脊、扫描书页,并将得到的文本纳入该公司的训练语料库。据称,该公司为此花费了数千万美元,处理了数百万册书籍。

目前,英国和爱尔兰的图书商们反映有大量奇怪的批量采购订单,订购的都是那些冷门且已绝版的书籍,从古老的农业著作到过时的赛车传记都有,而且这些订单在定价时往往几乎不考虑成本,购得后直接被运往仓库。据报道,Amazon 也在购买实体书并进行破坏性扫描。


二手店里那本被遗忘的书籍里,藏着 2026 年极为罕见的珍贵事物:一大段结构完整、经过专业编辑、明确由人类撰写的文字,这类内容很可能从未在互联网上出现过。
旧书有着明确的来源记载,它们源自更早的年代。对于一本 1987 年出版的养羊手册,我们可以相当有把握地认为它是人类所写,而非由某个语言模型生成的——那个模型部分基于另一个语言模型,而后者又部分基于一篇总结该养羊手册的 Reddit 帖子。
但仅仅从破产企业及二手书店中寻找数据是远远不够的。针对数据短缺问题更为直接的解决办法就是自行制造数据。这便催生了一个蓬勃发展的行业,该行业致力于为前沿实验室提供越来越特殊的训练数据。
-
专家数据。Mercor、Surge、Turing、Snorkel 以及 AfterQuery 等公司会招募软件工程师、律师、医生、银行家、科学家等各类专业人士,共同设计问题、演示解决方案、评估模型输出,并解释其中存在的细微错误。
这与传统的数据标注有着很大不同。如今的“边缘训练样本”可能是一名正在构建模型的投资银行家,也可能是一位在设计复杂数学证明题的哲学博士,或是负责解释为何某个看似合理的答案在实际应用中会失效的安全工程师。
-
偏好数据。有些问题并不存在客观正确的答案:哪种回应更有用?哪个生成的网站看起来更美观?哪张图片的审美效果更好?LMArena 和 Design Arena 之类的平台会将这类主观问题转化为两两比较的形式——向人们展示两种结果,询问他们更喜欢哪一个。在足够大的规模下,这些投票就会成为那些没有标准答案或参考答案的领域的模型训练数据。实际上,这些公司正在为人类的审美建立相应的市场。
-
强化学习环境。这或许最终会成为最重要的类别。与其向模型提供某人完成任务的静态示例,Fleet、Preference Model,以及越来越多的 Surge、Turing、AfterQuery 等公司都在构建模拟环境,让智能体能够在其中真正执行任务。
为智能体提供一个模拟的 CRM 系统,让它负责回复客户、更新记录、发送消息,同时处理意外状况并犯错。之后对正确的行为给予奖励,并重复进行数百万次训练。数据集只需使用一次,而该环境却可以无限生成新的训练案例。
-
合成数据。此外,还有一种显而易见的解决办法:让模型自行生成训练数据。
在那些结果可以被验证的情况下,这种方法效果极佳——代码可以运行起来,数学计算可以被检验,游戏也能分出胜负。合成数据能够以少量高质量的人类数据为起点,将其大幅放大。但合成数据并不能取代真实数据的需求,它只是放大你已有的那些数据而已。合成数据负责提升规模,而人类数据则决定发展方向。
综合以上种种,人工智能行业的数据策略逐渐呈现出一种层级结构:
互联网→授权内容→离线档案→企业工作流程→专家推理→交互式环境→现实世界行为
每一步都在朝着那些更难获取、更难标准化且成本高得多的数据前进。
如今,用于训练的那些数据样本越来越不可能是从网页上抓取来的新句子。正因如此,Google 才会收购破产航空公司的邮件,Anthropic 会拆解那些被遗忘的书籍,各人工智能实验室会按小时向医生和银行家支付费用,而各类初创企业则正在打造完整的数字世界,供人工智能模型在其中进行训练。