行业正放弃雇佣非洲和亚洲零工经济劳动者,以推动构建”更智能”模型

Montage of logos for Toloka, Scale AI and Turing

多家顶尖人工智能集团正用高薪行业专家取代非洲和亚洲的低成本”数据标注员”,这是构建更”智能”、更强大模型的最新举措。
Scale AI、Turing 和 Toloka 等公司正在招募生物学、金融学等领域的顶尖专家,帮助人工智能团队创建更复杂的训练数据——这对开发下一代 AI 系统至关重要。
随着 OpenAI 的 o3 和谷歌 Gemini 2.5 等”推理”模型的崛起,企业正加速淘汰肯尼亚、菲律宾等国每小时薪资不足 2 美元的大规模廉价劳动力。这些工人原本负责耗时费力的数据标注工作,为 AI 模型训练处理海量数据集。
荷兰公司 Toloka 首席执行官兼联合创始人奥尔加·梅戈尔斯卡娅表示:”长期以来,人工智能行业都过度聚焦于模型和算力,数据始终是被忽视的一环。如今行业终于认识到训练数据的重要性。”
这一转变引发了投资者对数据标注初创企业的热捧。6 月,Meta 向美国公司 Scale AI 注资 150 亿美元,使其估值翻倍至 290 亿美元,这是其追赶竞争对手战略的一部分。
今年 3 月,总部位于加州的 Turing AI 以 22 亿美元估值完成 1.11 亿美元融资;5 月,杰夫·贝索斯的个人投资公司 Bezos Expeditions 领投了 Toloka 7200 万美元的融资轮。
数据标注初创公司的价值正在飙升
企业价值,按年和公司成立日期(十亿美元)

过去数据标注员只需处理简单任务,例如在图像上绘制方框识别物体、描述图像内容、筛选流畅表达方式,以及从常含暴力或图像化内容的数据集中剔除不良答案。

由于 AI 模型需要更多数据来提升性能,这些工作者曾被要求在数秒内处理任务,每天完成数百项任务以构建庞大的数据集。

梅戈尔斯卡娅表示,随着许多此类任务可实现自动化,相关需求已大幅下降。

肯尼亚数据标注员协会主席琼·金尤阿指出,他们现在承接的工作需要依赖本地化语言技能和专业知识。该协会还发现,部分工作开始要求人工标注员对 AI 生成内容进行最终质量检查。

随着 OpenAI、Anthropic 和谷歌等领先 AI 团队试图开发据称将超越人类智能的模型,行业正掀起新一轮注重数据集质量、聘请专家解决复杂问题的风潮。

“这些模型现在需要的是真实人类使用模型进行知识工作的数据,以及模型出错时获得的反馈,”数据标注公司 Turing AI 联合创始人兼首席执行官乔纳森·西达尔思表示。

为确保模型在从编程到物理和金融等广泛领域中表现良好,资金雄厚的人工智能公司现在愿意为更复杂的数据集和来自全球各地的专家付费。

西达尔思称,为吸引来自不同行业的人才,Turing 支付给专家的薪酬比他们现有工作高出 20-30%。他补充说,虽然数据预算仅占人工智能公司在计算能力上花费的数千亿美元的 10-15%左右,但这仍然是”一笔巨额资金”。

Toloka 公司梅戈尔斯卡娅表示,诸如”思维链”这类展示 AI 模型逐步解决问题过程的新功能,是通过让人类专家示范如何拆解问题而开发出来的。

经验丰富的软件工程师可能还需要根据其专业领域设计相关任务,然后通过编写代码、调试程序及检查安全漏洞来解决问题。

与此同时,验证一个物理学理论需要物理学家贡献如何构建模拟器来检验理论真伪的见解,软件工程师负责编写模拟器代码,以及数据科学家分析模拟结果。

“这样做的结果是,模型不仅会比物理学家更出色,还将超越那些在物理学、计算机科学和数据科学领域顶尖人才的叠加水平,”图灵公司的西达尔特表示。