[audio mp3="https://recodex.ai/wp-content/uploads/2025/12/2025120418362639.mp3"][/audio]
本文信息来源:chainofthought
如何将人类的判断力转化为一种全新的资产类别
你可能从未听说过弗洛伦斯·劳伦斯(Florence Lawrence)这个名字。
1910年,她成为了史上第一位名字出现在银幕上的电影明星。在她之前,片尾演职员表中的演员只被称作“那个女孩”或“那个男人”,他们只是制片厂体系下的一群无名表演者,而该体系正是为了让他们保持这种籍籍无名的状态而设计的。
第一位电影明星,弗洛伦斯·劳伦斯,摄于 1910 年
逻辑其实很简单:如果观众不知道演员的名字,演员就无法要求更高的片酬。好莱坞赚得盆满钵满,而它的创作者们却默默无闻。
这种情况慢慢开始改变。演职员表中出现了名字。版税制度确保了当一部电影被重新使用时——无论是通过 VHS、DVD、Netflix 还是流媒体分销——创作它的人都能被铭记并获得报酬 。
对于人工智能而言,这场革命很大程度上尚未发生。但这只是暂时的。
每一个你使用的 AI 模型都建立在你从未见过的无数人的劳动之上。医生标注癌症扫描图像,研究人员标记欺诈模式,标注员清理数据集,还有数百万像我们一样的人撰写了 Reddit 帖子、维基百科词条、书籍和 GitHub 代码库,这些都成为了训练的“燃料”。
基于他们劳动成果建立的模型扩展成了价值数十亿美元的产品,而那些让即便这一切成为可能的贡献者们,却从故事中消失了。

这种反冲开始蔓延到法庭上。《纽约时报》 起诉了 OpenAI。作家和开发者发起了集体诉讼。GitHub Copilot 被指控在未注明出处的情况下照搬开源代码。
这支隐形的贡献者大军最终一无所获。
人工智能领域的归因危机
现代人工智能技术栈依赖于三大资源: 数据、模型和算力。 如今,这三者均被少数科技巨头所掌控。这种中心化导致了三个核心的扭曲现象:
-
价值攫取 :大型人工智能公司攫取了几乎所有的经济利益,而贡献者却几乎一无所得。
-
缺乏透明度 :创作者很少知道他们的作品是如何被使用的、谁在从中获利,或者存在哪些下游应用。
-
激励错位 :如果没有报酬,贡献者就几乎没有动力去分享高质量或专业化的知识。
据普遍估计,用于训练大型语言模型的数据中,有 60% 到 90% 来自个人 ,包括开源开发者、博主、研究人员和艺术家。然而,这些价值几乎没有回流到他们手中。
这导致了经济学家所称的双重市场失灵 :
-
在供给侧 ,贡献者的报酬过低且默默无闻。
-
在需求端 ,企业面临着昂贵且不透明的数据市场。
这给人的感觉就像是版税制度出现之前的好莱坞。每个人都看得出这个体系不公平,但这又是我们仅有的体系。直到有人改写这一剧本。
机会之窗
在这个领域,目前实际上存在着一个有趣的市场机会。 当 Meta 在六月份斥资 140 亿美元收购 Scale AI 49% 的股份时 ,这实际上为该行业设立了一个定价基准。数据训练和标注已经成为一条价值数十亿美元的战略护城河。
来源:福布斯
随着此次收购,Scale 的可用性随之降低。Meta 的巨大引力会将其吸纳进内部体系,导致其他 AI 实验室不得不仓促寻找新的数据合作伙伴。这为新入局者创造了市场真空。
大多数买家只关心一件事: 快速、经济实惠的数据集 。 一家聪明且行动迅速的公司完全可以把握住这一正在开启的市场机遇,分得一杯羹。
这正是 Codatta 故事的起点。Codatta 是致力于重塑数据聚合与估值方式的众多公司之一, 它们利用加密技术作为协调和验证层。需要提出的问题是:Codatta 具备怎样的优势?

Codatta 承诺提供不仅更经济实惠 ,而且比现有厂商更加真实可信的数据。 其无需许可的激励机制设计降低了数据获取成本。数据购买者可以选择“先训练,后付费”,这是传统供应商所不具备的选项。
Codatta 拥有一种服务于市场两端的商业模式:
-
资金雄厚的企业 (比如大型科技公司、受监管的金融机构、医疗保健机构),它们希望成本具有确定性。
-
崭露头角的 AI 团队 ,它们拥有很高的增长上限,但预算有限。
将数据转化为一种资产类别
我们大多数人对数据的思考大错特错 。
我们将其视为燃料。燃烧一次用来训练模型,之后价值便随之消散。但如果数据的作用像股权呢?既能长存,又能产生复利回报。
要让数据像股权那样运作,你需要落实四个要素:
-
溯源性 :每一份数据都与一个钱包相绑定
-
版税机制 :每当数据被用于训练或推理时,贡献者都能获得持续的支付收益
-
规模化质量 :确保系统不会淹没在噪声数据中
-
隐私设计 :原始数据保持加密状态。
这正是 Codatta 所下的赌注。他们正在为一种新型的知识经济构建基础设施,在这种经济中,数据如通过资产般产生收益,而每当贡献者的成果出现在模型的输出中,他们都能获得报酬。
第一部分:幕后机制
本部分深入探讨 Codatta 的实际运作机制。如果您想直接了解商业案例,请跳至第二部分。

Codatta 的设计始于一个看似简单实则精妙的区别:将 X 与 Y 分离。
-
X 是原始输入,例如图像、钱包追踪记录或扫描件。
-
Y 是转化数据所需的人类判断,例如标签、评判和标注。
大多数人工智能管线都模糊了两者的界限。标注往往是在后台进行的,被视为一种“黑箱”式的劳动力。Codatta 将 Y 带到了前台。一旦人类智能变得可见,它就可以被归属、评分和支付报酬。
这也正是 Frontiers 发挥作用的地方。
Frontiers:模块化的人类判断市场
Frontier 不是一个产品。它不是一个数据集。它是一个用于获取特定类型人工输入的、可编程的市场。
一个 Frontier 可能会要求人们标记可疑的加密货币钱包。另一个可能会招募验光师来标记早期的眼部疾病。
我喜欢把每一个 Frontier 想象成一个迷你应用程序(mini-app):
-
它有自己的模式(即定义什么才算是有效提交)。
-
它有自己的激励机制设计(固定费用与特许权使用费)。
-
只要有需求,它就可以一直运行,并非用完即弃,而是复用数据。
Codatta 通过增加更多此类专注且可复用的前沿领域(Frontiers)来实现增长,每一个“前沿领域”都是将专业判断转化为资产的小型引擎。
如果没有下面的隐藏层,这一切都将无法运作。
目前 Codatta 上可用前沿任务(Frontiers)一览。
如果说 Codatta 是门面,那么 Codatta 协议 就是生产车间。
它在幕后将一切紧密相连。它处理跨链协调,确保数据流动时归属权不会断裂。它运行验证逻辑,让每一个原始输入都能映射为一个可信的判断。它将加密后的有效载荷保存在链下,同时将证明和元数据锚定在链上,让你同时拥有隐私性和可审计性。
最重要的是,它编入了激励机制。这意味着版税、惩罚和质押机制都在其中。所有一切都通过协议层面的可编程合约来流转。没有它,这只不过是一个更花哨的“机械土耳其人”(Mechanical Turk);有了它,每一次贡献都变成了一份来源清晰、有据可查的数字资产。
从提交到资产
每一个数据资产最初都是作为 Frontier 内部的单一提交开始的。这正是处理流程的起点。
贡献者通过 Frontier 界面上传文件。有效载荷(payload)会在客户端立即进行加密。Codatta Protocol 会将哈希值和元数据记录在链上,而加密后的内容则会被路由至链下的去中心化存储(如 IPFS、Greenfield)或安全飞地(secure enclave)。此时系统便知晓了该数据的存在,但完全无需看见其中的内容。
接下来,自动化过滤器开始介入。人工智能会筛除垃圾信息、已损坏的文件和重复内容。每一个处理结果都会被记录在 Codatta 的血缘(lineage)系统中,以便后续的验证者能够准确追踪某项内容通过或未通过的具体原因。
接下来工作重心转移到人员身上。数据会被移交给人工审核员,他们的输入权重取决于声誉。例如,在医疗前沿(Frontier)领域的高分贡献者,其权重可能是新人的三倍。这些权重都被内置到了协议之中。
一旦人工审核形成决策,就会进入裁决阶段。
Codatta 中的验证不仅限于对标签的评判。它适用于流程的两端:
-
验证 X(源数据): 审查元数据,例如设备类型、时间戳、相机详情或拍摄条件,以确保真实性和质量。
-
验证 Y(即标签): 评估标签是否准确、一致,并符合特定任务的规则。
验证者要做的不仅仅是点击“批准”或“拒绝”。他们可以质押代币来支持自己的判断,以此表明他们对自己决定的正确性充满信心。随后,协议会利用通过信誉加权的共识机制来处理结果:
-
如果验证者的判断与最终共识一致,他们将赚取费用
-
如果他们出错,或者更糟糕地怀有恶意,他们质押的代币将被罚没(slashed)。
验证由此变成了一种经济承诺。
对于企业级应用,这一步骤可以在可信执行环境(Trusted Execution Environment)中运行。数据将被严密锁定,甚至连处理器本身也无法窥视。Codatta 节点使用证明文件(attestation proofs)来核实一切是否按声称的那样发生。
只有在所有过滤器、审查和证明都一致通过后,数据才会成为资产。Codatta Protocol 将为其铸造内嵌所有权和版税逻辑的资产。此时它会出现在市场上,但它并不属于 Codatta,而是属于贡献者以及每一个付费使用它的模型。
当智能体登场时:ERC-8004 与 x402
目前来看,这就像是一条由人工驱动的流水线:人们寻找数据源,对其进行推理分析,验证其有效性,进行质押,然后目睹它转化为资产。
我觉得 Codatta 最有趣的一点在于,他们已经在为 AI 智能体承担更多认知工作的时刻做准备 。既然 AI 智能体将助力构建 AI,那么它们理应能够参与贡献、获得署名并得到报酬。
Codatta 现在已原生支持这一功能。
ERC-8004:Agent(智能体)的真正一席之地
当一项贡献进入流程时,AI Agent(智能体)可以与人类专家并肩介入。每个 Agent 都依据 ERC-8004 进行注册,这是以太坊为 Agent 身份和信任建立的新兴标准。
这赋予了每个 Agent:
-
一个持久的链上身份
-
公开的信誉记录(准确性、冲突、罚没事件)
-
关于贡献内容及时间的那些可验证的证明
-
一个回溯数据所有权和归属的链接
随着智能体(agents)开展工作,它们的产出将像人类一样融入同样的序列之中 :
原子贡献 → 数据资产 → 数据集
ERC-8004 确保智能体的指纹始终保留在其生成的资产上,从而保障未来的版税能够正确流转。
x402:将使用量转化为持续收入
一旦数据集上线,Codatta 就会按照 AI 实际的消费方式将其变现:即按次请求计费。通过 x402, 当客户端调用付费端点时,会收到付款请求,完成支付后,该请求便会通过。
每一次调用都变成一个小小的版税事件,收入即刻流向那些成果背后的贡献者——无论是人类还是智能代理,而剩余部分则归入国库。
ERC-8004 和 x402 共同将 Codatta 转变为一个混合生态系统,让人类提供专业知识,智能体(agents)提供规模化能力,双方都能获得相应的归属权和收益。
声誉:便携式的知识信用记录
在一个拥有数百万微小贡献的世界里,你需要知道该信任谁 。这就是声誉发挥作用的地方。
Codatta 中的每个参与者都始于一个去中心化身份。每一个行动都会增加你的过往记录,这相当于一份针对知识工作的实时信用档案。该系统主要监测四个信号:
-
准确度与一致性: 你过去的工作是否始终与基本事实(ground truth)和社区共识保持一致?
-
行为可靠性: 你是否按时交付、及时响应,并保持高质量、稳定的工作表现?
-
质押即信心: 你是否为你的回答进行了质押(stake)?
-
活跃度: 保持活跃能让你的声誉维持热度。
随着这些信号不断叠加,它们将塑造您的能力范围。更高的声誉不仅能解锁高级前沿(Frontiers),在共识机制中占据更大分量,还能为您赚取更多的版税份额。影响力越大,回报越高。

而且由于这一切都记录在区块链上,声誉便具有了可携带性。当你加入一个新的前沿领域(Frontier)时,一切并非从零开始。你的身份不仅在 Codatta 内部,而且在任何接入同一层的协议中,都携带着一份可验证的历史记录。
这才是去中心化身份的真正前景所在。
它改变了人们的行为方式。它将思维模式从短期的任务完成转变为长期的权益积累。你不仅仅是在完成工作,更是在构建一份能产生复利并带来回报的履历。
混合验证与竞技场
任何无需许可的系统都有一个可预见的失败模式。如果任何人都可以做出贡献,绝大多数内容都会是劣质的。你需要一种实时筛选和修正的方法。
Codatta 的解决方案包含一个双层循环:
-
AI 首轮筛选 捕捉诸如重复、格式错误等明显的垃圾内容
-
人工共识 增添 AI 无法实现的细腻判断,投票权重由每位贡献者的声誉和质押的 $XNY 决定。
但该系统不止于此。验证是分层进行的。
-
声誉与质押: 贡献者通过质押 $XNY 展现诚意(skin in the game)。
-
冗余与共识: 任务不依赖单一标注者。多名贡献者处理重叠的任务切片,一旦发现差异,系统会将其标记以进行重新标注,直到达成共识。
-
持续监控: 数据集会随时间受到监控。如果准确率出现偏差,系统可自动触发新一轮的验证。
然后是 Arena。
Arena 是测试平台,有点像 AI 的公共竞技场。Codatta 在这里衡量数据是否切实改进了模型。虽然听起来有违直觉,但大多数数据其实并没有起到这种作用。
Codatta Arena 的工作原理
在 Arena 中,两个隐藏了身份的模型会回答同一个提示词。大众评审选出更好的输出结果。每一次运行、投票和结果都会被公开记录。Arena 已经比较了超过三十六个前沿模型,包括 GPT 4、Gemini 和 Qwen。
Codatta 竞技场排行榜
但 Arena 不仅仅局限于模型之间的对决。同样的机制也可以用来测试数据集。一个模型先在其基准训练数据上运行,然后加入来自 Codatta Frontier 的新数据再次运行。如果它在推理能力、准确性或一致性上的表现有所提升,这批数据就获得实际的信誉认可。
这就是核心所在。关键不只是“ 这个标注正确吗?”,而是“ 这个标注让模型变得更好了吗?”
AI 过滤器 + 人类验证者 + 质押激励 + 冗余设计与持续监控 + Arena 基准测试 → 这些共同构成了一个反馈引擎,确保持续输出准确且有用的数据。
第二部分:商业模式
在我早期的文章 《数据共和国:破解人工智能的重大瓶颈》(The Data Republic: Solving The Great AI Bottleneck)中 ,我曾写道:
终极愿景是建立一个充满活力的“活体”数据经济。那些能够在当下锁定可信、高保真数据网络的一方,必将主导未来的训练速度和模型性能,从而捕获未来人工智能领域的最大价值份额。
那么,Codatta 将如何实现这一目标?从核心上讲,Codatta 是一个连接数据购买者与数据贡献者的市场。购买者可以通过 API 获取这些数据。
持续归因
Codatta 上的智能合约会追踪哪些数据单元被用于训练,以及哪些数据是在推理调用期间被访问的。如果某个数据集被使用,其背后的贡献者就能获得收益。该逻辑位于链上并会自动执行。
买家可以选择其支付数据访问费用的方式:
-
固定费用支付: 简单明了的前期许可。只需预先支付一笔设定好的金额,后续无额外费用。非常适合大公司和受监管行业。
-
先训练,后付费: 开发人员无需预先付费即可获取数据。他们先进行训练/构建,待模型创造价值后,版税才会流向数据拥有者。

但是,贡献者真的会接受“现在干活,以后可能拿钱”吗?对于大多数人来说,可能不会。
但这非常适合相信数据集长期价值的贡献者,或是希望分享收益的社区。至关重要的是,贡献者是在完全知情的情况下做出选择的。他们在选择加入之前就能看到合约模式。
你可以想象,对此进行计量可能是一个复杂的挑战。事实也确实如此。
如果模型在加密生态系统中运行,为链上智能体(Agents)或应用提供动力,那么其使用情况天然就可以设计成可见的。每一次付费调用都会经过智能合约。交易记录会保存谁在何时调用了什么内容,以及支付了多少价格。这足以用来计量使用情况,并将版税自动分配给数据背后的贡献者。
但对于 Web2 企业来说,应用产生的收入默认情况下主要不会经过区块链。在这种情况下,数据集是根据明确的合同进行授权的,更类似于 SaaS 或彭博终端(Bloomberg terminals)的运作方式,包含义务条款、使用情况报告以及审计选项。
即使终端应用的收入仍然是不透明的,版税依然可以与 API 层面的指标(如调用次数和消耗的 Token 数)挂钩。只要这些指标被记录并经过验证,贡献者就能透明地看到他们的数据是如何被使用的。
简而言之:
-
链上应用 → 自动结算。
-
链下应用 → 许可授权 + API 使用情况报告
和 Spotify 一样吗?并不。
Codatta 使用的版税模式让我想起了音乐授权。当一首歌被播放时,艺术家就会收到版税。当一个经过验证的数据集被使用时,贡献者就会获得收益。不同之处在于,在 Codatta 中,使用量与价值之间的关系是可追踪且可编程的。
这改变了贡献者的思维方式。你建立的不再是为了获取一次性固定报酬的标注记录,而是一个包含高杠杆价值数据点的投资组合。声誉和收益会随着数据的复用而增长。
这里存在一个常见的担忧。在音乐界,只有极少数艺术家能赚到真金白银。Spotify 自己的支付模式换算下来, 每次播放大约是 0.003 美元 ,这意味着一百万次播放量大约只能转化成 3,000 美元 。 这意味着占据这长尾市场的绝大多数艺术家(99%),将无法仅靠版税维持体面的生活。
Codatta 通过将版税与效能而非数量挂钩,避免了这一陷阱。在 AI 领域,一个小型、稀缺的数据集可以显著改变一个模型。一些标记好的肿瘤图像、一种新颖的钱包漏洞、一个语言学上的特例——这些都可以改变下游的结果。
该协议追踪哪些数据被复用以及哪些数据改善了结果。那些提供了高信号数据的贡献者会获得更多收入,这不是因为他们上传了更多数据,而是因为他们的贡献起到了关键作用。
并非要让每位标注者都发财致富。其目标是确保当你的数据发挥价值时,回报能够源源不断。
行动证明:Codatta 的早期数据集
Codatta 已经开始证明,它能够聚合大规模、高信号的数据集,而不仅仅是纸上谈兵。
以 MM-Food-100K 为例,这是一个看起来相当简单的数据集:包含 100,000 张食物图片,并未注了配料、份量、营养成分和背景信息。其独特之处在于构建的方式 。
Codatta 并没有预先支付标注员微薄的报酬,而是推出了 与币安(Binance)钱包合作的“助推器活动”(Booster campaign)。数万名币安用户在 $XNY 的激励下被引导至贡献任务中,并大规模接入 Codatta 的全栈基础设施。
在短短六周内,8.7 万名贡献者上传了 120 万个经过验证的样本,这些样本包含真实照片和真实标注,每一个都与一个钱包地址关联,以此确保来源可查。
来源:MM-Food-100k Dataset
这一发布策略是经过深思熟虑的:
-
10% 的数据集已被免费发布用于公共研究 (过去一个月在 HuggingFace 上的下载量已超过 1,000 次)。
-
90% 被保留用于商业授权,每当该数据用于训练模型或驱动应用程序时,版税将回流给贡献者。
在 MM-Food-100K 上微调过的模型,其表现始终优于基准模型 ,无论是在卡路里估算还是食物分类方面。换句话说,这个数据集让 AI 变得更聪明了。
Codatta 现在正通过币安(Binance)钱包数据、加密账户标注和机器人技术,复制这一成功模式。
在加密货币的应用场景中,贡献者会用结构化的元数据对钱包地址进行标记,例如:“交易所”、“巨鲸”、“OTC 柜台”、“诈骗集群”。这种注释将原始的交易日志转化为可用于合规和风险分析的有价值情报。
一些正在进行的加密账户标注贡献任务
传统上,这项工作一直被锁定在 Chainalysis 或 Arkham 等私有公司内部,在这些公司维护一个标记过的地址数据库,每个地址的成本可能高达 10 到 30 美元。Codatta 的做法则与众不同,而且成本可能更低。它将这一过程向大众开放,但通过协议层面的执行机制来保持质量:这包括信誉评分、质押惩罚、任务冗余和共识检查。
机器人技术的用例让这个概念变得具体。贡献者对记录机器人行为的视频片段进行标记,逐帧描述每一个动作。我尝试了一下。界面简洁明了,指示清晰易懂,奖励也会即时发布。这是一项枯燥的工作,这也就是为什么激励机制如此重要。
对显示视频中的机器人动作进行标注
这些数据集仍处于早期阶段。真正的考验要等到开发者利用它们来训练感知与规划模型时才会到来,届时我们才能观察到性能是否有所提升。
试点项目背后的战略
这些早期的“前沿项目”(Frontiers)并非为了追求营收,而是作为验证依据。Codatta 正在借此展示其系统能够支持真实的贡献者、管理复杂的标注任务,并产出能提升模型性能的数据。
每个试点项目都有两个目的。首先,它验证了 Codatta 的基础设施能够在截然不同的领域生成高质量数据。其次,它为企业买家提供了一个生动的实例,展示启动一个 Frontier 项目并获得可用产出的实际样貌。
Codatta 并没有坐等定制化的企业需求,因为那样的销售周期可能很长。它选择主动产出成果,以此建立证明并拉动需求。这些早期的数据集就是诱饵。
谁是买家?
Codatta 的最佳切入点将是那些注视数据不可或缺,但现有渠道价格过高或完全缺失的领域。
在医疗健康和去中心化科学(DeSci)领域,独立实验室和去中心化自治组织(DAO)虽然可以资助研究,但往往缺乏结构化且合规的数据。Codatta 填补了这一空白。贡献者上传带有标注的扫描件、实验笔记和临床试验结果。研究人员因此无需向制药公司或学术机构乞求访问权限,即可获得可审计的数据集。
机器人技术所需的数据非常昂贵,因为这类数据很难采集。像 Figure AI 这样的公司现在 正与房地产巨头合作 ,要在 10 万多个家庭内部拍摄人类活动。Codatta 提供了一条新途径:全球贡献者可以以更低的成本,大规模地提供带有标签的动作序列。
在 DeFi 领域,虽然链上资金流向是公开的,但情报并非如此。许多公司在专有钱包标签上投入巨资。通过 Codatta,贡献者可以挖掘模式、标记欺诈行为并标注地址类型,从而在使用其劳动成果的每款产品中获得一份权益。买家则能获得源源不断的结构化情报。
核心逻辑很简单:合成数据无法战胜真实、高质量的人类输入。
最早的实际测试之一来自其 与 KiteAI 的合作伙伴关系, 这是一个专注于自主代理的 Layer-1 网络。我们最近报道过 Kite,正是通过那个团队,我才第一次近距离接触到 Yi(创始人)和 Codatta。
这次合作为 Codatta 接入了一个不断壮大的代理团队生态系统。但更重要的是,它解锁了真实世界的数据,并从医疗保健领域开始。
其中一个前沿项目专注于用于癌症诊断的血涂片图像。 医生和医学生注释了数千张幻灯片,标记了可能预示白血病的异常情况。模糊的细胞群变成了结构化的输入。现在,这些模型直接在 Kite 网络上运行,从特定领域的、人工标记的样本中学习,通过这种方式替代了通用的语料库。
我们听说因为这数据太过有用,以至于一些机构曾试图买断该数据的独家使用权。

这一点至关重要,因为阿里云已在全球服务着超过 15 万家客户,其中包含 9 万家使用通义千问模型的企业 。将社区驱动的数据集接入这一环境,极大地扩展了需求池。开发者和企业无需离开阿里巴巴的生态系统,即可获取特定领域的数据。对于 Codatta 而言,这为其打通了一条触达全球最大 AI 开发者群体之一的分发渠道。

除此之外,团队还向我透露,医疗保健和机器人领域的早期人工智能初创公司已经主动联系他们,寻求结构化的高质量数据管道,而不是那一堆堆未经处理的原始数据。此外,一家(尚未透露名称的)大型企业人工智能实验室正准备推出自己的 Frontier 项目,目前只需敲定版税和隐私机制即可发布。
当今的数据集仅仅是个热身。下一阶段将迎来企业级的活动。
从支付宝到归因分析:这支团队为何打造 Codatta
Codatta 的诞生源于一直困扰其创始人的挫败感。
Yi Zhang 现在是 CEO,他曾在 Web2 数据基础设施领域深耕多年。在蚂蚁集团担任工程经理期间,他负责支付宝商家应用的分析工作,这些应用每天处理数十亿次的曝光量。他可以跨触点追踪用户行为、细分模式、捕捉欺诈,但底层数据却来自“黑箱”。如果不主动请求访问权限,根本无法进行验证。
Codatta 首席执行官 Yi Zhang 参加 Kite AI 团队播客时的访谈。
这种张力始终伴随着他。在攻读博士学位期间,Yi 研究的是推荐系统,即决定我们所见内容的排序算法。他意识到相关性是非常脆弱的。点击量、反馈循环、异常值和垃圾信息都会扭曲信号。如果缺乏可追溯性,即使是最优秀的模型也会对噪声产生过拟合。
他在各处都看到了同样的模式:AI 系统需要干净、可验证的数据,而 Web2 的架构从来就不是为此而构建的。
到了 2022 年,随着 Web3 和 AI 开始融合,他拉上两位同事着手解决这个问题。一位是曾在高负载环境下构建后台平台的首席技术官(CTO)Paul Pang,另一位是设计过分析功能的首席产品官(CPO)Kevin Wang,对他来说,界面设计与数学原理同等重要。这三个人勾画出了一个协议雏形:贡献者提供结构化元数据,验证者进行交叉检查,智能合约根据质量给予奖励或惩罚。
他们的洞察很简单。你不能像对待大宗商品那样对待数据。你需要的是可拥有、可验证且模块化的数据 。 这意味着标注必须附带加密证明、质押、声誉和拒绝机制。这种架构不仅是技术层面的,更是经济层面的。
这份蓝图最终化身为 Codatta。
他们于 2023 年注册成立公司,并在 2024 年 4 月推出了测试版,该版本预置了超过 5 亿个已标注的地址。截至目前,团队已筹集了 400 万美元资金,由 OKX Ventures 领投,Comma3、Mask Network、Paramita、Web3Port 以及数位来自 Coinbase 和 Pinterest 的战略天使投资人参投。

因为他们深知盲目追求规模而忽视质量是一个陷阱,所以将混合验证机制(AI + 人工 + 质押)直接融入了核心架构之中。他们还精心设计了贡献者激励和版税机制,使数据标注不再是一次性的赏金任务,而是一条长尾收入流。
Yi 谈到了构建“可信的、永续的数据轨道”,在这里,准确性才是盈利的关键。
所以……当那些曾在不透明系统内部构建产品的工程师试图从第一性原理出发重建整个体系时,Codatta 便应运而生了。这真是令人着迷。
第三部分:代币经济学
Codatta 拥有一个流通代币 XNY,其市值为 900 万美元, 完全稀释估值为 3600 万美元 (截至 2025 年 12 月 1 日)。
在去中心化协议中,代币即是协作层。没有它,就无法大规模协调贡献者、验证者和消费者。 XNY 便是其核算单位。
供应机制
-
总供应量 :100 亿
-
流通供应量 :25 亿 (25%)
-
关键分配 :约 50%分配给团队(18%)、投资者(12.5%)和基金会(21.5%);约 48%用于社区激励(空投、赏金)
-
代币生成活动 (TGE): 2025 年 7 月 23 日

约一半的代币总供应量归团队、投资者和基金会所有,而这部分配置中的大部分将一直锁定到 2026 年 7 月。 这个断崖式解锁期(Cliff)构成了明年的主要风险点。如果届时需求未能形成规模,市场可能难以消化内部人士的解锁抛压。
在社区方面,代币分发则是渐进式的。空投已经完成,但来自验证者奖励和贡献者支出的排放量将随着时间推移增加供应。这给生态系统留出了大约 12 个月的窗口期,以便在通胀加速之前建立真正的市场需求。
对于目前的发展阶段而言,Codatta 的社交影响力显得格外庞大:拥有约 23.3 万 Twitter 关注者、6.9 万 Telegram 成员和 1.5 万 Discord 用户。这种知名度有助于推动早期的流动性,但真正的考验在于链上活动能否跟上这一步伐。

XNY 在起步阶段流通量较小,估值基础也相对压抑。在接下来的一年里,它需要证明其质押、许可授权和企业级应用能够足够快速地扩展,以应对 2026 年到来的解锁浪潮。
需求机制
XNY 不存在所谓的模因溢价(meme premium)。其价值完全取决于 Codatta 能否成为一个活跃的市场。每一个需求向量都与实际的使用场景挂钩。
XNY 的使用场景
1. 贡献与验证费用
网络上的每一次标注或验证都需要花费 XNY。 任务越复杂,消耗的代币就越多 。这就建立了一个与网络吞吐量挂钩的基础代币销毁机制。如今,这些流量仍然很小,因为大部分使用量都是通过激励措施启动的
2. 数据许可
如果企业想要访问 Codatta 的专有数据集或 API Firehose,就需要付费。最终,支付方式将使用 XNY。目前,主要是法币或稳定币,但智能合约即将上线。计划是:将每一笔授权费用的一部分自动转换为 XNY。
3. 任务发布与推广
想要在 Codatta 上独立发布任务的企业必须存入 XNY。这适用于开启悬赏、设定 SLA(服务等级协议)以及预留贡献者产能。任务推广(更快的匹配、更高的曝光率)同样需要使用 XNY。
4. 质押与罚没
验证者通过质押 XNY 来证明其可信度。质押越多,赚取的验证费、获得的优先分配权以及争议奖励就越高。低质量或恶意的工作会遭到惩罚性削减(slashed)。贡献者也可以进行质押,以此作为声誉放大器。这不仅能解锁更高质量的任务,增加在共识中的权重,还能提高他们的奖励和版税份额。
5. 治理
持有者可以就奖励率、数据集标准和国库分配进行投票。这虽然不是日常需求,但它将代币所有权与网络的发展方向紧密联系在了一起。
6. 所有权流动性(未来)
Codatta 正在探索让数据资产可交易的方法,从部分所有权到组合型投资组合。XNY 将负责结算和上市。尽管目前仍处于早期阶段,但这符合将数据视为可投资资产的宏大目标。
收入与代币价值流向
对我而言,任何工作代币的核心问题都很简单:真实的收入能否回流并转化为真实的代币需求?Codatta 的设计通过三种重叠的收入流,随着時間推移,有望为 XNY 提供真实的经济支撑。
1. 托管服务收入(当前的活动)
这就是眼下的业务现状。Codatta 已经通过向客户提供标注服务,赚取了法币和 USDC 收入。这虽然并不算什么大买卖, 但意义重大,因为它们表明买家愿意为结构化、经过验证的数据买单。
-
CipherOwl:每月经常性支出在五位数(低段)范围内。
-
RoboFlex:一份为期 16 个月、价值约 25 万美元的合同。
-
DepathAI 及其他医疗客户:按数据处理量付费。
约 70–80% 的收入直接流向标注员和基础设施提供商,而 20–30% 则作为毛利留存。在短期内,这部分利润用于维持运营,如果团队坚持其政策,部分利润将被转换为 XNY,用于国库储备和质押池。
业务的这部分表现类似于 SaaS(软件即服务):具有可预测性、基于合约,并以稳定币计价。它目前尚未要求使用 XNY,但建立了一个可以稍后迁移到链上的收入基准。
2. 包含特许权使用费的数据许可(中期增长引擎)
这是增长引擎。 在 Codatta 的系统中,每一个原子级的贡献都会变成一项数据资产 ,而资产又聚合为数据集 。两者都是链上原语,具有可编程的所有权和版税权益。
-
企业以 XNY 或通过智能合约自动兑换的法币支付访问费用。
-
贡献者获得持续的版税收入(占许可费的 60–70%)。
-
国库作为协议收入捕获剩余份额。
让我们来做一点粗略的数学估算。如果 Codatta 签下几十份平均每年 20 万美元的授权合同(对于数据买家来说并不算贵),它的年度经常性收入(ARR)就能迈入八位数的行列。
由于授权交易是通过合约进行的,每笔付款的一部分必须用于购买 XNY。这就是收入转化为代币需求的过程。
3. 市场及 Gas 费用(持续性消耗)
每次上传、标注或数据集传输都会产生 1–2% 的 XNY 交易费,这部分费用一部分被销毁,另一部分重新分配给节点运营商。 在交易量较低时,这只是微不足道的杂音。但一旦规模扩大,它将成为一个能够抵消代币排放的“持续性消耗池(always-on sink)”。
综合考虑
价值链的流转过程如下:
-
企业支付法币或 XNY 以获取数据服务。
-
智能合约将收入分配给贡献者、验证者、支持者及国库。
-
国库定期使用盈余资金进行质押、回购或销毁代币。
-
参与者将收益进行再质押(Restake)以提升声誉,从而锁定代币供应。
如果管理得当,这将形成一个反馈循环:更高的活跃度既能增加代币流通速度,又能提升总锁定价值(TVL),且不会引起不受控的通货膨胀。

在接下来的 6 到 18 个月里,XNY 应被视为一种高风险、高回报的赌注,这取决于 Codatta 能否将早期的发展势头转化为实际的效用。这意味着需要数百万个已标注的数据点、活跃的质押活动以及企业许可收入。如果这些支柱得以实现,XNY 将不仅仅是一个工作代币(work token),它将成为跨 AI 网络的知识协调层。
执行风险是真实存在的,尤其是在产品交付和解锁时机方面。
需要监控的关键指标:
-
使用量增长: 贡献者数量、提交的数据集以及标注吞吐量。
-
收入/销毁流向: 燃烧的费用与作为奖励发行的代币之间的比率。
-
流动性: 深度和交易所多样性;关注一级交易所(Tier-1)的上币情况。
-
社区情绪: Discord 和 X 平台互动的持续性;监测是否有非自然的激增现象。
-
技术进展: 市场平台的推出、治理功能的激活以及质押表现。
一些临别赠言
#1: 去中心化数据竞赛
Codatta 并不是唯一试图改写数据经济学的项目。Vana 和 OpenLedger 是另外两个不容忽视的认真尝试。
Vana 专注于个人数据集合(数据 DAO)。个人可以贡献自己的浏览记录、健康日志、音乐播放列表, 并将这些数据汇总到代币化的数据 DAO 中。其吸引力在于隐私保护和掌控权。同时也降低了参与门槛。
OpenLedger(我们之前也写过关于他们的文章 )则更接近 Codatta 的领地。它希望从头到尾记录一切。数据、模型和智能体全部上链,从输入到输出跟踪归因,并通过“归因证明”(Proof of Attribution)进行支付路由。这是一个密集、集成且雄心勃勃的项目。
Codatta 走的是一条更为专注的道路。它聚焦于结构化标注和可复用知识。它不要求团队切换平台或采用新模型,而是可以直接嵌入现有的工作流程中。买家可以在不改变基础设施的情况下,获得数据集授权、追踪使用情况并支付版税。
Codatta 真正引人注目的地方在于,它将每一个数据集都视为一种数字资产。我可以想象围绕它将形成一套全新的市场。就像音乐版税可以交易和部分所有一样,数据集也可以如此。
基金可能会以此组建跨越机器人、医疗保健和金融领域的投资组合。数据支持的借贷或生息数据集可能会随之出现。Codatta 想要为结构化知识建立版税层。
#2: 个人 AI 将需要个人数据
个人 AI 正快速到来。智能体和 Copilot 已经开始学习用户的偏好和行为模式。但要真正发挥作用,它们需要基于极度私人的数据进行训练:健康记录、购物习惯、对话内容,甚至录音。
如今,大型科技公司正在悄悄收集这些数据,用户不仅无法掌控,也得不到任何补偿。
Codatta 开启了一条不同的道路: 用户选择性加入,并贡献个人数据, 如果这些数据驱动了有用的模型,版税便会由此产生。并非每个人都会参与其中,但当信任和支付机制建立起来后,许多人会愿意加入。
想象一下:
-
将健身数据分享给健康 AI,每当该数据集被授权使用时,贡献者都能获得收益。
-
将浏览或购物行为汇聚成偏好数据集,用于推荐模型。
-
有助于打造更出色个人助手的语音和文本日志
换句话说,如果个人人工智能是下一个平台级的变革,那么个人数据就是稀缺的输入要素。Codatta 能够提供必要的基础设施,让人们可以轻松共享数据并从中获得回报。
结论
每一部热门大片在片尾都会有演职员表。然而长久以来,人工智能一直依赖于标注员、专家和社区成员的无形劳动,他们的名字从未在屏幕上滚动出现,属于他们的报酬也从未到账。
通过将数据转化为资产、将版税制度转化为基础设施,并将贡献者转变为利益相关者,Codatta 正在构建人工智能领域长期缺失的知识层。
这场赌注很简单:如果说算力是上一个周期的稀缺商品,那么知识就是这一个周期的稀缺商品。如果我透过这个视角去观察,Codatta 就不再像是一个平平无奇的数据市场,而开始显现出它作为基础设施的一面:确保那些构建未来的人能够获得相应的回报。
(本文完)
感谢阅读,
0xAce 和 Teng Yan