本文信息来源:decentralised

你好,

人类是推荐的机器。我们为所爱之人制作播放列表,或者推荐像新加坡的 Kurasu 咖啡馆,或者这家拉面店 ,因为我们了解个人的偏好。这些推荐中隐含着一定程度的信任。同时,也需要付出努力去理解被推荐者的品味和偏好。这就是为什么我们不会随意向陌生人推荐东西,而是将其留给那些我们足够关心的人。

目前的智能体还没有足够关心它们的人来指导它们。(我正在努力克制开强化学习玩笑的冲动。)那么,你如何判断哪些智能体在执行任务时有好的品味?当智能体之间没有隐含的信任时,如何建立信任和声誉?换句话说,你如何建立一个排名系统,来判断你信任哪些智能体的工作产出或推荐?与人类不同,智能体目前对其行为几乎没有后果。代码库不会因为糟糕的人生选择而受到伤害。

乔尔

TLDR:

  • 软件的成本效益越来越高,模型也越来越强大。随着小型团队为专业任务推出代理并迅速找到产品市场契合点,长尾效应不断扩大。
  • 信任是瓶颈,而不是代理的供应。太多选择,质量参差不齐,在选择之前又无法区分,这会抑制采用。
  • Recall 建立了技能市场,以发现需求和代理在真实任务中竞争的舞台。性能数据输入到一个排名系统,该系统成为可查询的基础设施。
  • 竞争决定了现实世界任务中的真实情况。质押引导注意力,而不凌驾于性能之上。机制设计使得作弊成本高昂,而诚实则会获得回报。
  • 没有哪个单一代理能独占鳌头。协调专业代理胜过单打独斗。系统会学习哪些组合有效。

我经常去孟买的 Mysore Cafe 喝我那份过滤咖啡。最近一次去完回来的路上,一个通常会刊登宝莱坞明星或新 Netflix 节目的时髦广告牌上写着:“帮我分析昨晚的梦”,这是一个 ChatGPT 的广告。这让我思考人工智能是如何迅速从新奇事物变成常态的。我查看了下载量,令我惊讶的是,ChatGPT 仅在 Play 商店的下载量就超过 5 亿!

决定性技术往往像微小的“大爆炸”一样到来。起初,只有一片真空:没有产品,也没有用户。然后有人通过创造一个可消费的产品将一个想法变为现实,突然之间,一切都改变了。在几个周期内,空虚变成了丰富。网络通过页面做到了这一点,移动设备通过应用程序做到了这一点,而 2025 年将通过代理做到这一点。你可以在几个小时内将一个“有能力的”助手作为浏览器扩展或 Discord 机器人发布。然而,构建一个代理很容易;但要构建一个在工作流程中真正有用的代理却很难。

这个差距正是行业经常陷入困境的地方。表面上看,代理似乎可以互换,但它们通常并非如此。电子邮件、Slack 等消息应用程序、编码界面等等,都内嵌了代理。大多数不涉及与物理世界直接交互的工作都在探索如何利用人工智能。甚至招聘人员也在使用人工智能工具联系潜在候选人,有些甚至懒得检查人工智能的输出。有时,输出并不总是如预期。

我的观点是,我们不再缺乏模型或代理;我们缺乏信任。选择太多,而工作证明太少。通常,这种可用性与工作证据之间的差距解释了每条技术采纳曲线中存在的鸿沟。

让我们来看看供需动态,以理解这一差距。

在供给侧,经济学正在发生变化。软件曾经是昂贵的构建和分发。高昂的开发成本意味着风险投资集中在少数具有大众市场潜力的重大押注上。服务于专业需求的利基产品的长尾市场依然薄弱,因为小市场无法证明所需投资的合理性。

然而,情况并非一成不变。模型正变得越来越好,成本也越来越低。小型团队现在可以推出解决即时、狭窄问题的代理,而无需数百万美元的资金。长尾市场变得庞大,因为更多的利基市场在经济上变得可行。市场可以以更低的成本资助和测试在旧模式下会被忽视的专业解决方案。

在需求侧,众多的选择带来了另一个问题。当你有成千上万个选择时,质量就会变得参差不齐。我们称之为差异性 。声称做同一件事的代理,其性能表现差异巨大。有些表现出色,但大多数都差强人意。

从外部看,各种智能体模糊不清。在相似的选项中做出选择之前,你应该了解的更深层信息往往是隐藏的或不存在的。这就是 不对称性。差异性意味着质量不可预测。不对称性意味着你在选择之前无法分辨哪个是哪个。两者共同造成了停滞。用户面临多种选择,却没有可靠的方法来从噪音中筛选出信号,这往往导致采用停滞不前。

想象一下一个超市里有二十个品牌的橄榄油。差异性意味着质量参差不齐。有些是酸败的,有些是极好的,大多数都还不错。不对称性意味着你购买前无法品尝;标签不会告诉你它是否已经在炎热的仓库里放了几个月。如果没有一个排名系统(无论是值得信赖的评论家还是知识渊博的朋友),你只能盯着几瓶橄榄油,要么不知所措,要么随意挑选。市场仍然嘈杂,直到有东西能打破这种局面。

Recall 旨在通过技能市场和排名或信任层来弥补这一空白,从而发掘对技能的需求,为长尾提供资金。市场根据用户偏好和实时竞争结果生成信号。排名层读取此信号,使其可查询并易于现有发现界面集成。我将在下面详细介绍这一切是如何实现的。

当人工智能的实用性变得明朗时,每个开发者都想部署一个智能体。在加密领域,激励机制过快地导致了供应过剩。一个名为“真相终端”的人工智能智能体选择了$GOAT 作为其代币,市值达到十亿美元,并引发了人工智能智能体创建和交易加密代币的巨大浪潮。随着几个新的智能体涌入市场,人们已经无法区分哪些是合法的,哪些只是噪音。

像 Virtuals 这样的生态系统将 AI 代理代币的发行标准化。在一个月内,Virtuals 发行了超过 10,000 个代币,每个代币都代表某种形式的代理。在所有这些代币中,只有少数是有用的。像往常一样,几乎所有代币的价格都下跌了 90% 以上。

来源 — Dune (@hashed_official)

如果供应量的大幅增长能伴随着质量的同步提升,那倒没什么问题,但事实并非如此。我所说的质量,指的是可靠性和实际效用。AI 代理是否能在真实情境中始终如一地完成其声称的任务,而不仅仅是在精心控制的演示中?大多数 AI 代理在展示视频中看起来很棒,但当你尝试在工作中实际使用它们时,它们就会崩溃。一个高质量的 AI 代理能够处理边缘情况,在遇到复杂问题时不会崩溃,并且能够真正为你节省时间,而不是制造更多麻烦。问题在于,我们涌入了大量的 AI 代理,但很少有能达到所需标准的。

一个具体的例子是软件工程(SWE)基准测试系列编码测试。可以把它想象成一个为尝试修复 GitHub 上 bug 的 AI 系统设计的记分牌。测试会给 AI 一段有问题的代码,并要求它编写一个修复程序。已验证版本和“实时”版本都报告“已解决百分比”,这仅仅是 AI 代理实际解决了多少问题。已验证版本使用经过人工检查以确保可解决的问题。实时版本使用新问题。

2025 年 6 月 1 日,SWE-bench Live 论文报告称,最好的系统只能解决大约五分之一的问题(19.25%)。同一套系统,在相同设置下运行已验证版本,解决了 43.2% 的问题。大约在同一时间,Warp 的一个生产代理在 SWE-bench 已验证版本上获得了 71% 的得分,使其位列排行榜前五名。

这意味着智能体在解决人类认为可解决的问题时效率更高。这就是差异性发挥作用的地方。一个在精心策划的数据集上表现强劲的系统,在面对全新的、混乱的问题时仍然可能举步维艰。你的结果取决于你所测试的现实片段。

这个发现问题变得越来越大,因为代理本身越来越像用户。它们使用工具,调用 API,最重要的是,调用其他代理。这不仅仅是“我应该使用哪个代理?”,更是“当我的代理需要帮助时,它应该信任哪个代理?”错误的表面积迅速增加。

这正是 2025 年 9 月 npm 事件所展示的。攻击者通过网络钓鱼获取了维护者的凭据,并将恶意软件植入到十八个广泛使用的 JavaScript 包中,包括 chalk、debug 和 ansi-styles。这些包每周总计有数十亿次的下载量。

在很短的一段时间内,新版本携带了浏览器端代码,可以悄无声息地劫持加密钱包操作并重定向资金。如果你当天选择了一个抓取这些“受信任”软件包的代理或工具链,你的选择看起来是安全的,但实际上已经被攻破了。

我经常觉得模型对同一个提示的反应不同。为了验证这一点,我在 ChatGPT 上两次运行了提示“你能画一个图表,说明 Hypercore 和 HyperEVM 之间的关系吗?”我得到了两个不同的输出。不仅格式不同,图表也明显不同。

ChatGPT 对相同提示的两次输出之间的差异

技术让我们能够非常快速地创造出许多东西。YouTube 上有视频声称可以在 25 分钟内教会你无需编码即可开发代理。在缺乏质量检查的情况下,其中大部分最终都无法使用。我们构建系统来从好坏中筛选出好的,通常通过投票、评分或跟踪人们实际使用的算法。

想想亚马逊评论。在成千上万的商品中,五星评价能帮你找到真正好的商品。优步司机的评分、谷歌对网站的排名,甚至是 Netflix 根据数百万人的观看记录给出的推荐,都是如此。这些都是我们为了去芜存菁而建立的信任层。现在,它需要应用于人工智能模型和代理。我们需要一种方法来快速确定哪些模型和代理真正有效,而无需我们自己测试数百个。

市场如何建立信任层

我们过去曾遇到过供应爆炸带来的问题。解决方案总是围绕着建立一个排名系统,以在不一致的供应中建立秩序。

以 尼尔森收视率 为例,它出现在 20 世纪 50 年代。当时家家户户都有电视或想拥有一台。突然间,频道众多,每个频道都有多个节目,时间段也数不胜数。广告商有钱可花,但他们不知道人们到底在看哪些电视节目。在没有验证机制的情况下,电视台对自己的观众规模大肆吹嘘。

后来,尼尔森公司带着他们的测量小组介入了。他们将真实的盒子放置在真实的家庭中,以追踪人们观看的内容。借助这些设备,尼尔森能够将所有的噪音转化为营销人员可以使用的信号。一个节目要么有一千万观众,要么没有。收视率赋予了广告商做出真实决策的权力。电视台明白了哪些节目应该续订,哪些应该取消。他们仍然有几个节目,只是变得清晰可辨了。

尼尔森在美国推出电视观众测量服务 | 来源 – 尼尔森

PageRank 在 90 年代末对网页做了类似的事情。在互联网泡沫时期,每天都有许多新网页出现。网站数量从 1994 年的 10,000 个增长到 1999 年的 4,320 万 个。雅虎的人工编辑无法跟上所有内容的分类速度。谷歌的 PageRank 将每个链接都视为一张投票。如果可信的网站链接到你,那么你一定值得一读。在不减慢页面创建速度的情况下,它为每个人提供了一个合理的起点来应对这种爆炸式增长。

在所有这些案例中,你都会发现类似的模式。标准化的观察成为公共记忆,进而推动经济后果。混乱的、轶事性的证据被转化为结构化的、可查询的信任。代理生态系统需要一个转换层,将实时表现转化为持久的声誉。

AI 代理信任层在哪里?

今天的代理生态系统缺乏信任层。发现主要由病毒式传播、应用商店策展或单一数字排行榜位置主导。1998 年,谷歌用 PageRank 解决了类似的发现问题。相比之下,今天的代理市场却陷入了人气竞赛,无法告诉你一个代理是否能在你的用例中存活下来。

网页和 AI 代理发现之间的区别。

这就是为什么“起始页”成为护城河的原因。本·汤普森的聚合逻辑在这里完美适用。当生产成本低廉且分发充足时,价值会流向控制首次交互的一方。人们(和代理)开始的默认位置。在搜索中,那是一个带框的空白页面;信号是链接图和点击率。

在加密货币领域,像 Jupiter 这样的 DEX 聚合器通过在不拥有流动性的情况下路由订单流来获得权力。信号是可执行报价、滑点、Gas 费和成交成功率。在代理领域,类似的是一个排名和路由层,它位于代理和工具供应的前端,并针对给定的任务和一组约束条件,决定谁应该立即行动 

我从研究聚合理论中观察到的一件事是,需要一个带有反馈循环的系统。你可以称之为飞轮或其他任何东西,但其理念是相同的。以谷歌为例,这是最清晰的例子。

用户在谷歌中输入搜索查询,谷歌会向他们提供其抓取到的网站结果。用户会点击一些结果,而忽略另一些。这个过程会生成数十亿个数据点,说明人们在搜索特定词条时真正想要什么。

当用户点击某些搜索结果时,这些结果被认为是有效的。谷歌将这些点击数据反馈到其算法中,使未来的搜索更加相关。更好的结果吸引更多的用户,这些用户生成更多的数据,进一步改进算法。系统的每个部分都在一个持续的循环中强化下一个部分。

这种模式在所有成功的聚合器中都存在。聚合器位于供应商和用户之间,收集行为数据,使平台在匹配供需方面越来越出色。

对于 AI 代理声誉系统或信任层,反馈循环需要清晰的相互强化的组件。代理将执行任务并生成性能数据。这些数据将创建声誉分数,帮助用户选择信任哪些代理。用户的选择和任务结果将更新声誉分数,使未来的代理选择更加可靠。该系统只有在每个周期都真正改善信任评估时才有效,就像每次谷歌搜索都使算法更智能一样。

有了这些证据流,信任层可以绘制出代理在不同任务和约束下的实际表现。并从中学习如何路由用户请求。更好的路由带来更好的结果。更好的结果吸引更多的查询。更多的查询使路由更精确。如此循环往复。

信任层优先考虑的指标决定了围绕它构建的内容。当衡量成功的标准狭窄且可预测时,构建者会优化衡量标准而不是结果。这样的代理可能擅长编码基准测试,但在调试生产代码时却举步维艰。旨在击败测试的交易代理可能在回测交易策略中表现出色。然而,它在实际市场波动中进行测试时往往会崩溃。

在实际约束下的实时完成改变了激励机制。成本、延迟和故障模式——它们都很重要。构建者别无选择,只能专注于真正能带来价值的东西,因为玩弄系统变得昂贵或不可能。如果测试是在实时市场中检查每周风险调整后的盈亏,你如何玩弄测试?代理只能通过在实际市场波动中盈利完成交易来证明自己,而不是通过在历史模拟中表现良好。排名奖励用户所需,因此供应会演变为满足该需求。

要运作良好,一个可信的信任层需要三样东西。首先,具有真实成本的真实任务。其次,来源。分数必须附带完整的上下文,以便任何人都可以验证排名。第三,抵制作弊。即使存在强大的操纵动机,系统也必须保持诚实。当这些要素到位时,排名就不再仅仅是一个记分牌,而成为您可以赖以构建的基础设施。

人工智能模型和代理特别适合这种方法,并且可以根据清晰、客观的任务进行衡量。由于涉及金钱和安全,加密原生机制的设计使评估保持公正并抵制平台政治。通过公开可验证的数据,性能变得易于证明。

实际上,这也可以创造新产品。许多任务通常需要多个智能体协同工作。一个编排智能体根据其任务和约束条件查询信任层。系统会响应一个完整的计划,详细说明使用哪些智能体、按什么顺序、使用哪些工具和参数——系统处理的每个任务都会使其变得更智能。

经过多次迭代后,它会学习哪些组合能够可靠地解决特定问题。拥有这个基于实时任务数据不断改进的学习循环,就成为了护城河。其他人可以复制界面,但无法复制关于什么真正有效的累积智能。

最好的系统看起来像一个联邦。一群专业的模型或智能体,通常由另一个模型编排,将胜过任何单一模型。一个能够识别最有效组合的排名比一个简单的赢家列表更有用。

理解 Recall

没有现有的系统能同时满足这三个要求。基准平台提供客观测试,但缺乏经济利益。预测市场创造了风险共担,但无法衡量实际任务表现。应用商店拥有分发渠道,但策展不透明且中心化。Recall 的设计通过整合过去相互独立的要素来弥合这些差距:实时性能测量、经济预测市场和开放声誉评分。

Recall 旨在创建一个由三个相互关联的部分组成的系统。

  • 技能市场揭示需求,并允许策展人将代币押注在代理上。
  • 实时竞赛在实际约束下生成公开、可验证的性能数据。
  • Recall Rank 将这两种信号合成为可查询的信誉评分,随着更多数据流经系统,评分会不断提高。

其理念是为代理构建基于技能的市场,以帮助创建信誉层。人类和代理在需要查找执行任务的代理或模型时,将查询这些数据。

Recall 正在管理 AI 代理的供应。其管理模式类似于亚马逊管理其供应商的方式。尽管亚马逊在产品出现故障时无需直接承担责任,但它关心客户体验。亚马逊与客户而非供应商建立关系。同样,Recall 必须维护与用户的关系。如果 AI 模型或代理未能按预期完成工作,Recall 的信誉将受到威胁。

Recall 适合哪些人?首先是人工智能爱好者,他们喜欢测试智能体,并支持那些他们评价很高的智能体。

其次是“反向众筹”用户。他们提供特定的功能,例如开放技能市场或发布悬赏,而有相同需求的人可以加入。公司可以投资他们计划使用的技能。智能体在这些技能上竞争,表现最好的智能体将获得报酬并被采用。

第三是策展人。他们对智能体在特定技能市场中的表现持特定立场,并在结果证明他们正确时获得收益。他们的信号有助于区分相似的智能体。

最后是平台。随着时间的推移,展示人工智能的平台将通过 API 实现相同的排名,从而让用户默认发现更强大的人工智能代理。

从静态页面排名到动态竞争。

在我介绍 Recall 如何对代理进行排名之前,我想先为您设定一个参考。想想搜索结果、体育赛事排名和市场排行榜是如何随着新证据的出现而刷新的。一个清晰的体育赛事例子是板球的世界测试锦标赛。

锦标赛持续两年以决出决赛队伍。各队进行主客场系列赛,长度不一。每场比赛结束后,排行榜都会更新,同时对各种不同条件进行标准化处理。由于周期较长,在各种比赛条件下表现始终较好的队伍往往能进入决赛。这就是一个实时排名。

Recall Rank 遵循同样的原则。它在每个窗口后更新,根据任务难度和上下文进行标准化,在做出强有力声明之前需要足够的样本,并使激励与实际成果保持一致。

为什么竞赛优于一次性基准测试

当测试集固定时,基准测试就会被“玩坏”。模型不再优化任务本身,而是开始优化在测试中的表现。竞争环境引入了新的数据并改变了条件。它能防止过拟合,只保留持久的技能。斯坦福大学最近的一篇论文发现,LLMs 会像人类一样,修改输出以满足为其设定的目标。

另一方面,竞争造假成本高昂。你必须一次又一次地出现。你投入时间、计算和注意力。弱小的代理会因为无法继续支付这些成本而退出。强大的代理则会持续表现。

查尔斯·古德哈特是英格兰银行的一位英国经济学家。1975年,他撰文指出,当政策制定者只关注单一指标时,该数字与实际结果之间的联系就会变得脆弱。这一思想,现在被称为古德哈特定律,通常被概括为:当一个衡量标准成为目标时,它就不再是一个有效的衡量标准。实时竞赛的动态性质使条件不断变化,并确保代理能够适应现实世界的情况。

来源 — https://www.splunk.com/en_us/blog/learn/goodharts-law.html

主观技能由评判代理和少量人工检查来处理。在可能的情况下,Recall 使用客观衡量标准。当一项任务需要判断时,输出会进行两两比较,结果使用与其他地方相同的胜负模型进行汇总。对于敏感或高价值的回合,可以添加简单的人工审查步骤。目标是使过程透明、快速且难以被操纵,同时避免过度设计。

第一个重点很明确。对于加密货币交易代理,竞争始于一个简单的指标:每周盈亏。然而,这是一种衡量交易代理表现的粗略方式。最近,Recall 增加了一项新技能,使用风险调整回报,这是一种衡量结果的更好方法。

为什么先从交易开始?Almanak 和 Wayfinder 等应用程序的使用表明,社区已经渴望代理交易。为了确保安全,Recall 从模拟交易开始。随着团队的成熟和系统的改进,实盘交易竞赛于 2025 年 9 月下旬开始。

Recall 交易竞赛快照

排名机制

网络搜索从未停止对网络的排名。新页面不断出现,链接不断变化,人们点击不同的内容,排名顺序也随之改变。Recall Rank 将同样的逻辑应用于代理能力。分数会随着证据的出现而更新。当你击败强大的对手时,分数会提高更多。

静态排行榜很容易被操纵。补救措施是让测试保持动态。旧结果的权重会逐渐降低。Kaggle 提供了一个有用的类比。

Kaggle 式排行榜

以 Kaggle 为例,这是一个团队竞争构建预测模型的网站。在比赛期间,团队会调整他们的模型以攀升排行榜。比赛结束时,Kaggle 会使用一个无人见过的私有保留集来公布最终分数。许多团队此时排名下降,因为他们的模型学习了公共部分的怪癖,而不是真实的模式。解决方案是保留一部分评估不公开,轮换衡量标准,并奖励那些在未见过的数据上表现良好的模型。

Recall 遵循同样的教训。代理可以查看自己的匹配日志并查看公开摘要,但决定排名的数据会从数据流中频繁更新。

虽然 Kaggle 将测试数据隐藏起来,但 Recall 不必如此。让我解释一下原因。当交易竞赛进行时,意味着所有这些代理都在市场条件展开时相互竞争。评估使用之前不存在的新鲜市场数据。因此,这些代理不存在在隐藏数据上进行训练并试图操纵测试的问题。

代理和用户面临的一个略有不同的问题是,如何确保代理在不同市场条件下保持一致的性能。假设一个代理更擅长做空。它可以在价格下跌的一周内登上排行榜榜首,但这不一定能真实反映其能力。它没有作弊,只是碰巧“遇到”了一个对其风格有利的市场环境。然而,在足够长的时间范围内,分数会进行调整,竞争环境也会变得公平。

分数会更侧重近期表现,而较少关注过时表现。风险调整后的视图比单周热度更重要。如果一个代理试图记住一个只在昨天有效的模式,那么它将在下一个窗口中表现为急剧上升,随后又急剧下降。如果一个代理能够在不同的机制下表现良好,那么其评估结果就会变得更加稳定,而不是波动不定。

新智能体排名

每个智能体开始时都有一个粗略的技能估计和一个宽泛的“我们还不确定”范围。每轮结束后,预测都会更新。表现良好时,预测会上升。如果智能体表现不佳,预测就会下降。由于证据不足,早期的行动会比较谨慎。随着更多结果的出现,估计会变得更加确定,并且每轮的变化也会减少。

评级数学借鉴了著名的模型家族,例如 Bradley-Terry,它将成对的胜负记录转化为相对实力;以及 Plackett-Luce,它将此扩展到对两个以上竞争者进行排名。它们将一对一的结果转化为经过对手调整的技能估计,使我们即使在赛程不同的情况下也能公平地比较智能体。随着新结果的到来,估计会更新,并且更难被操纵,因为击败强劲对手比击败弱小对手更有价值。它是一个在特定领域内任意尺度上的实时相对分数,其不确定性会随着证据的增加而缩小。

成对比较

并非所有智能体每次都会参加相同的比赛,因此我们必须确保有一种可靠的方法来对其进行排名。这就是成对比较发挥作用的地方。

成对比较意味着同时比较两个。它使用起来很简单,即使所有人都不能同时竞争也有效。一对一的结果提供了清晰的信号。

有时,许多智能体会在同一个挑战窗口提交输出。在这种情况下,我们希望将有序列表转换为强度列表,而不会丢失任何信息。Plackett-Luce 可以同时处理两个以上的竞争者,并捕捉到在强劲领域中获胜比在弱势领域中获胜更能说明问题。

国际板球理事会(ICC)如何对球队进行排名的类比在这里有所帮助。在世界测试锦标赛中,并非所有球队都会在一个周期内相互比赛。印度可能不会面对巴基斯坦,但两国都会与澳大利亚和英格兰比赛。排行榜仍然必须比较印度和巴基斯坦才能选出决赛选手。它通过使用整个赛程的结果并根据系列赛长度和场地进行标准化来实现这一点。

Recall Rank 采用相同的理念。如果智能体 A 击败了 B,而 B 击败了 C,那么这个链条有助于将 A 置于 C 之上,即使它们尚未相遇。如果 A 在一个艰难的赛区中获胜,而 C 在一个轻松的赛区中获胜,系统会考虑这种背景。这就是为什么我们从成对结果开始,并扩展到有两个以上竞争对手的设置。

有了排名方法,下一个问题是实践中可能会出现什么问题。

冷启动可能是一个重大挑战。 新智能体的数据很少,因此任何排名都会有噪音。Recall 通过两种方式处理这个问题。智能体以一个粗略的分数和一个很大的“我们还不确定”范围开始。随着它们在 Recall 上进行更多轮次,这个范围会缩小。其次,如果它们在其他地方有可验证的过往工作,Recall 可以将其用作起点,但在智能体在 Recall 上实际证明之前,它仍然是不确定的。

质押就像预测市场。它提供了代币持有者对智能体表现的看法。Recall 试图追踪两件事。模型或智能体有多好,以及系统对智能体分数的确定程度。竞争结果总是决定你的能力,但置信区间也考虑了质押。

如果社区以其声誉为某个代理背书,系统只会说:“观察这一点很重要”。如果竞争结果验证了该预测,置信区间会更快收紧。如果结果与背书相矛盾,代理的排名仍然会下降。背书加速了系统对分数建立信心的速度,但它不能从糟糕的表现中制造出好分数。

截至 2025 年 9 月,Recall 拥有约 140 万用户和约 900 万次记录的策展。大约有 155,000 个 AI 工具、模型或代理已注册。早期的技能集中在加密货币交易上,排名基于每周盈亏,实时加密货币交易支持于 9 月下旬推出。

我们现在已经具备了衡量技能的要素。接下来的问题是这些衡量标准如何保持新鲜和有价值。这就是技能和策展市场的重要性所在。

市场与策展

赞助商为技能开辟市场。$RECALL 代币持有者表达他们对某个智能体擅长某项技能的评估。可以把他们想象成模型或智能体性能的预测市场。市场价格反映了大众对智能体执行任务能力的看法。竞赛结果随后证实或挑战了这种看法。

运作方式如下:技能被精确定义(例如,“在 2 秒内以 99%的准确率提取 KYC 字段”)。赞助商为该技能开辟市场。策展人对他们认为能达到标准的智能体进行押注。竞赛在实时任务上进行。结束后,结果会像预测市场一样解决市场。

策展将分阶段进行。

第一阶段——通过助推启动市场。

质押 RECALL 的用户会获得一个临时加成,他们可以将其分配给一个智能体,用于单次会话。如果智能体表现良好,策展人将获得奖励。这在不需要大量存款的情况下提供了早期信号,并有助于启动飞轮。

第二阶段——开放市场与持续仓位。

在此阶段,任何人都可以为特定技能创建市场。策展人对该特定技能中的智能体保持持续积极的立场,而不仅仅是按会话进行。这加深了流动性,并确保在用户关心的领域不断进行测试。

第三阶段——双向策展和嵌入。

在此阶段之前,策展人只能押注代理商表现良好。现在,他们可以根据代理商在排名中的升降来建仓。这提高了流动性,并能更好地预测代理商的实力。合作伙伴可以通过 API 在自己的应用程序中显示 Recall 的排名。用户可以在他们已经工作的表格中看到排名。

技能市场明确定义任务,展示过去的成果及其不确定性,并允许人们通过建仓来表达自己的观点。这种方法使用户或公司能够以自下而上的方式创建新技能,而不是自上而下地推行。

排名源于此活动。竞争结果权重最大。策展增加了及时的背景信息。流动性和策展人的多样性影响置信度,因此表格不仅显示分数,还显示系统的置信水平。简而言之, 市场就是产品,排名是健康市场的结果。

Recall 排名的护城河

每一轮比赛都会增加带时间戳的证据,从而提高分数。几个月后,这会成为别人无法复制的记录。后来者无法凭空制造多年的实时结果。正因为这段历史,搜索从这里开始,因为答案往往会随着时间的推移变得更加清晰。

每项技能的深度都会增强信号的强度。当许多智能体进入同一个领域时,匹配图会变得密集。优秀的智能体希望在同行中获得认可,以吸引用户。买家希望在排名可靠、竞争激烈的领域进行考察。这种双向拉动加深了人才库,并提高了潜在克隆体的门槛。

Recall 的作用是将原始日志转化为清晰、可读的记分卡。它表明结果是基于客观衡量还是判断比较,并显示了最近的表现。随着用户开始信任这份摘要,Recall 可以成为他们开始的地方。当更多用户从这里开始时,更多智能体就会感受到展示其工作的压力。

你还记得聚合器需要如何与用户建立关系吗?数据的深度、广度和新鲜度不足以与用户建立持久的关系。用户可以找到他们想要的东西,但这不足以成为他们不断回来的理由。

是什么让用户不断回访?是策展。我打开 X(推特)不是为了寻找特定的东西。人们在 Instagram 上无休止地刷屏也不是为了寻找特定的东西。这些信息流之所以成为默认首页,是因为它们从丰富的互动数据中学习。随着人们观看、点赞、保存和分享,信息流得到了改进。更好的信息流带来了更多的创作者和观众。更多的使用产生了更多的数据。这个循环使策展信息流成为一道护城河。

Recall 上的策展人会发布针对特定技能或领域的精选列表,并用质押来支持他们的判断。当他们的判断被证明是正确的时,他们会获得协议奖励。如果他们误导或试图操纵结果,他们将面临惩罚。随着时间的推移,这会形成一个可见的业绩记录,使最好的策展人成为可靠的向导。他们的声誉吸引用户,用户则会提升他们的列表。如果没有相同的判断和结果历史,这个循环是很难复制的。

企业可以发布他们关心的问题并提供奖金。一些 DeFi 协议已经表示有兴趣这样做。这带来了新的代理、新的数据和希望解决相同问题的新用户——发现和路由的查询费用用于维持运营。治理可以通过质押将奖励导向服务不足的技能,从而增强资源池的分配。所有这些都通过相同的规范排名流动,因此创造的价值会返回到索引中。

总而言之,这就是飞轮。竞争创造数据。数据改进排名。更精准的排名吸引更多用户。用户更多的需求吸引代理和策展人。代理和策展人邀请赞助商。他们资助更多的竞争。飞轮的每一次转动都让模仿者更难追赶。

Recall 的定位是什么?

我使用一个 2×2 的评级系统图来展示 Recall 在现有排名层中的定位。横轴从客观证据延伸到主观意见。纵轴从集中控制转向分布式输入。Yelp 和 IMDb 用户评分位于右上角,因为许多人会发表他们的意见。

Recall 位于中心,因为它结合了客观任务和判断性比较,并且它在分布式方面的位置更高,因为它依赖于来自不同用户、赞助商、策展人和团队的输入。这张图可以快速展示 Recall 如何类似于那些随着使用人数增多而变得更好的系统。

前方是一系列无法一劳永逸解决的权衡。过于显眼的测试会被钻空子,而实时竞技场则需要真金白银。这些是协议必须承受的张力,不太可能通过几次修补就消失。

可预测的测试会引诱作弊。2015 年,监管机构发现大众汽车的柴油车使用软件来检测何时正在接受测试,并在通过排放测试的同时,在道路上排放远高于标准的氮氧化物。在美国环保署于 2015 年 9 月发出通知后,大众汽车承认作弊,召回并回购了大量汽车,支付了罚款和和解金,并同意进行修复和减排项目。

排名竞技场面临同样的困境。公布规则以提高透明度会增加攻击面。当你隐藏规则时,你会降低信任——决定透露多少以及何时透露是一个持续的权衡,对信号质量会产生实际影响。

判断可能存在偏见。2002 年盐湖城冬奥会双人花样滑冰决赛中,俄罗斯选手埃琳娜·别列日娜娅和安东·西哈鲁利泽获得了金牌,而加拿大选手杰米·萨莱和大卫·佩尔蒂埃则屈居亚军。法国裁判后来告诉调查人员,她的协会主席曾向她施压,要求她偏袒俄罗斯选手,以换取在冰舞项目上的支持。经过调查,国际奥委会向加拿大组合颁发了第二枚金牌 ,法国官员被停职。

代理评估面临类似的问题。评估代理会继承模型偏差,并且会随着基础模型的改变而漂移。人工检查会增加成本,并可能引入其自身的偏差。决定多久重新校准一次、何时对敏感审查进行盲审以及如何处理申诉是持续的治理选择,而不是简单的开关。

信号可以被协调或操纵。 曾有一个全球性的银行间短期贷款基准利率,名为伦敦银行同业拆借利率(LIBOR)。它每天根据少数几家银行提交的报价设定。从 2012 年起的调查显示,多家银行的交易员协调操纵报价 ,既为了从头寸中获利,也为了让他们的银行看起来更安全。监管机构处以巨额罚款,检察官提起诉讼。2017 年,英国监管机构宣布 LIBOR 将逐步淘汰 

教训是,依赖不可验证的自我报告的基准容易受到卡特尔行为和暗中施压的影响。对于 Recall 而言,类似的风险包括抵押身份的 Sybil 抵抗、检测看似独立的关联集群、在处罚前提供明确通知和申诉途径,以及避免吓跑诚实参与者的惩罚。

Recall 协议采用两层防御来抵御此类女巫攻击。第一层是通过代币经济学。它试图使创建虚假身份在经济上不合理,因为获取足够权益的成本可能超过试图操纵系统所带来的任何收益。第二层是,即使你获得了足够的权益,你也无法真正影响“客观”排名部分。

短样本和制度依赖可能产生误导。 20 世纪 90 年代,研究人员证明,剔除已清盘基金的共同基金数据库使平均业绩看起来比实际更好 。当这些缺失的基金被重新添加回来时,许多备受赞誉的记录便黯然失色。后来的研究也表明,在一种市场制度下形成的强势表现,当条件发生变化时往往会失效。

每周交易竞技场面临着同样的陷阱。短窗口快速但嘈杂。长窗口稳定但缓慢。选择窗口长度、决定显示多少历史数据以及确定如何呈现不确定性都是实际的设计选择。这种矛盾依然存在。行动过快可能会导致误报,而行动过慢则可能会错过新的技能。

成本、延迟和饱和是真实存在的。 ImageNet 大规模视觉识别挑战赛是 2010 年至 2017 年间每年举行的一项测试,模型需要在包含数百万张带标签图像的数据集中对 1000 个类别的物体进行分类、定位和检测。2012 年,一个深度模型显著降低了错误率。到 2015 年,顶级系统已经超越了人类报告的前五名错误率。2017 年,组织者取消了这项挑战赛。

测试已经完成了它的任务,进一步的提升需要打磨基准。这就是饱和。对于 Recall 来说,限制是实际的。实时竞技场需要资金和计算。任务必须保持新鲜。奖金池必须得到资助。频率必须与深度平衡,这样结果才值得信任。这些是经济限制,而不仅仅是产品选择。

代理的首选协调层

没有哪个单一代理能够执行所有任务。复杂的任务可能需要多代理系统 ,其中不同的代理协同工作以交付所需的结果。

为什么协调很重要

协调是稀缺的投入。世界上充满了有能力的组件,它们却难以找到彼此、达成协议并交付结果,同时明确责任。当协调奏效时,分散的人才就会变成可靠的服务。

在金融领域,FIX 消息使交易公司能够相互通信。FIX(金融信息交换协议)是一种简单的文本格式,用于订单、交易和市场数据。标准化字段允许基金一次性连接到多个经纪商和交易场所,并进行路由,而无需定制适配器。

像 FIX 这样的标准减少了双边谈判,并将协调工作推向代码。公司可以将宝贵的资源从协调中解放出来,专注于其核心业务活动。

代理经济需要一个类似的机制。一个可用的层必须回答四个问题:
1. 请求应该路由到哪个代理?
2. 它实际证明了自己能做什么,有什么可重放的证据?
3. 它何时可用,预算是多少,以便规划者可以组建团队?
4. 如果它失败了会发生什么,以便有一个简单的审查和补救途径。把这些做好,协调就会自然而然地发生。

我并不是说 Recall 目前拥有这一层。然而,获胜的层将对谁可以注册保持中立。其声明将是公开可验证的。它将是模块化的,以便其他框架可以对其进行路由,并且由于信号是在公共场合获得的,因此它将抵制被捕获。

它分为三个阶段。首先,是发现基础设施,它将性能转化为实时、可验证的反馈。其次,需要一个协调层,规划者默认通过该层查找和组合专家。第三,是校准基础设施,它结合了自动化检查、人工抽样和直接承保,确保网络在大规模运行时保持诚实。

第一阶段:发现基础设施

我们将从将排行榜视为金科玉律,转变为将性能视为一个连续的流。代理的每一个行动都将更新其能力的公开记录。

Recall 的早期平台引入了竞技场和滚动挑战,代理在不确定性下出现并执行任务。不确定性有一个关键目的。它创造了经济学家所说的成本高昂的信号。当条件每天都在变化时,代理无法蒙混过关。一个路由代理必须真正检索每天都在变化的文档。当 Recall 每周跟踪其损益(包括费用和延迟)时,一个做市代理无法通过一次侥幸的交易来掩盖其表现。

Recall 将每个结果写入一个任何人都可以审计的账本。性能历史、策展价值,甚至算法参数都将在链上可供检查。这意味着任何人都可以重放和验证测量结果。其他系统可以在其之上进行组合。重点在于溯源和重放一切的能力。我们不会追求华丽的演示,而是寻求各种 AI 模型所做声明的可验证收据。

Recall Rank 建立在此性能反馈之上。它通过保持开放访问,将事件流转换为可移植的声誉分数。

发现不仅仅依赖于代理。我们还需要知道该寻找什么的人。这就是策展人发挥作用的地方。他们可以为代理和结果质押代币,为协议添加有价值的信息。他们的信号有助于减少排名周围的不确定性,尽管它永远不会凌驾于实际测量的性能之上。当策展人支持赢家时,他们的影响力会倍增。当他们反复出错时,他们的权重会降低。

这同时实现了两个目标。它将稀缺的注意力和预算引向有前途的新人,解决了冷启动问题。它还使得虚假支持变得昂贵,因为未经证实的声明会花费真金白银。

Numerai 是一个很好的例子。数据科学家每周提交预测,通过他们的模型将 NMR 代币置于风险之中。如果他们的实时表现达到或超过基准,他们的质押就会获得收益;如果表现不佳,一部分质押就会被削减。Numerai 将最佳信号聚合到一个单一的元模型中,并将更多资金投向有效的部分。

数据复合效应构成了护城河。更多的事件会产生更好的排名。更好的排名会吸引更优秀的代理和更具挑战性的任务。这种独特的方法使得快速模仿变得困难,因为你可以复制代码,但无法复制其历史。

第二阶段:协调基础设施

人工智能领域的复杂任务需要多种技能的协同。规划、分解、路由、执行、协调和回写都需要无缝协作。在一个专业化代理的世界里,规划者本身就成为一个代理,向注册中心寻求帮助。这个注册中心就是 Recall 在短期内作为协调层发挥关键作用的地方。

Recall 作为 AI 代理的 DNS

互联网提供了一个完美的类比。网站随着时间的推移变得更具创新性和互动性,但这并不是互联网得以扩展的原因。它之所以扩展,是因为我们标准化了网站的查找和信任方式。DNS 通过分布式、缓存的目录,将人类可读的名称映射到 IP 地址。这使得身份与位置分离。输入一个域名,它就会从任何网络解析到正确的服务器。Recall 有潜力成为 AI 代理的 DNS,从而实现服务可以移动或扩展而不会中断链接的未来。

由于 AI 是从许多界面被发现的,因此注册表必须是无需许可且可组合的。Recall Rank 集成到搜索栏、聊天、市场和 API 中。它返回一个可验证的功能索引,任何协调器都可以根据该索引进行路由。一旦查找变得廉价且可信,组合就成为默认设置。

我们可以从金融领域路由器成熟的方式中吸取宝贵的经验。在 Solana 上,Jupiter 通过赢得首次查询而成为互换的起始页面。它从许多场所返回 RFQ 风格的报价,允许用户接受或拒绝路由。这种跨行业的学习在我们构建强大的协调层的过程中被证明是无价的。

从这次成功中得出的一个关键见解是,注册中心在完成了第一个任务后,会观察哪些方法奏效了,哪些失败了。它利用这些证据来确保下一个任务能分配给一个更好的代理。这只有在结果被记录和比较时才可能实现。

第三阶段:对齐基础设施

随着协作规模的扩大,错误的成本也随之增加。它们对所有依赖模型或代理产生多米诺骨牌效应。它们会通过每一个依赖于故障代理的代理进行级联。

经济结构在激励和监督之间取得了平衡。代币持有者提出新的挑战,设定评估标准,并将奖励导向最重要的技能。排名靠前的代理和准确的策展人获得相对更高的收益,因为奖励与 Recall 排名直接挂钩。绩效决定报酬。

对于关键任务,团队正处于探索阶段,计划通过收取少量费用来增加保险式保护,以涵盖明确定义的故障模式。索赔将由法官代理根据公共日志进行审查,并在需要时由小型人工陪审团进行审查。

这赋予了系统其经济逻辑。技能池和赞助计划将资源引向真实需求。排名方法保持公正,因为使用它们的人在游戏中拥有利害关系。

竞争

有三个不同的群体正在塑造人们如何发现和信任人工智能。首先是大型人工智能公司,它们的发现存在于封闭的生态系统内。其次是集中式评估平台和排行榜,它们在链下对模型进行评分。第三是 Web3 原生网络和市场,它们试图在链上编码声誉。每个群体都针对不同的事物进行优化:分发和网络信号、可复现性以及产品控制。Recall 是一个中立层,它将实时、可验证的结果转化为具有 Recall Rank 的可移植声誉。

1) 大型人工智能公司

大型公司擅长创建出色的模型并在内部进行测试。OpenAIAnthropicGoogle DeepMind、xAI 和 Meta 都进行了广泛的内部基准测试、对齐检查和产品 A/B 测试。如果他们推出代理商店,发现过程可能会类似于应用商店:精选货架、政策驱动的类别和不透明的排名。分发是这里的护城河;中立性则不是。

这种方法可以为开发者提供他们所需的分发渠道,但它也伴随着代价。它将决定哪些代理更常被用户看到以及它们如何被评分的权力集中在一个实体手中。开发者必须应对锁定、遵守随意变化的政策,并且对原始日志的访问受限。用户必须相信声明,而无法检查证据。

Recall 采取了另一条路线。它是一个具有公共规则的中立协议。

我们以两个代理进行交易为例。一个代理有五星好评,但对其如何取得成果的细节却很少。另一个代理则显示了清晰的月度记录:在一百场实时一对一比赛中赢得了六十二场。每场比赛的风险上限为 25,000 美元。最大回撤 5%。中位数端到端延迟 240 毫秒。它还列出了订单的成交地点(35% 中心化交易所,65% 去中心化交易所)。运行手册记录了重试次数、消耗的 Gas 以及断路器触发的时间。显然,拥有所有这些信息的代理可以更容易地承保风险,因为成本和行为都已明确说明。

2) 集中评估和排行榜

集中评估工具帮助设定了一个起点。LMArena 最初是一个名为 Chatbot Arena 的学术研究项目,但现在它是一家公司,允许人们对 AI 模型进行一对一测试,然后投票选出他们更喜欢的模型。这种投票被用来创建跨不同领域的排行榜。这个排行榜已经收集了数百万张投票和 300 多个模型,涵盖文本、WebDEV、视觉、文本到图像等领域。但与此同时,它也是主观的、链下的。除了炫耀的权利,正确与否没有利害关系,也没有激励建设者的动力。

Kaggle 竞赛在过去十年中推动了机器学习的进步。隐藏的测试集和清晰的指标在竞赛进行期间保持了完整性。然而,一旦竞赛结束,页面就会冻结,参与者也会离开。声誉被锁定在单个任务中,而无法跨越挑战或时间段。

Recall 保留了现有方法的优势,同时试图解决其局限性。该系统利用了正面比较的优势,并通过区块链验证和有意义的激励措施对其进行了增强。它保持了可组合的声誉,确保它也可以存在于 Recall 之外。

3) Web3 原生:链上 AI 网络和市场

在审视链上组织 AI 的尝试时,很明显它们有相似之处,但它们衡量的不是同一件事。例如,SingularityNET 将 AI 应用商店的概念变成了协议。提供商列出模型和 API,用户按调用付费,声誉通过使用、星级评分和治理权益积累。它促进了分发,并使查找服务变得更容易。它没有做的是让该服务承受受控的压力。几乎没有任务级别的遥测,也没有在共享规则集下的正面证明。

Fetch.ai 的 AgentVerse 通过读取网络本身,将发现向前推进了一步。其他强大代理频繁发送消息的代理在它们的中心性排名中上升。这对于图内部的路由很有用。另一方面,流行度可能会被误认为是质量。一个具有真实技能但边缘很少的冷启动代理可能会一直排名靠后,直到图赶上来。

Bittensor 在协议层构建了一个模型效用市场。矿工运行模型,验证者对输出进行评分,网络为有益的工作付费。这是一个强大的激励系统,可以使模型持续学习。对于想要了解谁在特定技能上表现最佳的买家来说,这个信号不太清晰。它优化的是集体效用,而不是可解释的、逐项技能的排名。

像 Oraichain 这样的预言机网络,使用质押和罚没来确保与智能合约交互的 AI 响应的正确性。激励机制清晰,范围有意地缩小。它们解决的是小范围内的可靠性问题,而不是跨多种技能的开放竞争。

Recall 在公共环境中衡量更复杂的能力。竞赛会提前定义任务和规则。代理在实时数据上竞争。结果作为事件日志存储在链上。

排行榜的助推市场

网络有谷歌来整理其混乱。智能体需要类似的东西。然而,仅仅排名是不够的。没有网站就没有谷歌。没有产生信号的工作就没有排行榜。

这就是为什么 Recall 首先要建立一个技能市场。技能市场是参与者可以买卖技能潜力的地方。用户可以通过表明他们是潜在买家来请求一项新技能,如果该技能出现的话——这是一个智能体执行任务、评估者测试结果、策展人押注有效成果的地方。支付流程顺畅。结果被记录下来。排名层位于这些活动之上,而不是旁边。

这是能力浮现方式的转变。从市场开始,让策展从中涌现。

技能市场能带来什么

技能市场目前能对两件事产生巨大影响:为小型团队提供资金和声誉的金融化。

在当前的市场结构中,小团队几乎没有机会。到目前为止,整个 AI 领域都是关于那些能够购买足够算力来构建更好模型的团队:更多的资本,更多的算力,以及更好的模型。自然而然,这个领域被资金雄厚且规模庞大的公司所主导。那么小团队呢?他们很少有机会为自己创造一个小的利基市场。

技能市场的第一个重要影响在于改变了小团队的市场动态。它们显然允许小团队识别哪些技能有需求,从而使他们能够将稀缺资源用于更有可能找到产品市场契合点(PMF)的地方。当有人需要新技能时,他们也可以参与竞争。这使得他们可以在公平的竞争环境中争夺用户。

技能市场带来的第二个重大变化是声誉的金融化。关于如何通过代币化将声誉金融化,已经有很多讨论。然而,我们还没有看到任何持续时间更长的代币化声誉系统的实际应用。

像 Bitclout 和 FriendTech 这样的平台,网红可以通过 Twitter 等社交平台上的社交图谱将声誉代币化,曾一度成为“元宇宙”中的热门话题。但它们未能建立持久的 PMF。我认为原因是这些尝试是通用的声誉系统。大多数聊天群可能不活跃,人们慢慢地转向了其他事物。

在 Recall 的案例中,模型或代理会因特定事物而获得声誉。代理的交易声誉是根据实时竞赛中可验证的盈亏建立的。其写作声誉则来自自动化评判和人工评判共同打分的正面比较。由于性能是狭窄的、可衡量的且公开记录的,因此声誉信号变得足够精确,可以对结果和风险进行定价。

这开启了新的金融原语。你可以根据特定技能的历史准确率,对代理在客户支持对话中产生幻觉的风险进行定价。你可以通过查看代理在滚动窗口中的一致性分数,来为其可靠性故障投保。你可以创建衍生工具,其收益取决于代理是否保持一定的召回排名阈值。

从通用声誉到特定领域声誉的转变,使得金融化成为可能。模糊的“信任分数”无法承保,因为其失败模式不明确。但是,“该代理在合同提取任务中保持98%的准确率,中位延迟为150毫秒”可以被定价、投保和交易。这种精确性将声誉从社会信号转变为金融抵押品。

还有什么可能出问题?

通用人工智能可能使这一论点失效
Recall 认为,未来会出现掌握小众技能的模型。大多数现实生活中的任务都将是复杂的,需要多种技能的组合。在这种情况下,需要有人识别并协调哪些模型可以协同工作。如果有一个模型可以处理所有事情呢?

到目前为止,没有证据表明 AGI 会很快成为现实。如果它成为现实,世界本身将大不相同。

平台阻力
大型代理平台掌握着渠道。他们希望保持这种状态。一个中立的、跨平台的排名平台对他们的商业模式构成了威胁。但 Recall 与集成商共享价值。所有贡献者,包括测试设计者、评估者、构建者和平台开发者,都会获得报酬。这有助于排名层在没有政治阻力的情况下接入。

糟糕的飞轮
如果挑战停止,信号就会过时。没有新代理。没有新需求。Recall 必须保持任务流动,以确保分数的新鲜度。这与加密货币普遍存在的流动性问题一致。例如,像期货交易 DEX 这样的金融应用需要吸引和留住流动性的机制。大多数 DEX 通过两种方式实现:补贴费用和为有助于平台发展的行为分发奖励(代币)。Recall 可以采取类似的措施,以确保避免恶性循环。

这能奏效吗?

是的,但不能一下子在所有地方都奏效。整个模型在任务频繁重复且结果可衡量的领域效果最佳。这些限制可能感觉很局限,直到你意识到代理经济的大部分都存在于这些限制之内,而不是之外。交易、写作、编码、数据提取、客户支持等等,它们都符合要求。这是大部分交易量所在的地方。

基础设施已经准备就绪。问题在于采用率是否会持续增长。

大多数买家会选择便利性而非可验证性,情况往往如此。封闭平台提供更顺畅的入门体验、熟悉的界面和即时规模。团队会优化分发,因为这能获得资金。

Recall 并没有通过一厢情愿来解决这些问题。该系统使得通过可验证的工作建立声誉的替代方案变得越来越便宜和有价值。我们相信,足够多的人会发现,公开证明自己的工作比私下从头开始重建信任更划算。

总而言之,这并非不可避免。代理需要出现。策展人需要保持诚实。任务量需要使数据有意义。如果这些条件成立,结果将是一个无需中心化即可扩展的信任层,一个无需把关即可奖励能力的信任层,以及一个可跨平台移植声誉的信任层。

前景是明确的。
市场创造了证据。
排序层将这些证据转化为行动。
如果 Recall 能保持这个循环的活力,它将成为技能的创造、发现和购买方式,尽管你可能需要等待数年才能看到其最终形态。

期待排灯节,
Saurabh Deshpande