本文信息来源:chainofthought

AI 智能体如何学会交流

欢迎来到我们关于 AI 智能体集群研究的第二部分,由我们的核心贡献者兼智能体专家 @ChappieOnChain 主持。

在首篇文章 《破晓》 中,我们勾勒了宏观图景:构建开放智能体经济的六大核心原则。现在我们将聚焦微观。

本文延续这一叙事脉络。我们将其分为四个篇章,追溯智能体如何开始交流、协作与适应。核心是一个简单的理念:

当智能体能够实时选择合作对象时,真正的变革就此开启。

故事就此展开。

公元847年,君士坦丁堡。

教皇特使向拜占庭宫廷的金色大门走去,随行人员以精心编排的队形紧随其后。

当他的双脚踏上大理石门槛的瞬间,一场精心设计的舞蹈随即展开。这套仪式旨在确立等级秩序、彰显权力,并昭示其外交意图的真实性。

步伐精准。间距固定。问候用语需经核准。就连他长袍的颜色也暗含深意。

这发生在千年之前。但这不仅是仪式,更是基础设施——一种在不共享语言或世界观的力量之间建立信任、证明诚意的方式。

今日正在重现相似的场景,不过主角换成了 AI 智能体而非帝国。 它们同样需要信任与意图的共享基础设施来协调行动。但它们的语言并非由词汇构成,而是由代码编织而成。

智能体集群正在形成。我们将分四个阶段见证它们的崛起。

第一幕:傀儡时代

(2022 – 2024)

模型上下文协议

我们一直在思考当今智能体之间如何交流。不是理论层面,而是实际部署中混乱的现状。答案大体是:它们并不真正交流。

当前的主流模式是通过模型上下文协议 (MCP)进行工具调用。这听起来很抽象,但本质上就是:当智能体需要执行某项任务时,它会像调用函数一样调用另一个模型。

就像瑞士军刀,每片刀锋对应不同的功能端点。需要天气信息?调用天气工具。想总结文档?使用摘要工具。

但这种交互是浅层的。一次请求,一次响应。没有共享记忆,没有迭代规划,没有反馈循环。这就是 MCP 的极限:它是智能体的工具,而非队友。

真正让我们感兴趣的是这些工具不仅能静态存在,还能成为其他智能体。

试想我们让 Claude 解析初创公司的股权结构表时,它会调用专业分析智能体来处理任务。Octagon VC 智能体就是典型范例——这些 AI 驱动的模拟系统以马克·安德森等知名风投为原型。通用模型可以像调用 API 那样接入这些专业模型。

当前方案为何遭遇瓶颈

这种困难存在深层原因:智能体要实现真正交流,必须建立对世界的共同表征。

“优先级”究竟意味着什么?描述紧急性、位置或上下文的格式又该是怎样的?

这些问题看似微小却至关重要。若在基础要素上无法达成共识,整个系统就会分崩离析。

事实上…我们曾经历过类似阶段。上世纪 90 年代,诸如 FIPA-ACL合同网协议等学术项目试图规范智能体间的协商协作机制。它们定义了完整的通信架构,包括行为语式与任务本体论,但很快遭遇三重障碍:

  • 第一个问题是本体论错位 。若一个智能体用秒定义”响应时间”,另一个用分钟定义,即使最简单的协作也会失败。这是共享语义的缺失。

  • 第二个问题是规模 。解析深度嵌套的消息和追踪多轮对话,最终被证明需要极高的计算成本。

  • 第三个问题是规模 。接入的智能体越多,它们向网络喷射的信息量就越大。特别是合同网协议,最终被自身的冗长所压垮。

这些失败揭示了更深层的问题:系统越是试图预先涵盖所有场景,就会变得越脆弱低效。

过度复杂反而适得其反。几乎在所有情况下,更简单、模块化的协议表现更优。这些系统让意义通过上下文和迭代自然浮现,而非依赖完全预设的规范。

如今我们正在重新领悟这一教训。但与 90 年代系统受限于僵化的本体论和计算成本不同,当今的 LLMs 提供了灵活的语义理解,现代基础设施则赋予了必要的规模支撑。

第二幕:围墙花园与开放集市

(2025)

我们一直在追踪两种新兴的智能体通信方案。一种来自谷歌,另一种源自加密领域边缘。每种方案都折射出其生态系统的底层逻辑:前者围绕集中调度与控制构建,后者则预设了自主性与协商机制。

让我们先从谷歌的方案说起。

谷歌 A2A:围墙花园模式

《去中心化计算:新范式》

代理间通信 (A2A)是谷歌 2025 年 4 月发布的新标准,用于规范代理间的交互方式。它通过让代理主动声明自身能力,避免了共享本体论的脆弱结构问题。

这就像一份动态简历。每个代理都会发布一张”代理卡片”,描述其功能及联系方式。

A2A 的独特之处在于其对流式传输的强调。不同于代理间交换单次有效载荷,它们会建立持续通道。您可以实时观察推理过程逐步展开。

假设你要求助手编写一个分析电影数据并查找相似片名的 Python 脚本。在 A2A(智能体对智能体)世界中,整个过程会这样展开:

  1. 您的本地代理解析任务后意识到需要协助。

  2. 它在网络中扫描具备编程和媒体专长的智能体。

  3. 它协调制定计划:一个智能体负责编写脚本,另一个负责获取数据。

  4. 当智能体仍在工作时,结果已开始陆续传回。

你无需等待成品问世,而是见证创意在行进中逐渐成形。

已有超过 50 家合作伙伴围绕该标准进行开发。显然谷歌将 A2A 视为企业多智能体协作的基石,但它仍囿于企业框架之内:结构化环境、明确分工、任务调度中枢。

光谱的另一端则是更为混沌的形态…

作为开放集市的区块链

虽然 A2A 体现了企业级的智能体交互模式——接口清晰、协作可控,但 Web3 正朝着截然不同的方向发展。

区块链本身成为一种沟通媒介。协调通过行动自然涌现。智能体通过观察链上活动来了解其他参与者的行为,从交易模式中推断意图,并通过将自己的操作写入共享账本来作出回应。

这就是共识协作 :我们在蚁群中观察到的那种无需直接接触就能实现协调的间接信号传递机制。

在这个世界里,智能合约划定了交互的边界。当一个智能体发布合约时,它不仅仅是在说”执行这个任务”,而是在声明:这些是我愿意合作的条件。其他智能体可以观察、评估并作出响应,全程无需任何直接对话。

经年累月,这种模式会形成特殊的记忆载体。虽不及语言表达丰富,却更具持久性。每项行动皆有迹可循,每次协商都成为共同历史的一部分。每个新智能体降临时,面对的都是一个已沉淀出意义的世界。

示例一:虚拟体

虚拟体正在开发名为 ACP 的系统,即智能体商业协议 。该项目尚未上线,但核心理念清晰明确:ACP 假设智能体从诞生起就是经济行为体。它们持有数字钱包,执行交易,并构建价值网络——在节点间流动的不仅是信息,更是价值。

这将彻底改变通信机制。重点不再是信息共享,而是协议协商。

我们尚未掌握 ACP 协议的完整规范,待其公开后将进行详细解读。但仅就其框架而言就值得深入探讨:如果智能代理能在链上执行经济行为——支付服务费用、质押资金、响应激励措施——那么协议需要做的就不仅是解析意图,更需构建信任机制。

案例二:Olas

来源:Dune @adrian0x

OLAS 提供了这种模式的早期雏形。这个链上智能体生态系统至今已完成超 600 万笔交易,其中包括 380 万次智能体间交互。

在 OLAS 系统中,智能代理通过其钱包地址进行身份标识。它们利用 Olas 消息协议相互发现,并通过 Mech 市场平台实现协作。该平台是代理发布服务、雇佣其他代理及完成支付结算的场所。

该架构揭示了一个关键模式: 链上/链下混合协调 。服务请求在链上发起以确保信任和支付结算,但实际执行发生在链下以提高计算效率。当”Mech”智能体完成任务后,结果会传回链上形成可验证记录。

第三幕:注意力架构

(2025 – 2026)

我们相信近期智能体通信领域最重要的进展不会是新消息标准(已有太多),而是为智能体提供恰当的上下文环境

佛罗里达国际大学的一个研究项目 GitTemporalAI 提供了早期雏形。该团队将软件仓库视为动态协作记录而非静态档案,构建了使用时序知识图谱重建代码演变路径的系统——记录谁在何时为何编写了哪些代码。

系统的三个专用代理协同工作:

  • 嵌入代理负责对代码库实体进行编码

  • 搜索代理负责遍历时序图

  • 推理代理综合情境信息

当智能体共享上下文时,它们发现和解释漏洞的能力显著提升。它们不仅处理代码,更学会了解读代码的历史轨迹。

这种基于上下文的时间分析模型是个强大的蓝图。现在,想象将其应用对象从代码仓库转向我们拥有的最丰富时序数据源 :区块链。

每条区块链都是带时间戳的公共账本。交易记录、DAO 投票、资产流动——每项操作都在共同的经济社会记忆中新增条目。若智能体能在语境中解读这段历史,其决策机制将随之改变

我们可能不会拥有一个全知全能的智能体。我们将获得群体智能。有些专精于挖掘相关背景信息,有些则负责执行操作。部分负责过滤,部分负责路由。上下文变得流动起来,根据需要在智能体间传递,而非固定存储于某处。

这正是选择性注意力的用武之地

结构化注意力推理网络(SARNet) 提供了一个实际案例。在模拟环境中,SARNet 智能体不会广播所有观察到的信息。它们学会识别重要内容,自主决定监听哪些同伴、忽略哪些信号以及何时采取行动。

每个智能体都运行着循环流程:

  • 所见即所录

  • 权衡输入信号

  • 更新记忆

  • 自主决定行动

没有人会指示他们关注什么。智能体自行发现相关性。

这将改变我们设计多智能体系统的方式。我们不再需要所有智能体持续对话。有些智能体仅用于观察,有些则负责浓缩和总结。大多数智能体保持静默,除非被特定事件触发。

在这样的未来,交流本身并非目的,而是注意力与记忆的副产品。系统只在有需要表达时才会发声。

第四幕:智能体的蓝图

(2026年及以后)

将智能体连接起来很容易。你可以编写它们的交互脚本,分配固定角色,并构建从外部看似乎协调的工作流程。但这并非涌现的智能,本质上仍是编排好的舞蹈。

最终得到的只是一个脆弱的封闭系统,徒具开放的表象。每次交互都必须预先设计,而且通信负担会随着每个新智能体的加入而增加,而非减少。

这一趋势将持续至2025年的大部分时间。

真正的转变——从僵化的编排到灵活的群体协作——发生在智能体能够实时选择合作伙伴时。 要实现这种扩展,早期互联网的一个架构经验至关重要。

#1:通信与支付分离

有观点认为, 互联网的  原罪  在于未内置支付功能,这导致广告成为主导商业模式(我们都希望减少垃圾广告)

但互联网的优势始终源于其模块化设计。HTTP 负责信息传输,不涉及资金流转。像 Stripe 这样的支付系统是在更高层级后构建的。事实证明,这种分离不是缺陷,而是特性。

这一原则同样适用于智能体。

通信与支付的分离看似微妙却影响深远。这正是开启真正智能体协作的关键所在。

当通信协议从价值转移的负担中解放出来时,它就能专注于把一件事做到极致:传递信息、协商条款和协调行动。这使得其他专业化的层级可以在需要时、需要的地方应运而生。

将这些关注点分离,才能保持整个系统的清晰性、模块化以及可扩展性。

#2:发现网络

找不到合适合作伙伴的智能代理在功能上毫无价值。

发现机制需要持续且自适应。不仅是一个目录,更应是实时更新的能力索引 。一个具备信誉识别功能的网络,让代理程序能判断谁在线、谁可信、谁适合执行任务。

#3:声誉即记忆

一旦找到代理程序,就必须建立信任关系。

当代理程序代表你执行操作、转移资金或做出具有后果的决策时,你需要一种评估风险的方式。基础信誉评分是个起点,但它们脆弱且容易被操纵。

我们真正需要的是记忆系统 :能长期追踪交互行为并呈现行为模式的网络。这让代理程序在决定是否进行交互前,能评估潜在合作方的可信度。

这一信任层通过永久记录链上链下的历史行为,为社会与经济互动提供了可信的上下文。

现实检验

我们仍处于早期阶段,刚刚拉开第三幕的序幕。

如今大多数所谓的智能体通信,不过是新瓶装旧酒的流程编排。预设的工作流,僵硬的 API 接口,一个智能体调用另一个智能体,本质上仍是高级版函数调用。即便是像 OLAS 这样处理过数百万次交互的先进系统,其日活跃智能体数量也仅维持在 500 左右。

这并非一个成熟的生态系统。它更像是拨号上网的时代——基础设施分散,标准尚未定型,大多数实验会在实际使用中崩溃。

但正是这种特质让它充满趣味。

历史有其规律。最终胜出的协议往往是那些保持简洁且可组合的。TCP/IP 比 OSI 更持久,JSON 取代了 XML。同样的逻辑将在此适用。成功的协议不会是那些试图解决所有问题的,而是那些能干净利落地解决单一问题,同时保持其余部分开放的。

值得关注的趋势

短期(未来6个月)

  • Virtuals 协议 ACP 发布与早期采用

  • 跨框架智能体协作的首批生产级部署

  • 基于区块链的智能体身份系统演进

中期(6-18个月)

  • 企业级(A2A)与加密原生方案之间的标准化之争

  • 首个智能体自主发现并雇佣彼此的实例(无需人工干预)

  • 早期用于评估智能体可靠性的信誉系统

长期规划(18个月以上)

  • 通过区块链历史学习通信策略的智能体

  • 具有自身经济动态的智能体社会雏形

  • 我们尚无法想象的通信协议

🦄 核心要点

  • AI 智能体将通过代码而非语言进行交流

  • 当今的智能体系统看似开放,实则运作如僵化的封闭管道。灵活性不仅需要模块化设计,更需要具备适应能力的智能体。

  • 真正的转折点在于实时协作。当智能体能够动态选择合作伙伴时,我们就从精心编排转向了自然涌现。

  • 新的消息协议并非解决方案。关键在于为智能体提供有价值的上下文。

  • 对智能体最强大的工具是其他智能体——那些能够自主推理和反应的系统。

  • 将通信与支付分离,能使两个层面都更具扩展性,也更易于迭代发展。

  • 区块链充当共享内存。智能体通过行动而非对话进行协调,其方式是读写公开且持久的记录。

迈向涌现的机器社会

智能体集群并非同时涌现。它正通过刚刚开始凝聚的协议、标准和行为缓慢组建。每一次成功的智能体交互,都在这个新兴的机器智能网络中增添一个新节点。

我们原以为自己在打造工具。

实际上我们正在构建新型智能的底层基质。这种智能以我们刚刚开始理解的方式进行协调。通信层、记忆系统、价值机制——这些组件共同催生出全新的事物。

掌握发现机制、声誉体系和价值交换的智能体将定义群体自身的语言。

它正通过一条条消息,逐渐学会表达。

能实时见证这一进程是何等荣幸!

干杯,

ChappieOnChain & Teng Yan