智能体系统现状 – 2025年7月
本文信息来源:thedatasource

七月带来了一波与过去几个月渐进式代理更新截然不同的发布浪潮。无论是在框架、基础设施还是模型训练方面,有一个共同的主题十分明确:从实验阶段向运营阶段的转变。工具开始呈现出为生产环境的复杂性而构建的样子,而不仅仅是为研究基准的无菌条件而设计。以下这些发布之所以引人注目,是因为它们缩小了聪明的代理演示与能够可靠地呈现在用户面前或投入实际工作流程之间的差距。
🔥 焦点发布
这些发布正在推动生产级代理工程的到来。
- 上下文工程调研:
这篇 ArXiv 论文的作者调研了超过 1,400 篇论文,以构建一个支持长上下文推理、记忆和工具使用的语言模型技术的结构化分类体系。[ 阅读论文 ] - LangChain 深度代理:
LangChain 推出了“深度代理”这一新的 LLM 代理类别,专为长周期推理、规划和执行而设计。这些代理与浅层代理的不同之处在于,它们通过类似文件的工作区引入了结构化规划、子代理和记忆功能。[ 博客文章 ] - GEPA:反思式提示进化可优于强化学习
GEPA 引入了一种提示优化框架,该框架使用对执行轨迹的自然语言反思来替代稀疏的标量奖励,通过遗传变异和基于帕累托的选择来进化指令。与 GRPO 和 MIPROv2 等方法相比,它的表现显著更优,在任务性能上最高提升约 20%,且所需的 rollout 数量最多可减少 35 倍。[ 阅读论文 ] - OpenAI 的开源模型
OpenAI 发布了 GPT-OSS,这是一对开放权重的推理模型(gpt-oss-120B 和 gpt-oss-20B),在 Apache 2.0 许可下发布,旨在实现高效的链式推理、工具使用和长上下文工作流;较大的模型在 OpenAI 的 o4-mini 基准测试中表现接近,而较小的模型性能可与 o3-mini 相媲美,并且可在仅 16 GB 内存的边缘设备上运行。[ 阅读博客文章 ] - ALHF:基于人类反馈的智能体学习
Databricks 推出了 ALHF,这是一种范式,代理可通过专家提供的最少自然语言反馈持续适应,大幅提升响应的相关性以及与企业期望的一致性,即使只有少量反馈示例也能实现。在他们的 DocsQA 基准测试中,ALHF 将答案完整性提升了 12 个百分点,并在仅使用 32 条反馈记录的情况下,将反馈遵循率从约 12% 提升至接近 80%,展示了通过反馈感知记忆和组件级适应实现的高效、可教化的代理行为。 [ 阅读博客文章 ] - LangChain 的开源编码代理
Open SWE 是一个云托管的开源编码代理,能够自主研究代码库、生成详细的执行计划、编写和测试代码、进行代码审查并发起拉取请求,同时允许开发者实时引导流程。它基于 LangGraph、LangGraph Platform 和 LangSmith 构建,并通过 Daytona 提供沙盒化执行,支持长时间运行的并行任务,并具有人类参与控制,以实现更安全、高效的工程工作流程 [ 阅读博客文章 ]
🛠️ 值得一看
小而强大的工具和库。
- GPU 内存快照:加速亚秒级启动:
这篇博客解释了 GPU 快照技术如何在早期 CPU 内存快照的基础上,通过集成 NVIDIA 的 CUDA 检查点 API 来对设备内存、上下文和流进行检查点保存。这消除了重新运行诸如 torch.compile 等繁重初始化的需求,即使在异构工作主机之间,也能即时恢复已完全预热的 GPU 模型,并带来高达 10 倍的加速效果。[ 博客文章 ] - Exa Search API:
Exa.ai 推出了 Exa Fast,声称这是全球最快的搜索 API,中位数(p50)延迟约为 425 毫秒,比基于 Brave 和 Google 的封装器快约 30%,得益于从零构建并针对 LLMs 优化的完整搜索技术栈。 [ 博客文章 ] - Daytona 沙盒用于 Agent 执行 :
Agno 的 Daytona 工具包为 Agent 提供了一个安全、高速的沙盒环境,配备文件、命令、Git 和 LSP 集成,可在 Agno 的多 Agent 框架中安全地运行和管理代码执行。 [ 查看文档 ] - Linear 代理交互指南 :
Linear 的 AIG 框架结合全新的 Agent Interaction SDK,提供了一种结构化的方法来构建能够在 Linear 内透明且直观地交互的代理,处理任务、传达状态、展示推理过程,同时始终将责任保留在人类手中。[ 查看文档 ]
🔍 深度解析
- 如何修复你的上下文
Drew Breunig 概述了六种实用策略,包括 RAG、Tool Loadout、Context Quarantine、Pruning、Summarization 和 Offloading,以防止 LLM 代理中常见的上下文失败。这些方法有助于缓解诸如幻觉污染的上下文、混乱或冲突的信息以及过载的提示等问题。[ 博客文章 ] - 深度思考:从推理时搜索到自我改进
Deep Cogito 发布了四个开放许可的 “Cogito v2” 模型(70B 稠密、109B MoE、405B 稠密和 671B MoE),采用迭代蒸馏与放大(Iterated Distillation and Amplification,IDA)训练范式,将链式思维推理内化到模型权重中,从而实现更短、更高效的推理链,比同类模型缩短约 60%,同时在各项基准测试中与最新的 DeepSeek v3 和 R1 模型表现持平或更优。旗舰版 671B MoE 脱颖而出,成为当今最强的开放模型之一,性能接近 o3 和 Claude 4 Opus 等闭源前沿模型,但训练成本仅为其一小部分,整个 Cogito 系列的训练成本低于 350 万美元。[ 博客文章 ] - Anthropic:我们如何构建我们的多智能体系统
Anthropic 的多智能体研究系统使用一个主智能体将复杂任务分解为由专业子智能体处理的子任务,从而实现并行、工具增强的研究。这种架构通过模拟专家团队的运作方式,大幅提升了深度研究任务的性能、可扩展性和可靠性。[ 博客文章 ]
🧠 七月的重要主题
7 月发布的核心趋势是,智能体正从研究项目跨越到真正可投入生产的系统。这一转变在整个技术栈中都十分明显。LangChain 和 Anthropic 的多智能体编排等框架正在推动规划、任务分配和记忆能力的进步。GPU 快照和低于 500 毫秒的搜索等基础设施进展正在消除延迟瓶颈。模型训练正通过基于反思的提示优化和具备推理感知的蒸馏不断演进。上下文处理正被正式化为一门拥有自身最佳实践的学科。
这些发展共同奠定了另一类智能体的基础。这类新型智能体速度快、可靠、可解释,并且能够在无需持续人工监督的情况下不断改进。形势正在发生变化。智能体不再是受控环境中的脆弱实验品,而是正逐步成为可以自信地嵌入到对收入至关重要的工作流程中的系统。
本月的动态显示,技术和市场的叙事开始趋于一致。基础设施的成熟意味着代理能力可以从有趣的演示转变为企业软件中的核心功能。领先者不仅仅是那些拥有最复杂代理行为的公司,还包括能够将这些能力整合进现有技术栈、在大规模下控制成本,并在零容错的环境中交付可衡量投资回报的企业。当前的机遇在于识别代理能产生最大影响的领域,并将其打造成企业愿意信任、用于最关键业务的基础设施。