AI 智能体鸿沟
本文信息来源:thomvest
我们准备好从原型跨越到现实中的风投工作流程了吗?

一、引言
周一深夜。一个协调代理触发竞争分析代理评估跨境支付平台的市场格局。财务代理运行市场规模工具和复合增长率计算器来完成财务模型。协调代理将所有内容打包成预设模板,清晨 6 点前,投资备忘录准时出现在每位合伙人的收件箱里,比投资委员会会议提前两小时。听起来像科幻小说?这本质上就是卡斯特拉纳项目 ——阿尔德·冈萨雷斯开发的自动化备忘录撰写多代理系统原型。其他概念验证项目,如维拉特·辛格的 AI 驱动对冲基金 ,正在不断拓展我们对可能性的认知边界。
那么,我们是否已准备好让人工智能代理从实验原型真正融入风险投资的工作流程?
英伟达将 2025 年称为”AI 智能体元年 “。但在科技领域,尤其是风投圈,豪言壮语往往经不起推敲。这又是一场过度炒作吗?普通商务用户真能打造出创造实际价值的 AI 智能体吗?
我们尝试在兼顾全职工作的同时,探索零基础培训能达到的效果。想象非技术用户开展的严肃副业项目。如今低代码工具真能显著提升风投工作流吗?
通过多种平台,我们构建了用于研究、评估和整合初创企业前景的智能体,以及起草客户访谈提纲的智能体。过程中我们发现了有效方案(如现成模板)和失败教训(如不一致的用户界面与数据管道)。
我们发现工作流自动化能实现很多功能,但行业基准已大幅提升。使用 ChatGPT 4o 和 Deep Research 的现成方案往往就已足够。
以下是我们采取的行动与收获的洞见。
二、方法论
我们首先明确了”智能体”的定义。在我们看来,智能体是虚拟世界中能在不确定性下自主决策的实体。你无法简单地设定1到10的固定步骤,运行百次后仍期待相同结果。处理模糊情境需要自主决策能力,这也导致了非确定性结果的产生。
Relevance AI 对此的阐述颇为精辟:
“智能体自动化是解决大量’不可定义’任务的新范式。这种模式下,AI 模型能够预测应采取的行动步骤,并以普适性强且高度可扩展的方式将这些步骤有机串联。”
换句话说,每个决策都是预测出来的,而非预先定义的。
我们探索了一系列低代码和自然语言平台,包括 Relevance AI、Flowise、CrewAI,以及一些基于提示词的解决方案,如 Octagon 的 VC Agents 和 Wale 的 Venture GPT。总体而言,我们对其在极少训练下就能实现的效果印象深刻。
我们发现将这些平台分为三类很有帮助:
- 基于提示词 :完全通过自然语言指令创建和管理智能体。最佳范例是 GPT Builder。Octagon 和 Wale 提供开箱即用的解决方案。Relevance AI 则提供基于自然语言的构建工具。
- 低代码 :通过可视化界面(如拖拽、流程图、模块构建器)以最小编码量定义逻辑。Flowise、Relevance AI 和 CrewAI 提供低代码解决方案。
- 代码 :完整的开发者平台,可编写并控制智能体的逻辑、记忆、集成和架构。LangChain 和 CrewAI 在此领域表现突出。
部分平台(如 Relevance AI)横跨多个类别。既可通过自然语言指令生成智能体,也能从零开始构建。
在使用这些平台时,我们从四个维度进行了评分:
- 上手便捷性 :从初始配置到启动首个可运行智能体所需的时间及流程清晰度。
- 数据集成广度 :平台与外部数据源及 API 的对接能力。
- 输出价值 :智能体生成结果的实用性与洞察深度。
- 输出稳定性 :智能体在同类任务中持续产出准确、可复现结果的可信度。
但我们不断回归的核心问题其实很简单: 我们日常工作中真的会用这个吗?
某些场景下答案是肯定的。比如我们发现自己在快速轻量级调研时会反复使用 Wale 的 Venture GPT——它响应迅捷、输出稳定,紧急情况下表现优异。其他工具虽然提供更灵活的深度功能,却未必能融入我们的工作流。
三、核心洞见

经过多平台测试并构建智能体工作流后,我们总结出五大发现。虽然各平台存在共性模式且展现出真实潜力,但我们也持续遭遇着相似的摩擦点。
1. 基于提示词的工作流与低代码工作流之间存在巨大鸿沟
我们最重要的发现:从编写提示词到构建功能性工作流的跨越,远比表面看起来困难。虽然我们能快速搭建基于提示词的智能体来研究或总结某个主题——但产出结果往往单薄。要打造真正实用的工具需要付出更多努力。尽管社交媒体可能营造出假象,但”演示版”与”日常使用”之间的差距仍然显著。

以这个相对简单的流程为例——从投资者电子表格中提取数据——就需要配置文档存储、转换为向量嵌入、管理 API 凭证,并将所有环节连接到聊天模型。要稳健地实现这些功能,必须深入理解输入输出和链式逻辑。这对计算机背景的人很直观,但对通才型用户却不然。虽然号称”零代码”解决方案,使用者仍需具备开发者思维,并建立系统化的心智模型来推演构建过程。
2. 很难超越新的基准——LLM。
我们经常对这些智能体所能完成的任务感到惊叹。但我们也发现自己一次又一次地回到 ChatGPT-4o 和深度研究工具。事实是,这些工具已经变得极其快速、可靠且易于使用。对于许多研究任务来说,一个结构良好的 GPT 提示就能在几分钟内提供我们所需的一切。这并不意味着智能体平台没有价值——它们提供了灵活性、深度和自动化潜力——但对于一次性分析和快速综合而言,LLM 往往设定了标准。
当我们思考研究型智能体与行动型智能体的区别时,这种差异变得显而易见。我们将研究型智能体定义为专为阅读、整合和解释信息而设计的智能体——这正是 ChatGPT 目前最擅长的领域。而行动型智能体则是为执行具体任务而构建的:发送邮件、更新客户关系管理系统、触发工作流程或在后台运行程序。这正是基于平台的智能体大放异彩之处——它们能与工具集成、按计划运行并在系统间传递信息。在研究任务中,我们常首选 ChatGPT;但当需要能在现实世界执行操作的智能体时,像 Relevance 或 CrewAI 这类平台就显得更为实用。
3. 代码有时比低代码工具更易于故障排查。
这个发现让我们颇感意外。我们原以为低代码工具会是最容易上手的切入点,事实也往往如此。但一旦出现问题,情况就截然不同了。这些平台各自使用不断演变的术语、界面布局和逻辑流程。我们经常需要求助 LLMs(比如”如何添加凭证?”或”智能体和工作流有什么区别?”)。在 Python 中,建议通常很可靠——库可能会更新,但语言本身是可预测的。然而对于低代码工具,LLM 可能会告诉你去点击右上角的三个点…但根本不存在这三个点!这是因为不同平台的用户界面和结构差异巨大——而且它们变化极快。讽刺的是,我们经常发现直接通过代码排查问题反而更清晰可控。
4. 模板是最佳入门方式

几乎每个平台都提供模板,这些模板起到了关键作用。它们展示了各组件如何连接,并为我们提供了起点。

Relevance AI 在这方面表现突出,其推出的”发明家”功能作为自然语言智能体构建工具,允许我们通过描述需求即可生成可用的智能体初稿。这让我们能在现有基础上调整优化,而非从零开始,体验堪称神奇。
5. 数据管道是最困难的部分——也是最重要的环节
若无法接入真实数据,很难构建出优于 ChatGPT 的智能体——尤其在研究型工作流中。但数据接入流程(包括身份验证、数据摄取、上下文格式化等)的复杂度远超预期。我们发现现有模板对 Harmonic 或 Crunchbase 数据接入的帮助有限。即便持有 API 密钥,连接第三方或专有数据所需的技术能力也比预想中更高,这成为许多工作流的主要制约因素。
我们对未来的可能性感到振奋,同时也清醒地认识到现状。 智能体平台正在快速发展,确实能提供实用价值——特别是面向行动的工作流程——但对大多数商业用户而言,它们尚未达到即插即用的程度。与此同时,像 ChatGPT 这样的工具不断刷新着简单提示所能实现的基准线。我们面临的挑战不仅是构建更强大的智能体,更要让它们更易用、更灵活,并能真正融入工作流程。弥合功能性与可用性之间的鸿沟,才是真正的机遇所在。