当一家AI代理被要求回答“这家公司最近的融资条款是什么”时,它需要先访问网页、解析HTML、剔除导航栏和广告、把正文转成干净文本,再交给大语言模型推理。这个过程里最脆弱的一环,往往不是模型能力,而是第一步:网页数据是否抓得到、抓得准、抓得快。而现实是,大量网站的反爬机制、动态渲染和结构混乱,让“干净网页数据”这件事远比听起来困难。

Firecrawl 正是把自己放在了这个环节上。这家总部位于旧金山的公司提供面向AI代理与开发者的网页数据API与检索平台,通过API将整个网站转换为干净、LLM-ready的Markdown或结构化数据。2026年9月,FinSMEs披露,Firecrawl完成7500万美元B轮融资。但该轮融资的具体投资方及资金用途,公司方面尚未披露。

这笔融资的金额是Firecrawl此前A轮融资规模的五倍有余。2025年8月,该公司宣布完成1450万美元A轮融资,由Nexus Venture Partners领投,Y Combinator、Shopify CEO Tobias Lütke等参投,使其总融资额达到1620万美元。从1620万到7500万,资本对“AI与网络之间缺失层”的押注在一年内急剧升温。但升温的不仅是资本,还有围绕AI爬虫的法律与伦理争议。

字段 内容
公司 Firecrawl
轮次 B轮
金额 7500万美元
投资方 未披露
总部 美国旧金山
创始人 Caleb Peffer、Eric Ciarla、Nicolas Silberstein Camara
官网 https://www.firecrawl.dev/

Fire-Engine的“快33%”与“快10倍”之间,隔着一层未经验证的真空

Firecrawl的核心技术资产是自研的Fire-Engine抓取引擎。据公司披露,该引擎比现有方案快33%、成功率高40%。这一数据出现在The AI Insider对A轮融资的报道中,来源是公司口径。但在AIbase与搜狐的中文报道中,V2版本API的抓取速度提升幅度被表述为“10倍”,成功率同样提高40%。两个数字指向的是同一项技术,却相差一个数量级。

这种差异可能来自不同的比较基准:33%可能对比的是某一类传统爬虫,而10倍可能对比的是Firecrawl自身V1版本,或者是在特定测试条件下的峰值表现。但关键问题是,来源材料没有提供任何第三方基准测试、样本网站列表或可复现的测试方法。因此,无论是33%还是10倍,都只能视为公司宣称,而非经过独立验证的行业事实。

从已披露的产品形态看,Firecrawl的技术路径并非不可理解。它通过API接收请求,爬取目标网站的所有可访问子页面,无需sitemap即可提取内容,并输出Markdown、JSON或截图等格式。V2版本加入了语义化爬取能力,据公司称利用自然语言处理理解网页结构、自动提取所需数据。这与传统基于CSS选择器或XPath的爬虫有本质区别:后者依赖网页结构的稳定性,一旦网站改版就需要重新配置;而语义化爬取试图让系统理解“这是文章正文”“这是评论区”“这是相关推荐”,从而降低维护成本。

但“语义化爬取”的实际效果高度依赖网页多样性和NLP模型的泛化能力。一个在新闻网站上训练有效的模型,面对电商产品页、论坛帖子或JavaScript重度渲染的单页应用时,表现可能显著下降。来源材料没有提供Firecrawl在不同类型网站上的成功率分布,也没有披露其处理反爬机制的具体方式。这意味着,开发者选择Firecrawl时,无法从公开信息判断它在自己目标网站上的真实表现。

35万用户与43,000星标:开源社区的规模能转化成多少付费意愿

Firecrawl在开发者社区的影响力是实打实的。据公司披露,其拥有超过350,000名用户,GitHub星标数43,000+。另一来源称星标数“近5万”。无论取哪个数字,这在开源网页爬虫工具中都属头部水平。客户名单包括Zapier、Shopify、Replit,以及多家未具名的全球顶级对冲基金。

Zapier的集成案例被公司作为标杆场景反复提及:据公司披露,Zapier在一个下午内完成集成,其Chatbots产品可自动摄取客户网站与帮助中心页面,使机器人能在几分钟内回答FAQ并捕获线索。这个案例说明Firecrawl的产品设计确实切中了自动化工作流的一个真实痛点——让非技术团队也能把网站内容接入AI应用。

但开源社区的规模与付费转化之间并不存在线性关系。Firecrawl的商业模式是开发者平台/API服务,提供自助服务平台。开源工具可以免费获取,API调用则按量计费。问题在于,350,000名用户中有多少是付费API客户,公司未披露。联合创始人兼CEO Caleb Peffer称公司已实现盈利,这一说法来自公司口径,同样没有经过独立审计验证。在SaaS行业,“盈利”可能指EBITDA为正、经营现金流为正,或仅仅是某个季度的账面利润,不同口径差异巨大。

从客户结构看,Zapier、Shopify、Replit这类高增长科技公司和对冲基金,通常对数据时效性和稳定性有较高要求,也具备付费能力。但这类客户同样可能自建爬虫基础设施,或使用商业爬虫服务商的定制方案。Firecrawl的API模式能否在开源免费与商业付费之间划出清晰的护城河,取决于其Fire-Engine在速度、成功率和反爬能力上是否真的构成不可替代的差异。

147个活跃竞争对手:一个拥挤赛道里的第五名

根据Tracxn的数据,Firecrawl有147个活跃竞争对手,其中20个已获融资、7个已退出。Firecrawl在这147个竞争对手中按总融资额排名第5。这个排名本身说明了两件事:第一,网页抓取与数据提取是一个充分竞争的市场;第二,Firecrawl的融资规模虽然增长迅速,但并非赛道内资金最充裕的玩家。

Tracxn列出的竞争对手类型包括:提供AI应用网页搜索API的开发者、面向AI代理与LLM优化的AI研究引擎、企业级自动化AI转型平台、网页抓取平台与数据提取工具市场、AI驱动的网络数据提取与知识图谱方案、企业级网络数据方案、提供产品数据与变现工具API的开发者、提供实时网络数据API的开发者等。这些描述虽然模糊,但勾勒出一个关键事实:Firecrawl的竞争对手并不只是其他爬虫工具,还包括任何试图把网页数据变成AI可用输入的中间层服务。

这意味着Firecrawl的竞争压力来自多个方向。向上游,云服务商和基础模型公司可能把网页抓取能力内嵌到自己的平台中;向下游,垂直行业的爬虫服务商可能在电商、金融、新闻等特定领域提供更深的定制能力;向开源侧,社区驱动的爬虫项目可能以零成本覆盖长尾需求。Firecrawl的应对策略是押注Fire-Engine的性能优势和开发者体验,但这两者在147个竞争对手中是否足够突出,来源材料无法给出答案。

内容授权补偿:一个尚未被验证的商业模式承诺

Firecrawl在A轮融资时宣布,计划探索授权合作模式,让内容所有者在付费墙内容被AI使用时直接获得收益。公司正在开发工具,帮助网站所有者和内容创作者在AI使用其内容时获得补偿。这一方向与Adobe等公司在内容所有权与货币化上的努力相呼应。

这是Firecrawl叙事中最具野心的部分,也是最缺乏细节的部分。来源材料没有披露该工具的具体机制:是爬虫在抓取付费内容时自动触发微支付?是内容所有者可以注册并设定授权价格?还是Firecrawl作为中间方从API收入中分成给内容方?这些关键问题都没有答案。

从行业背景看,AI爬虫因忽视robots.txt协议而备受争议。robots.txt是网站用来声明哪些路径允许爬虫访问、哪些不允许的文本协议,但它不具备法律强制力。大量AI爬虫被指控无视robots.txt的禁止声明,强行抓取内容用于模型训练。Firecrawl试图把自己定位为“更负责任的数据抓取”推动者,这在公关层面是合理的差异化策略。但从商业层面看,内容授权补偿模式面临一个根本性难题:如果Firecrawl尊重robots.txt并主动向内容方付费,它的抓取覆盖率和成本结构将劣于那些无视规则的竞争对手。在一个以数据覆盖率和抓取成功率为核心指标的赛道里,道德优势能否转化为商业优势,是一个悬而未决的问题。

从已披露的A轮资金用途看,Firecrawl将部分资金用于“探索”这一模式,而非“建设”或“推出”。这说明在A轮时点,内容授权补偿仍处于早期概念阶段。B轮融资是否加速了这一方向,公司未披露。如果7500万美元中有相当部分投入内容授权基础设施建设,那将是一个重要的战略信号;如果资金主要用于扩大工程团队和算力,那么内容补偿更多仍是叙事层面的差异化。

B轮投资方缺席:信息真空本身就是一种信号

FinSMEs对Firecrawl B轮融资的报道只有一句话:Firecrawl,一家总部位于旧金山的AI代理网页数据API与检索平台提供商,完成7500万美元B轮融资。投资方、领投方、估值、资金用途,全部未披露。

在创投报道中,B轮融资不披露投资方并不罕见,尤其是当投资方包含战略投资者、主权基金或希望保持低调的家族办公室时。但结合Firecrawl的A轮信息透明度——当时公司主动披露了领投方、参投方名单、总融资额和资金用途——B轮的信息真空显得反常。一种可能的解释是,本轮融资由一家或多家不愿公开的战略投资方主导,例如云服务商、基础模型公司或大型内容平台。另一种可能是,融资条款仍在最终敲定中,公司选择先公布金额以占据叙事主动权。

从已核实的A轮资本结构看,Firecrawl的股东名单包括Y Combinator、Nexus Venture Partners和Shopify CEO Tobias Lütke。Tobias Lütke的参与尤其值得注意:他既是Shopify的CEO,又是Firecrawl的客户。这种“客户即投资人”的结构在开发者工具赛道并不少见,但它的含义是双重的。一方面,它说明客户对产品的认可足以转化为股权投资;另一方面,它也意味着Firecrawl的商业决策可能受到关键客户的影响,尤其是在Shopify自身的AI战略与Firecrawl的服务范围发生重叠时。

B轮7500万美元的金额本身传递了一个明确信号:可能反映投资方对其A轮后增长的认可,但缺乏投资方口径佐证。投资方的缺席让外界无法判断,这次跃迁是由财务投资者基于增长指标驱动的,还是由战略投资者基于协同效应驱动的。这两种逻辑对公司未来的路径约束截然不同。

52名员工与盈利声明:一个小团队如何撑起7500万美元的预期

截至2026年7月,Firecrawl有52名员工。这个数字来自Tracxn,统计口径为最近一次更新时点。52人支撑起350,000名用户、Zapier和Shopify级别的客户、以及一套需要持续迭代的Fire-Engine抓取引擎。若以公开数据衡量,其人效在同类公司中处于较高水平,但缺乏可比基准;同时,这也意味着它在关键岗位上几乎没有冗余。

联合创始人兼CEO Caleb Peffer称公司已实现盈利。如果这一说法属实,Firecrawl在52人规模下实现盈利,说明其API收入足以覆盖工程、基础设施和运营成本。但盈利与增长之间的张力在B轮后被放大:7500万美元的融资通常意味着投资方期待的是指数级增长,而非稳态盈利。Firecrawl需要在保持盈利的同时大幅扩大团队、加速产品迭代、可能还要投入内容授权基础设施建设。52人的组织能力能否承接这种扩张,是B轮后最直接的执行风险。

从A轮到B轮之间,Firecrawl还做了一些引人注目的非核心动作。据AIbase报道,公司曾尝试以1.5万美元年薪招聘AI代理作为员工,未找到合适候选后,将预算提升至100万美元,计划招聘多位AI代理及其开发者,并增设AI首席执行官一职来管理这些“虚拟员工”。这一尝试的严肃程度难以判断,但它至少说明Firecrawl的创始团队愿意在组织形态上做实验。对于一个52人的公司来说,这种实验的成本可能不高,但它分散管理注意力的风险是真实存在的。

从Mendable到Firecrawl:创始团队的上游迁移逻辑

Firecrawl的创始人Caleb Peffer、Eric Ciarla和Nicolas Silberstein Camara并非第一次创业。据The AI Insider报道,Firecrawl诞生于团队此前创办Mendable的经历。Mendable是一个面向文档的AI聊天产品,被Snapchat、MongoDB和DoorDash的团队采用。正是在做Mendable的过程中,团队意识到真正的机会在上游:让AI能够访问世界的信息,而不仅仅是某个客户的文档库。

这个从下游应用向上游基础设施迁移的逻辑,在开发者工具赛道反复出现。团队先做了一个具体的AI应用,发现底层的数据获取环节是瓶颈,于是转身去做那个瓶颈本身。这种路径的优势在于,创始人对痛点有第一手体感,知道什么样的API设计能让开发者快速上手。Firecrawl的“一行代码提取结构化数据”定位,正是这种体感的产物。

但上游迁移也意味着竞争维度的变化。做Mendable时,Firecrawl团队面对的是文档AI聊天这个细分市场;做Firecrawl时,他们面对的是147个活跃竞争对手,其中包括资金更充裕、产品线更完整的企业级网络数据方案提供商。创始团队在Mendable积累的开发者关系和对AI工作流的理解,能否在更拥挤、更资本密集的赛道中转化为持久优势,是B轮之后需要持续观察的问题。

从已披露的信息看,Firecrawl的护城河目前主要建立在三件事上:Fire-Engine的技术性能宣称、开源社区的品牌认知、以及Zapier和Shopify等标杆客户的背书。这三件事中,第一件缺乏独立验证,第二件能否转化为付费收入未披露,第三件的客户集中度和续约率同样没有公开数据。B轮融资的7500万美元可以为这三件事的加固提供燃料,但无法替代验证本身。

Firecrawl面临的真正考验,不是能否抓到更多网页,而是能否在AI代理对干净数据的需求爆发与内容所有者对抓取行为的抵制之间,找到一个可持续的平衡点。内容授权补偿是它给出的答案方向,但这个方向目前还只是一个方向。7500万美元给了Firecrawl足够的跑道去探索,也给了市场足够的理由去追问:当AI代理越来越聪明,它们对“干净网页数据”的定义会变成什么?而那个定义,最终由谁来定价?

验证边界与可复核指标

本文涉及的“首个、唯一、最大、领先”、订单、出货、性能等表述,如无另行说明,均是公司、创始人或投资方在现有公开材料中的披露口径;RecodeX未在本次采集材料中找到独立审计或第三方测试结论,因而不将其视为已经独立确认的事实。文中的产业协同、竞争位置和商业路径属于基于已披露产品与融资用途的编辑分析,不代表相关结果已经实现。

  • 技术侧应核验第三方测试条件、样本规模、良率、稳定性及与可比方案一致口径的结果;
  • 商业侧应核验去重后的付费客户、可执行合同、收入确认、复购率以及订单转化;
  • 资本与产业协同应以工商股权、关联交易、联合开发、采购或量产文件为准。

RecodeX 极客视:Firecrawl的B轮融资揭示了一个正在成形的产业断层:AI代理对结构化网页数据的需求已经大到足以支撑一家52人公司在一年内从1620万美元融资跃升至7500万美元,但“干净数据”的成本由谁承担、收益如何分配,整个行业还没有答案。Firecrawl试图用内容授权补偿来回答这个问题,但它的技术性能宣称缺乏独立验证,B轮投资方的缺席又让战略方向蒙上迷雾。在147个竞争对手的挤压下,Firecrawl的真正对手或许不是其他爬虫工具,而是AI代理对网页数据的定义权本身——谁掌握了“干净”的标准,谁就掌握了这条数据管道的定价权。

信息来源

本文在采集与核验阶段引用了以下公开来源,按站点去重列出;来源内容归原发布方所有,其口径不代表 RecodeX 的核实结论。