返回首页
信息来源:gradient.com 2026.07.27 04:57 约 8 分钟 AI 1.6万 阅读

如何备份由人工智能代理运营的企业?

企业将会运行数千个人工智能智能体,它们需要一个“撤销”按钮。

Veeam、Commvault、Cohesity、Rubrik、Veritas,以及在此之前的 HPE、Dell、IBM 等公司,都花费了 45 年以上的时间来开发备份与灾难恢复产品,旨在帮助企业在遭遇勒索软件攻击、数据损坏或面临联邦机构审计时能够迅速恢复运营。这些产品每年带来的收入高达 300 亿美元以上(对于那些大型科技企业而言,这也是非常重要的业务板块)。

这些产品会对企业的数据进行快照备份,将其复制到多个硬盘上,然后根据数据被再次使用的概率,将数据存储在云存储中(比如,仍有一些企业使用磁带存储!),或者高速存储设备中(比如 Pure Storage 的闪存存储恢复解决方案)。

不过,那些产品是为以人为中心的世界设计的,在那样的环境中,人们会手动做出决策并更新数据,或者最多以大批量的方式来处理数据。而基于 AI 的企业则会同时运行数百万个智能体。这些智能体越来越多地对核心数据库执行读取、写入、更新和删除操作,并能根据上下文信息以及 LLM 的逻辑独立做出决策。就连这些智能体自身的发展速度——包括模型训练后的优化、效率提升以及上下文信息的检索——也远远快于单个员工。

那些以人工智能为核心业务的企业需要新的备份与灾难恢复解决方案。

300 亿美元的传统备份支出

备份与灾难恢复属于两个相互关联的市场:一个是规模较为分散的、价值 1001#$130 亿美元的数据保护软件市场;另一个则是发展势头更强劲的、价值 1002#$160 亿美元的灾难恢复即服务市场。两者共同构成了一个价值 300 多亿美元的、用于存储旧数据的产业。

事实上,目前存储在各类备份系统及 DSaaS 平台中的数据量已超过 250 艾字节(根据 IDC 的《Global DataSpheres 报告》)。由于生成式 AI 应用能够捕获并存储更多需要备份的数据(比如医生诊疗记录),这一数字正以前所未有的速度持续增长。

  • 备份是一种防止遗忘的保障。这些数据副本保存在低温环境中,成本较低且保存时间很长;之所以要保存它们,是因为相关法规要求这样做,以便确保数据安全、便于审计以及提供法律支持。实际上几乎从不有人会去读取这些数据,但它们通常会被保存 5 年以上。

  • 灾难恢复是一种防止业务停摆的保障措施。它指的是那些能够在勒索软件攻击、错误部署或某个区域发生故障后帮助企业重新恢复运营的备份副本。其效果可通过企业恢复的速度(RTO——恢复时间目标)以及企业遭受的损失程度(RPO——恢复点目标)来衡量。而“DRaaS”则是最常见、发展最快的灾难恢复解决方案,它其实就是将这项工作交给其他人来处理。

为什么还会有人在意这个问题呢?因为系统停机会造成巨大的损失。根据 2024 年 ITIC 发布的关于系统停机成本的调查,超过 90%的大型企业表示,每小时的停机损失在 30 万美元以上,还有 40%的企业认为这一数字甚至超过 100 万美元。据 Coreware 通过 Statista 发布的数据,典型的勒索软件攻击会持续 1001 天左右;而 IBM 发布的《数据违约成本报告》则指出,在美国,一次典型的数据违约事件所带来的损失平均为 1000 万美元。

传统的备份解决方案无法满足以人工智能为核心的企业需求。

如果核心系统遭到破坏,而现有的备份及灾难恢复工具又无法有效应对这些问题,那么主要由代理商运营的企业就面临着极大的倒闭风险。

备份更多信息:

  • 问责机制必须内嵌在备份系统中。当是多个操作主体而非单个人员导致了数据损坏时,仅仅“恢复到之前的状态”是远远不够的。IT 管理员需要知道是哪个操作主体在何时、出于何种原因做出了相应操作。一旦发生需要重置的违约或问题,要找到一个在此之前就存在的完好备份就会变得十分困难。不同的 DSaaS 提供商都有自己独特的解决方案(通过多种算法结合快照来确保有效的恢复点),而当操作主体不断破坏数据状态,且从“数据仍处于良好状态”到“数据开始受损”的时间间隔缩短到几分钟之内时,情况就会更加复杂。更不用说,任何恢复操作都应当与对操作主体行为或动作的相应调整紧密关联,这样才能确保数据不会在几分钟后再次遭到破坏。

  • 持续对智能体的状态进行快照并不可行。内存和上下文每隔几秒就会发生变化,因此不断对它们进行备份会显得过于复杂且成本高昂。不过,有些时刻是值得记录下来的,尤其是在那些需要遵守严格监管的行业中——因为审计人员会关注智能体做出决策的原因。此时的挑战就在于判断:哪些状态值得保存下来。

更频繁、更快速地访问用于灾难恢复的备份数据:

  • 对于那些承担关键任务的代理程序来说,必须尽快恢复运行。延迟处理的批处理作业可以等到周一再处理,但正在实时工作流中执行任务的代理程序却无法等待,尤其是当它正在操作重要系统时。这种情况会加剧恢复工作的难度,因此就需要采用闪存存储灾难恢复系统之类的解决方案。

  • 运行时间较长的智能体存在复杂的依赖关系。当 us-east-1 区域出现故障,这些智能体失去了所有积累的宝贵数据以及消耗过的计算资源时,它们要如何恢复状态呢?

保护的重点正从静态数据转向正在执行任务的代理程序。这一变化打破了现有系统所依赖的诸多假设。

基础设施提供商如何重新思考备份与灾难应对策略

初创企业正在将数据备份与历史数据追踪功能集成到代理架构中,而传统服务提供商则正在重新思考如何让存储的数据能够被人工智能代理所使用。

  • 初创公司正在为智能体本身构建相应的结构。他们为每一层都设计了不同的版本与分支(用于文件系统的有 Mesa,用于数据库的有 Ardent,用于代码管理的有 GitButler,用于内存管理的有 Letta),这样一来恢复操作就能瞬间完成“撤销”操作;而 Zep 则将智能体的内存视为一份受严格管理的记录,具备数据保留、法律约束以及审计功能。

  • 现有的备份供应商都在对他们已推出的产品进行升级改造。Eon 和 Cohesity 的 Gaia 技术能够将冷备份转化为可查询的数据湖,而 Veeam、Rubrik、Druva、Pure Storage 以及 NetApp 则会在现有的快照引擎上添加“检测与撤销”功能以及纯净环境恢复功能。这是最快速的采用途径,但主要解决的只是问题中可以逆转的那部分情况而已。

让我们倍感兴奋的空白领域

虽然在企业范围内大规模部署人工智能智能体还处于初期阶段,但对于那些需要长期运行、处理复杂情境且涉及关键系统的智能体所面临的种种挑战,已经有一些可行的解决方案。

在代理的基础设施中构建回放与重放功能,从而实现代理的灾难恢复。用按因果顺序记录的所有状态变化和工具调用的日志来替代传统的快照机制,同时通过确定性重放功能让代理能够从任意时间点继续运行。传统快照假设状态存储在单一位置且变化缓慢,但实际上代理的状态分散在内存、向量存储、实时计划以及一系列工具调用中,因此每晚生成的快照只能恢复出“功能受损”的代理。

应将备份状态捕获与外部影响联系起来,并设置相应的自适应策略引擎(这涉及到基础设施、合规性以及监管方面的问题)。静态数据是可以恢复的,但外部行为却无法撤销。数据库可以被恢复,但智能体无法撤回已发送的邮件或取消信用卡扣款。这对智能体本身而言确实构成挑战,但实际上这却是一种有效的机制,有助于确定何时以及是否需要对智能体状态及周边系统进行快照保存。除非智能体对外部系统做出了重大更改,否则其实很少需要对其进行状态快照;因此,快照操作应当由外部影响来触发,而非按照固定的时间间隔自动执行。这样一来,快照的数量就能得到有效控制,备份工作也能集中在那些真正重要的节点和智能体上。而负责做出这些决策的策略引擎,有望成为提升系统稳定性和知识产权保护的重要手段。

其实存在着一个很好的机会,可以与各类监管机构携手合作——包括负责医疗保健领域的 HHS OCR 与 NIST,以及负责金融服务领域的 SEC、FINRA、FFIEC 和 CFTC——共同制定在人工智能时代应具备怎样的备份与审计要求,以此确保责任可追溯性,同时这也是界定该行业标准的重要途径。

企业韧性是未来重要的投资主题。

十年前,最令人兴奋且最具投资价值的主题之一就是“工作的未来”。在那个时代,人们开始重新思考如何为那些能够通过互联网使用各种 SaaS 工具的知识型员工提供合适的工具。大多数人会想到 Zoom 和 Slack 作为协作工具,或是 Notion 作为提升工作效率的工具。但同样重要的还有 Okta,它为企业带来了多因素认证和单点登录技术,从而使企业能够安全地让员工使用这些工具。

在我们即将进入的“工作未来”第二阶段中,核心是人与智能体之间以及智能体之间的协作。此时,企业再次需要新的弹性与安全工具,以便在不会对业务运营造成重大风险的情况下采用智能体技术。目前,人们较多关注的是用于管理智能体身份的新工具,但我们认为,类似备份和灾难恢复这样的系统,对于企业的 IT 团队来说同样至关重要。

了解 RecodeX-立足新加坡,洞察全球 AI 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读