边缘数据

许多最为关键的数据集,正是那些我们长期以来一直无法获取或解读的。
互联网上的价值在很大程度上是通过不断随规模扩大而强化的数据循环来实现的。某个产品或平台首先收集数据,这些数据让产品性能更优,而更优质的产品又获得了收集更多数据的资格。这种自我提升的循环存在于大多数具有持久生命力的软件企业背后,自 2015 年安迪首次阐述其位于应用层网络效应之下这一观点以来,它便一直是美国虚拟服务器网络效应理论的重要支柱。
如今,这一观点比以往任何时候都更为正确。在人工智能时代,数据堪称最宝贵的资产。各实验室都在为此投入大量资金,而像 Mercor 这样的公司则力争实现数十亿美元的营收。
数据网络效应所面临的限制始终在于覆盖范围——哪些数据在覆盖范围内,哪些不在。软件能够获取的数据最为容易取得,因为那些处于软件覆盖范围之外的海量数据(我们周围的环境、物理世界以及人体)要么采集成本过高、难度极大,要么处理起来极为复杂,因此无法被利用。
如今,多种强劲力量的共同作用正在彻底改变这一局面。智能技术日益普及,其成本也在不断下降。各类模型能够快速处理那些原本连软件都难以处理的混乱、非结构化的数据。硬件构建的成本与时间也大幅缩短。与此同时,得益于越来越廉价且随处可见的传感器、卫星、摄像头等设备,我们对周围环境的观测能力得到了极大提升,收集相关数据变得比以往任何时候都更为容易。总体而言,这种即时、智能地收集数据,并以前所未有的方式对这些数据加以利用的能力,使得在几年前还完全无法获取数据的地方也能形成数据循环。这并非是 AI 为现有市场带来效率提升,而是一系列全新的机遇的诞生。
这一技术应用的实际案例不胜枚举。环境中的对话便是其中之一。虽然我们一个世纪以来一直能够录制语音,但如今通过转录、整理并对这些语音数据加以利用,我们已将其转变成了有实用价值的数据集。这便催生了诸如 Abridge 这样的企业,它们可以利用这些数据集构建出改变特定行业运作方式的应用程序;同时也催生了像 Granola 这样的企业,它们负责构建通用的基础设施与相关工具。录音本身从来都不是难点,而此前却无法对录音数据进行处理并将其转化为实际产品。
人体也是另一个数据来源。检测成本正在不断下降,结果解读能力也在不断提升,而且越来越能够根据这些数据来定制个性化方案。这样一来,人体便既便于获取数据,又能作为有用的数据源被利用。
但或许最大的机遇在于物理世界。
物理世界中蕴藏着海量数据,长期以来这些数据要么难以采集,要么过于复杂而无法处理,但它们对于实现自动化、优化以及深入理解现实世界而言至关重要。如今,传感器数量不断增加,机器人的功能日益强大且价格更低,同时快速处理复杂数据也已成为可能。用于训练机器人以完成越来越复杂任务的模型正在以极快的速度不断改进,而且所需的数据量也比以往任何时候都要多。我们正在见证物理世界中的各种可能性从实验阶段逐步走向商业化应用。在这一领域,这种数据循环尤为显著:更多的部署会产生更多真实世界的数据,更优质的数据能让模型表现更好,而更出色的模型则会让后续的部署比之前更快、成本更低。

在物理世界中利用这些机遇进行相关构建的工作目前还处于极为初级的阶段,且难度极大,因为数据驱动的循环机制才刚刚出现。在软件领域,我们已经开始看到从传统学习(利用数据训练模型)到强化学习(通过定义奖励函数让系统能够通过互动了解哪些行为能带来更好结果),再到持续学习(使模型能够随着新数据的不断输入而持续优化)的巨大进展。而在物理世界中,关于机器人与实际环境互动时所能应用的强化学习技术,我们才刚刚开始初步探索。
然而,这一来自物理世界数据飞轮的机遇极为巨大,足以改变市场格局,且是此前无法实现的。其中最值得关注的用例并非让复杂的事情变得更简单,而是能够带来我们以往从未拥有过的洞察力与行动能力。
例如,安装在每一根电线杆上的传感器将使得基础设施状况得以实时监测,而这在过去是无法实现的——因为旧的电池每 6 个月就必须更换一次,高昂的成本让此类监测难以开展。如今,由于电池的使用寿命已延长至 10 年,深入了解基础设施状况不仅不再昂贵,而且完全可行。那些能够从周围各种不同的来源获取传感器数据、并对这些数据进行整合处理以过滤掉噪声的模型,将让我们以前所未有的精细度和精准度掌握天气规律,而这正是最终改变天气状况的关键一步。借助传感器实现的自动驾驶技术正迅速发展,它将为人员和货物的运输带来全新的模式,并显著降低相关成本。现在,我们能够更好地了解海洋状况,从而获得关于如何保护陆地、引导船只航行以及维护地球的新知识。
我们有巨大的机会对物理世界的各个层面进行重新设计。我们已经在各个层级投入了大量资金,而且还会继续这么做(目前还有几项尚未公开的投资计划,未来我们会尽快透露更多细节)。Generalist 正在开发基础模型,让机器人具备通用操作能力,从而能够完成我们期望它们去执行的各种任务。Tutor Intelligence 则负责处理从数据收集到模型优化的整个机器人部署流程,这使得机器人能够在几天之内就能开始发挥作用,而无需经过长达六个月的整合时间(同时它还会将这些数据反馈到自身的模型中,以实现持续优化)。Sofar Ocean 利用日益增多的传感器为各类自有及第三方软件网络提供支撑架构。Viam 则处于中间位置,作为连接各类设备的数据、人工智能及自动化功能的运行层。Efficient Computer 则处于底层,致力于打造效率更高的芯片,从而使在边缘设备上实现新的应用方案变得更具经济性。
二级效应也同样显著。一旦能够大规模采集并利用物理世界中的数据,就可以通过自动化及智能操作系统来运营效率更高的工厂,这正是 Isembard 正在做的。当然,要支撑如此高的计算强度以及所有相关需求,还迫切需要更强大的能源供应——包括更高效的数据中心、更充足且更安全的电池,以及新型的、大规模且清洁的能源生成方式等。
下方的市场格局图展示了用于探索并作用于物理世界的各类技术架构。

我们目前还处于非常早期的阶段。这些数据集大多尚未被充分利用,能够运行在这些数据集上的产品也大多还不存在。找到它们、接入它们并加以运用,将会改变我们与物理世界互动的方式。我们希望与那些致力于这一领域的创始人们一起,探索这一“边缘计算”领域的全部可能。
特别感谢 Josh Gruenstien、Brandon Lucia、Alex Iskold、Kanyi Maqubela、Tina Haibodi、Nikhil Trivedi 以及 Chad Byers,正是他们帮助我们进一步深化了对这篇文章内容的思考。