深度文章
2025.11.11 02:42 约 12 分钟 全球动态 持续阅读

数据整合的漫漫征途:要分析数据,你必须先将其汇集到一处

RECODEX · 深度文章 全球动态

本文信息来源:sarahconstantin

数据整合的漫漫征途:要分析数据,你必须先将其汇集到一处
Midjourney,“第四次工业革命数字化转型”

我喜欢发发牢骚,因为这是我在工作中学到的东西,却从未见过有人明确地写出来。

在工业或制造业背景下,计算机技术领域充斥着一堆流行词:“ 数字化转型 ”、“ 第四次工业革命 ”、“ 工业物联网 ”。

这些东西到底意味着什么?

它们到底有没有意义?

答案是肯定的 ,它们指的是将公司所有数据录入计算机以便进行分析的过程 。

这是进行任何“人工智能”甚至基本统计分析的先决条件;在开始应用复杂的算法之前,你需要将数据集中到一个地方,并以表格形式呈现。

等等,他们还没做这个吗?

数据整合的漫漫征途:要分析数据,你必须先将其汇集到一处
半导体工厂中的每台机器可能都将数据存储在本地。操作一台机器的团队可能无法看到下一台机器的数据。

在制造业中,许多重要数据并不在计算机上。

有些数据根本没有数字化,而是以纸质形式存在:实验室笔记本、质量保证报告、工单等。

其他数据则是“勉强数字化”,以这些文档的扫描 PDF 形式存在。这对于保存记录来说没问题,但无法搜索或进行统计分析。(据我所知,一家主要的航空航天制造商将所有飞机质量测试结果都以填写好的手写表格的扫描 PDF 形式保存。想象一下,要从中整理出质量性能趋势是多么困难!)

还有一些数据则被隔离在工厂车间的机器内部。现代化的自动化机器可以生成大量数据——传感器测量值、执行器运动日志和工艺设置变化——但这些数据实际上存储在那台机器中 ,且仅限于那台机器。

近百年来,制造工艺工程师一直在利用数据来指导工厂运营,通常采用一种名为统计过程控制的框架。然而,在实践中,生成和收集的数据远多于实际使用的数据。只有少数过程变量被跟踪、优化和/或用作调整生产过程的输入;其余的都是“数据废气”,被忽略甚至可能被删除。原则上,“多余”的数据可能与设施的性能相关,但没有人知道如何关联,也没有能力去发现。

这就是为什么制造/工业公司通常会对“使用人工智能”来优化其运营的提议持怀疑态度。要“使用人工智能”,你需要围绕一个大数据集构建模型。而他们没有那个数据集 

通常情况下,你不能指望走进一家工厂就能找到一个单一的数据集,其中包含“所有机器从头到尾的所有过程日志”。

此外,即使数据集确实存在,通常也不会有最基本的内置工具来分析它。在一个异常现代的制造初创公司中,其操作模式可能是“将数据集导出为.csv 格式,并使用 Excel 对其进行基本统计分析。”

为什么数据集成如此困难

为了获得一个可以“进行人工智能处理”(甚至“进行基本统计/数据分析”)的标准化数据集,你需要:

  1. 获取数据
  2. 将数据数字化(如果相关)
  3. 标准化/“清理”数据
  4. 建立计算基础设施以存储、查询和提供数据

     

数据访问协商,又名请让我做你付钱让我做的工作

获取数据是一个棘手的人类问题。

也就是说, 人们不想给你。

当你向一家大公司销售软件时,达成一笔数百万美元的交易,比获得交付成品软件工具所需的实际数据访问权限要容易得多,这并非不寻常。

为什么?

部分原因是出于安全考虑。通常会有严格的 IT 政策规定哪些数据可以与外部人员共享,以及哪些网络权限是合规的。

例如,在半导体行业,每个人都理所当然地对工业间谍活动感到偏执。他们不会把他们的工厂数据“放到云端”。他们可能有完全气隙隔离的设施,其中没有任何东西连接到开放互联网。他们不希望正在生产的芯片图像或生产过程的细节落入“不法分子”手中。

其他行业也有类似的担忧,担心泄露商业机密、客户详情或其他敏感信息。你将不得不满足大量的安全要求,才能将敏感数据从“受保护区域”1 中取出并放到你的电脑上,或者让你的电脑获批安装到“受保护区域”中。

有时,遵守数据共享的安全要求很简单;但公司越大,你就越有可能遇到来自不同部门的多个 IT 政策,而且这些政策之间越有可能相互矛盾,或者根本无法与任何大规模数据集成兼容。2

我曾与一家公司合作,该公司要求甚至连潜在供应商在销售尚未完成之前,就得自掏腰包花费超过 100 万美元,建造一个特殊的、超安全的房间来存储他们的数据。安全要求可能非常严格。

然后,还有一些更“政治性”或“个人性”的原因,导致公司难以将大量数据集中到一处。

有时,人们担心“大数据”工具会取代他们的工作,或者让他们的表现看起来很糟糕,于是他们试图阻挠这个过程。

有时,部门之间存在竞争,导致一个部门的人不愿意与另一个部门共享数据。

有时,人们只是很忙,从工作日中抽出时间为供应商做设置是一种不便。

处理数据访问协商中的“人的问题”是一项巨大的、劳动密集型的麻烦,并且所需的工作量几乎与您尝试收集的数据量呈线性增长。

Palantir Technologies 现在正拥抱“AI”标签,但当我还在那里工作(2016-2017 年)时,他们自称是一家“数据集成”公司,因为这才是他们工作的根本 。Palantir 开发自己的软件工具来管理和分析数据——数据库、ETL 管道、分析仪表板——这些工具运行良好,但据我所知,它们在科技行业中并非独一无二或特别出色。 真正引人注目的是,他们投入了大量人力 ——按人数计算至少占公司三分之一——集体前往客户现场,设置和定制他们的数据库及相关工具,教用户操作 UI,并且,最关键的是, 协商数据访问权限 

Palantir 的策略,至少在商业方面,3 是:

  • 只向面临“生存威胁”的公司销售,即那些出了严重问题,可能彻底倒闭的公司
  • 获得高管层的支持,他们关心公司整体目标(“不倒闭”、“赚更多利润”),并且他们的个人声誉会因领导重大的公司级项目(如“数字化转型”)而提升。
  • 通过提供超级有用的功能,让一线员工的工作更轻松,从而赢得他们的心,并与他们一起在现场工作,建立个人联系
  • 利用底层的盟友(一线员工)和顶层的盟友(高管)来挤压中间的反对者(经理,通常在 IT 或数据科学部门,他们宁愿不让外部供应商侵占他们的地盘)。
    • “上级”可以要求你获得快速协助和数据访问;
    • “一线”人员可以向他们的老板施压,要求他们采取必要措施,让酷炫的新 Palantir 工具投入运行。

Palantir 的工作方式是劳动密集型的,几乎不可能系统化,更不用说自动化了。这就是为什么没有一百个 Palantir。你必须投入人力来解决说服问题——那些薪水高、认知灵活、情商高的人,他们能够应对公司内部的机能失调。

从这个角度来看,他们很像管理顾问……事实上,大规模的数据集成本质上有点像管理咨询。

每家公司在某个地方都有一些糟糕透顶的蠢事发生,无论它们在其他方面多么令人钦佩,如果它们正面临生存危机,那么肯定有什么地方出了大问题,而有些人不想面对。如果你想把所有数据都集中到一个地方,你需要弄清楚“坏事”的一些轮廓,在一个你遇到的大多数人都表现得“理智且能力出众的专业人士”的环境中,每个人对“坏事”以及为什么它不可避免或归咎于他人都有不同的说法。

例如,在我所服务的客户那里,有一个由大约十人组成的整个数据科学部门,他们的工作是创建一个单一的数字——一个风险评分——然后将其发送给另一个部门处理。第二个部门的负责人不信任统计数据 4,所以他把这个数字扔进了垃圾桶。这十名数据科学家的全部工作成果对公司来说都毫无意义。

我自己并不擅长这种“企业侦探工作”。我倾向于直言不讳地提问,这有时会带来好的结果,有时也会无意中惹恼一些人……然后当遇到负面反应时,我倾向于退缩,事后看来,这本身有时是错误的举动。我对此过程有足够的经验,足以意识到它的存在,并为看清组织中正在发生的一切全貌是多么困难而感到谦卑。

数据整合的漫漫征途:要分析数据,你必须先将其汇集到一处
试图弄清楚你的客户到底怎么了是什么感觉

数据清洗,又名“这堆垃圾我没法用”

每一位在职的数据科学家都会告诉你,他们花在“数据清洗”上的时间比实际运行任何统计或机器学习模型的时间都要多。

那是什么意思呢?

删除逗号。常规格式调整。标准化。以一致的方式推断缺失数据。

而且,要理解你的数据源实际指的是什么 ,这样当你做出判断时,它们才会有任何实际意义。

数据清洗看起来不像是智力上的挑战,但它却出奇地难以自动化,这让我觉得大卫·查普曼会窃笑——你可能需要“清洗”数据以使其符合训练模型的标准格式的方式是不可枚举的 ,而且经验上似乎永远不可能编写一个程序来为你完成所有这些工作,尽管过程中的个别部分当然可以自动化。

部分问题在于,“合理”的做法可能取决于数据的“现实世界”含义,这需要咨询人类专家。例如,这两列是否相同,是因为它们是同一传感器输出的字面重复(因此可以安全删除其中一列),还是它们指的是两个不同的传感器,而它们在这次运行中碰巧给出了相同的读数,因为允许它们不同的设置这次被关闭了?答案无法从数据集中得出,因为问题涉及数据所指的物理机器;这种模糊性本质上不可能仅凭软件就能自动化消除。

我曾期望 LLMs 能在自动化数据清洗方面带来实质性乃至全面的改进,但我对商业 LLMs(如 ChatGPT 和 Claude)的初步实验普遍令人失望;我反复要求 LLM 编辑我的文件以符合适当格式所花费的时间,比我自己使用正则表达式或其他脚本方法还要长。不过,我可能在提示方面遗漏了一些简单的东西,或者 LLMs 需要更多的“软件脚手架”或专门的微调,才能在数据清洗任务中发挥作用。

数据清洗和数据协商一样,都是劳动密集型工作,因为它们是高薪工作,并且工作量与数据集大小呈线性关系。你需要整合的数据源越多,你就需要花费越多的顾问时间去协商,也需要花费越多的工程师时间去清洗。

每一家大型企业软件公司(比如 SAP、Salesforce、AWS 等)都承诺成为大型企业存储大部分数字记录的“唯一” 场所,它们投入了大量精力来为每个客户设置软件,因为这项工作涉及数据访问、数据标准化和数据传输,所有这些都非常困难。

有整个行业的第三方“合作”公司,它们整天什么都不做 ,就只帮助客户设置 Salesforce、AWS 或其他什么。而且,设置过程耗时一年或更长时间也并非罕见。

总的来说,我发现有些工作比看起来要难 ——它们繁琐且看似例行公事,但往往需要做出判断,而这些判断出人意料地难以外包给实习生或其他“初级”员工,更不用说用软件自动化了。数据清洗就是其中之一。数据标注、数据录入、从大量文档中总结和整理“关键”事实和数字等也属于此类。除了数据清洗中涉及的基本编程,这些工作都不需要任何特殊的教育或培训;它们“只是”阅读、写作、算术和“常识”……然而,不知何故, 并非任何人都能做好。5

人工智能受制于数据集成

这就是为什么我不同意许多人的观点,他们认为一旦模型足够先进,“AI 转型”就会在经济生产力意义上瞬间发生。

如果人工智能要在我们利用完公共互联网数据这些唾手可得的成果之后,对经济产生真正重大的影响,它就需要开始学习商业数据,并在大型公司的生产力方面做出实质性改进。

如果你设想一个“AI 研发研究员”发明了许多新技术,例如,这意味着将其整合到企业研发中,这主要指的是那些在科学/工程创新(半导体、制药、医疗设备和科学仪器、石化、汽车、航空航天等)方面投入巨大的大型制造企业。你需要获得足够的私人研发数据来训练 AI,并通过试点项目建立足够的信誉,逐步说服公司让 AI 自由发挥,而且你还需要为每个新客户几乎从零开始。这需要时间、反复试验、逐步展示能力,以及大量高薪劳动力,而这目前几乎还没有开始做 

我绝不是说“AI 被高估了”——所有这些工作都可以完成,并且最终可以带来极高的投资回报。但它的进展速度取决于人类的适应能力。

想想几十年前计算机在商业领域的普及。那场“变革”绝非虚假。它发生了;它很重要;许多人因此发家致富。但它发生的速度是人类协商和学习的速度 ——企业高管必须决定购买计算机,每个公司内部的许多个人必须弄清楚他们将如何使用这些新机器,而且这必须针对每个单独的用例独立发生。它不是一蹴而就的。而且它并没有以相同的速度普及到所有地方;一些应用程序在其他应用程序完全数字化很久之后,仍然会手动处理事务。

人工智能也是如此。你无法跳过说服客户该工具物有所值、克服内部阻力以真正改变公司运营方式,以及针对不同环境测试和调整工具这些工作。

 

1

不是一个技术术语;实际的术语会因行业和语境而异。有时他们称之为“OT”或“高边”。

2

例如,制药行业的商业秘密通常对公司内部的其他部门保密。这使得构建跨多个部门的数据集变得棘手。

3

我对政府方面了解不多,他们向军事、安全机构和执法客户销售产品,那里的限制和激励机制都大相径庭。

4

他真的不相信介于零和一之间的概率。是的,这样的人确实存在。他会说“要么是,要么不是”之类的话,当我们试图解释90%的概率和10%的概率都是不确定的,但应该区别对待时,他并不买账。

5

图像处理领域的“传统观点”认为,“数据标注”是一项微不足道的任务,可以外包给 Mechanical Turk 的零工工人,而聪明、高薪的人则负责编写机器学习模型。但我确信,凝视图像是一项熟练的工作,有些人比其他人做得**好得多**。例如,请注意 Casey Handmer 发现赫库兰尼姆卷轴上墨水特有的“裂纹图案”;在编写任何算法之前,他花了数小时凝视这些图片。原则上,你需要成为一名 JPL 工程师和成功的创业公司创始人才能在图片中发现模式吗?不。原则上,任何人都可以做到。但在实践中,却是一位“大材小用”的人完成了这项工作。根据传闻,这并不罕见。

了解 RecodeX-立足新加坡,洞察全球 AI 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读