← 返回列表
Colossus (Invest Like the Best / Business Breakdowns)播客28 Jan 2021来源: joincolossus.com主持: Patrick O'Shaughnessy

Ali Ghodsi – The Past, Present, and Future of Big Data – [Founder’s Field Guide, EP.18]

一句话导读

这篇讲的是大数据和AI基础设施的演变,核心观点是:企业用数据做AI的最大障碍不是技术,而是IT和业务部门之间的组织壁垒。嘉宾Ali Ghodsi(Databricks创始人)认为,未来趋势是“数据湖仓”(把数据湖和仓库合二为一),并强调企业应该从一开始就以AI为目标来搭建数据系统。提到的重点标的:Databricks(他自己的公司,提供云数据平台)、Apache Spark(比老系统Hadoop快100倍的内存计算引擎)、Hadoop(早期分布式系统,但已过时)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

本期节目邀请Databricks创始人兼CEO Ali Ghodsi,探讨大数据的历史、现状与未来。核心观点包括:分布式计算从Hadoop到Apache Spark的演进,解决了内存计算瓶颈,使2000年无法实现的数据用例成为可能;Databricks作为基于Spark的商业化平台,通过开源社区与客户需求驱动增长,竞争优势在于统一数据分析和AI工作负载。重要结论:企业应打破数据孤岛,采用最佳实践(如统一数据湖仓),以释放大规模数据集价值;未来方向聚焦于简化数据基础设施,推动实时分析与机器学习融合。

全文约 8 分钟 · 5 个章节
深度解读

好的,作为第三方独立分析师,以下是对本期播客文字稿的解读。

本期速览

嘉宾是 Databricks 创始人兼 CEO Ali Ghodsi。本期主线是梳理从 Hadoop 到 Spark 再到 Databricks 的分布式计算演进史,并探讨企业如何利用数据基础设施实现 AI 转型。全片最有分量的一个判断:Ali Ghodsi 认为,当前企业数据与 AI 应用之间最大的障碍是组织架构上的“数据孤岛”——IT 部门(负责数据治理与安全)与业务部门(负责 AI 创新)往往分属不同领导,目标冲突,这比任何技术瓶颈都更严重地拖慢了企业从数据中获取价值的进程。

数据基础设施的演进:从 Hadoop 到 Lakehouse

Ali Ghodsi 认为,分布式计算的核心驱动力是“摩尔墙”(Moore's Wall)——2005 年左右 CPU 速度停滞,迫使计算从单台超级计算机转向数据中心内的数千台机器。 这催生了 Hadoop 和 MapReduce 等早期分布式系统,其核心创新在于“将计算移动到数据附近”,以避免网络拥塞。然而,Hadoop 的编程模型(仅 Map 和 Reduce 两个函数)极其复杂,且所有计算都基于磁盘读写,速度缓慢。

Ghodsi 指出,Spark 的诞生源于解决 Hadoop 在迭代式机器学习任务上的性能瓶颈。 2009 年,UC Berkeley 的团队为参加 Netflix 推荐算法竞赛,发现 Hadoop 在处理需要反复迭代的数据时,频繁的磁盘 I/O 导致速度极慢。Spark 的创新在于利用当时已变得廉价的内存,将数据加载到内存中进行迭代计算,速度提升可达 100 倍。Ghodsi 强调,这一突破得益于网络技术的进步(约 2009-2011 年),使得数据中心内任意两台机器可以全速通信,不再需要刻意将计算移动到数据附近。

Ghodsi 提出,未来范式是“Lakehouse”(数据湖仓),即数据湖(用于 AI)与数据仓库(用于数据管理)的融合。 他认为,这是简化企业数据基础设施的关键。Databricks 正致力于实现这一愿景,通过开源项目(Spark、Delta Lake、MLflow、Redash)避免供应商锁定,同时提供端到端的云 SaaS 平台,覆盖从数据摄取、治理(Delta Lake)、模型训练(MLflow)到生产化部署的全流程。

企业数据战略的最佳实践与组织挑战

Ghodsi 认为,成功利用数据的企业有几个共同特征,其中最核心的是打破 IT 与业务部门之间的组织壁垒。 他观察到,许多传统企业将数据管理(IT 部门负责,强调安全与合规)与 AI 项目(业务部门负责,追求商业价值)完全分离,导致两者目标冲突、政治内耗。成功的企业会设立统一的数据领导(如首席数据官),或建立卓越中心,让两个团队协同工作。

Ghodsi 强调,企业应避免“先收集数据,再想怎么用”的旧模式,而应从一开始就“以 AI 为目标”来构建数据基础设施。 他给出了四项具体建议:

1. 组织整合:将数据管理与 AI 项目置于统一领导之下。

2. 拥抱开源:利用开源技术避免被单一供应商锁定,跟上技术发展速度。

3. AI 优先:在数据收集和治理阶段就考虑后续的 AI 应用场景。

4. 多云战略:采用多云策略,避免将所有鸡蛋放在一个篮子里,并利用云计算的敏捷性。

提及的标的

标的 嘉宾态度 关键数据
Databricks 看好(自身业务) 7 年历史,1700 名员工;核心产品为基于 Spark、Delta Lake、MLflow 等开源项目的云 SaaS 平台。
Apache Spark 看好(核心开源项目) 始于 2009 年,比 Hadoop 快 100 倍;最初用于解决 Netflix 竞赛中的迭代式机器学习问题。
Hadoop 历史性但已过时 早期分布式计算的操作系统,编程复杂(仅 Map/Reduce 函数),基于磁盘处理,速度慢。
Cloudera 提及(竞争对手) 曾获得 Intel 7 亿美元投资,是当时 Hadoop 生态的代表。
Twilio 中性(类比对象) 被用来类比开发者角色从后台向前台转变的趋势。
Shell 客户案例 使用 Databricks 预测设备故障,节省数亿美元。
Comcast 客户案例 使用 Databricks 实现语音遥控器的 AI 功能。
Regeneron 客户案例 使用 Databricks 发现导致慢性肝病的基因。

值得记住的判断

1. “摩尔墙”是分布式计算的起点(Ali Ghodsi):CPU 速度自 2005 年左右停滞在 3GHz,迫使计算架构从单台超级计算机转向数据中心内的数千台机器,催生了 Hadoop 等分布式系统。

2. Spark 的诞生源于解决 Hadoop 的迭代性能瓶颈(Ali Ghodsi):Netflix 竞赛中,机器学习团队发现 Hadoop 在处理需要反复迭代的算法时,频繁的磁盘 I/O 导致速度极慢。Spark 利用廉价内存进行迭代计算,实现了 100 倍的速度提升。

3. 网络技术的进步使“移动计算到数据”的旧范式过时(Ali Ghodsi):2009-2011 年间,数据中心网络技术(如 UCSD 的研究)使得任意两台机器可以全速通信,不再需要刻意将计算移动到数据附近,这为 Spark 等内存计算框架铺平了道路。

4. 企业数据与 AI 的最大障碍是组织架构,而非技术(Ali Ghodsi):IT 部门(负责数据治理)与业务部门(负责 AI 项目)往往分属不同领导,目标冲突(安全 vs. 价值),导致项目陷入政治内耗。成功的企业会设立统一的数据领导来打破这一壁垒。

5. “Lakehouse”(数据湖仓)是数据基础设施的未来范式(Ali Ghodsi):这是数据湖(用于 AI)与数据仓库(用于数据管理)的融合,旨在简化企业数据栈,让传统企业也能拥有类似硅谷科技公司的数据能力。

6. CEO 的职责随公司阶段而变,早期优势可能成为后期障碍(Ali Ghodsi):早期需要“主人翁精神”(看到垃圾就捡),但规模化后需要“流程思维”(追溯垃圾来源并建立预防机制)。最核心的教训是建立与领导者之间的信任,这需要大量时间投入。

7. UC Berkeley 的 AMPLab 成功秘诀在于“跨学科协作”(Ali Ghodsi):教授 Dave Patterson 让不同背景的学生(如系统研究员和机器学习数学家)坐在一起工作,这种模式直接催生了 Spark。Databricks 的文化也继承了这一点(“团队合作让梦想成真”)。

8. 开源是企业避免供应商锁定的关键(Ali Ghodsi):企业曾被专有软件“绑架”,导致后期创新停滞、成本高昂。Databricks 将平台中可能导致锁定的每个组件都开源(Spark、Delta Lake、MLflow、Redash),迫使自己必须通过持续创新来赢得客户。