← 返回列表
Colossus (Invest Like the Best / Business Breakdowns)播客8 Jan 2026来源: joincolossus.com主持: Colossus

Databricks: From Data to Decisions - [Business Breakdowns, EP.238]

一句话导读

这篇讲的是数据公司Databricks如何从大学里的一个开源项目(Apache Spark,一种免费的数据处理工具)成长为估值1300亿美元的私有平台。嘉宾Alan Tu认为,Databricks最厉害的不是技术,而是先让开源工具流行起来,再做出比免费版好得多的付费产品,这很难。他看好Databricks,因为它解决了企业最头疼的“数据清洗”问题,而且搭上了AI的顺风车——企业想用AI,必须先整理好数据。重点提了三个标的:Databricks(年收入超40亿美元,已能自己赚钱);Snowflake(主要对手,但Databricks从处理非结构化数据向结构化数据扩展更成功);微软Azure(既是合作伙伴又是潜在威胁,但Databricks通过让客户消耗云服务来避免被完全打压)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Databricks是一家估值1300亿美元的私有软件公司,核心业务是帮助企业收集、存储和处理海量数据,并用于分析及训练机器学习模型。本期节目由WCM Investment Management的投资组合经理Alan Tu解读,他指出Databricks是连接原始数据管道与分析工具及AI构建的中间层,常作为大型数据与AI项目的幕后基础设施。公司起源于学术团队,从早期数据工程产品演变为广泛商业平台。报告讨论了Databricks与Snowflake的市场竞争、在现代AI堆栈中的角色、以及其规模、产品策略和资本状况如何形成差异化优势。关键结论包括:Databricks通过统一数据与AI平台,在数据

全文约 14 分钟 · 9 个章节
深度解读

Databricks: From Data to Decisions - [Business Breakdowns, EP.238]

本期速览

嘉宾:Alan Tu,WCM Investment Management 投资组合经理兼分析师(WCM 于 2024 年 12 月投资 Databricks)。主线:Databricks 从学术开源项目演变为估值 1300 亿美元的私有数据与 AI 平台,其核心优势在于「数据湖仓一体」架构和长期主义文化。全片最有分量的判断Alan Tu 认为,Databricks 最被低估的能力不是技术,而是「同时击中两个全垒打」——先让开源技术 Apache Spark 获得主流采用,再构建出值得付费的专有产品,而多数开源公司连第一个全垒打都打不中。


一、Databricks 的核心价值:解决「数据准备」这一最痛的环节

Alan Tu 认为,Databricks 解决的根本问题是「把杂乱数据变成可分析格式」,这是所有数据与 AI 项目中最耗时、最基础的一步。

  • 类比:拿到一个 Excel 表格,数据格式不统一(价格列有的含货币符号、有的含文字),80%-90% 的时间花在「清洗数据」上,而不是分析本身。Databricks 把这个过程搬到云上、放大到海量数据。
  • 规模差异:企业面对的数据源包括结构化数据(行列表格)和非结构化数据(日志文件、图像、视频、点击流数据)。Databricks 处理的是「完全不同的量级」。
  • 核心产品演进:从 Apache Spark(分布式计算引擎)→ MLflow(机器学习生命周期管理)→ Delta(引入 ACID 事务保证)→ 数据仓库产品(直接对标 Snowflake)。数据仓库产品上线约两年,年化收入已接近 10 亿美元,这是「多产品→多人设」的 TAM 扩张证明。

Alan Tu 指出:「Databricks 帮助引领行业走向他们认为行业应该去的地方——他们识别痛点,提出解决方案,而不是看着现有市场说『我们也能做个差不多的』。」


二、开源商业化:从「学术项目」到「商业平台」的两次全垒打

Alan Tu 强调,Databricks 的创始团队(7 位伯克利 AMP 实验室研究员)在 2009 年做出了三个关键押注:云将变大、数据将变大、开源是构建业务的好方式。但最难的是「在开源基础上赚钱」。

  • 开源的两难:开源能带来海量采用和心智份额,但「免费版本会成为自己最大的竞争对手」——竞争对手有更多分销渠道和客户关系,能更好地变现同一技术。
  • Databricks 的解法:不照搬 Red Hat(为 Linux 提供支持服务)的模式,而是从第一性原理出发:必须创造「值得付费的更好产品」。他们构建了 Spark 的专有实现,性能、可靠性、可扩展性远超开源版本,并明确表示「想用这个版本就得付费」。
  • 文化特质:「当你因开源成功而受欢迎时,突然说要做一个竞争性产品并收费,会被社区视为背叛。你需要愿意成为『反派』。」Alan Tu 认为,学术背景让团队没有「先入为主的商业观念」,反而能做出更纯粹的产品决策。

关键数据:Databricks 目前 ARR 超过 40 亿美元,其中约 10 亿美元(四分之一)来自 AI 相关收入。


三、竞争格局:数据湖仓一体 vs. Snowflake,以及云厂商的「竞合」

Alan Tu 认为,Databricks 与 Snowflake 的竞争不是「赢家通吃」,但 Databricks 从「非结构化数据处理」向「结构化数据仓库」的扩展,比 Snowflake 反向扩展更成功。

  • 市场现实:企业通常同时使用多个供应商。典型场景是「先用 Databricks 处理数据,再把处理后的数据存入 Snowflake 数据仓库」。
  • 湖仓一体(Lakehouse):Databricks 自创的品类名称,将数据湖(非结构化)与数据仓库(结构化)融合。推出时曾被嘲笑「太聪明」,但如今已成为行业公认的架构类别。 Alan Tu 认为这是 Databricks 被低估的能力——不仅执行了产品,还教育了整个市场。
  • 与云厂商的竞合:Databricks 从第一天起就与微软 Azure 有战略合作(Azure Databricks)。关键原则:永远不让云厂商有 100% 的动机去「杀死」Databricks——客户使用 Databricks 的同时也在消耗云厂商的基础设施(计算和存储),因此存在利益协同。
  • 定价策略:基于使用量(计算消耗)收费,但不按存储收费——这与 Snowflake 形成对比。Databricks 故意采用开放格式,让客户「数据存在哪里都可以,不需要搬进 Databricks」,这是一种「架构层面的颠覆」。

Alan Tu 指出:「有很多公司产品很好、势头很猛,但微软一旦觉得太战略就会全力扼杀。Databricks 从未把自己放在让云厂商 100% 想消灭的位置上。」


四、AI 时代的定位:数据策略是 AI 策略的前提

Alan Tu 认为,AI 对 Databricks 的影响是多层次的,最核心的是「没有数据策略就没有 AI 策略」这一共识带来的结构性顺风。

  • 三层影响

1. 核心数据处理的顺风:企业认识到 AI 需要干净、组织良好的数据,这直接推动了 Databricks 核心产品的需求。这一需求不依赖于 AGI 是否实现或下一个 OpenAI 模型的表现——只要企业相信 AI 重要,就会投资数据工程。

2. AI 原生公司自身使用:包括大型 AI 实验室在内的 AI 原生公司,内部也在使用 Databricks。

3. 新产品机会:Databricks 正在构建 Agentic 应用的全栈产品(Agent Bricks、Lake Base),帮助企业构建自动化特定任务的智能体应用。这涉及 RAG(检索增强生成)、向量数据库、模型评估等全套工具。

  • 成本结构优势:核心数据处理工作负载基于 CPU,而非 GPU。Databricks 不需要像 AI 训练公司那样大规模采购 GPU。虽然模型推理(model serving)会涉及 GPU 成本,但量级完全不同。
  • 财务健康度:在 40 亿美元 ARR 规模下已实现自由现金流为正。主要成本是传统软件公司的人力和研发投入,没有需要大量资本支出的硬件负担

Alan Tu 补充:「Databricks 的 AI 相关收入已达 10 亿美元,但更重要的可能是『AI 意识』本身带来的数据工程需求——这是一个更持久、波动性更小的增长引擎。」


五、风险与长期主义文化

Alan Tu 认为,Databricks 面临的最大风险不是竞争,而是「能否在规模扩大后继续保持执行力和长期主义文化」。

  • 执行风险:市场动态性强,创新速度至关重要。行业中有公司因「分心」或「产品发布迟缓」而付出代价。Databricks 同时推进多个产品线,持续执行能力是关键
  • AI 产品的不确定性:Agentic 应用领域仍在「品类创造」阶段——行业尚未就工具集和产品形态达成共识。Databricks 需要像当年定义「湖仓一体」一样,再次展示产品执行+市场教育的能力。
  • 文化风险长期主义需要具体的「取舍」来证明。Alan Tu 列举了多个例子:
  • 公司命名「Databricks」而非「Spark」——放弃短期品牌红利,为未来多产品平台留空间。
  • 从未推出本地部署版本——即使当时云尚未被普遍接受,但团队坚信云是未来。
  • 故意不收费某些功能(如治理层、开放格式)——短期牺牲收入,长期建立生态护城河。
  • 私有 vs. 公开的权衡:Databricks 在 2022 年增长科技股回调期间,因保持私有而能「继续进攻」,而许多上市公司被迫收缩。这强化了管理层对「保持私有」的偏好。但 Alan Tu 指出,大规模融资(如最近的数十亿美元轮次)主要用于解决员工股权激励的税务问题,而非运营需求。

Alan Tu 总结:「每次你做一个短期导向的决定,都会在某个地方打开一个漏洞。Databricks 能否保持『第一性原理』的思考方式,是我最关注的事情。」


提及的标的

标的 嘉宾态度 关键数据
Databricks 看好(WCM 于 2024 年 12 月投资) ARR > 40 亿美元;AI 相关收入约 10 亿美元;数据仓库产品年化收入接近 10 亿美元;净美元扩张率 > 140%;自由现金流为正
Snowflake 中性(主要竞争对手) 未提供具体数据;与 Databricks 在数据仓库领域直接竞争
微软 Azure 中性(战略合作伙伴/竞合) 提供 Azure Databricks 品牌产品;与 Databricks 有长期战略合作
AWS 中性(基础设施提供商/竞合) 客户使用 Databricks 时同时消耗 AWS 基础设施
Red Hat 背景参照(开源商业化先驱) 基于 Linux 构建服务和支持业务
Cloudera 背景参照(前代数据湖公司) 基于 Hadoop 技术,已上市但技术不够好

值得记住的判断

1. Alan Tu 认为,开源商业化的核心挑战是「需要同时击中两个全垒打」——先让开源技术获得主流采用,再构建出值得付费的专有产品。多数公司连第一个都打不中,而 Databricks 做到了。支撑:他们从第一性原理出发,不照搬 Red Hat 模式,而是创造性能远超开源版本的专有实现。

2. Alan Tu 指出,Databricks 最被低估的能力是「市场教育」——他们自创了「湖仓一体(Lakehouse)」这个品类名称,推出时被嘲笑,但如今已成为行业公认的架构。支撑:这不仅是产品执行,更是「让整个市场理解为什么这个架构是未来」的营销和商业化能力。

3. Alan Tu 认为,AI 对 Databricks 最持久的推动力不是 AI 产品本身,而是「没有数据策略就没有 AI 策略」这一共识——这创造了核心数据处理业务的长期顺风,且不依赖于 AGI 是否实现。支撑:只要企业相信 AI 重要,就会投资数据工程,而这是 Databricks 的核心价值。

4. Alan Tu 强调,Databricks 的长期主义文化有具体的「取舍」来证明——他们从未推出本地部署版本(即使云尚未被普遍接受),公司命名「Databricks」而非「Spark」(放弃短期品牌红利),故意不收费某些功能(短期牺牲收入)。支撑:这些决策在当时都有明确的短期成本,但团队坚持了长期判断。

5. Alan Tu 指出,Databricks 与云厂商的「竞合」关系是其被低估的战略优势——客户使用 Databricks 的同时消耗云厂商基础设施,因此云厂商没有 100% 的动机去消灭 Databricks。支撑:很多增长期软件公司因被微软等巨头视为「太战略」而被扼杀,Databricks 通过利益对齐避免了这一命运。

6. Alan Tu 认为,Databricks 的成本结构比表面看起来更健康——核心数据处理基于 CPU,不需要大规模 GPU 采购;在 40 亿美元 ARR 规模下已实现自由现金流为正。支撑:即使模型推理涉及 GPU 成本,量级与 AI 训练公司完全不同。

7. Alan Tu 指出,Databricks 的「数据湖仓一体」架构从非结构化向结构化扩展,比 Snowflake 反向扩展更成功——数据仓库产品两年内达到近 10 亿美元年化收入,而 Snowflake 向数据工程领域的扩展规模远不及此。支撑:这不仅是技术优势,也是「开放格式」和「不按存储收费」等战略决策的结果。

8. Alan Tu 认为,Databricks 面临的最大风险不是竞争,而是「能否在规模扩大后继续保持执行力和长期主义文化」——每次短期导向的决策都会打开一个漏洞,而 Agentic 应用领域仍在「品类创造」阶段,需要再次展示产品执行+市场教育的能力。支撑:行业中有公司因「分心」或「产品发布迟缓」而付出代价,Databricks 同时推进多个产品线,持续执行是关键。