这篇讲的是数据公司Databricks如何从大学里的一个开源项目(Apache Spark,一种免费的数据处理工具)成长为估值1300亿美元的私有平台。嘉宾Alan Tu认为,Databricks最厉害的不是技术,而是先让开源工具流行起来,再做出比免费版好得多的付费产品,这很难。他看好Databricks,因为它解决了企业最头疼的“数据清洗”问题,而且搭上了AI的顺风车——企业想用AI,必须先整理好数据。重点提了三个标的:Databricks(年收入超40亿美元,已能自己赚钱);Snowflake(主要对手,但Databricks从处理非结构化数据向结构化数据扩展更成功);微软Azure(既是合作伙伴又是潜在威胁,但Databricks通过让客户消耗云服务来避免被完全打压)。
Databricks是一家估值1300亿美元的私有软件公司,核心业务是帮助企业收集、存储和处理海量数据,并用于分析及训练机器学习模型。本期节目由WCM Investment Management的投资组合经理Alan Tu解读,他指出Databricks是连接原始数据管道与分析工具及AI构建的中间层,常作为大型数据与AI项目的幕后基础设施。公司起源于学术团队,从早期数据工程产品演变为广泛商业平台。报告讨论了Databricks与Snowflake的市场竞争、在现代AI堆栈中的角色、以及其规模、产品策略和资本状况如何形成差异化优势。关键结论包括:Databricks通过统一数据与AI平台,在数据
嘉宾:Alan Tu,WCM Investment Management 投资组合经理兼分析师(WCM 于 2024 年 12 月投资 Databricks)。主线:Databricks 从学术开源项目演变为估值 1300 亿美元的私有数据与 AI 平台,其核心优势在于「数据湖仓一体」架构和长期主义文化。全片最有分量的判断:Alan Tu 认为,Databricks 最被低估的能力不是技术,而是「同时击中两个全垒打」——先让开源技术 Apache Spark 获得主流采用,再构建出值得付费的专有产品,而多数开源公司连第一个全垒打都打不中。
Alan Tu 认为,Databricks 解决的根本问题是「把杂乱数据变成可分析格式」,这是所有数据与 AI 项目中最耗时、最基础的一步。
Alan Tu 指出:「Databricks 帮助引领行业走向他们认为行业应该去的地方——他们识别痛点,提出解决方案,而不是看着现有市场说『我们也能做个差不多的』。」
Alan Tu 强调,Databricks 的创始团队(7 位伯克利 AMP 实验室研究员)在 2009 年做出了三个关键押注:云将变大、数据将变大、开源是构建业务的好方式。但最难的是「在开源基础上赚钱」。
关键数据:Databricks 目前 ARR 超过 40 亿美元,其中约 10 亿美元(四分之一)来自 AI 相关收入。
Alan Tu 认为,Databricks 与 Snowflake 的竞争不是「赢家通吃」,但 Databricks 从「非结构化数据处理」向「结构化数据仓库」的扩展,比 Snowflake 反向扩展更成功。
Alan Tu 指出:「有很多公司产品很好、势头很猛,但微软一旦觉得太战略就会全力扼杀。Databricks 从未把自己放在让云厂商 100% 想消灭的位置上。」
Alan Tu 认为,AI 对 Databricks 的影响是多层次的,最核心的是「没有数据策略就没有 AI 策略」这一共识带来的结构性顺风。
1. 核心数据处理的顺风:企业认识到 AI 需要干净、组织良好的数据,这直接推动了 Databricks 核心产品的需求。这一需求不依赖于 AGI 是否实现或下一个 OpenAI 模型的表现——只要企业相信 AI 重要,就会投资数据工程。
2. AI 原生公司自身使用:包括大型 AI 实验室在内的 AI 原生公司,内部也在使用 Databricks。
3. 新产品机会:Databricks 正在构建 Agentic 应用的全栈产品(Agent Bricks、Lake Base),帮助企业构建自动化特定任务的智能体应用。这涉及 RAG(检索增强生成)、向量数据库、模型评估等全套工具。
Alan Tu 补充:「Databricks 的 AI 相关收入已达 10 亿美元,但更重要的可能是『AI 意识』本身带来的数据工程需求——这是一个更持久、波动性更小的增长引擎。」
Alan Tu 认为,Databricks 面临的最大风险不是竞争,而是「能否在规模扩大后继续保持执行力和长期主义文化」。
Alan Tu 总结:「每次你做一个短期导向的决定,都会在某个地方打开一个漏洞。Databricks 能否保持『第一性原理』的思考方式,是我最关注的事情。」
| 标的 | 嘉宾态度 | 关键数据 |
|---|---|---|
| Databricks | 看好(WCM 于 2024 年 12 月投资) | ARR > 40 亿美元;AI 相关收入约 10 亿美元;数据仓库产品年化收入接近 10 亿美元;净美元扩张率 > 140%;自由现金流为正 |
| Snowflake | 中性(主要竞争对手) | 未提供具体数据;与 Databricks 在数据仓库领域直接竞争 |
| 微软 Azure | 中性(战略合作伙伴/竞合) | 提供 Azure Databricks 品牌产品;与 Databricks 有长期战略合作 |
| AWS | 中性(基础设施提供商/竞合) | 客户使用 Databricks 时同时消耗 AWS 基础设施 |
| Red Hat | 背景参照(开源商业化先驱) | 基于 Linux 构建服务和支持业务 |
| Cloudera | 背景参照(前代数据湖公司) | 基于 Hadoop 技术,已上市但技术不够好 |
1. Alan Tu 认为,开源商业化的核心挑战是「需要同时击中两个全垒打」——先让开源技术获得主流采用,再构建出值得付费的专有产品。多数公司连第一个都打不中,而 Databricks 做到了。支撑:他们从第一性原理出发,不照搬 Red Hat 模式,而是创造性能远超开源版本的专有实现。
2. Alan Tu 指出,Databricks 最被低估的能力是「市场教育」——他们自创了「湖仓一体(Lakehouse)」这个品类名称,推出时被嘲笑,但如今已成为行业公认的架构。支撑:这不仅是产品执行,更是「让整个市场理解为什么这个架构是未来」的营销和商业化能力。
3. Alan Tu 认为,AI 对 Databricks 最持久的推动力不是 AI 产品本身,而是「没有数据策略就没有 AI 策略」这一共识——这创造了核心数据处理业务的长期顺风,且不依赖于 AGI 是否实现。支撑:只要企业相信 AI 重要,就会投资数据工程,而这是 Databricks 的核心价值。
4. Alan Tu 强调,Databricks 的长期主义文化有具体的「取舍」来证明——他们从未推出本地部署版本(即使云尚未被普遍接受),公司命名「Databricks」而非「Spark」(放弃短期品牌红利),故意不收费某些功能(短期牺牲收入)。支撑:这些决策在当时都有明确的短期成本,但团队坚持了长期判断。
5. Alan Tu 指出,Databricks 与云厂商的「竞合」关系是其被低估的战略优势——客户使用 Databricks 的同时消耗云厂商基础设施,因此云厂商没有 100% 的动机去消灭 Databricks。支撑:很多增长期软件公司因被微软等巨头视为「太战略」而被扼杀,Databricks 通过利益对齐避免了这一命运。
6. Alan Tu 认为,Databricks 的成本结构比表面看起来更健康——核心数据处理基于 CPU,不需要大规模 GPU 采购;在 40 亿美元 ARR 规模下已实现自由现金流为正。支撑:即使模型推理涉及 GPU 成本,量级与 AI 训练公司完全不同。
7. Alan Tu 指出,Databricks 的「数据湖仓一体」架构从非结构化向结构化扩展,比 Snowflake 反向扩展更成功——数据仓库产品两年内达到近 10 亿美元年化收入,而 Snowflake 向数据工程领域的扩展规模远不及此。支撑:这不仅是技术优势,也是「开放格式」和「不按存储收费」等战略决策的结果。
8. Alan Tu 认为,Databricks 面临的最大风险不是竞争,而是「能否在规模扩大后继续保持执行力和长期主义文化」——每次短期导向的决策都会打开一个漏洞,而 Agentic 应用领域仍在「品类创造」阶段,需要再次展示产品执行+市场教育的能力。支撑:行业中有公司因「分心」或「产品发布迟缓」而付出代价,Databricks 同时推进多个产品线,持续执行是关键。