← 返回列表
Colossus (Invest Like the Best / Business Breakdowns)播客30 Sep 2025来源: joincolossus.com主持: Patrick O'Shaughnessy

Dylan Patel - Inside the Trillion-Dollar AI Buildout - [Invest Like the Best, EP.442]

一句话导读

这篇讲的是AI基础设施的疯狂现状:钱、电力和芯片正在重塑整个产业。作者Dylan Patel认为AI竞赛才刚开始,后训练和强化学习才是未来算力需求的大头,而不是预训练。他重点提了三个标的:OpenAI(年收入约160亿美元,但签了3000亿美元的Oracle合同,风险极高)、NVIDIA(毛利率75%,通过股权投资变相降价)、Oracle(如果OpenAI成功,能赚1000亿美元利润)。他还警告,传统SaaS模式正在被AI的高成本瓦解,因为每个token都要花钱。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Dylan Patel在《Invest Like the Best》节目中深入剖析了万亿美元级AI基础设施建设的物理现实。核心观点是,AI竞赛仍处于早期阶段,后训练和强化学习(RL)的算力需求远未达上限。关键结论包括:OpenAI、Nvidia与Oracle之间的战略博弈正推动数据中心规模从百兆瓦级跃升至千兆瓦级,导致电工工资翻倍,企业甚至使用柴油卡车发动机作为应急电源。传统SaaS经济模型因AI高昂的销售成本(COGS)而瓦解,价值将向硬件瓶颈(如半导体供应链)集中。Patel强调,美国必须赢得AI竞赛以维持对华竞争优势,而当前基础设施瓶颈(电力、劳动力)是最大制约。

全文约 15 分钟 · 9 个章节
深度解读

本期速览

Dylan Patel 是 SemiAnalysis 的创始人兼CEO,以卫星图像追踪数据中心建设、绘制数千亿美元资本流向而闻名。本期主线是:AI基础设施的物理现实——从电力、劳动力到供应链瓶颈——正在重塑整个产业的权力格局与投资逻辑。全片最有分量的判断:Patel认为AI竞赛仍处于"第一局"的早期阶段,后训练和强化学习(RL)的算力需求远未达上限,而传统SaaS经济模型正因AI高昂的销售成本(COGS)而瓦解。


一、OpenAI-NVIDIA-Oracle的"无限金钱循环":权力博弈与资本结构

Dylan Patel认为,OpenAI、NVIDIA与Oracle之间的三方交易本质上是"资本主义史上最高风险的赌局",其核心逻辑是:谁能为AI基础设施的前端资本支出(Capex)提供资产负债表,谁就拥有权力。

Patel拆解了这笔交易的机制:OpenAI与Oracle签署了约3000亿美元的五年期合同,Oracle向NVIDIA采购GPU,而NVIDIA则向OpenAI进行约1000亿美元的股权投资。具体到1吉瓦(GW)的数据中心,建设成本约500亿美元,其中NVIDIA的芯片约占350亿美元。NVIDIA的毛利率为75%,即约300亿美元的毛利润——其中一半以股权形式回流给OpenAI。

"这就像蜘蛛侠互指 meme——OpenAI 付钱给 Oracle,Oracle 付钱给 NVIDIA,NVIDIA 又付钱给 OpenAI。"Patel 指出,这种结构源于一个根本矛盾:OpenAI 的算力需求是"无限的",但其年化收入仅约160亿美元(2025年底),而它承诺的支出高达数千亿。因此,它必须找到愿意"先垫付资本、后回收租金"的盟友。

关键数据链

  • 1 GW 数据中心年租金:100-150亿美元,五年合计500-750亿美元
  • OpenAI 当前 ARR:约160亿美元(2025年底预估)
  • Oracle 签署的合同总额:约3000亿美元
  • NVIDIA 股权投资:约1000亿美元(对应10 GW容量)

Patel 的判断:如果 OpenAI 成功,Oracle 将获得1000亿美元的纯现金利润;如果失败,Oracle 将背上巨额债务。而 NVIDIA 通过这一结构"在不降价的情况下变相降价",同时获得了前端现金和股权。


二、Tokenomics:推理需求的指数增长与模型经济的根本矛盾

Patel 提出"Tokenomics"框架,认为AI经济的核心是"每token的经济学"——推理需求的增长(每两个月翻倍)远超硬件部署速度,迫使模型提供商在"更大更慢"与"更小更快"之间做出艰难权衡。

"GPT-5 并没有比 GPT-4 大很多,因为 OpenAI 面临一个根本困境:如果模型太大,没人能用得起、用得快。"Patel 指出,GPT-4.5 实际上更聪明,但"没人能承受其成本和速度",因此 Anthropic 的绝大部分收入来自 Claude Sonnet(较小模型),而非 Opus(更大模型)。

推理需求 vs. 硬件供给的矛盾

  • 推理 token 需求:每两个月翻倍
  • 硬件部署速度:远低于此增速
  • 解决方案:模型成本必须持续下降(GPT-3 到 GPT-4 的成本下降了 2000倍;DeepSeek 进一步降低了 500-600倍

Patel 的推演:OpenAI 选择将 GPT-5 保持与 GPT-4o 相近的规模,以最大化可服务用户数,而非追求单次推理的极致智能。这意味着"更大模型"的消费者体验要等到硬件(推理延迟)瓶颈被突破后才能实现。

可证伪条件:如果推理 token 需求增速放缓至每6-12个月翻倍,或模型成本下降速度不足以匹配需求增长,则当前资本支出节奏将面临风险。


三、后训练与强化学习:真正的"第一局"

Patel 认为,预训练(Pre-training)在文本领域已进入"晚期局",但后训练(Post-training)和强化学习(RL)才刚刚"投出第一个球"——这才是未来算力需求的主要来源。

各阶段"局数"判断

阶段 局数 关键瓶颈
文本预训练 晚期局 互联网文本数据已基本耗尽
非文本预训练(视频/音频/图像) 早期局 数据丰富但处理成本极高
后训练/RL 第一局刚投出 需要构建大量"环境"(environments)来生成训练数据

Patel 用婴儿的感官校准作类比:"婴儿把手放进嘴里,因为舌头是最敏感的器官——他在校准触觉。模型还没有做到这一点。我们离真正的通用智能还差得远。"

环境(Environments)的多样性

  • 模拟电商平台(如"假亚马逊")训练模型进行商品比较与购买
  • 数学谜题(从简单到复杂逐步递进)
  • 医疗病例诊断
  • 代码调试与数据清洗

关键数据:目前湾区已有约40家初创公司在构建这些"环境",但Patel认为"它们能否成功尚存疑问"。

推演:RL 的算力需求将"吸收大部分计算资源",因为模型需要通过试错来学习,而每次试错都需要大量推理和训练计算。可证伪信号:如果 RL 方法在12-18个月内未能显著提升模型在现实世界任务(如复杂操作、多步推理)上的表现,则当前对 RL 的算力投入预期可能过高。


四、硬件瓶颈与供应链现实:电力、劳动力与"柴油卡车发动机"

Patel 认为,AI 基础设施的最大制约不是芯片本身,而是电力供应、劳动力短缺和供应链瓶颈——这些物理现实正在催生"疯狂"的解决方案。

电力与劳动力现状

  • 美国数据中心目前占全国电力消耗的3-4%(其中AI约占一半)
  • 电工工资已翻倍,尤其是可移动工作的"移动电工"
  • 有公司正在使用柴油卡车发动机并联作为应急电源,因为燃气轮机供应不足
  • Elon Musk 从波兰采购电力设备运往美国,因为本土供应链无法满足需求

供应链瓶颈

  • GE Vernova 和 Mitsubishi 正在加倍燃气轮机产能
  • 变压器供应链"完全售罄",企业开始考虑从中国进口
  • 不同数据中心建设商(Google、Vantage、EdgeConneX、QTS)的供应链各不相同,导致"各种奇怪的问题"

关键数据

  • 单个 500 MW 数据中心的总资本支出(含GPU):约250亿美元
  • OpenAI 计划建设的 2 GW 数据中心相当于费城全市的电力消耗
  • 德州 ERCOT 和 PJM 电网已出台新规:可提前24-72小时通知切断大型负载的一半电力

Patel 的判断:"我们正在重新学习如何建设电力系统。这不是因为需求太大,而是因为我们40年没建过新的电力基础设施了。"


五、美中AI竞赛:两种截然不同的资本分配哲学

Patel 认为,美国必须赢得AI竞赛以维持全球霸权,否则将面临经济衰退和社会不稳定;而中国正在用"历史上惯用的长线策略"——通过国有资本大规模投入半导体供应链,追求自给自足。

美国视角

  • "如果没有AI,美国到本世纪末可能不再是世界霸主"
  • AI 必须"大幅加速GDP增长",否则"一旦开始分蛋糕,就完蛋了"
  • 美国资本主要流向:建设最大数据中心、训练最佳模型

中国视角

  • 过去10年已向半导体生态系统投入了4000-5000亿美元(通过国有企业、税收政策、土地补贴、"大基金"等)
  • 追求"自给自足"的供应链安全,而非短期商业回报
  • 字节跳动可能是全球第二或第三大GPU用户(仅次于OpenAI和Meta)
  • 中国建设速度远超美国:"如果中国想建一个10 GW的数据中心,可能几年内就能建成;美国短期内建不成一个"

关键对比

维度 美国 中国
资本分配重点 建设数据中心、训练模型 建设半导体供应链、自给自足
建设速度 慢(受制于劳动力、监管) 快(政府协调、集中决策)
芯片能力 领先3-4年 追赶中(华为等)
人才 全球人才虹吸 本土人才密集(全球约一半工程师是华人)

Patel 的警示:"如果美国把中国逼到墙角,他们会反击。但如果美国不施加压力,中国会通过长期积累逐步超越。"


六、SaaS经济模型的瓦解:AI时代的"高COGS困境"

Patel 认为,AI 正在从根本上改变软件经济学——传统 SaaS 的"低COGS、高客户获取成本"模式将被颠覆,因为 AI 带来了高昂的销售成本(COGS),同时降低了竞争对手的进入门槛。

传统 SaaS 模型

  • R&D 成本相对固定
  • COGS 很低
  • 客户获取成本(CAC)高
  • 达到临界规模后利润丰厚

AI 时代的 SaaS 模型

  • COGS 大幅上升(每个 token 都有计算成本)
  • CAC 并未下降(销售仍然困难)
  • 竞争对手的进入门槛大幅降低("你可以用 AI 自己写代码")

Patel 的推演

1. AI 降低了软件开发成本,意味着更多企业可以"自建而非购买"

2. AI SaaS 产品的 COGS 很高,压缩了利润空间

3. 结果:市场更加碎片化,单个 SaaS 公司更难达到"逃逸速度"

4. "已经规模化的大公司(如 YouTube)会很好,但新进入者将面临严峻挑战"

历史类比:中国 SaaS 市场相对较小,因为中国软件开发者成本仅为美国的1/5,企业更倾向于自建。AI 正在将这种"自建经济"推广到全球。


提及的标的

标的 嘉宾态度 关键数据
OpenAI 看好但风险提示 ARR约160亿美元(2025年底);800M用户;签署约3000亿美元Oracle合同
NVIDIA 看好 毛利率75%;通过股权投资变相降价;1GW数据中心中占约350亿美元Capex
Oracle 看好(条件性) 签署约3000亿美元合同;若OpenAI成功可获1000亿美元利润
Anthropic 更看好(优于OpenAI) 收入从<10亿美元增至70-80亿美元;主要来自代码相关产品
Meta 强烈看好 拥有"全栈"(硬件+模型+推荐系统+资本);眼镜产品可能成为下一代人机界面
Google 转多(此前看空) 拥有最低token成本(垂直整合TPU);正在觉醒并积极投资
AMD 个人情感看好,业务"中等" 作者个人第一只多倍股;但认为与NVIDIA竞争困难
xAI 风险提示 面临融资挑战;需找到商业模式(目前主要靠"Anime"聊天机器人)
ByteDance 未明示 可能是全球第二或第三大GPU用户
TSMC 未明示 作者认为"如果你相信台湾风险,就不能投资任何美国科技巨头"
CoreWeave 看好(条件性) 与微软签署约190亿美元合同;与OpenAI的合同存在信用风险
Nebius 看好 与微软签署约190亿美元合同
Periodic Labs 看好(作者个人投资) 用RL方法加速材料科学/化学发现
Cursor 中性(权力动态分析) 收入近10亿美元;大部分收入流向Anthropic;但拥有用户数据和嵌入模型

值得记住的判断

1. Patel 认为"Tokenomics"是理解AI经济的核心框架——每token的价值创造与成本结构决定了整个产业链的利润分配。推理需求每两个月翻倍,但硬件增速远不及此,因此模型成本必须持续下降。

2. "后训练和强化学习才刚刚投出第一个球"——Patel 用婴儿把手放进嘴里校准触觉来类比:模型还没有学会通过试错来理解物理世界。RL 的算力需求将"吸收大部分计算资源"。

3. "传统SaaS经济模型正在瓦解"——AI 带来了高昂的 COGS,同时降低了竞争对手的进入门槛("你可以用AI自己写代码"),导致市场碎片化,新进入者更难达到逃逸速度。

4. "电工工资已经翻倍,企业开始用柴油卡车发动机并联作为应急电源"——AI 基础设施的最大瓶颈不是芯片,而是电力供应和劳动力短缺。美国正在"重新学习如何建设电力系统"。

5. "如果美国不赢得AI竞赛,到本世纪末可能不再是世界霸主"——Patel 认为,没有AI加速的GDP增长,美国将因债务、收入不平等和社会分裂而"分崩离析"。

6. "ML研究就像半导体制造——有上千个旋钮要调,你不可能全部试一遍"——Patel 用半导体工艺中的"过程知识"类比AI研究中的直觉和经验,强调"知道该试什么"比"试了多少"更重要。

7. "NVIDIA 正在做史无前例的事——用资产负债表来赢得竞争"——通过股权投资和需求担保,NVIDIA 实际上在"不降价的情况下变相降价",同时锁定了前端现金。

8. "Meta 可能是唯一拥有下一代人机界面全栈的公司"——Patel 认为,从硬件(眼镜)、模型、推荐系统到资本,Meta 最有可能主导"你说AI做"的新交互范式。