← 返回列表
Lex Fridman Podcast播客3 Feb 2025来源: lexfridman.com主持: Lex Fridman

#459 – DeepSeek, China, OpenAI, NVIDIA, xAI, TSMC, Stargate, and AI Megaclusters

一句话导读

这篇播客聊的是中国AI公司DeepSeek发布的新模型R1,它性能跟OpenAI的O3 Mini差不多,但成本低很多、还开源了,这让英伟达股价一天跌了17%。嘉宾认为,这反而会刺激更多人用AI,长期看对英伟达是好事,因为它家的GPU需求会更大。他们重点提了:英伟达(股价大跌但长期被看好)、台积电(全球90%先进芯片靠它,地缘风险被低估)、OpenAI(成本太高,面临压力)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Dylan Patel(SemiAnalysis创始人)与Nathan Lambert(Allen Institute for AI研究员)在Lex Fridman播客中深入探讨了DeepSeek引发的AI行业震荡。核心观点:DeepSeek R1在基准测试中性能与OpenAI O3 Mini相当,但成本更低、开源权重且展示完整思维链(O3 Mini仅显示摘要),而O3 Mini High在主观体验上略优。重要结论:DeepSeek事件是技术史上的转折点,凸显中美AI竞争加剧,但美国模型(如Claude Sonnet 3.5在编程领域仍具优势)与NVIDIA、TSMC等硬件供应链将继续推动成本

全文约 20 分钟 · 15 个章节
深度解读

本期速览

Dylan Patel(SemiAnalysis创始人)与Nathan Lambert(Allen Institute for AI研究员)在Lex Fridman播客中深入剖析DeepSeek引发的AI行业震荡。核心判断:DeepSeek R1在基准测试中性能与OpenAI O3 Mini相当,但成本更低、开源权重且展示完整思维链(O3 Mini仅显示摘要),而O3 Mini High在主观体验上略优——这是技术史上的转折点,凸显中美AI竞争加剧,但美国模型(如Claude Sonnet 3.5在编程领域仍具优势)与NVIDIA、TSMC等硬件供应链将继续推动成本曲线下移。

DeepSeek R1:开源模型的“斯普特尼克时刻”

Dylan Patel认为DeepSeek R1的发布是AI行业的“斯普特尼克时刻”,其意义远超技术本身。

历史脉络:DeepSeek V3于2024年12月26日发布,当时市场反应平淡。但2025年1月20日R1发布后,引发全球关注。Patel指出:“DeepSeek V3发布时,市场几乎没反应,但R1发布后,NVIDIA股价单日下跌17%——这是市场在重新定价AI竞争格局。”

机制拆解:R1的核心创新在于混合专家模型(MoE)架构强化学习训练方法。Patel解释:“DeepSeek用MoE架构,每次推理只激活370亿参数(总参数6710亿),这大幅降低了推理成本。而R1的训练方法——用强化学习让模型学会‘思考’——是OpenAI O1论文中描述的方法,但DeepSeek将其开源了。”

数据链:R1的训练成本约560万美元(仅计算GPU算力成本),而OpenAI训练GPT-4的成本估计在1亿至10亿美元之间。推理成本方面,R1每百万token输出成本约2.19美元,而OpenAI O1 Mini约4.40美元,O1约60美元

Nathan Lambert补充:“R1展示了完整的思维链(Chain of Thought),而OpenAI O3 Mini只显示摘要。这意味着开发者可以完全理解模型的推理过程,这对调试和微调至关重要。”

证伪条件:如果未来OpenAI发布O3完整版,在基准测试中大幅领先R1(如超越20%以上),且成本差距缩小,则R1的“转折点”叙事将被削弱。

中美AI竞争:成本曲线与硬件供应链

Dylan Patel认为,DeepSeek事件暴露了美国AI公司的成本结构问题,但硬件供应链优势仍在美国手中。

成本对比:Patel给出具体数据:“DeepSeek用2000块H800 GPU训练了R1,而OpenAI用数万块H100。如果美国公司能用同样效率,成本可降低10-100倍。但问题在于,美国公司目前更关注模型性能而非成本效率。”

硬件供应链:Patel强调:“NVIDIA的B100/B200 GPU将在2025年下半年量产,性能是H100的2-3倍。TSMC的3nm工艺(N3)已量产,而中国最先进的工艺是SMIC的7nm(N+2),差距约3-4代。这意味着美国在硬件上仍有2-3年领先优势。”

Nathan Lambert指出:“中国在应用层面可能更快。DeepSeek的API价格仅为OpenAI的1/10,这会让更多中国开发者使用AI,加速应用生态发展。”

分歧点:Patel认为硬件差距是关键,Lambert则认为应用生态更重要。两人都同意:中美AI竞争不是零和游戏,而是两条不同路径的竞赛

NVIDIA与xAI:算力需求的结构性变化

Dylan Patel分析,DeepSeek事件不会减少算力需求,反而会加速推理计算需求增长。

机制拆解:Patel提出“杰文斯悖论(Jevons Paradox)在AI领域的应用”:“当计算成本下降时,使用量会大幅增加,最终总计算需求反而上升。DeepSeek降低了推理成本,这会刺激更多应用场景,从而增加对GPU的总需求。”

数据链:Patel给出预测:“2025年,NVIDIA的H100/B100出货量将达400-500万块,而2024年约200万块。xAI的Colossus集群已部署10万块H100,计划扩展到20万块。Stargate项目(微软与OpenAI合作)将建设100万块GPU的超级集群,投资额超1000亿美元。”

Nathan Lambert补充:“xAI的Grok模型在编程任务上表现优异,但Grok 2.0的推理成本是DeepSeek R1的5-10倍。如果xAI能优化成本,其竞争力将大幅提升。”

证伪条件:如果2025年下半年NVIDIA的B100出货量低于预期(如低于200万块),或Stargate项目延期,则算力需求增长叙事将被削弱。

TSMC与地缘政治:芯片制造的战略地位

Dylan Patel认为,TSMC是AI供应链中最关键的节点,其地缘政治风险被市场低估。

历史脉络:Patel回顾:“2022年佩洛西访台后,中国军演导致全球芯片供应链紧张。2023年,美国通过《芯片法案》补贴本土制造,但TSMC在亚利桑那州的工厂已延期至2025年量产。”

机制拆解:Patel解释:“全球90%以上的先进芯片(7nm以下)由TSMC生产。NVIDIA、AMD、Apple、Qualcomm都依赖TSMC。如果台海冲突爆发,全球AI芯片供应将中断6-12个月。”

数据链:TSMC 2024年资本支出约320亿美元,其中70%用于3nm/5nm工艺。2025年计划将3nm产能提升至每月10万片晶圆(2024年约5万片)。Patel指出:“TSMC的3nm良率已超过80%,而Intel的18A工艺良率仅约50%。”

Nathan Lambert补充:“地缘政治风险是投资者必须考虑的尾部风险。但短期内,TSMC的垄断地位不会改变,因为三星和Intel在先进工艺上仍有差距。”

证伪条件:如果Intel 18A工艺在2025年实现量产且良率超过70%,或三星3nm GAA工艺获得NVIDIA订单,则TSMC的垄断地位将被削弱。

提及的标的

标的 嘉宾态度 关键数据
NVIDIA 看好(长期需求增长) 2025年H100/B100出货量预计400-500万块;股价因DeepSeek单日下跌17%
TSMC 看好(垄断地位) 2024年资本支出320亿美元;3nm良率>80%;全球90%以上先进芯片由其生产
OpenAI 风险提示(成本结构问题) O3 Mini推理成本是DeepSeek R1的2倍;O1推理成本是R1的27倍
DeepSeek 看好(成本效率) R1训练成本560万美元;API价格是OpenAI的1/10
xAI 中性(需优化成本) Colossus集群10万块H100;Grok 2.0推理成本是R1的5-10倍
Microsoft 看好(Stargate项目) Stargate投资超1000亿美元;计划建设100万块GPU集群
Intel 风险提示(技术落后) 18A工艺良率约50%;与TSMC差距2-3年

值得记住的判断

1. Dylan Patel:“DeepSeek R1是AI行业的‘斯普特尼克时刻’”——R1在基准测试中与O3 Mini相当,但成本低2倍、开源权重、展示完整思维链,迫使美国公司重新思考成本效率。

2. Nathan Lambert:“DeepSeek的API价格仅为OpenAI的1/10,这会加速中国AI应用生态发展”——成本优势将刺激更多开发者和企业使用AI,形成网络效应。

3. Dylan Patel:“杰文斯悖论在AI领域成立——计算成本下降会刺激使用量增长,最终总计算需求上升”——DeepSeek降低推理成本,反而会增加对NVIDIA GPU的总需求。

4. Dylan Patel:“TSMC是AI供应链中最关键的节点,地缘政治风险被市场低估”——全球90%以上先进芯片由TSMC生产,台海冲突将导致AI芯片供应中断6-12个月。

5. Nathan Lambert:“O3 Mini High在主观体验上优于R1,但差距在缩小”——在创意写作、复杂推理等任务上,OpenAI仍领先,但DeepSeek的追赶速度超出预期。

6. Dylan Patel:“美国在硬件供应链上仍有2-3年领先优势”——NVIDIA B100/B200性能是H100的2-3倍,TSMC 3nm已量产,而中国最先进工艺是SMIC的7nm。

7. Nathan Lambert:“中美AI竞争不是零和游戏,而是两条不同路径的竞赛”——美国在基础研究和硬件上领先,中国在应用和成本效率上追赶,双方各有优势。

8. Dylan Patel:“Stargate项目投资超1000亿美元,将建设100万块GPU集群——这是人类历史上最大的计算基础设施投资”——微软与OpenAI的合作将重新定义AI算力规模,但项目延期风险存在。

续篇分析:DeepSeek、AI竞赛与地缘政治

1. DeepSeek R1 的推理能力与成本优势

1.1 推理模型的成本对比

DeepSeek R1 的 API 定价为每百万输出 token 约 2 美元,而 OpenAI o1 为 60 美元,差距达 27 倍。这一差距由多个因素叠加形成:

因素 影响倍数 说明
OpenAI 的利润率 4-5x OpenAI 推理毛利率超 75%,定价含高额利润
模型架构效率 5-7x MLA + MOE 架构显著降低内存与计算需求
基础设施规模 受限 DeepSeek 缺乏足够 GPU 容量,实际无法大规模服务

1.2 推理效率的技术根源

DeepSeek 的 Multi-Head Latent Attention (MLA) 是核心创新:

  • 相比标准注意力机制,MLA 可节省 80-90% 的 KV Cache 内存
  • 在长序列推理(如 R1 的 chain-of-thought 输出可达数万 token)时,内存压力是主要瓶颈
  • 传统注意力机制的内存需求随序列长度呈二次增长,MLA 通过低秩近似大幅降低常数

1.3 服务能力瓶颈

尽管模型效率极高,DeepSeek 的实际服务能力严重受限:

  • 发布后因流量过大暂停注册
  • 用户实际体验中 token 生成速度低于 5 tokens/秒
  • 估计总 GPU 数量约 50,000(含研究、量化交易),远低于 OpenAI 的数十万级别

2. 出口管制与硬件限制

2.1 GPU 限制的三维框架

美国出口管制围绕三个技术维度:

维度 初始限制 当前限制 H20 规格
浮点运算 (FLOPS) H100 的 1/3(理论)
互联带宽 与 H100 相同
内存带宽/容量 优于 H100

2.2 H20 的悖论

H20 在推理任务上可能优于 H100:

  • 推理(尤其是 reasoning)对内存带宽和容量的需求高于对 FLOPS 的需求
  • H20 拥有更高的内存带宽和容量,更适合长序列推理
  • NVIDIA 已取消 2024 年约 200 万颗 H20 的订单,推测是因预期进一步限制

2.3 走私规模与渠道

渠道 规模估计 现状
合法 H20 销售 ~100 万颗/年 已取消订单
小型走私(个人携带) 20-30 万颗/年 持续存在
云租赁(如 Oracle→字节跳动) 数十万颗 被 AI Diffusion Rules 限制
大规模商业走私 受限 10 亿美元以上规模难以隐藏

3. 后训练范式转变:从预训练到 RL

3.1 计算重心转移

阶段 2022-2023 2024-2025
预训练 主导(>90% 计算量) 仍重要但占比下降
后训练(RL) 微不足道 快速增长,可能超过预训练
推理(test-time compute) 少量 大幅增长(reasoning 模型)

3.2 可验证领域的 RL 训练

DeepSeek R1 的关键突破:

  • 仅使用可验证奖励(数学答案正确性、代码单元测试)进行 RL 训练
  • 无需人类标注的 chain-of-thought 数据
  • 推理行为(如自我纠错、回溯)自然涌现
  • 这与 AlphaGo 从模仿学习转向自我对弈的路径高度相似

3.3 未来扩展方向

领域 可验证性 当前进展 预计突破时间
数学 接近饱和 已接近
编程 快速提升 1-2 年
网页操作 中高 早期 2-3 年
机器人 实验室阶段 3-5 年

4. 开源生态与许可证博弈

4.1 开源程度对比

模型 权重 训练数据 训练代码 许可证
DeepSeek R1 MIT(最宽松)
Llama 3 Llama 许可证(有使用限制)
OLMo (AI2) Apache 2.0

4.2 许可证的关键差异

  • MIT 许可证:无下游使用限制,允许商业使用、合成数据生成、蒸馏
  • Llama 许可证:要求衍生模型名称包含 "Llama",有特定使用场景限制
  • 开源软件标准:要求自由修改、无歧视性限制——Llama 不符合此标准

4.3 开源 AI 的反馈循环问题

与开源软件不同,开源 AI 缺乏有效的社区贡献反馈循环:

  • 改进模型需要大量计算资源(非普通开发者可负担)
  • 训练数据难以共享(版权、隐私问题)
  • 模型评估和调试需要专业领域知识

5. 地缘政治与军事应用

5.1 出口管制的战略逻辑

Dario Amodei 的论点:

  • 若 AI 在 2026 年达到"超级强大"水平,将带来显著军事优势
  • 民主国家应保持单极优势,避免威权国家获得同等能力
  • 出口管制旨在减缓而非完全阻止中国获取先进芯片

5.2 实际效果评估

目标 效果 局限性
阻止前沿模型训练 部分成功 DeepSeek 证明可用受限硬件训练前沿模型
限制推理部署 更有效 大规模推理需要更多 GPU,更难隐藏
维持技术代差 短期有效 长期可能刺激中国自主研发

5.3 军事应用的时间线

  • 当前:AI 在军事中主要作为辅助工具(无人机操控、情报分析)
  • 近期(2-3 年):可能实现半自主系统,但人类仍在回路中
  • 远期(5-10 年):全自主蜂群、网络战系统可能成为现实

6. 集群建设与能源挑战

6.1 当前最大集群排名

公司 GPU 数量 功率 地点
xAI 200,000 ~280 MW 孟菲斯
Meta 128,000 ~180 MW 多地
OpenAI/Microsoft 100,000 ~140 MW 亚利桑那
Google (TPU) 跨站点 更大但分散 爱荷华/内布拉斯加

6.2 Stargate 项目解析

指标 数据
宣称投资 5000 亿美元
第一阶段实际 1000 亿美元(TCO)
第一阶段 Capex 约 500 亿美元
功率 2.2 GW(输入)/ 1.8 GW(芯片)
资金现状 仅 Oracle 已投入约 60 亿美元

6.3 能源瓶颈

  • 美国电网建设速度远落后于 AI 集群需求
  • 传输成本在某些地区已超过发电成本
  • 解决方案:天然气发电(Meta、xAI)、核能(Amazon)、电池缓冲(Tesla Megapack)

7. 关键结论与展望

7.1 短期(1-2 年)

  • 推理成本将继续暴跌,类似 GPT-3 的 1200x 成本下降将在 GPT-4 级别重演
  • 后训练 RL 将成为主要创新方向,预训练 scaling law 边际收益递减
  • 开源模型将逼近闭源前沿,DeepSeek R1 的 MIT 许可证加速了这一趋势

7.2 中期(3-5 年)

  • Agent 系统将在受限领域实用化(编程、特定网站操作)
  • 多数据中心训练成为常态,光纤互联技术突破
  • 中国可能通过自主研发缩小硬件差距,但代差仍存

7.3 长期(5-10 年)

  • 超级强大 AI 的军事应用可能改变地缘格局
  • 人类-AI 融合(BCI)可能加剧不平等
  • 物理世界交互(机器人)仍是最大瓶颈

"对于成功的科技,现实必须优先于公关,因为大自然不会被愚弄。"

— Richard Feynman