这篇播客聊的是中国AI公司DeepSeek发布的新模型R1,它性能跟OpenAI的O3 Mini差不多,但成本低很多、还开源了,这让英伟达股价一天跌了17%。嘉宾认为,这反而会刺激更多人用AI,长期看对英伟达是好事,因为它家的GPU需求会更大。他们重点提了:英伟达(股价大跌但长期被看好)、台积电(全球90%先进芯片靠它,地缘风险被低估)、OpenAI(成本太高,面临压力)。
Dylan Patel(SemiAnalysis创始人)与Nathan Lambert(Allen Institute for AI研究员)在Lex Fridman播客中深入探讨了DeepSeek引发的AI行业震荡。核心观点:DeepSeek R1在基准测试中性能与OpenAI O3 Mini相当,但成本更低、开源权重且展示完整思维链(O3 Mini仅显示摘要),而O3 Mini High在主观体验上略优。重要结论:DeepSeek事件是技术史上的转折点,凸显中美AI竞争加剧,但美国模型(如Claude Sonnet 3.5在编程领域仍具优势)与NVIDIA、TSMC等硬件供应链将继续推动成本
Dylan Patel(SemiAnalysis创始人)与Nathan Lambert(Allen Institute for AI研究员)在Lex Fridman播客中深入剖析DeepSeek引发的AI行业震荡。核心判断:DeepSeek R1在基准测试中性能与OpenAI O3 Mini相当,但成本更低、开源权重且展示完整思维链(O3 Mini仅显示摘要),而O3 Mini High在主观体验上略优——这是技术史上的转折点,凸显中美AI竞争加剧,但美国模型(如Claude Sonnet 3.5在编程领域仍具优势)与NVIDIA、TSMC等硬件供应链将继续推动成本曲线下移。
Dylan Patel认为DeepSeek R1的发布是AI行业的“斯普特尼克时刻”,其意义远超技术本身。
历史脉络:DeepSeek V3于2024年12月26日发布,当时市场反应平淡。但2025年1月20日R1发布后,引发全球关注。Patel指出:“DeepSeek V3发布时,市场几乎没反应,但R1发布后,NVIDIA股价单日下跌17%——这是市场在重新定价AI竞争格局。”
机制拆解:R1的核心创新在于混合专家模型(MoE)架构与强化学习训练方法。Patel解释:“DeepSeek用MoE架构,每次推理只激活370亿参数(总参数6710亿),这大幅降低了推理成本。而R1的训练方法——用强化学习让模型学会‘思考’——是OpenAI O1论文中描述的方法,但DeepSeek将其开源了。”
数据链:R1的训练成本约560万美元(仅计算GPU算力成本),而OpenAI训练GPT-4的成本估计在1亿至10亿美元之间。推理成本方面,R1每百万token输出成本约2.19美元,而OpenAI O1 Mini约4.40美元,O1约60美元。
Nathan Lambert补充:“R1展示了完整的思维链(Chain of Thought),而OpenAI O3 Mini只显示摘要。这意味着开发者可以完全理解模型的推理过程,这对调试和微调至关重要。”
证伪条件:如果未来OpenAI发布O3完整版,在基准测试中大幅领先R1(如超越20%以上),且成本差距缩小,则R1的“转折点”叙事将被削弱。
Dylan Patel认为,DeepSeek事件暴露了美国AI公司的成本结构问题,但硬件供应链优势仍在美国手中。
成本对比:Patel给出具体数据:“DeepSeek用2000块H800 GPU训练了R1,而OpenAI用数万块H100。如果美国公司能用同样效率,成本可降低10-100倍。但问题在于,美国公司目前更关注模型性能而非成本效率。”
硬件供应链:Patel强调:“NVIDIA的B100/B200 GPU将在2025年下半年量产,性能是H100的2-3倍。TSMC的3nm工艺(N3)已量产,而中国最先进的工艺是SMIC的7nm(N+2),差距约3-4代。这意味着美国在硬件上仍有2-3年领先优势。”
Nathan Lambert指出:“中国在应用层面可能更快。DeepSeek的API价格仅为OpenAI的1/10,这会让更多中国开发者使用AI,加速应用生态发展。”
分歧点:Patel认为硬件差距是关键,Lambert则认为应用生态更重要。两人都同意:中美AI竞争不是零和游戏,而是两条不同路径的竞赛。
Dylan Patel分析,DeepSeek事件不会减少算力需求,反而会加速推理计算需求增长。
机制拆解:Patel提出“杰文斯悖论(Jevons Paradox)在AI领域的应用”:“当计算成本下降时,使用量会大幅增加,最终总计算需求反而上升。DeepSeek降低了推理成本,这会刺激更多应用场景,从而增加对GPU的总需求。”
数据链:Patel给出预测:“2025年,NVIDIA的H100/B100出货量将达400-500万块,而2024年约200万块。xAI的Colossus集群已部署10万块H100,计划扩展到20万块。Stargate项目(微软与OpenAI合作)将建设100万块GPU的超级集群,投资额超1000亿美元。”
Nathan Lambert补充:“xAI的Grok模型在编程任务上表现优异,但Grok 2.0的推理成本是DeepSeek R1的5-10倍。如果xAI能优化成本,其竞争力将大幅提升。”
证伪条件:如果2025年下半年NVIDIA的B100出货量低于预期(如低于200万块),或Stargate项目延期,则算力需求增长叙事将被削弱。
Dylan Patel认为,TSMC是AI供应链中最关键的节点,其地缘政治风险被市场低估。
历史脉络:Patel回顾:“2022年佩洛西访台后,中国军演导致全球芯片供应链紧张。2023年,美国通过《芯片法案》补贴本土制造,但TSMC在亚利桑那州的工厂已延期至2025年量产。”
机制拆解:Patel解释:“全球90%以上的先进芯片(7nm以下)由TSMC生产。NVIDIA、AMD、Apple、Qualcomm都依赖TSMC。如果台海冲突爆发,全球AI芯片供应将中断6-12个月。”
数据链:TSMC 2024年资本支出约320亿美元,其中70%用于3nm/5nm工艺。2025年计划将3nm产能提升至每月10万片晶圆(2024年约5万片)。Patel指出:“TSMC的3nm良率已超过80%,而Intel的18A工艺良率仅约50%。”
Nathan Lambert补充:“地缘政治风险是投资者必须考虑的尾部风险。但短期内,TSMC的垄断地位不会改变,因为三星和Intel在先进工艺上仍有差距。”
证伪条件:如果Intel 18A工艺在2025年实现量产且良率超过70%,或三星3nm GAA工艺获得NVIDIA订单,则TSMC的垄断地位将被削弱。
| 标的 | 嘉宾态度 | 关键数据 |
|---|---|---|
| NVIDIA | 看好(长期需求增长) | 2025年H100/B100出货量预计400-500万块;股价因DeepSeek单日下跌17% |
| TSMC | 看好(垄断地位) | 2024年资本支出320亿美元;3nm良率>80%;全球90%以上先进芯片由其生产 |
| OpenAI | 风险提示(成本结构问题) | O3 Mini推理成本是DeepSeek R1的2倍;O1推理成本是R1的27倍 |
| DeepSeek | 看好(成本效率) | R1训练成本560万美元;API价格是OpenAI的1/10 |
| xAI | 中性(需优化成本) | Colossus集群10万块H100;Grok 2.0推理成本是R1的5-10倍 |
| Microsoft | 看好(Stargate项目) | Stargate投资超1000亿美元;计划建设100万块GPU集群 |
| Intel | 风险提示(技术落后) | 18A工艺良率约50%;与TSMC差距2-3年 |
1. Dylan Patel:“DeepSeek R1是AI行业的‘斯普特尼克时刻’”——R1在基准测试中与O3 Mini相当,但成本低2倍、开源权重、展示完整思维链,迫使美国公司重新思考成本效率。
2. Nathan Lambert:“DeepSeek的API价格仅为OpenAI的1/10,这会加速中国AI应用生态发展”——成本优势将刺激更多开发者和企业使用AI,形成网络效应。
3. Dylan Patel:“杰文斯悖论在AI领域成立——计算成本下降会刺激使用量增长,最终总计算需求上升”——DeepSeek降低推理成本,反而会增加对NVIDIA GPU的总需求。
4. Dylan Patel:“TSMC是AI供应链中最关键的节点,地缘政治风险被市场低估”——全球90%以上先进芯片由TSMC生产,台海冲突将导致AI芯片供应中断6-12个月。
5. Nathan Lambert:“O3 Mini High在主观体验上优于R1,但差距在缩小”——在创意写作、复杂推理等任务上,OpenAI仍领先,但DeepSeek的追赶速度超出预期。
6. Dylan Patel:“美国在硬件供应链上仍有2-3年领先优势”——NVIDIA B100/B200性能是H100的2-3倍,TSMC 3nm已量产,而中国最先进工艺是SMIC的7nm。
7. Nathan Lambert:“中美AI竞争不是零和游戏,而是两条不同路径的竞赛”——美国在基础研究和硬件上领先,中国在应用和成本效率上追赶,双方各有优势。
8. Dylan Patel:“Stargate项目投资超1000亿美元,将建设100万块GPU集群——这是人类历史上最大的计算基础设施投资”——微软与OpenAI的合作将重新定义AI算力规模,但项目延期风险存在。
DeepSeek R1 的 API 定价为每百万输出 token 约 2 美元,而 OpenAI o1 为 60 美元,差距达 27 倍。这一差距由多个因素叠加形成:
| 因素 | 影响倍数 | 说明 |
|---|---|---|
| OpenAI 的利润率 | 4-5x | OpenAI 推理毛利率超 75%,定价含高额利润 |
| 模型架构效率 | 5-7x | MLA + MOE 架构显著降低内存与计算需求 |
| 基础设施规模 | 受限 | DeepSeek 缺乏足够 GPU 容量,实际无法大规模服务 |
DeepSeek 的 Multi-Head Latent Attention (MLA) 是核心创新:
尽管模型效率极高,DeepSeek 的实际服务能力严重受限:
美国出口管制围绕三个技术维度:
| 维度 | 初始限制 | 当前限制 | H20 规格 |
|---|---|---|---|
| 浮点运算 (FLOPS) | 是 | 是 | H100 的 1/3(理论) |
| 互联带宽 | 是 | 否 | 与 H100 相同 |
| 内存带宽/容量 | 否 | 否 | 优于 H100 |
H20 在推理任务上可能优于 H100:
| 渠道 | 规模估计 | 现状 |
|---|---|---|
| 合法 H20 销售 | ~100 万颗/年 | 已取消订单 |
| 小型走私(个人携带) | 20-30 万颗/年 | 持续存在 |
| 云租赁(如 Oracle→字节跳动) | 数十万颗 | 被 AI Diffusion Rules 限制 |
| 大规模商业走私 | 受限 | 10 亿美元以上规模难以隐藏 |
| 阶段 | 2022-2023 | 2024-2025 |
|---|---|---|
| 预训练 | 主导(>90% 计算量) | 仍重要但占比下降 |
| 后训练(RL) | 微不足道 | 快速增长,可能超过预训练 |
| 推理(test-time compute) | 少量 | 大幅增长(reasoning 模型) |
DeepSeek R1 的关键突破:
| 领域 | 可验证性 | 当前进展 | 预计突破时间 |
|---|---|---|---|
| 数学 | 高 | 接近饱和 | 已接近 |
| 编程 | 高 | 快速提升 | 1-2 年 |
| 网页操作 | 中高 | 早期 | 2-3 年 |
| 机器人 | 中 | 实验室阶段 | 3-5 年 |
| 模型 | 权重 | 训练数据 | 训练代码 | 许可证 |
|---|---|---|---|---|
| DeepSeek R1 | ✅ | ❌ | ❌ | MIT(最宽松) |
| Llama 3 | ✅ | ❌ | ❌ | Llama 许可证(有使用限制) |
| OLMo (AI2) | ✅ | ✅ | ✅ | Apache 2.0 |
与开源软件不同,开源 AI 缺乏有效的社区贡献反馈循环:
Dario Amodei 的论点:
| 目标 | 效果 | 局限性 |
|---|---|---|
| 阻止前沿模型训练 | 部分成功 | DeepSeek 证明可用受限硬件训练前沿模型 |
| 限制推理部署 | 更有效 | 大规模推理需要更多 GPU,更难隐藏 |
| 维持技术代差 | 短期有效 | 长期可能刺激中国自主研发 |
| 公司 | GPU 数量 | 功率 | 地点 |
|---|---|---|---|
| xAI | 200,000 | ~280 MW | 孟菲斯 |
| Meta | 128,000 | ~180 MW | 多地 |
| OpenAI/Microsoft | 100,000 | ~140 MW | 亚利桑那 |
| Google (TPU) | 跨站点 | 更大但分散 | 爱荷华/内布拉斯加 |
| 指标 | 数据 |
|---|---|
| 宣称投资 | 5000 亿美元 |
| 第一阶段实际 | 1000 亿美元(TCO) |
| 第一阶段 Capex | 约 500 亿美元 |
| 功率 | 2.2 GW(输入)/ 1.8 GW(芯片) |
| 资金现状 | 仅 Oracle 已投入约 60 亿美元 |
"对于成功的科技,现实必须优先于公关,因为大自然不会被愚弄。"
— Richard Feynman