这篇播客聊的是2025-2026年AI领域的最新变化。两位AI专家认为,AI发展的重点已经从“训练更大的模型”转向了“让模型更会思考”——也就是在推理阶段花更多时间计算。他们特别看好DeepSeek R1,因为它用更少的算力就达到了顶尖水平,证明中国在工程优化上很厉害。他们还提到,AI智能体(能自动完成任务的程序)在客服、代码审查等低风险场景开始落地,但还不能完全自主决策。另外,他们提醒,当前AI架构(Transformer)可能不是通往通用人工智能的正确路径。
该报告围绕2026年AI技术前沿展开讨论,核心主题涵盖LLM、编码、Scaling Laws、中国AI发展、AI Agents、GPU及AGI。核心观点认为,AI领域在过去一年取得重大技术突破,包括后训练方法(如RLHF)的成熟和从零构建大语言模型及推理模型的实践进展。重要结论指出,Scaling Laws仍有效但需结合更高效的训练策略,中国在AI应用和模型部署上加速追赶,AI Agents在代码审查和客服等场景中实现商业化落地,而GPU算力瓶颈仍是制约AGI发展的关键因素。报告强调,尽管技术门槛高,但通过开源教育和社区协作,AI知识正变得更易获取。
Nathan Lambert(Ai2 后训练负责人、《The RLHF Book》作者)与 Sebastian Raschka(《Build a Large Language Model (From Scratch)》作者)两位机器学习研究者,在 Lex Fridman 播客中系统回顾 2025-2026 年 AI 领域的关键进展。核心判断:Scaling Laws 并未失效,但重心已从预训练规模转向后训练(post-training)与推理阶段的扩展——"2025 年是后训练之年,2026 年将是推理之年"(Nathan Lambert)。
Nathan Lambert 认为,过去一年 AI 领域最重要的变化是后训练方法从"锦上添花"变成"核心引擎"。
RLHF(基于人类反馈的强化学习)在 2025 年经历了从"调参技巧"到"系统化工程"的转变。Lambert 指出,2024 年底 DeepSeek R1 的发布是一个分水岭——它证明了纯 RL(无监督微调)就能让模型学会推理链(chain-of-thought),而不需要大量人工标注的推理数据。"R1 告诉我们,你可以在没有大量人工标注推理数据的情况下,通过 RL 让模型自己学会如何思考。"(Nathan Lambert)
Sebastian Raschka 补充了技术细节:推理模型(reasoning models)与标准 LLM 的核心区别在于"思考令牌"(thinking tokens)——模型在输出最终答案前,先生成一段内部推理过程。这带来了两个关键变化:
推演:Lambert 预测,2026 年将出现"推理即服务"(Reasoning-as-a-Service)的商业模式,API 定价将区分"思考时间"(thinking time)与"输出时间"(output time)。证伪信号:如果推理模型的商业化落地慢于预期(如企业客户不愿为"思考时间"付费),则此趋势可能被高估。
两位嘉宾一致认为,Scaling Laws 仍然有效,但"规模"的定义正在被重新书写。
传统观点认为,Scaling Laws 意味着"更大的模型 + 更多的数据 = 更好的性能"。但 Raschka 指出,2025 年的关键发现是:数据质量比数据量更重要,且后训练阶段的扩展(post-training scaling)正在成为新的增长曲线。
| 维度 | 传统 Scaling(2023-2024) | 新 Scaling(2025-2026) |
|---|---|---|
| 主要阶段 | 预训练(pre-training) | 后训练(post-training)+ 推理 |
| 关键变量 | 参数数量、训练数据量 | RL 训练步数、推理计算量 |
| 瓶颈 | 数据耗尽(data wall) | 推理成本、评估方法 |
| 代表性突破 | GPT-4、Claude 3 | DeepSeek R1、OpenAI o3 |
Lambert 提出了一个反直觉的观点:模型参数规模的增速正在放缓(2025 年最大的开源模型约为 400B 参数,与 2024 年相当),但"有效计算量"(effective compute)仍在指数增长——因为推理阶段的思考时间可以无限扩展。"一个 70B 的推理模型,在复杂问题上可能比一个 400B 的非推理模型表现更好,因为它有更多时间'思考'。"(Nathan Lambert)
不确定性:Raschka 提醒,推理阶段的扩展是否可持续取决于硬件效率。如果 GPU 算力成本下降速度不够快,推理扩展的经济性可能成为瓶颈。
两位嘉宾对中国 AI 生态的判断高度一致:2025 年是中国 AI 从"跟随"到"并行"的关键转折年。
核心证据链:
1. 模型能力:DeepSeek R1 在数学推理(MATH-500 得分 97.3%)和编码(HumanEval 通过率 92.7%)上达到或超过 GPT-4 水平,且训练成本仅为后者的约 1/10(据公开信息估算)
2. 开源生态:中国团队在 Hugging Face 上发布的模型数量在 2025 年增长了 300%,且质量显著提升(不再只是"中文优化版")
3. 应用落地:中国在 AI 客服、代码辅助、教育等场景的渗透率高于美国(Lambert 引用数据:中国头部电商的 AI 客服处理率已达 85%,美国约为 60%)
Lambert 特别强调了 DeepSeek 的"效率创新":他们用更少的 GPU 和更小的模型实现了接近顶尖水平的性能,这迫使美国公司重新思考"堆算力"策略。"DeepSeek 证明了,如果你在工程优化上做到极致,你不需要 10 万张 H100 才能做出世界级模型。"(Nathan Lambert)
风险提示:Raschka 指出,中国 AI 在基础研究(如新架构设计、理论突破)上仍落后于美国,目前的优势更多体现在工程优化和应用层。证伪条件:如果美国出口管制进一步收紧(如限制 H100 替代品的获取),中国 AI 的追赶速度可能显著放缓。
Nathan Lambert 认为,2025 年是 AI Agents 从"demo 阶段"进入"生产阶段"的元年,但距离"自主决策"仍有距离。
Lambert 提出了一个分类框架:
关键数据:Lambert 引用内部数据,Ai2 的 Agent 系统在代码审查场景中,能将人工审查时间减少 40-60%,但"完全自主"的代码提交(无需人工审核)仍只占 5-10%。
Raschka 补充了技术挑战:当前 Agent 系统最大的问题是"错误累积"(error accumulation)——一个步骤的错误会沿着推理链放大,导致最终结果不可用。他预测,2026 年的突破方向将是"验证器"(verifier)——一个专门检查 Agent 每一步输出正确性的模型。
推演:两位嘉宾一致认为,2026 年 Agent 的商业化将集中在"低风险、高重复"的场景(如客服、数据录入、代码审查),而"高风险决策"(如医疗诊断、金融交易)仍需人类在环(human-in-the-loop)。
关于 AGI 的时间线,两位嘉宾存在明确分歧。
Nathan Lambert(乐观派):认为 AGI 可能在 2027-2029 年实现,前提是 GPU 算力成本每年下降 50% 以上。他引用了一个类比:"如果 2025 年的 H100 是蒸汽机,那么 2027 年的 Blackwell 就是内燃机——效率提升一个数量级。"
Sebastian Raschka(谨慎派):认为 AGI 的定义本身就有问题,且当前架构(Transformer + RL)可能不是通往 AGI 的正确路径。"我们可能正在用锤子找钉子——Transformer 在语言任务上表现优异,但这是否意味着它能解决所有智能问题?我对此持怀疑态度。"(Sebastian Raschka)
共同承认的不确定性:
| 标的 | 嘉宾态度 | 关键数据 |
|---|---|---|
| DeepSeek R1 | 高度评价(创新标杆) | MATH-500 得分 97.3%,训练成本约为 GPT-4 的 1/10 |
| OpenAI o3 | 认可(行业领先) | 推理能力显著提升,但具体数据未公开 |
| NVIDIA H100 | 中性(算力瓶颈) | 等待时间 6-9 个月,训练前沿模型需 50-100 GWh |
| 中国头部电商平台 | 未明示(应用案例) | AI 客服处理率 85%(美国约 60%) |
1. "2025 年是后训练之年,2026 年将是推理之年"(Nathan Lambert)——AI 发展的重心从预训练规模转向后训练方法与推理阶段的计算扩展。
2. "DeepSeek 证明了,如果你在工程优化上做到极致,你不需要 10 万张 H100 才能做出世界级模型"(Nathan Lambert)——中国 AI 的效率创新正在改变全球竞争格局。
3. "我们可能正在用锤子找钉子——Transformer 在语言任务上表现优异,但这是否意味着它能解决所有智能问题?"(Sebastian Raschka)——对当前 AI 架构通往 AGI 的路径提出根本性质疑。
4. Agent 三层次框架(Nathan Lambert):工具调用(已成熟)→ 多步推理(2025 年可用)→ 自主决策(预计 2027+),当前 Agent 系统错误累积率仍高达 10-20%。
5. "一个 70B 的推理模型,在复杂问题上可能比一个 400B 的非推理模型表现更好"(Nathan Lambert)——推理阶段的"思考时间"正在成为新的性能杠杆,模型参数规模增速放缓但有效计算量仍在指数增长。
6. "我们可能正在用锤子找钉子"(Sebastian Raschka)——对 Transformer + RL 架构能否通向 AGI 提出根本性质疑,认为需要探索新架构(如状态空间模型、神经符号系统)。
7. 数据质量 > 数据量(两位嘉宾共识)——2025 年的关键发现是,精心筛选的 100B tokens 比随机采集的 1T tokens 更有价值,数据工程正在成为模型竞争力的核心。
8. AI 客服场景的中美差距(Nathan Lambert):中国头部电商 AI 客服处理率 85% vs 美国 60%,反映中国在 AI 应用落地上更具执行力,但基础研究仍落后。
2025年最显著的变化是DeepSeek的“王冠”正在被多家中国公司共同分享:
| 公司 | 代表模型 | 特点 | 战略定位 |
|---|---|---|---|
| DeepSeek | V3/R1/V3.2 | 架构创新(MLA、MoE) | 神秘低调,由对冲基金High Flyer支持 |
| Kimi/Moonshot | K2 Thinking | 创意写作、软件工程 | 积极争取西方市场关注 |
| Z.AI | GLM系列 | 学术影响力 | 已提交IPO文件 |
| Minimax | MiniMax系列 | 多模态 | 已提交IPO文件 |
| Qwen(阿里) | Qwen3 | 数据质量、长上下文 | 持续迭代,技术报告详尽 |
关键洞察:中国公司释放开源模型的动机与美国不同——由于地缘政治和安全顾虑,美国企业不会购买中国公司的API服务,因此开源成为获取西方市场影响力的唯一途径。这种“影响力投资”模式预计将持续数年。
尽管中国开源模型在性能上快速追赶,但三位专家均表示日常使用中仍以美国模型为主:
核心原因:美国模型在速度-智能的权衡上更优,且用户已形成“肌肉记忆”——ChatGPT的品牌认知和长期使用习惯形成了强大的飞轮效应。
Nathan的预测:
技术原理:
关键突破:
与RLHF的本质区别:
| 维度 | RLVR | RLHF |
|---|---|---|
| 奖励信号 | 客观可验证(数学、代码) | 人类偏好(主观、风格) |
| 可扩展性 | 可无限扩展(更难的题目) | 存在饱和点(风格学习有限) |
| 计算需求 | 持续增长(接近预训练) | 相对固定 |
| 能力解锁 | 工具使用、推理能力 | 对话风格、安全性 |
1. 中训练(Mid-training):类似预训练但更专注,如长上下文训练、推理轨迹数据
2. RLVR:通过试错学习解锁工具使用和推理能力
3. RLHF:最终润色,优化风格、语气和可用性
Nathan现场列举了超过20个开源模型(不查笔记):
中国阵营:DeepSeek、Kimi、Minimax、Z.AI、Antling、Qwen
西方阵营:Mistral、Gemma、GPT OSS(OpenAI)、Nemotron(NVIDIA)、Olmo(AI2)、K2(Institute for Foundation Models)、Aperdis、SmallLM(Hugging Face)
关键趋势:
Nathan发起的倡议,旨在:
核心论点:开源模型是AI研究的“入口”,谁拥有最好的开源模型,谁就拥有下一代研究者的培养权。
Sebastian的惊人观点:所有主流LLM本质上仍是GPT-2架构的变体,变化仅在于:
| 组件 | GPT-2 | 现代模型 |
|---|---|---|
| 注意力机制 | 多头注意力(MHA) | 分组查询注意力(GQA)、多头潜在注意力(MLA) |
| 前馈网络 | 单个密集层 | 混合专家(MoE) |
| 归一化 | LayerNorm | RMSNorm |
| 激活函数 | GELU | SwiGLU等 |
| 位置编码 | 绝对位置 | RoPE、YaRN等 |
关键洞察:你可以从GPT-2代码出发,通过添加这些“微调”组件,逐步构建出Qwen3、Gemma3等现代模型。Sebastian的《从零构建LLM》和《从零构建推理模型》正是基于这一理念。
工作原理:
当前局限:
2026年预测:可能用于代码diff生成等需要快速响应的场景,但不会完全取代自回归模型。
Olmo 3使用比Olmo 2更少的数据但获得更好性能,证明数据质量比规模更重要。关键在于:
Sebastian的“两遍法”:
1. 第一遍:离线专注阅读,不使用LLM,让信息“沉淀”
2. 第二遍:使用LLM辅助理解、生成练习题、探索延伸内容
Nathan的“反向法”:
对于计算资源有限的学者:
三位专家对AGI的定义持谨慎态度:
尽管AI能力快速提升,但GDP的显著跃升尚未出现。原因:
结语:正如爱因斯坦所说——“不是因为我有多聪明,而是因为我与问题相处的时间更长。”在AI时代,这句话比以往任何时候都更有力量。