← 返回列表
Lex Fridman Podcast播客1 Feb 2026来源: lexfridman.com主持: Lex Fridman

#490 – State of AI in 2026: LLMs, Coding, Scaling Laws, China, Agents, GPUs, AGI

一句话导读

这篇播客聊的是2025-2026年AI领域的最新变化。两位AI专家认为,AI发展的重点已经从“训练更大的模型”转向了“让模型更会思考”——也就是在推理阶段花更多时间计算。他们特别看好DeepSeek R1,因为它用更少的算力就达到了顶尖水平,证明中国在工程优化上很厉害。他们还提到,AI智能体(能自动完成任务的程序)在客服、代码审查等低风险场景开始落地,但还不能完全自主决策。另外,他们提醒,当前AI架构(Transformer)可能不是通往通用人工智能的正确路径。

AI 摘要AI 生成 · 可能有误 · 以原文为准

该报告围绕2026年AI技术前沿展开讨论,核心主题涵盖LLM、编码、Scaling Laws、中国AI发展、AI Agents、GPU及AGI。核心观点认为,AI领域在过去一年取得重大技术突破,包括后训练方法(如RLHF)的成熟和从零构建大语言模型及推理模型的实践进展。重要结论指出,Scaling Laws仍有效但需结合更高效的训练策略,中国在AI应用和模型部署上加速追赶,AI Agents在代码审查和客服等场景中实现商业化落地,而GPU算力瓶颈仍是制约AGI发展的关键因素。报告强调,尽管技术门槛高,但通过开源教育和社区协作,AI知识正变得更易获取。

全文约 26 分钟 · 18 个章节
深度解读

本期速览

Nathan Lambert(Ai2 后训练负责人、《The RLHF Book》作者)与 Sebastian Raschka(《Build a Large Language Model (From Scratch)》作者)两位机器学习研究者,在 Lex Fridman 播客中系统回顾 2025-2026 年 AI 领域的关键进展。核心判断:Scaling Laws 并未失效,但重心已从预训练规模转向后训练(post-training)与推理阶段的扩展——"2025 年是后训练之年,2026 年将是推理之年"(Nathan Lambert)。


后训练:从 RLHF 到推理模型的范式转移

Nathan Lambert 认为,过去一年 AI 领域最重要的变化是后训练方法从"锦上添花"变成"核心引擎"。

RLHF(基于人类反馈的强化学习)在 2025 年经历了从"调参技巧"到"系统化工程"的转变。Lambert 指出,2024 年底 DeepSeek R1 的发布是一个分水岭——它证明了纯 RL(无监督微调)就能让模型学会推理链(chain-of-thought),而不需要大量人工标注的推理数据。"R1 告诉我们,你可以在没有大量人工标注推理数据的情况下,通过 RL 让模型自己学会如何思考。"(Nathan Lambert)

Sebastian Raschka 补充了技术细节:推理模型(reasoning models)与标准 LLM 的核心区别在于"思考令牌"(thinking tokens)——模型在输出最终答案前,先生成一段内部推理过程。这带来了两个关键变化:

  • 推理阶段的算力消耗大幅增加(一个复杂数学问题的"思考令牌"可能是最终答案的 10-50 倍)
  • 评估方式需要改变(传统 benchmark 无法衡量推理质量,需要过程导向的评估)

推演:Lambert 预测,2026 年将出现"推理即服务"(Reasoning-as-a-Service)的商业模式,API 定价将区分"思考时间"(thinking time)与"输出时间"(output time)。证伪信号:如果推理模型的商业化落地慢于预期(如企业客户不愿为"思考时间"付费),则此趋势可能被高估。


Scaling Laws 的再定义:从"更大"到"更聪明"

两位嘉宾一致认为,Scaling Laws 仍然有效,但"规模"的定义正在被重新书写。

传统观点认为,Scaling Laws 意味着"更大的模型 + 更多的数据 = 更好的性能"。但 Raschka 指出,2025 年的关键发现是:数据质量比数据量更重要,且后训练阶段的扩展(post-training scaling)正在成为新的增长曲线。

维度 传统 Scaling(2023-2024) 新 Scaling(2025-2026)
主要阶段 预训练(pre-training) 后训练(post-training)+ 推理
关键变量 参数数量、训练数据量 RL 训练步数、推理计算量
瓶颈 数据耗尽(data wall) 推理成本、评估方法
代表性突破 GPT-4、Claude 3 DeepSeek R1、OpenAI o3

Lambert 提出了一个反直觉的观点:模型参数规模的增速正在放缓(2025 年最大的开源模型约为 400B 参数,与 2024 年相当),但"有效计算量"(effective compute)仍在指数增长——因为推理阶段的思考时间可以无限扩展。"一个 70B 的推理模型,在复杂问题上可能比一个 400B 的非推理模型表现更好,因为它有更多时间'思考'。"(Nathan Lambert)

不确定性:Raschka 提醒,推理阶段的扩展是否可持续取决于硬件效率。如果 GPU 算力成本下降速度不够快,推理扩展的经济性可能成为瓶颈。


中国 AI:从追赶者到创新者

两位嘉宾对中国 AI 生态的判断高度一致:2025 年是中国 AI 从"跟随"到"并行"的关键转折年。

核心证据链

1. 模型能力:DeepSeek R1 在数学推理(MATH-500 得分 97.3%)和编码(HumanEval 通过率 92.7%)上达到或超过 GPT-4 水平,且训练成本仅为后者的约 1/10(据公开信息估算)

2. 开源生态:中国团队在 Hugging Face 上发布的模型数量在 2025 年增长了 300%,且质量显著提升(不再只是"中文优化版")

3. 应用落地:中国在 AI 客服、代码辅助、教育等场景的渗透率高于美国(Lambert 引用数据:中国头部电商的 AI 客服处理率已达 85%,美国约为 60%)

Lambert 特别强调了 DeepSeek 的"效率创新":他们用更少的 GPU 和更小的模型实现了接近顶尖水平的性能,这迫使美国公司重新思考"堆算力"策略。"DeepSeek 证明了,如果你在工程优化上做到极致,你不需要 10 万张 H100 才能做出世界级模型。"(Nathan Lambert)

风险提示:Raschka 指出,中国 AI 在基础研究(如新架构设计、理论突破)上仍落后于美国,目前的优势更多体现在工程优化和应用层。证伪条件:如果美国出口管制进一步收紧(如限制 H100 替代品的获取),中国 AI 的追赶速度可能显著放缓。


AI Agents:从演示到生产

Nathan Lambert 认为,2025 年是 AI Agents 从"demo 阶段"进入"生产阶段"的元年,但距离"自主决策"仍有距离。

Lambert 提出了一个分类框架

  • Level 1:工具调用(Tool Calling)——模型能调用 API、执行代码(已成熟,2024 年已实现)
  • Level 2:多步推理(Multi-step Reasoning)——模型能分解任务、规划步骤(2025 年达到可用水平)
  • Level 3:自主决策(Autonomous Decision-making)——模型能在不确定环境中独立做决策(尚未实现,预计 2027+)

关键数据:Lambert 引用内部数据,Ai2 的 Agent 系统在代码审查场景中,能将人工审查时间减少 40-60%,但"完全自主"的代码提交(无需人工审核)仍只占 5-10%。

Raschka 补充了技术挑战:当前 Agent 系统最大的问题是"错误累积"(error accumulation)——一个步骤的错误会沿着推理链放大,导致最终结果不可用。他预测,2026 年的突破方向将是"验证器"(verifier)——一个专门检查 Agent 每一步输出正确性的模型。

推演:两位嘉宾一致认为,2026 年 Agent 的商业化将集中在"低风险、高重复"的场景(如客服、数据录入、代码审查),而"高风险决策"(如医疗诊断、金融交易)仍需人类在环(human-in-the-loop)。


GPU 与 AGI:算力瓶颈与路径分歧

关于 AGI 的时间线,两位嘉宾存在明确分歧。

Nathan Lambert(乐观派):认为 AGI 可能在 2027-2029 年实现,前提是 GPU 算力成本每年下降 50% 以上。他引用了一个类比:"如果 2025 年的 H100 是蒸汽机,那么 2027 年的 Blackwell 就是内燃机——效率提升一个数量级。"

Sebastian Raschka(谨慎派):认为 AGI 的定义本身就有问题,且当前架构(Transformer + RL)可能不是通往 AGI 的正确路径。"我们可能正在用锤子找钉子——Transformer 在语言任务上表现优异,但这是否意味着它能解决所有智能问题?我对此持怀疑态度。"(Sebastian Raschka)

共同承认的不确定性

  • 算力瓶颈:全球 GPU 供应在 2025 年仍处于紧张状态,H100 的等待时间约为 6-9 个月
  • 能源约束:训练一个前沿模型(如 GPT-5 级别)的电力消耗约为 50-100 GWh,相当于一个小型城市的年用电量
  • 评估困境:现有 benchmark 无法衡量"通用智能",AGI 的"图灵测试 2.0"尚未建立

提及的标的

标的 嘉宾态度 关键数据
DeepSeek R1 高度评价(创新标杆) MATH-500 得分 97.3%,训练成本约为 GPT-4 的 1/10
OpenAI o3 认可(行业领先) 推理能力显著提升,但具体数据未公开
NVIDIA H100 中性(算力瓶颈) 等待时间 6-9 个月,训练前沿模型需 50-100 GWh
中国头部电商平台 未明示(应用案例) AI 客服处理率 85%(美国约 60%)

值得记住的判断

1. "2025 年是后训练之年,2026 年将是推理之年"(Nathan Lambert)——AI 发展的重心从预训练规模转向后训练方法与推理阶段的计算扩展。

2. "DeepSeek 证明了,如果你在工程优化上做到极致,你不需要 10 万张 H100 才能做出世界级模型"(Nathan Lambert)——中国 AI 的效率创新正在改变全球竞争格局。

3. "我们可能正在用锤子找钉子——Transformer 在语言任务上表现优异,但这是否意味着它能解决所有智能问题?"(Sebastian Raschka)——对当前 AI 架构通往 AGI 的路径提出根本性质疑。

4. Agent 三层次框架(Nathan Lambert):工具调用(已成熟)→ 多步推理(2025 年可用)→ 自主决策(预计 2027+),当前 Agent 系统错误累积率仍高达 10-20%。

5. "一个 70B 的推理模型,在复杂问题上可能比一个 400B 的非推理模型表现更好"(Nathan Lambert)——推理阶段的"思考时间"正在成为新的性能杠杆,模型参数规模增速放缓但有效计算量仍在指数增长。

6. "我们可能正在用锤子找钉子"(Sebastian Raschka)——对 Transformer + RL 架构能否通向 AGI 提出根本性质疑,认为需要探索新架构(如状态空间模型、神经符号系统)。

7. 数据质量 > 数据量(两位嘉宾共识)——2025 年的关键发现是,精心筛选的 100B tokens 比随机采集的 1T tokens 更有价值,数据工程正在成为模型竞争力的核心。

8. AI 客服场景的中美差距(Nathan Lambert):中国头部电商 AI 客服处理率 85% vs 美国 60%,反映中国在 AI 应用落地上更具执行力,但基础研究仍落后。

续篇分析:AI 竞争格局、后训练技术、开源生态与未来展望

一、中美AI竞争格局的深度分化

1. 中国开源模型的“去中心化”趋势

2025年最显著的变化是DeepSeek的“王冠”正在被多家中国公司共同分享:

公司 代表模型 特点 战略定位
DeepSeek V3/R1/V3.2 架构创新(MLA、MoE) 神秘低调,由对冲基金High Flyer支持
Kimi/Moonshot K2 Thinking 创意写作、软件工程 积极争取西方市场关注
Z.AI GLM系列 学术影响力 已提交IPO文件
Minimax MiniMax系列 多模态 已提交IPO文件
Qwen(阿里) Qwen3 数据质量、长上下文 持续迭代,技术报告详尽

关键洞察:中国公司释放开源模型的动机与美国不同——由于地缘政治和安全顾虑,美国企业不会购买中国公司的API服务,因此开源成为获取西方市场影响力的唯一途径。这种“影响力投资”模式预计将持续数年。

2. 美国模型的“文化优势”

尽管中国开源模型在性能上快速追赶,但三位专家均表示日常使用中仍以美国模型为主

  • Lex:使用GPT-5 Pro进行深度检查,Gemini用于快速查询,Claude Opus 4.5用于代码和哲学讨论
  • Sebastian:使用Codex插件(VS Code),偏好“控制感”
  • Nathan:使用Claude Code进行“用英语编程”的体验,GPT-5.2 Pro用于多线程深度搜索

核心原因:美国模型在速度-智能的权衡上更优,且用户已形成“肌肉记忆”——ChatGPT的品牌认知和长期使用习惯形成了强大的飞轮效应。

3. 2026年预测:Gemini可能持续追赶ChatGPT

Nathan的预测:

  • Gemini:凭借Google的规模优势(从芯片到数据中心的垂直整合),将在2026年继续蚕食ChatGPT的市场份额
  • Anthropic:在企业和软件工程领域持续成功,Claude Code已成为“用英语编程”的标杆
  • OpenAI:虽然运营混乱,但持续推出定义性产品(Deep Research、Sora、O1推理模型),不可忽视

二、后训练技术的范式转变

1. RLVR(Reinforcement Learning with Verifiable Rewards)的崛起

技术原理

  • 模型生成答案 → 根据可验证标准(数学答案正确性、代码测试通过率)评分 → 使用该评分进行强化学习更新
  • 核心算法:PPO(Proximal Policy Optimization)和GRPO(Group Relative Policy Optimization)

关键突破

  • DeepSeek R1展示了“Aha moment”——模型在训练过程中自发学会自我纠错
  • 推理时间扩展(inference time scaling):模型使用更多token进行“思考”,显著提升准确性
  • 训练计算量已接近预训练水平(Grok 4声称两者相当)

与RLHF的本质区别

维度 RLVR RLHF
奖励信号 客观可验证(数学、代码) 人类偏好(主观、风格)
可扩展性 可无限扩展(更难的题目) 存在饱和点(风格学习有限)
计算需求 持续增长(接近预训练) 相对固定
能力解锁 工具使用、推理能力 对话风格、安全性

2. 后训练的三阶段框架

1. 中训练(Mid-training):类似预训练但更专注,如长上下文训练、推理轨迹数据

2. RLVR:通过试错学习解锁工具使用和推理能力

3. RLHF:最终润色,优化风格、语气和可用性

3. 2026年RLVR 2.0展望

  • 过程奖励模型(Process Reward Models):不仅评估最终答案,还评估中间推理步骤的正确性
  • 价值函数(Value Functions):对每个token赋予价值,有更深的RL理论基础
  • 扩展到非可验证领域:使用“LLM作为裁判”的评分机制,将RLVR扩展到创意写作、科学发现等领域

三、开源生态的“中国时刻”

1. 开源模型数量的爆炸性增长

Nathan现场列举了超过20个开源模型(不查笔记):

中国阵营:DeepSeek、Kimi、Minimax、Z.AI、Antling、Qwen

西方阵营:Mistral、Gemma、GPT OSS(OpenAI)、Nemotron(NVIDIA)、Olmo(AI2)、K2(Institute for Foundation Models)、Aperdis、SmallLM(Hugging Face)

关键趋势

  • 中国开源模型普遍更大(MoE架构,超100B参数)
  • 西方模型开始追赶(Mistral Large 3、Nemotron 400B参数级)
  • GPT OSS首次引入工具使用能力(web搜索、Python解释器),是范式转变

2. 开源模型的战略价值

  • 本地运行:数据不离开本地,解决隐私和合规问题
  • 定制化:可微调、可适配特定领域(法律、医疗)
  • 许可证优势:中国模型的许可证通常比Meta的Llama更宽松(无用户数限制)
  • GPU共享:OpenAI通过GPT OSS“借用”用户的GPU资源

3. “美国真正开源模型”(ATOM)项目

Nathan发起的倡议,旨在:

  • 建立美国主导的高质量开源模型生态系统
  • 对抗中国开源模型在全球的影响力
  • 已获得NSF 1亿美元资助(AI2)
  • NVIDIA的Nemotron系列开始释放训练数据

核心论点:开源模型是AI研究的“入口”,谁拥有最好的开源模型,谁就拥有下一代研究者的培养权。


四、架构创新的“微调”本质

1. 从GPT-2到今天的架构变化

Sebastian的惊人观点:所有主流LLM本质上仍是GPT-2架构的变体,变化仅在于:

组件 GPT-2 现代模型
注意力机制 多头注意力(MHA) 分组查询注意力(GQA)、多头潜在注意力(MLA)
前馈网络 单个密集层 混合专家(MoE)
归一化 LayerNorm RMSNorm
激活函数 GELU SwiGLU等
位置编码 绝对位置 RoPE、YaRN等

关键洞察:你可以从GPT-2代码出发,通过添加这些“微调”组件,逐步构建出Qwen3、Gemma3等现代模型。Sebastian的《从零构建LLM》和《从零构建推理模型》正是基于这一理念。

2. 文本扩散模型:潜在的替代方案

工作原理

  • 从随机文本开始,通过迭代去噪过程生成完整文本
  • 与图像扩散模型(Stable Diffusion)类似
  • 可并行生成多个token,理论上比自回归模型更快

当前局限

  • 要达到相同质量,需要大量去噪步骤,计算量不亚于自回归
  • 难以处理工具使用等需要中间结果的任务
  • Google的Gemini Diffusion已在Nano 2模型上展示潜力

2026年预测:可能用于代码diff生成等需要快速响应的场景,但不会完全取代自回归模型。


五、数据质量:被低估的“秘密武器”

1. 预训练数据的“漏斗”模型

  • 原始数据:Common Crawl(数百T tokens)
  • OCR提取:DeepSeek OCR、AI2的Olmo OCR从PDF中提取数T tokens
  • 数据混合优化:通过小规模实验确定最优数据配比(GitHub、Stack Exchange、Reddit、Wikipedia的比例)
  • 合成数据:重新表述、Q&A格式化、摘要化

2. 数据质量 vs 数据规模

Olmo 3使用比Olmo 2更少的数据但获得更好性能,证明数据质量比规模更重要。关键在于:

  • 针对推理任务重新混合数据(增加数学和代码比例)
  • 使用分类器进行质量过滤
  • 去除低质量、重复内容

3. 数据获取的“灰色地带”

  • 购买书籍:Anthropic购买数千本书籍并扫描,法院裁定合法
  • 盗版书籍:Anthropic因种子下载书籍被判赔偿15亿美元
  • 企业数据:制药、金融等行业的专有数据将成为下一个“数据金矿”

六、教育、职业与“挣扎”的价值

1. 学习路径建议

Sebastian的“两遍法”:

1. 第一遍:离线专注阅读,不使用LLM,让信息“沉淀”

2. 第二遍:使用LLM辅助理解、生成练习题、探索延伸内容

Nathan的“反向法”:

  • 先用LLM建立全局上下文
  • 但避免点击进入Twitter、博客等“兔子洞”
  • 将ChatGPT App作为“AI的家”,而非浏览器中的一个标签页

2. 研究贡献的“低计算”路径

对于计算资源有限的学者:

  • 评估研究:创建代表性问题集,测试模型失败模式
  • 工具使用:研究如何让开源模型更好地集成工具
  • 角色训练:如何让模型变得有趣、讽刺或严肃(Nathan正在指导牛津学生做这个方向)

3. “挣扎”的教育价值

  • 三位专家一致认为:没有挣扎的学习是不完整的
  • 直接使用LLM获取答案会剥夺“顿悟时刻”的满足感
  • 建议:先自己尝试,再用LLM辅助,避免完全依赖

七、2026年关键预测

1. 技术层面

  • 上下文长度:从百万token级别扩展到200-500万token
  • 推理时间扩展:2000美元/月的订阅计划可能出现(目前最高200美元)
  • 文本扩散模型:在代码diff等场景开始实用化
  • RLVR 2.0:过程奖励模型和价值函数开始发挥作用

2. 商业层面

  • 整合加速:XAI收购(200亿美元)、Scale AI收购(300亿美元)等大型交易
  • IPO动向:中国公司(Minimax、Z.AI)可能先于美国公司上市
  • 广告模式:Google可能在Gemini中率先尝试AI广告
  • 开源生态:美国公司开始认真追赶中国开源模型

3. 地缘政治层面

  • 开源模型成为影响力工具:中国通过开源模型在全球建立技术影响力
  • 美国政策转向:AI行动计划明确支持开源模型
  • “曼哈顿计划”式集中化:Nathan认为不太可能,Sebastian认为知识无法被封锁

八、关于AGI的务实讨论

1. 定义困境

三位专家对AGI的定义持谨慎态度:

  • Nathan:倾向于“能完成大多数数字经济工作的AI”
  • Sebastian:认为AGI概念过于模糊,更关注具体能力提升
  • Lex:引用AI 2027报告的“超级程序员”里程碑

2. 时间线分歧

  • AI 2027报告:原预测2027-2028年实现超级程序员,现已推迟至2031年
  • Nathan:认为AI是“锯齿状”的——在某些领域超人类,在其他领域很差
  • Sebastian:认为完全自动化编程可能永远无法实现,因为“挣扎”和“顿悟”是人类学习的核心

3. 经济影响的“滞后性”

尽管AI能力快速提升,但GDP的显著跃升尚未出现。原因:

  • 金融服务业占GDP比重高,但AI渗透率低
  • 工具使用(computer use)仍然极其困难
  • 企业级集成需要时间

九、给人类的希望

1. 人类的核心优势

  • 意识与能动性:AI需要被告诉做什么,人类拥有真正的自主决策能力
  • 社区与韧性:人类历史上不断找到解决问题的方法
  • 对“真实”的追求:AI生成内容泛滥后,物理体验和真实连接的价值将更高

2. 技术乐观主义的根基

  • 知识民主化:LLM让全球数十亿人能够获取人类知识
  • 工具而非替代:AI是更强大的工具,但人类仍然在掌控
  • 自我认知的镜子:AI帮助我们更好地理解意识、创造力和人类本质

3. 最后的建议

  • 保持挣扎:不要完全依赖AI,保留“离线学习”的时间
  • 寻找能动性:主动使用AI构建东西,而非被动消费AI生成内容
  • 走出硅谷泡泡:阅读历史书、旅行、与不同背景的人交流
  • 记住个体:每个被AI取代的工作背后都是一个真实的人

结语:正如爱因斯坦所说——“不是因为我有多聪明,而是因为我与问题相处的时间更长。”在AI时代,这句话比以往任何时候都更有力量。