← 返回列表
Lex Fridman Podcast播客3 Apr 2020来源: lexfridman.com主持: Lex Fridman

#86 – David Silver: AlphaGo, AlphaZero, and Deep Reinforcement Learning

一句话导读

这篇讲的是DeepMind的David Silver如何用强化学习让AI从零开始学会下围棋、国际象棋和打游戏。他认为,AlphaZero这种自我对弈加深度神经网络的算法,是通往通用人工智能的最靠谱路径——同一套代码不用改就能在多个领域超越人类。重点提到了AlphaGo(2016年击败李世石)、AlphaZero(同一算法打败了国际象棋和将棋的世界冠军程序),以及MuZero(不需要知道规则,自己摸索就能玩转各种游戏)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

DeepMind强化学习研究负责人David Silver在Lex Fridman播客中讨论了AlphaGo、AlphaZero、AlphaStar及MuZero等里程碑式AI项目。核心观点认为,AlphaZero是人工智能史上最重要的成就之一,其通过纯强化学习从零开始掌握围棋、国际象棋等游戏,无需人类数据或领域知识。重要结论包括:深度强化学习通过自我对弈和奖励机制,能超越人类专家水平;MuZero进一步扩展至无需环境模型即可规划。Silver强调,这些技术突破为通用人工智能奠定了基础,但谦逊地指出团队协作是关键。

全文约 11 分钟 · 8 个章节
深度解读

本期速览

David Silver 是 DeepMind 强化学习研究负责人,AlphaGo、AlphaZero 的首席研究员,AlphaStar 和 MuZero 的联合负责人。本期核心围绕深度强化学习如何从零开始掌握游戏(Go、国际象棋、将棋、Atari),并逐步走向通用人工智能。Silver 的核心判断是:强化学习问题定义本身足以涵盖智能的绝大部分内涵,而 AlphaZero 式的自我对弈+深度神经网络,是当前最接近「通用智能算法」的路径——同一套算法,不做任何修改,就能在多个完全不同领域达到超人类水平。


主题一:Go 为何是 AI 的「终极试金石」——直觉与搜索的双重困境

David Silver 认为,Go 之所以被视为 AI 不可逾越的挑战,核心在于它同时要求「直觉性位置评估」和「天文级搜索空间」,而这两者恰好是传统符号 AI 的软肋。

  • 规则极简,复杂度极高:Go 在 19×19 棋盘上落子,规则简单到「如果外星人存在,我们可能无法交流,但能一起下 Go」。但状态空间达 10¹⁷⁰,远超宇宙原子数(约 10⁸⁰)。
  • 位置评估无法靠「计分」:与象棋不同,Go 没有棋子分值。双方落子数几乎相等,胜负取决于「哪块地盘最终属于谁」——这需要从稀疏的 20-30 颗棋子中预判 300 步后的结果。Silver 指出:「这种直觉判断能力,正是人类能下 Go 的关键,也是计算机此前完全无法模拟的。」
  • 历史对照:1990 年代,启发式搜索攻克了象棋(Deep Blue)、西洋跳棋、黑白棋等,但到 2000 年,最强 Go 程序仍被 9 岁小孩让 9 子击败,而计算机 Go 专家本人可让 29 子战胜同一程序。Silver 回忆:「当时人们深信,攻克 Go 意味着攻克了某种类似人类直觉的东西——而这正是 AI 的圣杯。」

主题二:从 MoGo 到 AlphaGo——蒙特卡洛树搜索的突破与天花板

Silver 指出,蒙特卡洛树搜索(MCTS)是 Go 领域的第一次革命,但它很快触及天花板——而 AlphaGo 用深度学习突破了这一天花板。

  • MCTS 的核心思想:不靠人类知识评估局面,而是让系统从当前局面开始「随机下完」多次,取胜率平均值作为评估值。Silver 评价:「随机下棋居然能给出有用信息,这本身就很神奇——它暗示了随机性在理解搜索树结构中的根本作用。」
  • MoGo 的成就与局限:基于 MCTS 的 MoGo 首次在 9×9 小棋盘上达到人类大师级水平,但在 19×19 全棋盘上,无论投入多少算力,始终无法突破业余高段(amateur dan level),离职业棋手甚远。
  • AlphaGo 的突破:2014-2015 年,Silver 团队用深度神经网络直接学习「从局面预测最佳落子」和「从局面预测胜负」,纯深度学习(无搜索)就达到了当时最强 MCTS 系统的水平。Silver 回忆:「我们内部打了个赌——赌纯深度学习能否击败业余高段棋手。结果系统赢了。那一刻我意识到,达到世界冠军水平已成必然。」

主题三:自我对弈的魔力——AlphaZero 如何从零开始超越人类千年知识

Silver 认为,AlphaZero 最重要的贡献不是性能,而是证明了「从随机开始、纯靠自我对弈修正错误」这一过程可以无限逼近最优,且不依赖任何人类数据或领域知识。

  • 从 AlphaGo 到 AlphaZero 的动机:AlphaGo 仍依赖人类棋谱预训练,这带来了「幻觉」(delusion)——系统在某些局面下会持续误判。Silver 的逻辑是:「唯一能彻底消除错误的方法,是让系统自己纠正自己的错误。而如果这个逻辑从随机起点开始也成立,那就不需要任何人类数据。」
  • 自我对弈的机制:系统从完全随机落子开始,通过「尝试→看到结果→修正」的循环,逐步提升。Silver 描述:「它先发现随机很蠢,于是变得比随机好一点;然后发现这个好一点的系统也有问题,再修正……这个过程可以无限持续。」
  • 可证伪的预测:Silver 给出了一个明确的科学预测:「如果有人用比我们更多的算力运行 AlphaZero 算法,它将以 100:0 击败之前的版本;几年后重复这一过程,结果相同——至少在人类有生之年,这一过程不会停止。」他补充道,Go 的状态空间(10¹⁷⁰)决定了理论天花板远不可及。
  • 与人类知识的共鸣:训练过程中,AlphaZero 自主发现了人类花了数千年积累的全部「定式」(joseki),然后开始抛弃其中一部分,创造自己的新定式——这些新定式如今已被职业棋手纳入常规训练。

主题四:MuZero——当规则不再被给予

Silver 将 MuZero 视为从游戏走向真实世界的关键一步:系统不再被告知游戏规则,而是通过与环境交互自行学习一个「隐式模型」,然后用这个模型进行规划。

  • 核心创新:AlphaZero 需要知道游戏规则(如「落子后棋盘如何变化」),而 MuZero 完全不知道规则。它只接收原始像素输入(如 Atari 游戏画面),通过试错自行学习「如果我做这个动作,接下来会发生什么」。
  • 性能验证:同一套 MuZero 算法,不做任何修改,同时在 Atari 游戏、Go、国际象棋、将棋上达到或超越 AlphaZero 的水平。Silver 强调:「这证明了即使没有规则,系统也能通过纯试错学会足够好的世界模型,并用它来规划。」
  • 现实意义:真实世界没有「规则说明书」。MuZero 的思路——从交互中自行学习环境动态——是强化学习走向机器人、自动驾驶等真实场景的必要条件。

主题五:智能的多层结构与「意义」问题

在面对「人类生命的意义是什么」这一哲学问题时,Silver 用强化学习的层次结构给出了一个科学框架:每一层都在为更高层的目标服务,而智能本身是这一层级结构的自然产物。

  • 从宇宙到智能的层级:Silver 借用物理学家 Max Tegmark 的视角,提出一个层级链:宇宙的物理定律(熵增)→ 进化(高效耗散能量的机制)→ 生物体(最大化繁殖成功率)→ 大脑(灵活学习与决策)→ 人工系统(超越人类自身能力的工具)。
  • 对「单一奖励函数」的坚持:Silver 强调,尽管系统内部可以有无数子目标和内在动机,但必须有一个可度量的终极目标,否则问题本身就没有被定义。「如果你没有一个明确定义的目标,你就不会得到一个明确定义的答案。」
  • AI 作为新层级:Silver 指出,他当初想「造一个比我下得更好的 Go 程序」,本质上就是在创造一个新层级——这个层级能比人类更有效地实现「下好 Go」这一目标。未来,AI 系统自身也可能产生子目标,形成更深的层级。

提及的标的

标的 嘉宾态度 关键数据
AlphaGo 里程碑成就 2016 年 4:1 击败李世石;后续版本 60:0 击败其他顶尖棋手
AlphaGo Zero 更优版本 以 100:0 击败原版 AlphaGo;训练 40 天自主发现人类全部定式并创造新定式
AlphaZero 通用算法突破 同一算法击败世界最强国际象棋程序 Stockfish、将棋程序 Elmo;Magnus Carlsen 称因研究 AlphaZero 棋谱而创下个人等级分新高
MuZero 关键技术进步 同一算法在 Atari、Go、国际象棋、将棋上均达超人类水平;无需知道规则
MoGo 早期先驱 首个在 9×9 棋盘达人类大师级的 Go 程序(2006-2007)
Deep Blue 历史对照 1997 年击败卡斯帕罗夫,但依赖手工评估函数,无法迁移到其他领域

值得记住的判断

1. 「Go 的直觉判断能力,正是人类能下 Go 的关键,也是计算机此前完全无法模拟的。」(Silver)——Go 的位置评估无法像象棋那样「计分」,需要从稀疏局面预判 300 步后的领土归属,这迫使 AI 必须学会类似人类的直觉。

2. 「纯深度学习(无搜索)就达到了当时最强 MCTS 系统的水平——那一刻我意识到,达到世界冠军水平已成必然。」(Silver)——2014-2015 年 AlphaGo 早期实验证明,深度神经网络可直接从局面预测落子和胜负,无需蒙特卡洛树搜索。

3. 「AlphaZero 的自我对弈过程:从随机开始,发现随机很蠢→变得比随机好一点→发现这个好一点的系统也有问题→再修正……这个过程可以无限持续。」(Silver)——这是 AlphaZero 的核心机制,也是其可证伪预测的基础:更多算力必然带来更强版本。

4. 「如果有人用更多算力运行 AlphaZero,它将 100:0 击败之前版本;几年后重复,结果相同——至少在人类有生之年不会停止。」(Silver)——一个明确的、可检验的科学预测,基于 Go 10¹⁷⁰ 的状态空间远不可及。

5. 「AlphaZero 自主发现了人类全部定式,然后开始抛弃其中一部分,创造自己的新定式——这些新定式如今已被职业棋手纳入常规训练。」(Silver)——这是「机器创造力」最直观的例证:系统不仅学会人类知识,还超越了它。

6. 「MuZero 证明了:即使没有规则,系统也能通过纯试错学会足够好的世界模型,并用它来规划。」(Silver)——同一算法在 Atari、Go、国际象棋、将棋上均达超人类水平,是强化学习走向真实世界的关键一步。

7. 「如果你没有一个明确定义的目标,你就不会得到一个明确定义的答案。」(Silver)——Silver 坚持强化学习必须有一个可度量的终极目标,即使系统内部可以有无数子目标和内在动机。

8. 「智能的多层结构:宇宙的物理定律→进化→生物体→大脑→人工系统——每一层都在为更高层的目标服务。」(Silver)——借用 Max Tegmark 的视角,Silver 将「生命的意义」重新框架化为一个层级优化问题,AI 是这一链条的最新一层。