这篇讲的是DeepMind的David Silver如何用强化学习让AI从零开始学会下围棋、国际象棋和打游戏。他认为,AlphaZero这种自我对弈加深度神经网络的算法,是通往通用人工智能的最靠谱路径——同一套代码不用改就能在多个领域超越人类。重点提到了AlphaGo(2016年击败李世石)、AlphaZero(同一算法打败了国际象棋和将棋的世界冠军程序),以及MuZero(不需要知道规则,自己摸索就能玩转各种游戏)。
DeepMind强化学习研究负责人David Silver在Lex Fridman播客中讨论了AlphaGo、AlphaZero、AlphaStar及MuZero等里程碑式AI项目。核心观点认为,AlphaZero是人工智能史上最重要的成就之一,其通过纯强化学习从零开始掌握围棋、国际象棋等游戏,无需人类数据或领域知识。重要结论包括:深度强化学习通过自我对弈和奖励机制,能超越人类专家水平;MuZero进一步扩展至无需环境模型即可规划。Silver强调,这些技术突破为通用人工智能奠定了基础,但谦逊地指出团队协作是关键。
David Silver 是 DeepMind 强化学习研究负责人,AlphaGo、AlphaZero 的首席研究员,AlphaStar 和 MuZero 的联合负责人。本期核心围绕深度强化学习如何从零开始掌握游戏(Go、国际象棋、将棋、Atari),并逐步走向通用人工智能。Silver 的核心判断是:强化学习问题定义本身足以涵盖智能的绝大部分内涵,而 AlphaZero 式的自我对弈+深度神经网络,是当前最接近「通用智能算法」的路径——同一套算法,不做任何修改,就能在多个完全不同领域达到超人类水平。
David Silver 认为,Go 之所以被视为 AI 不可逾越的挑战,核心在于它同时要求「直觉性位置评估」和「天文级搜索空间」,而这两者恰好是传统符号 AI 的软肋。
Silver 指出,蒙特卡洛树搜索(MCTS)是 Go 领域的第一次革命,但它很快触及天花板——而 AlphaGo 用深度学习突破了这一天花板。
Silver 认为,AlphaZero 最重要的贡献不是性能,而是证明了「从随机开始、纯靠自我对弈修正错误」这一过程可以无限逼近最优,且不依赖任何人类数据或领域知识。
Silver 将 MuZero 视为从游戏走向真实世界的关键一步:系统不再被告知游戏规则,而是通过与环境交互自行学习一个「隐式模型」,然后用这个模型进行规划。
在面对「人类生命的意义是什么」这一哲学问题时,Silver 用强化学习的层次结构给出了一个科学框架:每一层都在为更高层的目标服务,而智能本身是这一层级结构的自然产物。
| 标的 | 嘉宾态度 | 关键数据 |
|---|---|---|
| AlphaGo | 里程碑成就 | 2016 年 4:1 击败李世石;后续版本 60:0 击败其他顶尖棋手 |
| AlphaGo Zero | 更优版本 | 以 100:0 击败原版 AlphaGo;训练 40 天自主发现人类全部定式并创造新定式 |
| AlphaZero | 通用算法突破 | 同一算法击败世界最强国际象棋程序 Stockfish、将棋程序 Elmo;Magnus Carlsen 称因研究 AlphaZero 棋谱而创下个人等级分新高 |
| MuZero | 关键技术进步 | 同一算法在 Atari、Go、国际象棋、将棋上均达超人类水平;无需知道规则 |
| MoGo | 早期先驱 | 首个在 9×9 棋盘达人类大师级的 Go 程序(2006-2007) |
| Deep Blue | 历史对照 | 1997 年击败卡斯帕罗夫,但依赖手工评估函数,无法迁移到其他领域 |
1. 「Go 的直觉判断能力,正是人类能下 Go 的关键,也是计算机此前完全无法模拟的。」(Silver)——Go 的位置评估无法像象棋那样「计分」,需要从稀疏局面预判 300 步后的领土归属,这迫使 AI 必须学会类似人类的直觉。
2. 「纯深度学习(无搜索)就达到了当时最强 MCTS 系统的水平——那一刻我意识到,达到世界冠军水平已成必然。」(Silver)——2014-2015 年 AlphaGo 早期实验证明,深度神经网络可直接从局面预测落子和胜负,无需蒙特卡洛树搜索。
3. 「AlphaZero 的自我对弈过程:从随机开始,发现随机很蠢→变得比随机好一点→发现这个好一点的系统也有问题→再修正……这个过程可以无限持续。」(Silver)——这是 AlphaZero 的核心机制,也是其可证伪预测的基础:更多算力必然带来更强版本。
4. 「如果有人用更多算力运行 AlphaZero,它将 100:0 击败之前版本;几年后重复,结果相同——至少在人类有生之年不会停止。」(Silver)——一个明确的、可检验的科学预测,基于 Go 10¹⁷⁰ 的状态空间远不可及。
5. 「AlphaZero 自主发现了人类全部定式,然后开始抛弃其中一部分,创造自己的新定式——这些新定式如今已被职业棋手纳入常规训练。」(Silver)——这是「机器创造力」最直观的例证:系统不仅学会人类知识,还超越了它。
6. 「MuZero 证明了:即使没有规则,系统也能通过纯试错学会足够好的世界模型,并用它来规划。」(Silver)——同一算法在 Atari、Go、国际象棋、将棋上均达超人类水平,是强化学习走向真实世界的关键一步。
7. 「如果你没有一个明确定义的目标,你就不会得到一个明确定义的答案。」(Silver)——Silver 坚持强化学习必须有一个可度量的终极目标,即使系统内部可以有无数子目标和内在动机。
8. 「智能的多层结构:宇宙的物理定律→进化→生物体→大脑→人工系统——每一层都在为更高层的目标服务。」(Silver)——借用 Max Tegmark 的视角,Silver 将「生命的意义」重新框架化为一个层级优化问题,AI 是这一链条的最新一层。