← 返回列表
Lex Fridman Podcast播客26 Jul 2022来源: lexfridman.com主持: Lex Fridman

#306 – Oriol Vinyals: Deep Learning and Artificial General Intelligence

一句话导读

这篇访谈聊的是AI怎么从只会干一件事(比如下棋、翻译)变成什么都能干的通用智能。DeepMind的研究主管Vinyals觉得,他们做的Gato模型是个好开头——它用一个大脑同时处理文字、图片和机器人动作,但能力还比不上专才。他看好Gato(参数才10亿,未来做大后可能更强)、Flamingo(把语言和视觉模块拼起来,不用每次都从头训练)和Chinchilla(用来算模型多大最划算)。他认为靠模仿学习达到人类水平“很有可能”,但想超越人类还得靠强化学习等新招。

AI 摘要AI 生成 · 可能有误 · 以原文为准

DeepMind研究总监兼深度学习负责人Oriol Vinyals在Lex Fridman播客中探讨了深度学习与通用人工智能(AGI)的发展路径。核心观点认为,当前深度学习模型(如Transformer架构)已展现出向AGI迈进的潜力,但需解决规模扩展、数据效率与推理能力等关键挑战。重要结论包括:大型语言模型通过自监督学习可掌握复杂模式,但缺乏真正的因果理解;强化学习与多模态融合是突破瓶颈的关键方向;DeepMind的Alpha系列项目(如AlphaFold、AlphaGo)证明了结构化任务中AI的超越人类表现,但通用性仍需跨领域迁移能力。Vinyals强调,未来AGI需结合神经符号方法,并警

全文约 9 分钟 · 6 个章节
深度解读

好的,这是对 Lex Fridman 播客 #306 期(嘉宾:Oriol Vinyals)文字稿的分析。

本期速览

DeepMind 研究总监兼深度学习负责人 Oriol Vinyals 与主持人探讨了从专用 AI 到通用智能(AGI)的路径。本期主线是:Gato 等通用模型标志着“开端”而非“终点”,其核心价值在于通过单一架构统一处理语言、图像与动作,但当前系统仍缺乏持续学习、长期记忆与真正的因果理解。Vinyals 认为,通过模仿学习达到人类水平的通用智能“非常可能”,但超越人类水平则需要强化学习等机制的突破,且当前模型距离“有感知”还非常遥远。

从专用到通用:Gato 与通用智能的“开端”

Vinyals 认为,Gato 的核心突破在于用单一神经网络统一处理语言、图像与动作,证明了“通用代理”的可行性,但当前性能仍低于专用模型。

  • 机制拆解:Gato 是一个基于 Transformer 的序列模型。它将所有输入(文本、图像、机器人传感器数据、游戏动作)都视为“字节序列”,并通过预测序列中的下一个字节来训练。其训练数据混合了互联网文本和 DeepMind 内部各种专用代理(如玩 Atari、导航 3D 迷宫)的“经验轨迹”。
  • 数据与规模:Gato 仅有 10 亿参数,远小于当前常见的千亿级模型。Vinyals 指出,规模是提升性能的关键,更大规模的 Gato 有望在不同任务间产生“协同效应”,从而超越专用模型。
  • 推演与验证:Vinyals 认为,Gato 证明了“通用”的可行性,但“开端”意味着仍需大量工作。未来的方向包括:1) 规模化:通过增加参数和数据量来提升性能;2) 上下文增强:用自然语言为模型提供任务背景(如“你现在要玩雅达利游戏”),帮助其更好地利用不同模态间的联系;3) 模块化:借鉴 Flamingo 模型的做法,将预训练好的语言模型(如 Chinchilla)冻结,再“嫁接”上视觉模块,从而避免每次从头训练。

元学习的进化:从分类到交互式教学

Vinyals 认为,元学习的概念已从“学会学习新物体分类”演变为“通过自然语言交互来教会模型执行任何任务”,未来将走向更丰富的交互式教学。

  • 历史脉络:2019 年,元学习主要指在少量样本下学习新的视觉分类任务。GPT-3 的“少样本学习”能力(通过自然语言提示词定义新任务)彻底改变了这一领域。Flamingo 则将这种能力扩展到了视觉-语言领域,例如通过几张图片教会模型做简单的算术。
  • 未来推演:Vinyals 展望,未来 5-10 年,我们可以通过交互式对话来“教”一个通用模型玩《星际争霸》这样的复杂游戏。模型不仅能通过提示词学习,还能主动提问(“我玩得怎么样?能教教我吗?”),并接收人类的反馈。这本质上是一种“交互式最近邻”方法:模型利用其庞大的预训练知识库,通过交互来“检索”并组合出解决新任务的方法。
  • 证伪条件:Vinyals 承认,这一愿景能否实现取决于 Transformer 架构是否足够强大。如果 Transformer 无法处理超长上下文(如整本游戏攻略),则可能需要架构上的根本性突破。

涌现能力与规模化法则

Vinyals 指出,大型语言模型在某些任务上表现出“涌现”能力(性能随规模增大而突然跃升),这给规模化研究带来了挑战,但也催生了“经验性理论”。

  • 机制拆解:对于需要多步推理的复杂任务(如数学问题),模型性能可能长期停留在随机水平,直到模型规模达到某个“阈值”后突然提升。Vinyals 认为,这可能是因为 Transformer 的“注意力”机制需要足够大的模型容量,才能学会提出“正确的问题”来引导推理过程。
  • 数据链:Vinyals 以 DeepMind 的 Chinchilla 论文为例,说明可以通过在较小规模(数亿到十亿参数)的模型上进行实验,来推导出关于最优模型大小与数据量配比的“缩放定律”,从而指导大规模训练。然而,这种“经验性理论”无法预测涌现现象,因为后者依赖于具体的任务难度。
  • 推演:Vinyals 认为,涌现现象意味着某些架构问题只能在特定规模下才能被有效研究。好消息是,对于较简单的“系统一”任务(如物体识别),缩放定律的预测效果较好,并能部分迁移到更难的“系统二”任务上。

提及的标的

标的 嘉宾态度 关键数据
Gato 看好(里程碑,但只是开端) 10 亿参数,统一处理文本、图像、动作
Flamingo 看好(模块化范例) 80 亿参数(70 亿冻结的 Chinchilla + 10 亿新增视觉模块)
Chinchilla 看好(语言模型,用于推导缩放定律) 700 亿参数
AlphaFold 看好(专用模型成功的典范) 未明示
AlphaStar 中性(作为专用模型被超越的案例) 未明示
GPT-3 中性(作为元学习范式转变的标志) 未明示

值得记住的判断

1. “Gato 不是终点,而是开端。” (Oriol Vinyals)

  • 支撑:它用单一神经网络统一处理语言、图像和动作,证明了通用代理的可行性,但性能仍低于专用模型,规模化和模块化是下一步关键。

2. “当前模型是世界的被动观察者,而非主动体验者。” (Oriol Vinyals)

  • 支撑:模型从离线数据中学习,部署后权重不再更新。它们缺乏“终身学习”的能力,其“经验”仅限于推理时的上下文窗口(约 2000 个词),远不及人类从出生开始的持续学习。

3. “元学习已从‘学会分类’进化为‘通过自然语言交互来教会模型任何任务’。” (Oriol Vinyals)

  • 支撑:GPT-3 的少样本学习能力是这一转变的标志。未来 5-10 年,我们有望通过交互式对话教会模型玩《星际争霸》等复杂游戏,模型将能主动提问并接收反馈。

4. “涌现能力是性能随规模增大而突然跃升的现象,它使规模化研究变得复杂。” (Oriol Vinyals)

  • 支撑:对于需要多步推理的任务,模型性能可能长期停滞,直到规模达到某个“阈值”才突然提升。这导致无法从小规模实验简单外推所有任务的表现。

5. “通过模仿学习达到人类水平的通用智能‘非常可能’,但超越人类需要强化学习等机制的突破。” (Oriol Vinyals)

  • 支撑:当前模型在语言等领域的模仿能力已很强,但“超越”需要定义并优化新的奖励函数,这在通用领域并不清晰。

6. “当前任何模型都远未达到‘有感知’的程度,生物学系统的复杂度高出数个数量级。” (Oriol Vinyals)

  • 支撑:Vinyals 明确表示从未认为 AlphaStar 等模型有感知。他认为,从原子层面看,生物系统的“魔法”远超当前可微分的数学函数,两者复杂度差距巨大。

7. “模块化是未来构建更大、更强模型的关键,正如软件工程中的代码复用。” (Oriol Vinyals)

  • 支撑:Flamingo 模型成功地将预训练的 Chinchilla 语言模型冻结,并“嫁接”上视觉模块,避免了从头训练。这为未来组合不同能力的模型提供了范例。

8. “人类在 AI 发展中的作用至关重要,决定了突破发生的时间顺序。” (Oriol Vinyals)

  • 支撑:不同研究者的风格(如执着于某个想法 vs. 务实解决问题)和工程细节的“天才”都会影响研究进程。Vinyals 强调,需要保护研究风格的多样性,因为像“注意力机制”这样的关键突破恰恰源于计算资源受限的环境。