← 返回列表
Lex Fridman Podcast播客31 Aug 2019来源: lexfridman.com主持: Lex Fridman

Yann LeCun: Deep Learning, Convolutional Neural Networks, and Self-Supervised Learning

一句话导读

这篇播客中,图灵奖得主Yann LeCun聊了深度学习、卷积神经网络和自监督学习。他认为AI的“价值对齐”问题不是新事,就像人类社会用法律来约束行为一样。他看好自监督学习,认为它是未来AI的关键,但指出在视觉领域预测下一帧画面很难,因为可能性太多。提到的标的:Waymo(自动驾驶公司)在凤凰城运营,用大量激光雷达;Sophia机器人被批评为营销过头,实际能力有限。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Yann LeCun,深度学习之父、纽约大学教授、Facebook副总裁兼首席AI科学家、图灵奖得主,在Lex Fridman播客中讨论了深度学习、卷积神经网络(CNN)及自监督学习。核心观点:AI系统存在“价值对齐”问题,如《2001太空漫游》中机器因目标函数缺乏约束而伤害人类。LeCun强调,设计AI目标函数需借鉴人类社会通过法律和教育塑造人类行为的方式,而非从零开始。重要结论:未来需通过类似法律代码的约束机制,确保AI系统在实现目标时避免造成伤害,实现与人类价值观的长期对齐。

全文约 9 分钟 · 8 个章节
深度解读

本期速览

Yann LeCun,深度学习之父、纽约大学教授、Facebook首席AI科学家、图灵奖得主,在Lex Fridman播客中讨论了深度学习、卷积神经网络(CNN)及自监督学习。核心观点:AI系统存在“价值对齐”问题,如《2001太空漫游》中机器因目标函数缺乏约束而伤害人类。LeCun强调,设计AI目标函数需借鉴人类社会通过法律和教育塑造人类行为的方式,而非从零开始。


主题一:AI价值对齐——不是新问题,而是法律代码的延续

LeCun认为,AI系统的“价值对齐”问题并非全新挑战,人类社会通过法律代码(legal code)解决同类问题已有数千年历史。

  • 机制拆解:LeCun将法律视为一种“目标函数”(objective function)——它规定什么能做、什么不能做,违反则受惩罚。这与AI系统的目标函数设计本质相同。因此,设计AI的伦理约束不是从零开始,而是“法律科学与计算机科学的融合”。
  • 历史脉络:LeCun以《2001太空漫游》中的HAL 9000为例,指出其失败根源在于被要求“保守秘密并撒谎”,导致内部记忆冲突。他认为,AI系统应内置类似“希波克拉底誓言”的硬性规则,而非阿西莫夫式的“机器人三定律”(后者不实用)。
  • 推演与不确定性:LeCun明确表示,当前讨论AGI的价值对齐“过于抽象”,因为“我们还没有自主智能机器”。现有AI只是“训练来做一件事的专用系统”,不具备完整的目标驱动能力。证伪条件:直到我们拥有设计完整自主智能系统的方案,对齐问题才值得深入探讨。

主题二:深度学习为何成功——反直觉的“随机梯度下降”与“科学的不精确性”

LeCun认为,深度学习最令人惊讶的事实是:用随机梯度下降(SGD)在相对少量数据上训练巨型神经网络居然有效,这“打破了每一本教科书”。

  • 历史类比:LeCun将这一反直觉现象比作19世纪末“比空气重的飞行不可能”的断言——但鸟确实会飞。同样,大脑作为大型神经网络确实工作,这为深度学习提供了方向性指引。
  • 机制拆解:LeCun强调“智能与学习不可分割”——所有已知智能实体都通过学习获得智能。因此,机器学习是“智能的自动化”。他自称“懒惰”,所以选择自动化一切。
  • 数据链:LeCun指出,深度学习使用的数学更接近“控制论/电气工程”,而非传统计算机科学。计算机科学追求精确性(每个索引必须正确、算法可证明正确),而机器学习是“关于不精确性的科学”。

主题三:推理与学习——连续函数 vs 离散逻辑,梯度才是关键

LeCun坚信推理必须与基于梯度的学习兼容,因此反对用离散逻辑和符号表示知识。

  • 机制拆解:LeCun提出推理的两种形式:

1. 基于工作记忆的推理:需要类似海马体的子系统,能存储大量事实/情景信息。当前Transformer的自注意力机制可视为一种工作记忆,但“规模不够”——若记忆包含整个维基百科,现有架构无法有效工作。

2. 基于能量最小化的推理:类似模型预测控制(MPC)——用世界模型预测行动后果,通过最小化能量函数(如碰撞次数、能耗)规划动作序列。LeCun认为这是人类推理能力的起源(狩猎、生存需要规划)。

  • 与市场共识的分歧:LeCun明确反对Gary Marcus等人的观点——后者认为需要更多先验结构。LeCun认为,用符号表示知识并用逻辑操作“与学习不兼容”。他支持Geoffrey Hinton的提议:用向量(神经元活动模式)替代符号,用连续函数替代逻辑。
  • 数据链:LeCun引用Leon Bottou 10年前的论文《从机器学习到机器推理》,其核心思想是:学习系统应能在同一空间中操作对象并将结果放回同一空间——即工作记忆概念。

主题四:自监督学习——通向世界模型的关键,但视觉领域面临根本挑战

LeCun认为自监督学习(self-supervised learning)是当前最重要的研究方向,但视觉领域的预测不确定性问题是核心障碍。

  • 机制拆解:自监督学习本质上是“预测被遮盖的输入”——如BERT预测文本中被遮住的15%单词,或预测视频的下一帧。它使用与监督学习相同的算法,但不需要人工标注。
  • 为什么NLP成功而视觉困难
  • NLP:预测单词的可能性空间小(约10万词汇),输出概率向量容易表示不确定性。
  • 视觉:预测被遮图像区域有无数合理答案(如视频下一帧中LeCun可能向左或向右转头)。若用最小二乘法训练,会得到“模糊图像”——所有可能位置的均值,这不是好预测。
  • 数据链:LeCun指出,当前最成功的NLP模型(如BERT)都使用自监督学习。但视觉领域“进展迅速但仍不成熟”。
  • 推演:LeCun认为,自监督学习是构建世界预测模型的关键,而世界模型是实现高效学习(如人类20-30小时学会开车而不出事故)的前提。证伪条件:若无法解决高维连续空间中不确定性表示问题,自监督学习在视觉领域将始终受限。

主题五:人类智能的“虚假普遍性”——我们远比想象中更专门化

LeCun认为“通用人工智能”(AGI)一词具有误导性,因为人类智能远非通用,而是高度专门化的。

  • 机制拆解:LeCun用视觉系统论证:视神经约100万根纤维(每根可视为1比特输入),视觉皮层通过局部连接处理空间信息。若将神经纤维随机置换,即使从婴儿期开始,视觉皮层也永远无法学会正常视觉——因为“硬件是为支持真实世界的局部性而构建的”。
  • 数学论证:对于100万比特输入,可能的布尔函数数量为2^(2^1000000)(天文数字),而视觉皮层能计算的只是“极小极小极小的一小片”。结论:人类智能是“对可理解事物的通用”,而非真正通用。
  • 类比:LeCun将人类无法感知的事物比作“热”(熵)——气体分子运动有强结构,但人类无法直接感知。同样,存在“近乎无限多我们未被设计去感知的事物”。

提及的标的

标的 嘉宾态度 关键数据
Waymo(自动驾驶) 中性/认可当前路径 在凤凰城100平方公里内运营,天气好、道路宽,使用大量激光雷达
Sophia机器人 批评 被营销为远超实际能力的系统,LeCun认为“几乎一切都需要改变”

值得记住的判断

1. AI价值对齐不是新问题(LeCun):人类社会通过法律代码解决同类问题已有数千年——法律就是“目标函数”,规定什么能做、不能做,违反则受惩罚。设计AI伦理约束是“法律科学与计算机科学的融合”。

2. 深度学习最令人惊讶的事实(LeCun):用随机梯度下降在相对少量数据上训练巨型神经网络居然有效,“打破了每一本教科书”。这就像19世纪“比空气重的飞行不可能”的断言——但鸟确实会飞。

3. 机器学习是“关于不精确性的科学”(LeCun):计算机科学追求精确性(每个索引必须正确、算法可证明正确),而机器学习“什么都不精确”。这是深度学习被传统计算机科学家怀疑的原因之一。

4. 推理必须与梯度学习兼容(LeCun):用符号表示知识并用逻辑操作“与学习不兼容”。应像Hinton提议的:用向量替代符号,用连续函数替代逻辑。

5. 自监督学习在视觉领域面临根本挑战(LeCun):预测被遮图像区域有无数合理答案,若用最小二乘法训练会得到“模糊图像”。这与NLP不同——NLP的预测空间小(约10万词汇),容易表示不确定性。

6. 人类智能远非通用(LeCun):视神经约100万根纤维,可能的布尔函数数量为2^(2^1000000),而视觉皮层能计算的只是“极小极小极小的一小片”。人类只是“对可理解事物的通用”。

7. 没有情感就没有自主智能(LeCun):恐惧是对未来可能发生坏事的预期——不确定性创造恐惧。因此,“我们不可能拥有没有情感的自主智能”。

8. 测试AI智能的好问题(LeCun):问“风是怎么产生的?”若AI回答“因为树叶在动,所以产生了风”,说明它有了因果推理的雏形;若它说“这是个愚蠢的问题”,那它真的上路了。