← 返回列表
Lex Fridman Podcast播客3 Oct 2019来源: lexfridman.com主持: Lex Fridman

Gary Marcus: Toward a Hybrid of Deep Learning and Symbolic AI

一句话导读

这篇访谈里,AI专家Gary Marcus认为,现在流行的深度学习(一种让电脑从数据中学习的AI技术)有根本缺陷:它只会找数据里的相关性,但不懂常识,比如“瓶子能装水”“人渴了要喝水”。他主张把深度学习跟符号AI(一种用逻辑规则推理的AI)结合起来。Marcus对市场偏谨慎,觉得AI进步是渐进的,不是突然爆发。他重点提到了DeepMind(亏损严重,技术用在语言上效果差)、GPT-2(能写流畅文章但逻辑推理会出错)、Google Duplex(只能处理理发店预约等简单任务,不通用)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Gary Marcus在Lex Fridman播客中探讨了深度学习与符号AI融合的必要性。他指出,当前深度学习存在数据效率低、缺乏常识推理等根本局限,无法实现通用人工智能(AGI)。Marcus主张构建混合系统,将深度学习的模式识别能力与符号AI的知识表示和逻辑推理相结合。他批评单纯扩大算力无法解决AI的根本缺陷,并强调人类儿童的学习方式(先天知识+后天经验)为AI发展提供了重要启示。Marcus认为,未来100年内AI不会出现奇点式突破,而是需要逐步解决知识表示、因果推理等核心挑战,才能构建值得信赖的机器。

全文约 9 分钟 · 9 个章节
深度解读

Gary Marcus: Toward a Hybrid of Deep Learning and Symbolic AI

本期速览

Gary Marcus是纽约大学荣休教授、Robust.AI创始人,长期以批判性视角指出深度学习局限。本期核心主线:当前深度学习在数据效率、常识推理、因果理解等根本问题上存在无法通过单纯扩大算力解决的局限,必须构建融合符号AI与深度学习的混合系统Marcus的核心判断:深度学习擅长感知分类,但无法理解“瓶子装水”“人因口渴而喝水”这类常识——而这是实现通用智能的“速率限制步骤”


一、奇点不会“突然到来”:智能是多维变量

Marcus认为,所谓“技术奇点”不会是单一时刻的突变,而是渐进的、多维度的演变。

  • 智能不是单一IQ分数:Marcus指出,智能包含语言、运动、数学等多个维度。机器在数学和游戏领域已远超人类,但在自然语言理解上“落后于我五岁的孩子”。他预测AI进步是线性的,而非Ray Kurzweil所认为的指数级。
  • 常识是“速率限制步骤”:机器缺乏常识——不理解瓶子装水、人喝水解渴、脱水有害这些基本事实。这限制了阅读理解(故事依赖背景知识)和灵活问题解决。Marcus强调:“如果我们有一个机器可解释的常识库,很多事情会相对快速地加速。”

推演:Marcus认为物理常识(如钥匙开锁)可能比心理常识(如理解他人动机)更容易被机器掌握,因为机器人可通过实验获取物理数据,而心理实验受伦理限制。


二、深度学习的根本局限:相关性≠理解

Marcus系统性地批判了当前深度学习架构的10项挑战,核心问题是:系统学习的是相关性,而非因果与抽象概念。

  • 封闭问题 vs. 开放问题:国际象棋和围棋是“封闭问题”——规则固定、动作空间有限。而阅读理解中“下一句可以是任何内容”,是根本不同的挑战。Marcus指出:“你不能把AlphaGo的技术直接用在阅读上,DeepMind试过了,效果很差。”
  • 抽象概念无法“涌现”:Marcus以1998年的实验为例——神经网络能学会所有偶数,但无法推广到奇数。原因在于系统学习的是输入输出节点间的相关性,而非变量上的代数运算。他引用Bertrand Russell的比喻:深度学习“有偷窃相对于诚实劳动的所有优势”。
  • 卷积是“先天编程”的成功案例:Marcus指出,卷积(CNN的核心)是Yann LeCun人工编程的抽象——让系统识别不同位置的相同物体。这恰恰说明“我们需要更多这样的先天特征,而不是更少”。

数据支撑:Marcus提到DeepMind 2018年亏损5.3亿美元,尽管投入巨资将类似技术应用于语言,但“生产力远低得多”。


三、混合系统:符号AI+深度学习的必然融合

Marcus明确反对“纯深度学习”或“纯符号AI”的极端路线,主张构建融合两者优势的混合系统。

  • 符号AI的价值:Marcus强调,变量、运算、条件判断(如“如果X>Y则执行Z”)是现代计算机的基础。他反问:“你会用机器学习的方式构建一个操作系统或浏览器吗?没人会这么做。”
  • 专家系统的教训:Marcus澄清自己并非“回归专家系统”——1980年代的专家系统几乎全是手工规则、没有机器学习。他主张的是“新混合技术”,既利用深度学习的感知分类能力,又利用符号系统的推理能力。
  • AlphaGo已是混合系统:Marcus指出,AlphaGo常被描述为“深度学习系统”,但更准确地说,它是深度学习+蒙特卡洛树搜索(经典AI技术)的混合。他认为未来人们会“将混合系统重新标签为深度学习”。

推演:Marcus认为符号AI可能需要自己的“ImageNet时刻”——一个能激发世界想象力的突破性演示。Allen AI研究所(AI2)正在构建常识推理基准数据集,可能成为催化剂。


四、先天知识:从生物学中汲取设计灵感

Marcus认为,人类儿童的学习方式——先天知识框架+后天经验——为AI提供了关键设计原则。

  • 先天知识的必要性:Marcus指出,儿童生来具备空间、时间、其他智能体、因果关系等“框架性知识”。这并非“先天vs后天”的二分法,而是“先天与后天必须协同工作”。
  • 进化是累积的:Marcus以婴儿羚羊出生几小时就能下山为例,说明生物体携带大量先天知识。进化效率低(花10亿年演化出脊椎动物脑计划),但一旦“好主意”出现,基因库会迅速传播。他建议AI应借鉴“生物仿生学”——研究认知科学、心理学、语言学。
  • 人类是“低标准”:Marcus与诺贝尔奖得主Danny Kahneman达成共识:人类是“一个很容易超越的低标准”。机器应学习人类擅长的(灵活推理、语言理解),同时避免人类的缺陷(动机推理、确认偏误、糟糕的记忆)。

证伪条件:如果未来有系统能仅通过观看视频就稳健地预测“哪些容器会漏水、哪些不会”,Marcus表示“我会很高兴看到”。


五、可信AI的前提:从深度学习走向“深度理解”

Marcus认为,当前AI不可信的根本原因是它只处理相关性,不理解“伤害”“意图”等抽象概念。

  • 无法对齐的系统:Marcus指出,你不能与一个只处理像素相关性的系统进行“价值对齐”。Asimov的机器人第一定律“首先不伤害”需要机器理解“伤害”是什么——这需要抽象概念,而深度学习不擅长。
  • 翻译鸿沟:即使伦理委员会制定了规则,也需要有人将其翻译成代码或神经网络。Marcus强调:“我们现在不知道怎么做。如果连用Python或TensorFlow都做不到,我们就是在自欺欺人地认为可以构建可信AI。”
  • 六问检验法:Marcus在书中提出评估AI报道的六个问题,核心是“要求看演示”——如果Sundar Pichai说Google Duplex能像人一样对话,你应该问“我能试试吗?它有多通用?”

推演:Marcus认为,如果AI能通过“理解测试”——比如看完《斯巴达克斯》后回答“为什么所有人都站起来说‘我是斯巴达克斯’?”——他会承认AI取得了真正进展。


提及的标的

标的 嘉宾态度 关键数据
DeepMind 风险提示 2018年亏损5.3亿美元;将AlphaGo技术应用于语言效果差
GPT-2 风险提示 能生成流畅文本但概念理解不一致;在“DAX是DAX”类推理上失败
Google Duplex 风险提示 仅能处理理发店、餐厅预约和营业时间查询,非通用
CYC 中性(历史案例) 30年手工编码常识,未成功;Marcus认为不应因此否定符号AI路线
AlphaGo/AlphaZero 中性(混合系统案例) 深度学习+蒙特卡洛树搜索,非纯深度学习

值得记住的判断

1. Marcus:智能是多维变量,不是单一IQ分数。 机器在数学和游戏上远超人类,但在语言理解上落后于五岁儿童——不同维度进展不同步,奇点不会是单一时刻。

2. Marcus:深度学习擅长感知分类,但无法理解“瓶子装水”这类常识。 这是实现通用智能的“速率限制步骤”,因为阅读理解、物理推理、社会互动都依赖这种背景知识。

3. Marcus:神经网络学的是相关性,不是变量上的代数运算。 1998年实验证明网络能学会所有偶数但无法推广到奇数——21年后GPT-2在“DAX是DAX”类推理上同样失败,根本架构未变。

4. Marcus:AlphaGo是混合系统,不是纯深度学习。 它包含蒙特卡洛树搜索(经典AI技术),未来人们会“将混合系统重新标签为深度学习”。

5. Marcus:人类是“很容易超越的低标准”。 与Kahneman共识:机器应学习人类擅长的灵活推理,同时避免人类的动机推理、确认偏误、糟糕记忆等缺陷。

6. Marcus:可信AI的前提是“深度理解”,不是“深度学习”。 你不能与只处理相关性的系统进行价值对齐——理解“伤害”需要抽象概念,而深度学习不擅长。

7. Marcus:进化是累积的——一旦“好主意”出现,基因库会迅速传播。 婴儿羚羊出生几小时就能下山,说明生物体携带大量先天知识;AI应借鉴认知科学,而非从零开始。

8. Marcus:评估AI报道的六问检验法——核心是“要求看演示”。 如果Sundar Pichai说系统能像人一样对话,你应该问“我能试试吗?它有多通用?”