这篇播客聊的是深度强化学习(一种让AI通过试错来学习的技术)和机器人怎么变得更聪明。Pieter Abbeel教授认为,现在的机器人硬件(比如Boston Dynamics的机器人)还要10-15年才能像人类一样灵活奔跑和挥拍,而软件上通过强化学习训练机械臂虽然可行,但需要大量试错。他特别提到,机器人要学会“爱”人类是可能的,就像狗和人之间的感情一样,不需要人类级别的智能。重点提到的公司:Boston Dynamics(机器人跑酷很厉害,但硬件还没成熟)、OpenAI(用语言模型做其他任务,技术参考)、DeepMind(用UNREAL算法在迷宫里导航,表现更好)。
Pieter Abbeel(UC Berkeley教授、Berkeley Robot Learning Lab主任)在Lex Fridman Podcast中探讨了深度强化学习与机器人交互的核心挑战。他指出,制造能击败Roger Federer的网球机器人需同时解决硬件与软件问题:硬件方面,Boston Dynamics等机器人仍需10-15年才能达到人类级奔跑与挥拍能力;软件上,通过强化学习训练机械臂击球虽可行(需大量试错),但双足移动、草地滑行等复杂场景更难掌握。若采用轮式非人形设计,实现时间可能更短。核心结论是:机器人自主完成精细运动任务需软硬件协同突破,当前两者均未成熟。
Pieter Abbeel(UC Berkeley教授、Berkeley Robot Learning Lab主任)在Lex Fridman Podcast中探讨了深度强化学习与机器人交互的核心挑战。他指出,制造能击败Roger Federer的网球机器人需同时解决硬件与软件问题:硬件方面,Boston Dynamics等机器人仍需10-15年才能达到人类级奔跑与挥拍能力;软件上,通过强化学习训练机械臂击球虽可行(需大量试错),但双足移动、草地滑行等复杂场景更难掌握。若采用轮式非人形设计,实现时间可能更短。核心结论是:机器人自主完成精细运动任务需软硬件协同突破,当前两者均未成熟。
Pieter Abbeel认为,强化学习在稀疏奖励场景下需要海量样本的根本原因在于信用分配难题。 当100个动作后只获得一个分数(如3分),算法无法直接判断哪个动作贡献了正面或负面结果。RL通过策略梯度更新来逐步分离信号——提高"好结果时出现"的动作概率,降低"差结果时出现"的动作概率。Abbeel指出,RL之所以比理论预期更高效,是因为深度网络本质上是分段线性反馈控制器:每个隐藏层单元从激活到非激活的转变相当于在状态空间中切分一个维度,从而渐进地拼贴出整个控制空间,且各线性控制器之间共享大量参数。这种结构继承了线性反馈控制在复杂动力学系统中的强大能力(如直升机悬停),但通过非线性拼贴突破了线性控制的局限。
Abbeel强调,真实世界的时间尺度是RL面临的根本挑战。 人类一生是肌肉纤维收缩与放松的序列(高频控制),但"决定读博"这样的抽象决策与底层动作之间跨度极大,现有RL算法完全无法完成这种信用分配。他提出三条解决路径:
1. 端到端训练+传统规划:让深度学习产生可被传统动力学系统用于规划的表示(如Aviv Tamar等人的工作)
2. 信息论方法:通过选择能预测未来状态的潜变量作为高层动作(但该方向进展困难)
3. 元学习(RL²):直接优化"更快学习"这一目标,让层次化概念从优化中涌现——在迷宫导航实验中,模型学会了"沿走廊持续移动→在岔路口决定转向→避免重复访问"的层次化行为,但尚未扩展到真实世界场景。
Abbeel认为,自我对弈(self-play)是强化学习中最优雅的信号获取机制。 在自我对弈中,双方总有一方成功、一方失败,每次对弈都产生对比信号,因此学习速度远快于普通RL环境。这一机制在棋类等有天然对手的游戏中已大获成功。关键问题是:能否将任意RL问题转化为自我对弈形式? 如果能找到通用形式化方法,将实现"数学式跨越"——大幅减少实验迭代。但目前大多数现实问题(如机器人建房)尚无法转化为自我对弈。
当无法构建自我对弈时,Abbeel倾向模仿学习。 他指出,如果必须为机器人设计详细奖励函数(不仅奖励最终目标,还奖励进展),其时间成本已接近直接演示。核心突破来自Chelsea Finn领导的第三人称模仿学习:机器人通过元学习学会将人类演示"翻译"为自身动作——类似机器翻译,但映射的是不同形态间的动作空间。这一方法在机器人操作任务中仅需10分钟即可教会新技能(如"无论瓶子从何处开始,将其放到目标位置")。
Abbeel对比了两种方法在自动驾驶中的应用:
Abbeel提出,模拟器不必追求对真实世界的精确复制。 他建议构建模拟器集成(ensemble of simulators)——每个模拟器都不完全代表真实世界,但若策略在所有模拟器中表现良好,真实世界作为"另一个模拟器样本"也将被覆盖。这一思路将模拟从"精确建模"问题转化为"分布覆盖"问题,降低了对单一模拟器精度的要求。
Abbeel指出,当前缺乏对机器人能力的有效测试框架。 以人类驾驶考试为例:仅需在郊区绕行几圈、完成停车和Stop Sign即可获得驾照,但人类事故率仅为每百万英里一次——这表明人类考试具有惊人的代表性。对于机器人,软件更新后如何确保新版本在所有场景下都优于旧版本、没有引入退化?Abbeel认为这是一个尚无解决方案的重要研究方向。
Abbeel认为,RL算法完全可能让机器人学会"爱"人类并激发人类回爱。 他的论证基于类比:狗不具备人类级推理能力,但人与狗之间的深厚情感纽带是普遍现象。既然不需要人类级智能就能产生强烈情感连接,AI系统同样可能达到类似效果。关键问题不是"能否",而是"是否应该"——这涉及伦理选择,而非技术可行性。
Abbeel指出,人类的情感倾向是长期进化的结果——痛苦、饥饿、口渴等先天信号塑造了学习过程。人类倾向于善待自己群体内的成员,但对其他群体需要后天学习。他引用Steven Pinker《人性中的善良天使》指出,暴力在历史长河中持续下降,表明合作倾向可能随文明发展而增强。
| 标的 | 嘉宾态度 | 关键数据 |
|---|---|---|
| Boston Dynamics | 硬件标杆(非投资建议) | 机器人跑酷、爬楼梯能力"令人印象深刻";Spot Mini在Bezos活动中跟随Jeff Bezos |
| OpenAI | 技术参考 | 语言模型通过预测学习后迁移到其他任务;Paul Cristiano团队用人类偏好比较训练hopper做后空翻 |
| 技术参考 | 语言模型通过预测学习后迁移到其他任务 | |
| DeepMind | 技术参考 | UNREAL算法在迷宫导航中通过多目标优化提升表现 |
| Fidelity | 场景引用 | 使用Pepper机器人主持活动,100%脚本化仍引发"有意识"错觉 |
| Pepper(SoftBank) | 场景引用 | 同上 |
1. Pieter Abbeel:深度网络本质是分段线性反馈控制器的渐进拼贴,这是RL比理论预期更高效的根本原因。 每个隐藏层单元的状态切换相当于在状态空间中切分一个维度,各线性控制器共享参数,继承了线性控制在复杂动力学中的强大能力。
2. Pieter Abbeel:自我对弈是RL中最优雅的信号获取机制,因为每次对弈都产生对比信号。 关键突破在于能否将任意RL问题形式化为自我对弈——若能实现,将大幅减少实验迭代。
3. Pieter Abbeel:模拟器不必精确,构建模拟器集成(ensemble of simulators)即可。 策略在所有模拟器中表现良好时,真实世界作为"另一个样本"自然被覆盖,将模拟从精确建模转为分布覆盖问题。
4. Pieter Abbeel:第三人称模仿学习(Chelsea Finn)是今年重大突破,机器人通过元学习学会将人类演示"翻译"为自身动作。 这类似于机器翻译,但映射的是不同形态间的动作空间,大幅降低了机器人技能获取成本。
5. Pieter Abbeel:人类驾驶考试仅需郊区绕行几圈,但事故率仅每百万英里一次——这表明人类考试具有惊人的代表性。 机器人缺乏类似的有效测试框架,软件更新后如何确保没有退化是一个尚无解决方案的重要研究方向。
6. Pieter Abbeel:RL算法完全可能让机器人学会"爱"人类并激发人类回爱。 论证基于狗与人的情感纽带——狗不具备人类级推理能力,但情感连接普遍存在,因此人类级智能不是必要条件。
7. Pieter Abbeel:人类情感倾向是长期进化结果,痛苦、饥饿等先天信号塑造了学习过程。 引用Steven Pinker指出暴力在历史中持续下降,合作倾向可能随文明发展而增强。
8. Pieter Abbeel:RL需要层次化推理来处理真实世界的时间尺度,但当前算法完全无法完成"决定读博"这种抽象决策与底层肌肉动作之间的信用分配。 元学习(RL²)在迷宫导航中展示了层次化行为涌现的迹象,但尚未扩展到真实世界场景。