← 返回列表
Colossus (Invest Like the Best / Business Breakdowns)播客31 Mar 2026来源: colossus.com主持: Patrick O'Shaughnessy

Sergey Levine - Building LLMs for the Physical World - [Invest Like the Best, EP.465]

一句话导读

这篇访谈讲的是机器人领域的未来方向。UC Berkeley教授Sergey Levine认为,与其造只会干一件事的专用机器人,不如开发一个能控制任何机器人的通用大脑(基础模型),这样更省事。他创办的Physical Intelligence公司正在做这件事,目前模型已能完成开门、洗锅等日常杂务,但像给婴儿换尿布这种需要精细互动的事还很难。他看好这个通用路线,认为它比专用机器人更有潜力。提到的标的:Physical Intelligence(模型进步快)、Boston Dynamics(演示很酷但没实际用处)、Tesla(自动驾驶的数据收集模式值得学习)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

UC Berkeley教授、Physical Intelligence联合创始人Sergey Levine认为,构建通用机器人基础模型是正确路径,通过跨机器人、环境和任务学习比开发窄领域专家更具可扩展性。其公司正开发能控制任何实体系统执行任意任务的机器人基础模型,这些模型无需直接训练即可完成新任务。Levine指出,日常人类动作仍是机器人领域最难解决的问题,而人类信任与接受度与技术突破同等重要,将决定机器人何时融入日常生活。他预测到2050年厨房中可能出现机器人,但强调最终挑战在于制造规模化和人类行为理解。

全文约 9 分钟 · 6 个章节
深度解读

好的,这是根据您的要求对 Sergey Levine 访谈的分析。

本期速览

UC Berkeley 教授、Physical Intelligence 联合创始人 Sergey Levine 认为,构建通用机器人基础模型是正确路径,通过跨机器人、环境和任务学习比开发窄领域专家更具可扩展性。其公司正开发能控制任何实体系统执行任意任务的机器人基础模型,这些模型无需直接训练即可完成新任务。Levine 指出,日常人类动作仍是机器人领域最难解决的问题,而人类信任与接受度与技术突破同等重要,将决定机器人何时融入日常生活。

通用性赌注:为何“更难”的路径可能“更简单”

Sergey Levine 认为,追求完全的通用性,而非为特定任务打造专用机器人,从长远来看可能是一条更简单的路径。 这借鉴了 LLM 的经验:为机器翻译等特定任务构建专用系统,最终被能利用海量网络数据的通用语言模型所超越。

  • 核心机制:通用模型通过跨多种机器人、环境和任务的学习,建立起对物理交互的“世界理解”。这种理解能力使其在面对新任务时,能像人类一样快速“举一反三”,而无需从头训练。Levine 强调:“如果你能利用来自许多来源、许多应用、许多机器人的数据,那么你就能拥有一个具备物理理解的模型。在这个平台上构建新应用会容易得多。”
  • 数据挑战与策略:与 LLM 拥有互联网级数据不同,机器人领域缺乏现成的大规模数据集。Levine 的策略并非预先量化所需数据量,而是“让系统变得足够有用,使其能够进入世界,自行收集更多数据”,形成类似特斯拉的数据飞轮。关键在于先达到一个“有用”的临界点。
  • 独到之处:Levine 承认,通用性路径在演示上不占优势。专用机器人可以在受控环境中完美执行单一任务,看起来更酷。而通用模型的价值在于“做一些任何人类都能做的平凡事,但在任何情况下都能做”,这种泛化能力难以通过单个视频体现。

技术突破:从“肌肉记忆”到“常识推理”

Levine 指出,机器人领域最令人惊讶的进展是,模型在灵巧性和跨形态泛化上的表现远超预期,而当前最大的瓶颈已从底层物理控制转向了中层语义推理。

  • 灵巧性与泛化:Physical Intelligence 的模型无需特殊设计,仅通过增加数据就能执行非常灵巧的操作,并能适应不同形态的机器人(如多指手、不同自由度)。模型甚至无需被告知自身形态,就能自动适应。
  • “常识”的科学:Levine 将“常识”定义为应用从其他领域学到的语义知识来解决当前物理任务,与“肌肉记忆”相对。其实现方式是通过“思维链”(Chain of Thought):机器人进入场景后,先思考任务(如“清理厨房”),再执行动作。这解锁了模型在互联网数据上预训练所获得的先验知识,从而处理从未见过的边缘情况。
  • “教练”式改进:一个关键发现是,当模型在长程任务(如清理整个厨房)中失败时,仅通过添加高层级的语义指令(如“把盘子放进橱柜”)进行“教练”式纠正,就能提升其泛化能力。这意味着瓶颈已从“机器人能否做到”转向了“机器人能否理解场景并选择正确步骤”,而后者可以通过语言进行低成本监督。

未来图景:从“工具”到“平台”,从“酷”到“有用”

Levine 认为,通用机器人基础模型的价值不在于制造一个“人形终结者”,而在于成为一个“平台”,激发无数形态各异的机器人应用,就像个人电脑催生了软件生态的寒武纪大爆发。

  • 形态创新:Levine 对“人形机器人”持开放但非唯一的态度。他认为,通用模型可以适配从“1000 架四旋翼无人机组成的建筑队”到“微型手术机器人”等各种形态。关键在于降低准入门槛,让更多人能“在车库里组装一个机器人,加载基础模型,然后让它动起来”。
  • “酷”与“有用”的权衡:Physical Intelligence 的策略是“在有用的约束下,尽可能做到最酷”。他们选择像“做浓缩咖啡”或“折叠衣物”这类既具挑战性又能推动技术边界的任务。Levine 特别提到了“机器人奥运会”的概念,即比拼“开门”、“清洗油腻的煎锅”等对人类简单但对机器人极难的任务,而非跑酷或后空翻。
  • 最后被征服的任务:Levine 认为,“给婴儿换尿布”和“老年护理”这类涉及与人类亲密互动、需要高度同理心和精细物理控制的任务,将是机器人最难攻克的领域。这完美体现了“莫拉维克悖论”——对人类最简单的事,对机器却最难。

提及的标的

标的 嘉宾态度 关键数据
Physical Intelligence 看好(联合创始人) 模型已能完成“机器人奥运会”中除“将衬衫里外翻转”和“剥橙子”外的几乎所有任务。
Boston Dynamics 欣赏(技术层面) 其 Atlas 机器人因“非常像人又非常不像人”的敏捷性而备受赞赏,但 Levine 也指出其“做了很久很酷的演示,但并未为客户做任何有用的事”。
Tesla (自动驾驶) 作为正面类比 其数据收集飞轮(人类驾驶时收集数据)是机器人领域希望复制的模式。
Roomba (iRobot) 作为历史参照 被提及为“有史以来最畅销的消费类机器人”。

值得记住的判断

1. 通用性赌注 (Sergey Levine): 追求完全的通用性,从长远看可能比开发窄领域专家更简单,因为通用模型能利用更广泛的数据建立“世界理解”,从而快速适应新任务。

  • 支撑:类比 LLM 取代了机器翻译等专用系统;Physical Intelligence 的模型无需为每个新厨房重新训练就能清理厨房。

2. “教练”式改进 (Sergey Levine): 当机器人失败时,仅通过高层级的语言指令进行“教练”,就能提升其泛化能力,这意味着瓶颈已从物理控制转向语义理解。

  • 支撑:Physical Intelligence 发现,为失败场景添加语义标签(而非更多操作数据)就能改善模型表现,这使“与机器人对话”成为有效的改进方式。

3. “机器人奥运会” (Sergey Levine, 引用 Benji Holson): 衡量机器人能力的真正标准,应是“开门”、“清洗油腻煎锅”等对人类简单但对机器极难的任务,而非跑酷或后空翻。

  • 支撑:Physical Intelligence 的通用模型能完成该清单中除两项(因硬件限制)外的所有任务,证明了通用方法的威力。

4. 最后被征服的任务 (Sergey Levine): “给婴儿换尿布”和“老年护理”这类涉及亲密人际互动和精细物理控制的任务,将是机器人最难攻克的领域。

  • 支撑:这是“莫拉维克悖论”的终极体现——人类最擅长的事(与人互动、精细操作)对机器最难,且容错率极低。

5. 数据飞轮 > 数据规模 (Sergey Levine): 关键不在于预先知道需要多少数据,而在于让系统足够有用,使其能进入真实世界自行收集更多数据,形成自我强化的飞轮。

  • 支撑:类比特斯拉的自动驾驶系统,其数据收集能力远超需求;机器人领域应追求达到这个“有用”的临界点。

6. “酷”与“有用”的权衡 (Sergey Levine): 在机器人领域,最酷的演示(如后空翻)往往不是最有用的,而最有用的能力(如泛化清理)看起来却很平凡。

  • 支撑:Boston Dynamics 的演示很酷,但未转化为实际客户价值;Physical Intelligence 的策略是在“有用”的约束下追求“酷”。

7. 硬件成本下降是关键催化剂 (Sergey Levine): 机器人硬件成本在过去十年急剧下降(从约 40 万美元的 PR2 到如今约 3000 美元的机械臂),这使通用机器人变得可行。

  • 支撑:低成本、低精度的硬件配合强大的学习算法,可以弥补精度不足,从而大幅降低部署门槛。

8. 乐观的研究者,悲观的创业者 (Sergey Levine): 在机器人领域,他对技术前景的乐观程度高于大多数资深研究者,但低于许多机器人创业者。

  • 支撑:他看到了许多“拼图碎片”可以拼合,但承认机器人领域有漫长的失败历史,需要保持谨慎。