← 返回列表
Lex Fridman Podcast播客5 May 2020来源: lexfridman.com主持: Lex Fridman

#93 – Daphne Koller: Biomedicine and Machine Learning

一句话导读

这篇播客里,斯坦福教授、Coursera联合创始人Daphne Koller聊了用机器学习加速新药研发。她认为,传统用动物(比如小鼠)试药效果不好,因为很多人类疾病动物不会自然得。她的公司insitro用干细胞和基因编辑技术在培养皿里造出“病人细胞”,再用机器学习分析数据,找出能逆转疾病的药物。她看好这个方向,但提醒机器学习模型在陌生数据上会“自信地犯错”,需要学会说“不知道”。提到的重点:insitro(她创办的公司,用新技术造数据);Coursera(她联合创办的在线教育平台,课程曾数周内超10万人注册)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Daphne Koller,斯坦福大学计算机科学教授、Coursera联合创始人及insitro公司CEO,探讨了机器学习在生物医学中的应用。核心观点:数据驱动的机器学习方法正进入药物发现和治疗的早期阶段,有望大规模加速新药研发。重要结论:治愈所有主要疾病极其困难,因为疾病发现时往往已造成不可逆损伤;延长人类寿命至永生也面临根本性挑战,但不应断言“永远无法解决”。insitro正引领这一领域的突破,可能影响包括应对COVID-19在内的所有医学领域。

全文约 8 分钟 · 6 个章节
深度解读

好的,作为第三方独立分析师,我已分析该播客文字稿。以下是我的解读报告。

本期速览

本期嘉宾是斯坦福大学计算机科学教授、Coursera联合创始人及insitro公司CEO Daphne Koller。她探讨了机器学习在生物医学领域的应用前景,核心观点是:数据驱动的机器学习方法正进入药物发现和治疗的早期阶段,有望大规模加速新药研发。她认为,治愈所有主要疾病极其困难,因为疾病发现时往往已造成不可逆损伤;延长人类寿命至永生也面临根本性挑战,但不应断言“永远无法解决”。

机器学习与生物医学的交叉:从数据到药物

Daphne Koller 认为,机器学习在生物医学领域尚未发挥显著作用,但情况正在改变。 过去,缺乏大规模、高质量的数据集是主要瓶颈。然而,过去几年,能够大规模生产数据的技术(如单细胞RNA测序、超分辨率显微镜)开始涌现。Koller强调,insitro的策略并非被动等待数据,而是主动利用生物工程方法(如诱导多能干细胞、CRISPR基因编辑)来创造适合机器学习分析的数据集,从而构建强大的预测模型,以解决人类健康中的根本问题。

她指出,传统的动物模型(如小鼠模型)在药物研发中效果不佳。 许多人类疾病(如阿尔茨海默症、糖尿病)在动物身上不会自然发生,人为诱导的疾病表型与人类疾病的机制往往不同,导致在动物身上有效的药物在人体中失败。这正是大多数药物研发失败的原因。

Koller 重点介绍了“疾病在培养皿中”的模型。 该模型利用诱导多能干细胞技术,将患者的皮肤细胞逆转为干细胞,再分化成特定类型的细胞(如神经元、心肌细胞)。这些细胞携带患者的完整遗传信息,因此可以模拟由遗传驱动的疾病。通过比较“患病”细胞与“健康”细胞的差异,研究人员可以探索哪些干预措施(药物或基因编辑)能将“患病”细胞恢复至健康状态。她认为,对于由人类遗传学驱动的疾病,这种模型比动物模型更具预测性。

她认为,机器学习在此过程中的作用并非简单的“科学发现”,而是“模式识别”。 具体而言,insitro利用大规模数据,通过机器学习来发现分子层面上的疾病亚型。一旦识别出亚型,就可以测试特定干预措施是否能逆转该亚型的细胞状态。这是一种非假设驱动的方法,可能发现与现有研究完全不同的新干预途径。

机器学习与教育:Coursera的经验与洞见

Daphne Koller 分享了创办Coursera的初衷和从中学到的教育经验。 她认为,全球对学习有巨大需求,因为世界变化太快,大学所学的技能可能很快过时,人们需要持续学习新技能。Coursera的诞生正是为了满足这种“终身学习”的渴望。

她总结了在线教育的几个关键原则:

1. 内容要短:无论是单个视频还是整个课程,都应尽量缩短。15分钟的视频太长,5-7分钟更佳;15周的课程不现实,应拆分成更短的单元。

2. 内容要压缩:在线学习允许学生按自己的节奏回放,因此可以压缩内容,提高信息密度。

3. 即时反馈:在学习过程中嵌入小测验和自动评分作业,能有效提高参与度。

4. 社会性:学习是一种社会体验。即使是在线课程,自发形成的“学习小组”也能显著提高学习效果。她认为,MOOC不会完全取代面对面教学,就像录制音乐不会取代现场音乐会一样。

对人工智能的思考:从不确定性到风险

Koller 强调,当前机器学习模型的一个关键局限是缺乏对不确定性的校准。 模型在远离训练数据的区域不仅会犯错,而且往往对其错误答案“极度自信”。这在医疗诊断、自动驾驶等关键应用中可能致命。她认为,让模型能够“认输”(即对未知数据不给出预测)至关重要。她提到,贝叶斯深度学习、高斯过程、集成方法等都是解决此问题的研究方向。

她认为,通用人工智能(AGI)仍然非常遥远。 当前的机器学习算法是特定领域内“极其出色的模式识别器”,但缺乏人类(甚至幼儿)的通用性和灵活性。因此,她并不担心“机器统治世界”的威胁。

她更担心的是“更笨的系统”带来的风险。 随着系统日益复杂,其行为难以预测,可能产生意想不到的连锁反应(如金融市场的反馈循环)。她认为,我们需要关注系统的可解释性、鲁棒性测试,以及技术被滥用的风险(如对抗性攻击、人脸识别监控)。她将机器学习与基因编辑(CRISPR)并列为同样强大的“双刃剑”技术。

提及的标的

标的 嘉宾态度 关键数据
insitro 看好(创始人兼CEO,公司核心策略) 公司利用诱导多能干细胞、CRISPR和机器学习,主动创造数据集以构建预测模型。
Coursera 看好(联合创始人,回顾成功经验) 2011年秋季首批课程上线,数周内每门课有超过10万名学生注册。

值得记住的判断

1. Daphne Koller 认为,治愈所有疾病极其困难,因为疾病被发现时往往已造成不可逆损伤。 支撑:她指出,人类真正“治愈”的疾病数量非常少,大多数只是“治疗”。要治愈,需要再生整个身体部位,这是极具挑战性的。

2. Daphne Koller 认为,阿尔茨海默症、精神分裂症等复杂疾病并非单一疾病,而是一组机制各异的疾病集合。 支撑:她类比乳腺癌,指出分子数据揭示了其多种亚型。对于这些疾病,理解其异质性比寻找单一机制更重要。

3. Daphne Koller 认为,传统的动物模型(如小鼠模型)是药物研发失败的主要原因。 支撑:小鼠不会自然患上阿尔茨海默症或糖尿病,人为诱导的疾病表型与人类机制不同,导致在动物身上有效的药物在人体中无效。

4. Daphne Koller 认为,insitro的核心策略是“翻转”传统流程,主动创造适合机器学习的数据集,而非被动等待。 支撑:她强调,insitro利用生物工程方法(如诱导多能干细胞、CRISPR)来生成数据,目标是构建强大的预测模型,而非仅仅进行科学发现。

5. Daphne Koller 认为,当前机器学习模型最大的问题之一是其对不确定性缺乏校准,在未知数据上会“自信地犯错”。 支撑:她指出,在医疗诊断中,一个对错误诊断“极度自信”的模型可能致命。她认为,让模型学会“认输”至关重要。

6. Daphne Koller 认为,通用人工智能(AGI)还很遥远,我们更应警惕“更笨的系统”带来的风险。 支撑:她认为当前AI只是特定领域的模式识别器,缺乏通用性。但复杂系统(如电网、金融市场)的不可预测性,以及技术被滥用的风险(如对抗性攻击),是更现实的威胁。

7. Daphne Koller 认为,在线教育的核心原则是“短、压缩、即时反馈”。 支撑:她指出,15分钟的视频太长,5-7分钟更佳;15周的课程不现实,应拆分成更短的单元;嵌入小测验能有效提高参与度。

8. Daphne Koller 认为,人生的意义在于“在宇宙中留下印记”,让世界因自己而变得更好。 支撑:她引用史蒂夫·乔布斯的名言,并强调,对于生于特权的人来说,利用自己的机会让世界变得更好是一种责任。