← 返回列表
Lex Fridman Podcast播客19 Nov 2019来源: lexfridman.com主持: Lex Fridman

Michael Kearns: Algorithmic Fairness, Bias, Privacy, and Ethics in Machine Learning

一句话导读

这篇播客讲的是算法在公平、隐私和伦理上的难题。作者认为,算法公平性比隐私更麻烦,因为没法同时满足三个看似合理的公平定义,比如你保护了种族公平,可能就忽略了“55岁以上的残疾西班牙裔低收入女性”这类更细的歧视,他管这叫“公平性杰利蝾螈”。隐私问题倒是有个公认的解法叫“差分隐私”,核心就是加一点随机噪声,让数据无法反推出你个人。文中没提具体股票或基金。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Michael Kearns在Lex Fridman播客中探讨了机器学习中的算法公平性、偏见、隐私与伦理问题。核心观点是算法公平存在群体与个体间的权衡,且公平性指标间存在不可调和的矛盾(如00:33:36讨论的公平性权衡)。重要结论包括:差分隐私(1:11:50)是保护数据隐私的有效方法,但需警惕通过错误信息实现隐私(1:22:31);计算机科学家必须主动思考伦理问题(1:01:25)。Kearns还涉及博弈论(1:27:49)、纳什均衡(1:29:40)及算法交易(1:36:56)等跨领域研究,强调机器学习与博弈论的结合(1:30:35)对理解竞争与合作场景至关重要。

全文约 8 分钟 · 6 个章节
深度解读

好的,遵照您的指示,以下是基于您提供的播客文字稿的分析与解读。

本期速览

本期嘉宾是宾夕法尼亚大学教授、新书《伦理算法》的合著者 Michael Kearns。他是一位在机器学习理论、博弈论和算法交易等多个领域均有建树的学者。本期播客的主线是探讨算法在公平性、隐私和伦理方面的挑战与解决方案。全片最有分量的一个判断是:Kearns 认为算法公平性领域存在根本性的、不可调和的矛盾——你无法同时满足三个看似合理且令人向往的公平性定义,这比算法隐私问题(已有公认的差分隐私方案)要棘手得多。

算法公平性:一个比隐私更“混乱”的战场

Michael Kearns 认为,算法公平性领域远不如算法隐私成熟,因为它面临着根本性的定义冲突和哲学难题。

  • 核心矛盾:Kearns 指出,在算法公平性文献中,已经存在一些定理,证明你无法同时拥有三个“完全合理、令人向往的公平性概念”。这意味着,无论你选择哪种公平性定义,都必然要牺牲其他同样重要的方面。这与隐私领域形成了鲜明对比,后者已经基本达成了共识,即差分隐私是“正确的定义”。
  • 群体 vs. 个体:Kearns 深入探讨了群体公平与个体公平之间的张力。目前的公平性定义大多是基于群体的(例如,确保不同种族间的错误拒绝率相近)。但Kearns 指出,这种群体层面的保证,可能掩盖了对特定个体(例如,一位55岁以上的残疾西班牙裔低收入女性)的歧视。他将这种现象称为 “公平性杰利蝾螈”(fairness gerrymandering)——就像政治上的杰利蝾螈一样,你在宏观层面给出了保证,但在更细粒度的层面,你实际上是通过偏袒某些群体、歧视另一些群体来实现的。
  • 权衡是不可避免的:Kearns 强调,追求公平必然带来权衡。他提出了一个 “帕累托曲线” 的概念:一条轴是算法的预测误差,另一条轴是某种不公平性的度量。你无法同时达到“零误差”和“零不公平”。你只能在这条曲线上选择一个点,这个选择本质上是一个价值判断,不应该由计算机科学家来决定,而应该由政策制定者和利益相关者来决定。Kearns 认为,向非技术人员解释这条曲线,让他们做出选择,是未来工作的关键接口。

算法隐私:差分隐私是“救星”,但并非万能

Kearns 认为,差分隐私为数据隐私问题提供了一个强大且实用的解决方案,但其应用场景仍有局限。

  • 差分隐私的核心思想:Kearns 用一个生动的比喻解释了差分隐私:它比较两个世界——一个包含你的数据,另一个不包含。差分隐私保证,任何因包含你的数据而可能产生的“伤害”,与不包含你的数据时可能产生的“伤害”几乎完全相同。这意味着,你的数据本身不会成为你受到伤害的“元凶”。
  • 实现机制:添加噪声:Kearns 指出,实现差分隐私的算法机制是在计算过程中“巧妙且得体地添加噪声”。例如,计算一组数字的平均值时,不是直接输出精确值,而是先计算,然后添加一个均值为零的高斯噪声。这样,输出值接近真实平均值,但无法反推出任何一个输入值。
  • 局限性与未来:Kearns 承认差分隐私并非适用于所有场景。例如,当你向谷歌搜索“山地自行车”时,你希望谷歌精确地知道你的查询,而不是一个被噪声干扰的结果。在这种情况下,需要其他类型的隐私保护思路,比如通过混淆(obfuscation)来保护隐私——例如,一个浏览器插件在你搜索的同时,不断向谷歌发送大量无关的虚假查询,从而“淹没”你的真实意图。

博弈论与机器学习:从“自私”走向“稳定”

Kearns 认为,博弈论与机器学习的结合,是理解当今许多平台(如导航App、社交媒体)如何运作的关键,并揭示了“自私”行为如何导致集体次优结果。

  • 机器学习的“自私”本质:Kearns 以导航App(如Google Maps、Waze)为例,指出这些App本质上是在为每个用户计算一个“自私的最佳回应”——在给定所有其他用户当前行为的情况下,为你规划出最短时间的路线。这实际上是在驱动所有用户趋向于一个纳什均衡
  • 均衡不等于最优:Kearns 强调,博弈论最重要的教训之一就是:达到均衡并不意味着所有人都得到了最好的结果。在导航的例子中,所有用户都遵循App的“自私”建议,可能会导致集体通勤时间显著高于其他可能的解决方案。同样,在社交媒体上,算法为你优化内容,让你只看到自己喜欢的东西,最终可能导致整个社会的政治话语极化。
  • 算法交易的时间尺度:Kearns 将算法交易的成功归因于其时间尺度。他认为,算法在高频交易和统计套利(预测几秒到几天内的价格走势)方面表现出色,因为这些是纯粹的优化和控制问题。但对于巴菲特式的长期投资(持有10-20年),算法需要理解经济周期、政治局势和人类本性,Kearns 认为“离机器人巴菲特的出现还很远”。

提及的标的

本节内容为访谈,未涉及具体的可投资标的。

值得记住的判断

1. 公平性存在“不可能三角” (Michael Kearns): 算法公平性领域已有定理证明,你无法同时满足三个看似合理且令人向往的公平性定义,这使得该问题比算法隐私(已有公认的差分隐私方案)要棘手得多。

2. “公平性杰利蝾螈” (Michael Kearns): 只保护种族、性别等宏观群体的公平性,可能会掩盖对特定交叉群体(如“55岁以上的残疾西班牙裔低收入女性”)的歧视,这种现象被称为“公平性杰利蝾螈”。

3. 公平性的权衡应由社会决定 (Michael Kearns): 算法在误差与不公平性之间存在“帕累托曲线”,选择曲线上哪一点是一个价值判断,不应由计算机科学家决定,而应由政策制定者和利益相关者通过理解曲线来做出选择。

4. 差分隐私的核心是“你的数据不是元凶” (Michael Kearns): 差分隐私保证,任何因包含你的数据而可能产生的“伤害”,与不包含你的数据时可能产生的“伤害”几乎完全相同。这意味着你的数据本身不会成为你受到伤害的“元凶”。

5. “自私”的算法驱动我们走向次优均衡 (Michael Kearns): 导航App为每个用户计算“自私的最佳回应”,驱动所有用户趋向纳什均衡。但博弈论告诉我们,均衡不等于最优,这可能导致集体通勤时间显著高于其他解决方案。

6. 长期投资是算法的“盲区” (Michael Kearns): 算法在高频交易和短期统计套利上表现出色,但对于需要理解经济周期、政治局势和人类本性的长期投资(如巴菲特风格),算法离取代人类还很远。

7. 计算机科学家应主动“涉足”世界 (Michael Kearns): 鉴于计算机科学对社会的影响日益巨大,计算机科学家不能再闭门造车,而应主动走出去,理解并参与到更广泛的社会、伦理和政治讨论中。

8. 算法公平性研究需要“主观”输入 (Michael Kearns): 目前的公平性定义大多是学者“拍脑袋”想出来的,缺乏对普通人主观公平感的调查。未来需要更多行为实验,了解人们真正认为什么是公平的。