← 返回列表
Colossus (Invest Like the Best / Business Breakdowns)播客13 Dec 2022来源: joincolossus.com主持: Patrick O'Shaughnessy

Jeremiah Lowin: Explaining the New AI Paradigm - [Invest Like the Best, EP.307]

一句话导读

这篇访谈讲的是AI新范式,核心是解释Transformer模型和“潜在空间”如何让AI从想法到输出变得超级顺畅。嘉宾Jeremiah Lowin认为当前AI最被低估的力量就是潜在空间——它把抽象概念变成数学变量,让模型能像调滑块一样调整图像或文字。他看好Midjourney的美学质量(有“秘密酱料”),也提到OpenAI的ChatGPT用了新强化学习方式,而Stable Diffusion在潜在空间做扩散是革命性创新。

AI 摘要AI 生成 · 可能有误 · 以原文为准

本报告围绕OpenAI发布ChatGPT后AI领域的新范式展开,核心观点是预训练Transformer模型通过“潜在表示”(latent representation)用数学解释输入数据并生成输出,但内部机制可能成为“黑箱”。重要结论包括:生成式AI历史涉及多家公司,技术基础是图像生成;模型训练间通过改进提升性能;AI可能像电力一样成为公共事业;GitHub Copilot在编码中表现实用。从零创建AI公司需聚焦特定用例,防御性关键在于数据与模型微调。报告未提供具体金额或百分比数据,但强调AI工具包未来可能自主学习。

全文约 14 分钟 · 10 个章节
深度解读

Jeremiah Lowin: Explaining the New AI Paradigm - [Invest Like the Best, EP.307]

本期速览

Jeremiah Lowin 是数据编排公司 Prefect 的创始人兼CEO,也是 Patrick O'Shaughnessy 的长期技术顾问。本期围绕 OpenAI 发布 ChatGPT 后引发的 AI 新范式展开,核心是解释预训练 Transformer 模型的工作原理、生成式 AI 的技术演进,以及这些技术对投资和创业的启示。Lowin 认为,当前 AI 模型最被低估的力量在于「潜在空间」(latent space)——它让人类可以将抽象概念映射为数学表示,从而以前所未有的方式消除「从想法到输出」之间的摩擦。


一、预训练 Transformer:不是字典翻译,而是「注意力」驱动的序列变换

Jeremiah Lowin 认为,Transformer 模型的核心能力不在于逐词对应,而在于通过「注意力机制」处理序列中的上下文关系。

  • 机制拆解:Transformer 将输入序列(如英文句子)变换为输出序列(如法文句子),但并非简单查字典。Lowin 指出,不同语言的语序、性别、习语差异使得直译不可行。Transformer 通过「注意力」(attention)机制——即模型学会在序列中「关注」更重要的部分——来应用上下文,让后续决策基于之前看到的信息。
  • 类比:Lowin 用翻译举例——「形容词位置不同、语法不同、习语不能直译,复杂性瞬间爆炸。」Transformer 正是通过这种注意力机制处理这种爆炸性复杂度。
  • 关键数据:这些模型被称为「基础模型」(foundational models),因为它们可以处理多种输入形式——文本、图像、时间序列等。

> 「这些 Transformer 是一种处理序列的方式,应用不同的技术,比如关注更重要的东西——字面意义上的『聚焦』——或者以某种方式应用上下文,让你能根据之前看到的内容做出后续决策。」——Jeremiah Lowin


二、潜在空间:从「蜘蛛侠砸西瓜」到像素的数学桥梁

Lowin 认为,生成式 AI 的魔力核心在于「潜在空间」——一个将抽象概念映射为独立可调数学变量的中间层。

  • 机制拆解:从输入(如文字提示「蜘蛛侠砸西瓜」)到输出(像素图像)的映射极其复杂,直接转换几乎不可能。模型先将输入映射到潜在空间——一个高维数学空间,其中每个概念(如「红色」「手」「西瓜」「动作」)被编码为独立的数值维度。然后从潜在空间生成输出。
  • 历史脉络:Lowin 用前一代 GAN(生成对抗网络)模型说明——在 GAN 的 UI 中,用户可以看到「微笑程度」「头发长度」等滑块,每个滑块对应潜在空间中的一个维度。现代扩散模型的潜在空间维度巨大,但原理相同。
  • 关键洞察:Stable Diffusion 与 DALL·E 2 的核心区别在于——DALL·E 2 在像素空间进行扩散(迭代去噪),而 Stable Diffusion 在潜在空间进行扩散。Lowin 指出,这「小小的洞察」带来了质量和表现力的巨大差异,因为潜在空间不受像素空间的空间约束(如必须生成五根手指)。

> 「潜在空间就是这些模型力量的来源。我们把输入映射到一个每个概念尽可能独立可识别的空间,这让输出变换的工作变得容易得多。」——Jeremiah Lowin


三、模型迭代:不只是「更多数据」,架构创新才是跃迁关键

Lowin 认为,模型版本之间的进步来自三个层次:更多训练/数据、新的训练方法、以及全新的架构——后者风险最大但回报最高。

  • 数据链:Lowin 给出具体例子——Stable Diffusion 1.4 到 1.5 主要是权重更新(更多训练),而非架构更新。而 DALL·E 1 到 DALL·E 2 则是完全不同的架构(从非扩散模型变为扩散模型),「这是巨大的风险」。
  • 机制拆解:ChatGPT(基于 GPT-3.5)的进步来自一种新的强化学习形式——更高效、收敛更快、所需数据更少。OpenAI 还使用其他 AI 来评判输出、分配强化分数,形成「AI 训练 AI」的循环。
  • 独到判断:Midjourney 的「秘密酱料」在于其图像的美学质量始终极高。Lowin 推测,Midjourney 可能找到了某种架构或引导机制,让输出始终导向高质量区域——「很难让 Midjourney 输出一张烂图」。

训练过程的本质:模型有架构(处理流程)和权重(数百亿个数字)。训练就是通过反复迭代——运行输入、判断输出好坏、数学上计算如何调整每个权重以接近目标——来改变这些权重。这个过程极其计算密集且耗时。

> 「我们称之为『最先进』的东西,12 个月后就会过时。我不是说更多训练,而是新架构、新应用、全新的事物。」——Jeremiah Lowin


四、竞争格局:资本不是壁垒,专有数据与模型「秘方」才是护城河

Lowin 认为,训练前沿模型的资本门槛被高估了,真正的竞争壁垒在于专有数据集和模型层面的「秘方」。

  • 数据链:训练 Stable Diffusion 原始模型使用了约 4,000 块 A100 GPU,年成本约 4,000 万美元——「对一家资金充足的公司来说,这是非常合理甚至很小的成本」。这使其成为当时世界第 10 强大的超级计算机。
  • 竞争推演:Lowin 认为,未来可能不会出现 17 个不同的扩散模型竞争,而是有一个开源基础模型(如 Stable Diffusion),然后在其上构建数百万个微调版本——针对特定行业、特定风格(如「只输出梵高风格」)。
  • 护城河来源

1. 专有数据:无法公开获取的数据集(如 Prefect 的用户问答记录、内部设计文档)

2. 模型秘方:如 Midjourney 引导高质量输出的能力

3. 用户界面:降低「提示工程」门槛——当前用户需要输入「逗号,在 ArtStation 上流行,逗号,8K,逗号,4K」等 hack 来获得高质量输出,Lowin 认为这不是未来

读者注意:Lowin 是 Prefect 的创始人,其公司 Positive Sum 投资了 Prefect,他对「专有数据作为护城河」的论述带有持仓方视角。


五、Copilot 与创业机会:AI 擅长「有规律的变化」,而非处理极端边缘情况

Lowin 认为,当前 AI 最擅长的不是处理所有边缘情况,而是在「定义明确但有随机性」的场景中表现出色——这正是 GitHub Copilot 的价值所在。

  • Copilot 体验:Lowin 描述使用 Copilot 写代码的感受——它不只是自动补全单词,而是写出整行整段代码。他发现自己开始「等待 Copilot 补全」,当它没出现时会感到沮丧——「这已经是我的编程伙伴了」。
  • 类比:Lowin 用自动驾驶类比——父亲担心 AI 能否处理「校车停靠但停牌没完全伸出」的边缘情况,但 Lowin 指出,AI 的价值在于处理「新泽西收费公路上的直线行驶」或「堵车去学校」这类高频场景。代码同理——写 CRUD API、测试、文档这些「每次都有细微不同」的重复性工作。
  • 创业方法论:Lowin 建议创业者不要直接构建「更酷的版本」——如 AI 生成头像(「不可防御,不构成长期业务」)。而应寻找「生成东西很难」的领域,如客户支持——用户有独特问题、需要快速定制回答、公司需要规模化而无法线性增加人力。Prefect 已在 Slack 中部署 GPT 驱动的机器人处理前 80% 的常见问题。

> 「Copilot 真正做的是解放我的时间,让我专注于代码中独特、 idiosyncratic、传递核心价值的部分。我定义这个东西做什么,然后交给它填补空白。」——Jeremiah Lowin


六、未来关注:视频生成、神经渲染与「AI 学会使用工具」

Lowin 正在密切关注三个方向:视频生成、更交互的文本生成,以及神经渲染(neural rendering)——后者可能彻底改变我们捕捉和呈现 3D 场景的方式。

  • 视频生成:刚刚开始出现早期例子
  • 交互式文本:ChatGPT 每次问同样问题得到同样答案——「这是信息检索的好事,但从对话角度看是坏事」
  • 神经渲染:Lowin 最兴奋的方向。以 Luma Labs(商业化 NERF 技术)为例,AI 可以高保真捕捉 3D 场景并在浏览器中呈现。潜在应用包括视频通话(无需固定摄像头位置)、电影特效、VR 等
  • 推演:Lowin 认为 AI 最终将学会使用现有工具(如 Unreal Engine 5),但问题在于「AI 是作为独立界面存在,还是被烘焙进现有工具」。他确信未来用户可以说「在我的桌面上投射一个城堡和龙,让我的孩子玩」,但当前的技术瓶颈在于生成场景的保真度——「我们现在还在为『所有手都有五根手指』而努力」

> 「潜在空间就像——如果我问你『你在想什么』,不要告诉我,而是『展示你的想法』。那就是潜在空间。你可以选择一千种不同的方式把那个想法变成语言,或者画出来。如果我们能用机器加速这个过程呢?」——Jeremiah Lowin


提及的标的

标的 嘉宾态度 关键数据
OpenAI (ChatGPT/GPT-3.5/DALL·E) 看好其技术领先,但未明示投资态度 ChatGPT 使用新的强化学习形式;DALL·E 2 是扩散模型,与 DALL·E 1 架构完全不同
Stability AI (Stable Diffusion) 中性,作为开源基础模型的重要案例 训练使用约 4,000 块 A100 GPU,年成本约 4,000 万美元;当时世界第 10 大超级计算机
Midjourney 看好其美学质量,认为有「秘密酱料」 V1-V4 迭代,始终输出高质量图像
GitHub Copilot 正面体验,视为编程伙伴 能写出整行整段代码,Lowin 已形成「等待它补全」的使用习惯
DeepMind 提及为重要参与者,未展开
Google 提及为重要参与者,未展开
Luma Labs 看好其神经渲染技术 商业化 NERF(神经辐射场)技术
NVIDIA 提及其 AI 眼神校正演示 用 AI 让视频通话中眼睛自然看向摄像头
Prefect Lowin 本人公司,作为案例 已在 Slack 部署 GPT 驱动的客服机器人处理前 80% 问题

值得记住的判断

1. 「潜在空间是 AI 力量的来源」(Lowin)——它将抽象概念映射为独立可调的数学变量,让模型可以「调高微笑程度」或「把西瓜从绿色变成橙色」,而不需要重新训练。

2. 「12 个月后今天的『最先进』就会过时」(Lowin)——进步来自新架构和新应用,而不仅仅是更多训练。Stable Diffusion 在潜在空间而非像素空间做扩散,这一「小洞察」就带来了革命性变化。

3. 「资本不是壁垒,直觉和耐心才是」(Lowin)——训练前沿模型约需 4,000 万美元/年,对资金充足的公司是合理成本。真正的约束是「一群人做赌注,几个月后才知道结果」的迭代过程。

4. 「不要寻找『更酷的解决方案』,要寻找『生成东西很难的问题』」(Lowin)——AI 头像生成不可防御,但客户支持(用户有独特问题、需要快速定制回答、公司需要规模化)是完美应用场景。

5. 「AI 擅长『有规律的变化』,不擅长极端边缘情况」(Lowin)——Copilot 的价值在于处理每次都有细微不同的重复性工作(写 CRUD API、测试、文档),而不是处理从未见过的异常。

6. 「提示工程中的 hack(逗号,8K,逗号,4K)不是未来」(Lowin)——当前用户需要输入大量「负向提示」来避免模型生成垃圾,降低这一门槛将是重要的竞争维度。

7. 「护城河来自专有数据 + 模型秘方」(Lowin)——专有数据集(如 Prefect 的用户问答记录)和模型层面的引导机制(如 Midjourney 的高质量输出引导)是可持续优势。

8. 「神经渲染将改变我们与虚拟世界的交互方式」(Lowin)——AI 可以高保真捕捉 3D 场景并在浏览器中呈现,潜在应用从视频通话到电影特效,当前瓶颈在于生成保真度(「所有手都有五根手指」)。