这篇访谈讲的是AI新范式,核心是解释Transformer模型和“潜在空间”如何让AI从想法到输出变得超级顺畅。嘉宾Jeremiah Lowin认为当前AI最被低估的力量就是潜在空间——它把抽象概念变成数学变量,让模型能像调滑块一样调整图像或文字。他看好Midjourney的美学质量(有“秘密酱料”),也提到OpenAI的ChatGPT用了新强化学习方式,而Stable Diffusion在潜在空间做扩散是革命性创新。
本报告围绕OpenAI发布ChatGPT后AI领域的新范式展开,核心观点是预训练Transformer模型通过“潜在表示”(latent representation)用数学解释输入数据并生成输出,但内部机制可能成为“黑箱”。重要结论包括:生成式AI历史涉及多家公司,技术基础是图像生成;模型训练间通过改进提升性能;AI可能像电力一样成为公共事业;GitHub Copilot在编码中表现实用。从零创建AI公司需聚焦特定用例,防御性关键在于数据与模型微调。报告未提供具体金额或百分比数据,但强调AI工具包未来可能自主学习。
Jeremiah Lowin 是数据编排公司 Prefect 的创始人兼CEO,也是 Patrick O'Shaughnessy 的长期技术顾问。本期围绕 OpenAI 发布 ChatGPT 后引发的 AI 新范式展开,核心是解释预训练 Transformer 模型的工作原理、生成式 AI 的技术演进,以及这些技术对投资和创业的启示。Lowin 认为,当前 AI 模型最被低估的力量在于「潜在空间」(latent space)——它让人类可以将抽象概念映射为数学表示,从而以前所未有的方式消除「从想法到输出」之间的摩擦。
Jeremiah Lowin 认为,Transformer 模型的核心能力不在于逐词对应,而在于通过「注意力机制」处理序列中的上下文关系。
> 「这些 Transformer 是一种处理序列的方式,应用不同的技术,比如关注更重要的东西——字面意义上的『聚焦』——或者以某种方式应用上下文,让你能根据之前看到的内容做出后续决策。」——Jeremiah Lowin
Lowin 认为,生成式 AI 的魔力核心在于「潜在空间」——一个将抽象概念映射为独立可调数学变量的中间层。
> 「潜在空间就是这些模型力量的来源。我们把输入映射到一个每个概念尽可能独立可识别的空间,这让输出变换的工作变得容易得多。」——Jeremiah Lowin
Lowin 认为,模型版本之间的进步来自三个层次:更多训练/数据、新的训练方法、以及全新的架构——后者风险最大但回报最高。
训练过程的本质:模型有架构(处理流程)和权重(数百亿个数字)。训练就是通过反复迭代——运行输入、判断输出好坏、数学上计算如何调整每个权重以接近目标——来改变这些权重。这个过程极其计算密集且耗时。
> 「我们称之为『最先进』的东西,12 个月后就会过时。我不是说更多训练,而是新架构、新应用、全新的事物。」——Jeremiah Lowin
Lowin 认为,训练前沿模型的资本门槛被高估了,真正的竞争壁垒在于专有数据集和模型层面的「秘方」。
1. 专有数据:无法公开获取的数据集(如 Prefect 的用户问答记录、内部设计文档)
2. 模型秘方:如 Midjourney 引导高质量输出的能力
3. 用户界面:降低「提示工程」门槛——当前用户需要输入「逗号,在 ArtStation 上流行,逗号,8K,逗号,4K」等 hack 来获得高质量输出,Lowin 认为这不是未来
读者注意:Lowin 是 Prefect 的创始人,其公司 Positive Sum 投资了 Prefect,他对「专有数据作为护城河」的论述带有持仓方视角。
Lowin 认为,当前 AI 最擅长的不是处理所有边缘情况,而是在「定义明确但有随机性」的场景中表现出色——这正是 GitHub Copilot 的价值所在。
> 「Copilot 真正做的是解放我的时间,让我专注于代码中独特、 idiosyncratic、传递核心价值的部分。我定义这个东西做什么,然后交给它填补空白。」——Jeremiah Lowin
Lowin 正在密切关注三个方向:视频生成、更交互的文本生成,以及神经渲染(neural rendering)——后者可能彻底改变我们捕捉和呈现 3D 场景的方式。
> 「潜在空间就像——如果我问你『你在想什么』,不要告诉我,而是『展示你的想法』。那就是潜在空间。你可以选择一千种不同的方式把那个想法变成语言,或者画出来。如果我们能用机器加速这个过程呢?」——Jeremiah Lowin
| 标的 | 嘉宾态度 | 关键数据 |
|---|---|---|
| OpenAI (ChatGPT/GPT-3.5/DALL·E) | 看好其技术领先,但未明示投资态度 | ChatGPT 使用新的强化学习形式;DALL·E 2 是扩散模型,与 DALL·E 1 架构完全不同 |
| Stability AI (Stable Diffusion) | 中性,作为开源基础模型的重要案例 | 训练使用约 4,000 块 A100 GPU,年成本约 4,000 万美元;当时世界第 10 大超级计算机 |
| Midjourney | 看好其美学质量,认为有「秘密酱料」 | V1-V4 迭代,始终输出高质量图像 |
| GitHub Copilot | 正面体验,视为编程伙伴 | 能写出整行整段代码,Lowin 已形成「等待它补全」的使用习惯 |
| DeepMind | 提及为重要参与者,未展开 | — |
| 提及为重要参与者,未展开 | — | |
| Luma Labs | 看好其神经渲染技术 | 商业化 NERF(神经辐射场)技术 |
| NVIDIA | 提及其 AI 眼神校正演示 | 用 AI 让视频通话中眼睛自然看向摄像头 |
| Prefect | Lowin 本人公司,作为案例 | 已在 Slack 部署 GPT 驱动的客服机器人处理前 80% 问题 |
1. 「潜在空间是 AI 力量的来源」(Lowin)——它将抽象概念映射为独立可调的数学变量,让模型可以「调高微笑程度」或「把西瓜从绿色变成橙色」,而不需要重新训练。
2. 「12 个月后今天的『最先进』就会过时」(Lowin)——进步来自新架构和新应用,而不仅仅是更多训练。Stable Diffusion 在潜在空间而非像素空间做扩散,这一「小洞察」就带来了革命性变化。
3. 「资本不是壁垒,直觉和耐心才是」(Lowin)——训练前沿模型约需 4,000 万美元/年,对资金充足的公司是合理成本。真正的约束是「一群人做赌注,几个月后才知道结果」的迭代过程。
4. 「不要寻找『更酷的解决方案』,要寻找『生成东西很难的问题』」(Lowin)——AI 头像生成不可防御,但客户支持(用户有独特问题、需要快速定制回答、公司需要规模化)是完美应用场景。
5. 「AI 擅长『有规律的变化』,不擅长极端边缘情况」(Lowin)——Copilot 的价值在于处理每次都有细微不同的重复性工作(写 CRUD API、测试、文档),而不是处理从未见过的异常。
6. 「提示工程中的 hack(逗号,8K,逗号,4K)不是未来」(Lowin)——当前用户需要输入大量「负向提示」来避免模型生成垃圾,降低这一门槛将是重要的竞争维度。
7. 「护城河来自专有数据 + 模型秘方」(Lowin)——专有数据集(如 Prefect 的用户问答记录)和模型层面的引导机制(如 Midjourney 的高质量输出引导)是可持续优势。
8. 「神经渲染将改变我们与虚拟世界的交互方式」(Lowin)——AI 可以高保真捕捉 3D 场景并在浏览器中呈现,潜在应用从视频通话到电影特效,当前瓶颈在于生成保真度(「所有手都有五根手指」)。