← 返回列表
Lex Fridman Podcast播客6 Oct 2024来源: lexfridman.com主持: Lex Fridman

#447 – Cursor Team: Future of Programming with AI

一句话导读

这篇播客讲的是AI如何改变写代码这件事。Cursor团队认为,AI不会取代程序员,而是帮程序员更快地写代码,就像给程序员配了一个超级助手。他们觉得未来3-4年AI编程工具会越来越好用,现在只是开始。他们重点提到了几个工具:GitHub Copilot(早期AI编程工具,现在更新慢了)、GPT-4(让AI编程能力大飞跃)、Claude Sonnet(目前最擅长理解程序员模糊要求的模型)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

该报告基于Lex Fridman对Cursor团队(Aman Sanger, Arvid Lunnemark, Michael Truell, Sualeh Asif)的访谈,探讨AI辅助编程的未来。核心观点是:基于VS Code的Cursor编辑器通过集成强大AI功能,正重塑编程范式,强调人机协作在复杂系统设计中的关键作用。重要结论包括:AI可大幅提升代码生成效率,但人类仍需主导架构设计与调试;数据质量(尤其是非合成、人工生成数据)对模型训练至关重要。报告提及赞助商如Encord(数据标注与管理平台)和Masterclass(在线课程),但未给出具体财务数据或用户增长百分比。

全文约 9 分钟 · 7 个章节
深度解读

本期速览

Cursor团队(Aman Sanger, Arvid Lunnemark, Michael Truell, Sualeh Asif)在Lex Fridman播客中深入探讨AI辅助编程的未来。核心主线是:AI将从根本上改变编程方式,但人类程序员仍将长期处于驾驶席,关键在于构建"人机混合工程师"——通过定制模型、智能UX和极低延迟,让程序员以判断速度迭代,而非被AI替代。Michael Truell判断:"未来3-4年的最佳产品将比今天的最佳产品有用得多——这个领域的天花板极高,停止创新就会输。"

从Copilot到Cursor:为什么必须fork VS Code

Michael Truell认为,GPT-4的能力跃迁让"AI将改变整个编程"从理论变成现实,这要求一个全新的编程环境,而非插件。

  • 历史脉络:团队原为Vim用户,2021年Copilot发布后转向VS Code。Copilot是"LLM的第一个杀手级应用"——即使它猜错,多打一个字符就能修正,这种低摩擦体验令人着迷。
  • 关键转折:2022年底获得GPT-4早期访问权限。"能力提升感觉巨大……之前我们做的是给金融专业人士的Jupyter工具、静态分析等点解决方案。GPT-4让我们确信,整个编程都将通过这些模型流动。"
  • 为什么fork而非插件:插件对编辑器的控制极其有限。"我们不想被现有环境的限制锁住,要能构建最有用的东西。"
  • 竞争逻辑:Aman Sanger指出,AI编程领域"每一年、每一次模型能力跃迁都会解锁新一波功能。领先几个月甚至一年,产品有用性差距巨大。Cursor一年后的版本必须让今天的Cursor看起来过时。"微软虽然做了很多出色工作,但"他们无法像初创公司那样快速创新和实验"。

Cursor Tab:消除所有"低熵"操作

Arvid Lunnemark将Cursor Tab的核心目标定义为"消除编辑器内所有低熵动作——当意图已确定时,直接把你跳到未来"。

  • 机制拆解:Tab不仅是自动补全,而是预测"下一个diff"——包括编辑代码、跳转到文件内不同位置、甚至跨文件跳转。"内部竞赛是:你能让用户按多少次Tab?"
  • 技术实现
  • 稀疏MoE模型:输入(代码上下文)极大,输出极小,MoE架构大幅提升长上下文性能。
  • Speculative Edits:利用"原始代码本身就是最强先验"——将原代码块直接喂回模型,模型大部分时间会"同意"并并行处理多行,只在分歧点逐token生成。结果:diff流式显示,用户可在生成完成前开始审阅。
  • KV缓存与缓存预热:用户打字时立即预热当前文件内容的缓存,按Enter时只需极少量预填充计算,显著降低首token延迟。
  • 未来方向:从"预测下一行"扩展到"预测下10分钟"——包括终端命令、跳转到定义获取类型信息再返回等。"有时接下来5分钟做什么,从你刚做的事就能预测。"

模型策略:定制模型+前沿模型的"混合引擎"

Aman Sanger解释,Cursor通过"定制模型处理具体任务+前沿模型处理推理密集型任务"的混合架构,在速度和质量上取得优势。

  • Cursor Tab模型:专为"预测下一个编辑"任务定制,在自家评估上甚至超越前沿模型。
  • Apply模型:解决前沿模型在生成diff时的致命弱点——"数错行号"。让前沿模型输出粗略代码块,再由训练好的小模型精确应用到文件。"你以为这是确定性算法?它失败率超过40%。"同时,这种策略让前沿模型只需输出"草图",大幅降低token消耗(成本和延迟)。
  • 模型路由:正在探索动态判断问题难度,自动选择合适模型。"判断一个问题是否对4级模型太难,可能本身就需要O1级别的智能——这很难。"
  • 对O1的早期判断:团队已集成O1但未纳入默认体验。"它不流式输出,你得等一堵文字墙……感觉像是测试时计算和搜索的v0版本,很多地方不对劲。"Sualeh Asif指出,O1在推理型问题(如LeetCode)上出色,但"理解人类模糊意图的能力不如Sonnet"

编程的未来:人类在驾驶席,但抽象层级可调

Michael Truell强调,团队愿景是"程序员长期在驾驶席",通过可调节的抽象层级保持控制权,而非将编程简化为自然语言对话。

  • 反对"纯自然语言编程":Arvid Lunnemark以"结对编程"类比——有时用语言说"实现这个函数"就够了,有时"直接抢过键盘写个例子"才是最高效沟通。"对AI也一样,有时展示例子比用语言描述快得多。"
  • 核心原则:速度+控制+迭代速度。"很多最好的工程涉及无数微决策和艰难权衡……只要人类还在设计软件,你就希望人类在驾驶席。"
  • 未来形态猜想:可能像"可调节抽象层级的代码浏览器"——用伪代码浏览代码库,直接编辑伪代码,改动自动映射到正式代码层。"你可以指向任何逻辑片段,上下调整抽象层级。"
  • 对年轻程序员的建议:Aman Sanger认为"这是编程最激动人心的时代"——2012年的编程充满样板和繁琐查找,现在"编程的乐趣浓度被大幅提升"。Arvid Lunnemark补充:"未来你可以先尝试再调整,不用花五天站在黑板前想清楚所有细节——因为试错成本变得极低。"

提及的标的

标的 嘉宾态度 关键数据
GitHub Copilot 历史参照(早期产品,已显"停滞") 2021年beta发布;"很长时间没有新功能"
GPT-4 / GPT-4系列 关键转折点(能力跃迁触发Cursor创建) 2022年底获得早期访问
Claude Sonnet 当前"净最佳"编程模型 "在理解模糊意图上优于O1"
OpenAI O1 实验性/早期阶段(未纳入默认体验) "不流式输出,等待体验差";"v0版本"
DeepSeek MLA 技术参照(高效注意力机制) "将KV cache压缩为潜在向量,推理时再展开"
LLaMA / Gemma 技术参照(蒸馏/过度训练策略) Gemma 2B通过蒸馏27B模型获得

值得记住的判断

1. Michael Truell: "未来3-4年的最佳产品将比今天的最佳产品有用得多——天花板极高,停止创新就会输。"——支撑:AI编程领域每年模型能力跃迁都会解锁新功能,领先几个月就产生巨大差距。

2. Arvid Lunnemark: "Tab的目标是消除所有低熵动作——当意图已确定,直接把你跳到未来。"——支撑:通过Speculative Edits利用"原代码本身就是最强先验",并行处理大部分代码块。

3. Aman Sanger: "前沿模型在生成diff时连行号都数不对——你以为这是确定性算法?它失败率超过40%。"——支撑:因此训练专门的Apply模型,让前沿模型只输出粗略草图,小模型负责精确应用。

4. Michael Truell: "人类在驾驶席——最好的工程涉及无数微决策和艰难权衡,你不能把这些都委托给一个聊天框。"——支撑:团队反对"纯自然语言编程"愿景,主张可调节抽象层级、保持控制权。

5. Sualeh Asif: "O1在推理型问题上出色,但理解人类模糊意图的能力不如Sonnet。"——支撑:O1在分布内基准测试表现好,但"当你把它推到基准测试分布之外,Sonnet更能保持能力"。

6. Arvid Lunnemark: "未来你可以先尝试再调整——不用花五天站在黑板前想清楚所有细节,因为试错成本变得极低。"——支撑:以代码库迁移为例,未来只需展示几个例子,AI自动应用到所有位置。

7. Michael Truell: "合成数据的第三类——用可验证系统(测试、形式化证明)筛选模型输出——最可能带来巨大收益。"——支撑:类似"猴子打字机+莎士比亚验证器"范式,在数学和编程竞赛题中已验证有效。

8. Aman Sanger: "我们不是被计算限制,而是被想法和工程人才限制——即使有10万亿美元,你也无法快速聚集足够多的顶尖工程人才。"——支撑:从Transformer到GPT-3的工程实现(CUDA内核、模型并行)需要世界级工程师,这无法用资本简单复制。