← 返回列表
Colossus (Invest Like the Best / Business Breakdowns)播客30 Jun 2026来源: colossus.com主持: Patrick O'Shaughnessy

Etched - Building AI Hardware to Make Inference Faster and Cheaper - [Invest Like the Best, EP.480]

一句话导读

这篇访谈讲的是AI芯片初创公司Etched如何挑战英伟达,他们专门造一种更快更便宜的推理芯片(推理就是AI实际回答问题、生成内容的过程)。两位创始人认为,未来谁生产的token(AI输出的文字单位)最多,谁就最值钱。他们赌了两个技术方向:一是用超低电压让芯片不发热、跑得更快;二是自研连接技术,让几百块芯片像一台电脑一样协同工作。文中重点提到了英伟达(芯片间延迟约4000纳秒,比Etched慢5倍以上)、台积电(关键合作伙伴,帮他们做实验提升良率)和Synopsys(在缺钱时低价提供仿真器)。

AI 摘要AI 生成 · 可能有误 · 以原文为准

Etched创始人Gavin Uberti和Rob Wachen在播客中分享了他们挑战NVIDIA的历程。公司成立于2023年,专注于构建更快的AI推理芯片及完整机架系统,已首次流片成功,成为ChatGPT后首家达成此目标的硬件公司。他们已获得超过10亿美元的客户需求,并融资8亿美元。核心观点是推理将成为全球最大市场之一,其架构基于两大技术赌注,通过垂直整合(芯片、板卡、电源、互连及制造)实现每兆瓦更高并发。团队招募了行业传奇与22岁精英,并曾将十几名工程师派往班加罗尔六个月以加速开发。Etched已筹集AI芯片领域最大规模A轮融资,并正为第二代产品设计千兆瓦级生产。

全文约 10 分钟 · 8 个章节
深度解读

好的,以下是基于您提供的访谈文字稿的分析与解读。

本期速览

嘉宾:Gavin Uberti 与 Rob Wachen,AI芯片公司 Etched 的联合创始人。

主线:两位年轻创始人讲述他们如何挑战NVIDIA,通过垂直整合与两大核心技术赌注(低电压推理与集群规模内存),构建专为推理优化的AI芯片与机架系统,并已获得超过10亿美元客户需求。

最有分量的判断Gavin Uberti 认为,推理将成为全球最大的市场之一,而生产最多token的公司将成为世界上最有价值的公司。 这一判断驱动了Etched所有关于产品设计、垂直整合和产能扩张的决策。

主题小节

1. 两大技术赌注:低电压推理与集群规模内存

Gavin Uberti 认为,现有GPU架构是为训练而非推理设计的,Etched通过两个关键技术赌注实现了根本性的性能突破。

  • 机制拆解:推理分为“预填充”(pre-fill,加载模型记忆)和“解码”(decode,生成输出token)两个阶段。Etched针对这两个阶段分别做出了核心赌注。
  • 预填充(低电压推理):关键在于每秒浮点运算次数(FLOPS)和FLOPS密度。但增加FLOPS会导致热节流(thermal throttling)。Gavin指出,通过降低电压(Denard scaling),功耗会以平方关系下降。Etched开发了“低电压推理”技术,运行电压低于任何其他AI芯片的一半,从而在相同硅面积内塞入更多FLOPS而不热节流。
  • 解码(集群规模内存):关键在于内存带宽。Gavin认为,人们问错了问题,不应只看单芯片带宽,而应看“整个扩展集群的内存带宽”。Etched通过自研互连,将芯片间延迟从NVIDIA Blackwell的约4000纳秒降低了5倍以上,使得一个集群内所有芯片的内存(SRAM和HBM)可以被当作一个统一的内存池来使用,从而大幅提升解码速度。
  • 数据支撑:Gavin强调,GPU的模型FLOPS利用率(MFU)通常在20-50%之间,且无法达到100%因为热节流。Etched的互连延迟比NVIDIA低“超过5倍”。
2. 生产即产品:极端垂直整合与并行化

Rob Wachen 认为,Etched的竞争优势不仅在于芯片设计,更在于将整个机架系统(从芯片到冷板到生产)进行极端垂直整合和并行化开发的能力。

  • 机制拆解:Etched并非只造芯片,而是交付一个完整的推理机架,包括芯片、电路板、电源、互连和制造。他们信奉“最好的零件就是没有零件,最好的供应商就是没有供应商”,尽可能将所有环节内部化。
  • 数据链与历史脉络:为了加速开发,Etched在芯片流片前就做了大量“预取”工作:
  • 制造了与芯片热分布完全相同的“热芯片”来验证冷板,确保芯片回来后无泄漏。
  • 在台湾自建工厂,并在办公室内搭建了测试站的克隆版本。
  • 在芯片回来前,就将机架(不含芯片)部署到客户数据中心,启动软件栈。
  • 用700多个FPGA模拟了整个芯片,提前运行了推理软件栈。
  • 结果:另一家知名AI芯片公司从拿到芯片到运行推理花了10个月,而Etched只用了40天
  • 推演:这种模式使得Etched能够以远少于大公司(如NVIDIA的2万人)的人员,实现更快的产品迭代和上市速度。
3. 人才哲学:“传奇”与“肩膀上有芯片的人”的二元组合

Gavin Uberti 和 Rob Wachen 描述了一种独特的招聘策略:将行业传奇(legends)与充满干劲的年轻天才(chips on shoulders)配对,以解决最困难的技术问题。

  • 机制拆解
  • 传奇:针对每个最困难的技术问题,通过“项目制招聘”找到世界上最好的那个人(如NVIDIA HGX/DGX系统创始人Brian Loyler)。他们相信,第一名和第十名之间的能力差距是巨大的。
  • 年轻天才:像Gavin的高中机器人竞赛搭档Sanford这样的年轻人,他们“不知道尸体埋在哪里”,敢于承担巨大风险,用第一性原理思考。
  • 合作模式:传奇提供经验和“十亿美元级别的教训”,年轻天才提供速度和打破常规的勇气。两者必须紧密合作,缺一不可。
  • 推演:这种模式自我筛选。Gavin指出,只有“脑子有点毛病”的人才会在纸面上看起来如此不靠谱的情况下加入Etched。随着公司成功,他们担心会失去这种“反共识”的文化,因此需要刻意保持。
4. 融资的至暗时刻与“假设它可行”的心态

Rob Wachen 和 Gavin Uberti 分享了公司在2024年初融资的艰难时刻,并强调“假设问题可解”是克服一切困难的核心心态。

  • 历史脉络:在2024年初,Etched完成了架构设计,准备进入物理设计阶段。他们意识到,不仅要造芯片,还要造整个集群,这需要远超当时账上1500万美元的资金。他们估算需要1亿美元,但当时AI芯片A轮融资的最高纪录约为4000-5000万美元。
  • 数据链:他们花了100小时写了一份30页的备忘录,但几乎所有主流风投都拒绝了。他们被迫进入“生存模式”,从每一笔小额投资开始(100万、200万),最终通过债务和股权组合,艰难地凑齐了1.03亿美元的A轮融资。
  • 机制拆解:面对看似无解的技术问题(如将两个时钟信号在50皮秒内对齐),Gavin的哲学是:“假设问题可解,然后思考如何解决。” 他们通过一个巧妙的相位漂移机制解决了这个难题,而当时有团队成员因此辞职,认为问题无解。这种“找办法”的心态(find a way mentality)是公司文化的核心。

提及的标的

标的 嘉宾态度 关键数据
NVIDIA 风险提示/对比对象 芯片间延迟约4000纳秒;Blackwell B300的FLOPS密度低于某些竞品;HGX/DGX系统贡献了其大部分收入。
TSMC 看好/关键合作伙伴 客户服务“远超其他任何行业”;愿意自费为Etched做实验以提升良率。
Synopsys 看好/关键合作伙伴 在Etched资金紧张时,以极优惠条件提供仿真器(相当于一笔大额贷款)。
Google (TPU) 风险提示/对比对象 嘉宾认为,TPU对Google并非“生死攸关”,因为其核心收入来自搜索。
Meta (MTIA) 风险提示/对比对象 同上,MTIA对Meta并非“生死攸关”。
Microsoft (Maya) 风险提示/对比对象 同上,Maya对Microsoft并非“生死攸关”。
OpenAI (Jalapeño) 风险提示/对比对象 同上,Jalapeño对OpenAI并非“生死攸关”。
Cursor 看好/案例 曾用多个编码代理在一周内从零构建了一个完整浏览器。
Exnor 背景提及 Gavin的第一份工作,后被苹果以2亿美元收购。
Octo 背景提及 Gavin曾工作过的公司,后被NVIDIA以数亿美元收购。

值得记住的判断

1. 推理将成为全球最大市场之一,生产最多token的公司将成为最有价值的公司。 (Gavin Uberti) —— 这驱动了Etched所有决策,即如何以最快速度上线最多的token产能。

2. “最好的零件就是没有零件,最好的供应商就是没有供应商。” (Rob Wachen) —— 极端垂直整合(芯片、板卡、冷板、互连、生产)是获得性能和速度的关键。

3. “假设问题可解,然后思考如何解决。” (Gavin Uberti) —— 面对50皮秒时钟对齐这样的“不可能”问题,这种心态是克服恐惧、找到解决方案的核心。

4. “生产就是产品。” (Rob Wachen) —— 在芯片流片前就完成机架、软件、冷板、生产线的准备,使得Etched从拿到芯片到运行推理仅用40天,而另一家公司花了10个月。

5. “机器不像人一样思考。对人来说,存储和加载记忆很便宜,做数学很贵;对芯片来说,恰恰相反。” (Gavin Uberti) —— 这解释了为何未来的模型应设计为使用大量计算(如激活更多专家、处理超长上下文),而非依赖高效的内存访问。

6. “对于我们的产品,成功是生死攸关的;对于Google、Meta、微软、OpenAI,他们的芯片项目失败并非生死攸关。” (Etched 新招聘的架构师) —— 这解释了为何专注于单一产品的初创公司能吸引到最顶尖的人才,并造出最好的芯片。

7. “我们正处于一个‘智能’成本远低于‘智能’价值的时代,这意味着我们将面临长达数年甚至数十年的token供应短缺。” (Rob Wachen) —— 任何能生产token的芯片或系统都将极具价值。

8. “到2027年,从事知识工作的‘代理’数量将超过人类。” (Rob Wachen) —— 这预示着未来衡量社会生产力的指标将从“人均GDP”变为“每兆瓦代理数”。