每百万 token 便宜 0.04 美元:一份第三方跑分,凿开了 CUDA 的墙

2026年9月11日 · zknr

谷歌 TPU 与英伟达 CUDA 的成本之争

SemiAnalysis 发布了谷歌第七代 TPU Ironwood 的首份第三方推理性能测算。在对等负载下,TPU 的每美元性能最高领先英伟达 B200 达 50%,对 B300 的领先幅度接近 96%。换算成每百万 token 成本,TPU 为 0.181 美元,B200 为 0.222 美元,B300 为 0.276 美元。

这场对比的引子在今年 4 月埋下。黄仁勋在 Dwarkesh 播客上表示,TPU 与 Trainium 都不敢来跑分,还公开鼓励挑战者使用 InferenceMAX 证明推理成本优势。五个月后,第三方把数据摆上了桌。

黄仁勋算的是芯片,客户算的是钞票

那次播客里,黄仁勋的判断可以拆成三层:TPU 的成本优势在逻辑上无法成立;从第一性原理看,TPU 的优势没有道理;Anthropic 只是特例,失去它 TPU 就会丧失增长引擎。

物理层面,前两条并没有被完全推翻。在原始吞吐曲线的大部分区间,TPU 的物理性能确实不及 GPU。差距出现在租赁价格上,5% 的物理吞吐优势叠加极低的单位时间租金,转化成 50% 的每美元性价比优势。若按谷歌内部每颗芯片一小时 1.03 美元的底线成本核算,这一优势会放大到 77% 甚至 130%。

黄仁勋计算的是单颗芯片榨出的绝对算力,商业客户衡量的是每一美元能买到多少实际产出。两套账本的不同算法,导向了不同结论。

第三条判断目前只维持了表面成立。Anthropic 确实吞下超过 100 万颗 TPU,其中约 40 万颗直接买断,60 万颗通过谷歌云租赁,到 2029 年它会超过 DeepMind 成为全球最大的 TPU 单一用户。另一边,谷歌自去年起开放芯片直售,不再只守云端租赁这一条路。黄仁勋当时敢下判断,前提是 TPU 在外面从来没有标过价,现在价标出来了,标价的人并不是谷歌。

生态铁幕比性能墙更难翻

真正有杀伤力的部分在软件层。

开源推理生态长期扎根于 PyTorch 与 CUDA 体系,而 TPU 的原生开发环境是 JAX。此前 vLLM 要跑在 TPU 上,得依靠一层叫 TorchAX 的翻译墙,把每个算子逐一翻译为 JAX 执行,分页注意力与底层优化因此积累了大量兼容问题,谷歌联合开源社区修补了一年多。

如今 TorchTPU 直接拆掉了这层翻译墙。它利用 PyTorch 自带的 PrivateUse1 后端接口,让 TPU 成为原生 Torch 计算设备。开发者敲下一行代码即可把编译交给 XLA,核心算子调用 Pallas 内核,DDP 与 FSDP2 等分布式特性可以无缝运转,vLLM 与 SGLang 的调度器与 API 层也能直接复用。

CUDA 的城墙由两部分垒成,一层是底层芯片性能,一层是封闭的生态铁幕。跑分打破了第一层的不可替代性,TorchTPU 则在填平第二层。

数字的来源需要注明

这份测算出自 SemiAnalysis,属于第三方机构口径,并不是谷歌官方数据。文中 77% 与 130% 的放大区间建立在谷歌内部 TCO 口径之上,带有自证性质,参考价值需要打折扣。

B200 也没有全盘落败。在中位响应时间 30 秒的狭窄区间内,它依然维持着微弱优势,随着延迟要求放宽,TPU 才重新接管制高点。两者存在各自的适用区间,选型最终要落到具体负载上。

写在最后

这次对比改变的是成本叙事。专用芯片用更低的单小时租金换取每美元产出优势,这条路在推理侧被验证了一次。对英伟达而言,护城河的物理部分被凿出裂缝,生态部分正在被 PyTorch 的底层更新慢慢填平,这个过程不可逆,也不会在一年之内走完。对买方而言,真正的意义在于议价空间,当第二个可比的选项被摆到台面上,采购谈判的起点就变了。

配图说明:本文封面为 AI 生成图像。

参考:36氪转载新智元《黄仁勋三次断言翻车,CUDA护城河,被谷歌一行代码凿穿》报道,本文为基于公开信息的独立评述。

← 返回首页