
SemiAnalysis 于 2026 年 9 月 7 日在 InferenceX Official Preview 刊出针对 TPUv7 Ironwood 的首份第三方推理成绩。对比设定为同等聚合服务、FP8、单 token 预测;用来打分的模型是 Qwen3.5 397B FP8。文中写,Ironwood 相对 B200 / B300,每美元性能最高大约好 50%。
交互速度 100 tok/s/user 时,Ironwood 约 0.181 美元 / 百万 token,B200 为 0.222 美元,B300 为 0.276 美元,分别大约便宜 19% 与 34%。降到 20 tok/s/user 时,Ironwood 单芯片总吞吐约 9364 token/s,高于 B200 的 8903 与 B300 的 8925;折算到每美元产出的 token,相对 B200 约多 50.4%,相对 B300 约多 96.0%。
文中写明 TPUv7 没有原生 FP4,该精度下 NVIDIA 仍占优;下一代 TPUv8i(代号 Boardfly)会带原生 FP4。TorchTPU 把 TPU 做成原生 PyTorch 设备,调用时把 device 设为 tpu,拟在 10 月 PyTorch 大会期间开源,并拟把适配扩到 Kimi K3、GLM 5.3 与 Gemma4。另按原文表述,Anthropic 承诺采购逾百万颗 TPU,约 40 万直购、60 万经 GCP 租赁。


