Prefill - Decode Disaggregation
搜索文档
SA-TPU推理外部化全面加速-TPU Inference Externalization Full Steam Ahead - InferenceX
2026-09-10 10:51
好的,作为一名拥有10年投资银行从业经验的资深研究分析师,我已仔细研读这份关于TPU推理外部化的电话会议记录,并总结出以下关键要点。 行业与公司 * **行业**:AI加速器(半导体)行业,专注于AI推理工作负载[1] * **公司**:谷歌(Google)[1]、英伟达(NVIDIA)[4]、Anthropic[2]、Inferact[11]、RadixArk[11]、Red Hat[81]、AMD[8] 核心观点与论据 1. TPUv7 Ironwood 性能与成本优势 * **核心观点**:谷歌TPUv7 Ironwood在推理性能每美元成本上显著优于英伟达Blackwell系列,正在削弱英伟达的CUDA护城河[1][4] * **性能对比**:在与B200/B300的同口径对比中,Ironwood每美元性能最高可提升50%[4][5] * **成本对比**:在每用户每秒100 Token的交互速率下,Ironwood每百万总Token成本约为0.181美元,较B200的0.222美元低约19%,较B300的0.276美元低约34%[21] * **吞吐量优势**:在每用户每秒20 Token的交互速度下,Ironwood原始吞吐量达到每芯片每秒9,364个Token,比B200的8,903个和B300的8,925个高出约5%[28] * **性价比优势**:结合更低的每小时成本,Ironwood每美元产出的Token数比B200多50.4%,比B300多96.0%[29] * **内部TCO优势**:若以谷歌内部工作负载的TPU总拥有成本(每芯片小时1.03美元)计算,在并发度为256时,其性价比优势较B200提升76.7%,较B300提升130.2%[31] * **延迟权衡**:高并发结果伴随延迟权衡,例如在并发度256时,TPU平均首Token时间(TTFT)为5.41秒,而B200为3.75秒,B300为2.40秒[31][32] * **端到端延迟**:在20秒中位响应时间下,TPU每百万总Token成本约为0.098美元,比B200的0.106美元低约8%,比B300的0.132美元低25%[35][36] * **FP4场景**:TPUv7不具备原生FP4计算能力,因此在FP4场景下英伟达GPU仍保持领先,但TPUv8i将改变这一局面[18] 2. TPU外部化战略与软件生态 * **核心观点**:谷歌正通过可购买或租赁的TPUv7芯片,以及全新的TorchTPU软件栈,全面加速TPU推理外部化进程[1][7] * **客户基础**:Anthropic已成为TPU的最大用户,承诺部署超一百万颗(约40万+颗直接采购,60万+颗通过GCP租用),主要用于训练和推理[7] * **软件栈演进**:TPU软件支持经历了从PyTorch/XLA到TorchAX/JAX,再到全新的原生TorchTPU后端的三个阶段[51][57] * **TorchTPU优势**:TorchTPU将TPU作为原生PyTorch设备,允许开发者使用`.to("tpu")`,复用更多上游模型代码和调度器,降低模型启动成本[69][75][76] * **开源时间表**:TorchTPU技术栈预计将于10月左右退出私有测试阶段并开源[16][85] * **社区合作**:Inferact、RadixArk和Red Hat正与谷歌合作,致力于让TorchTPU后端在vLLM和SGLang中成为一流体验[81] * **模型支持**:谷歌计划将支持扩展到Kimi K3和GLM5.3等开放权重模型[15] 3. TPU系统级协同设计 * **核心观点**:谷歌的成本优势源于将计算裸片、芯片间互联和编译器作为整体进行协同设计,而非追求单芯片性能最大化[155][156] * **芯片架构**:TPUv7 Ironwood采用两个独立的计算裸片,每颗芯片搭载2个TensorCore和4个第三代SparseCore[158] * **内存**:每颗芯片的HBM容量约为Trillium的6倍[161] * **MXU**:从TPU v6e起,MXU阵列尺寸翻倍至256x256,每周期算力较前代设计提升4倍[163][165] * **网络**:TPUv7 Pod可通过低延迟ICI结构扩展至1000多个芯片,实现英伟达NVL72无法执行的大模型解耦及超宽专家并行优化[42] 4. 推理优化深度解析 * **核心观点**:为在TPU上高效运行模型,需要进行一系列针对TPU架构的专属优化,包括DP注意力、MoE路由、GDN内核等[88][89] * **DP注意力优化**:将八路注意力数据并行(DP8)与八路专家并行(EP8)相结合,避免不必要的All-to-All通信[92][93] * **通信优化**:将专家ID和路由权重的收集合并为一次全收集,在DeepSeek-V3测量中每层节省约80微秒[95] * **SparseCore卸载**:将ReduceScatter集合通信和专家输入的不规则重排迁移至SparseCore,释放TensorCore执行其他操作[98][110] * **MoE路由优化**:通过移除冗余瓦片计算、三重缓冲专家权重等,分组矩阵乘法第二版在8k1k服务吞吐量上提升12%[109][111] * **GDN内核优化**:通过重排代数运算、减少向量寄存器溢出、异步状态传输等,GDN v3内核级加速分别为解码1.41倍、预填充1.60倍、混合批次2.14倍[122][124][125] * **混合状态管理**:通过紧凑分配循环状态、以BF16格式存储、移除旧页大小对齐约束等,在并发度为512时,1k8k吞吐量分别提升18%、15%和7%[130][131][132] * **低并发开销**:通过按活动请求数量分桶元数据、将填充Token路由至专家零等,在并发数为四时,1k1k场景综合性能提升22.9%[136][139][140] * **前缀缓存**:为混合模型启用前缀缓存,通过为GDN提供独立的读取检查点和写入实时状态的槽位,解决循环状态覆盖问题[143][144] * **分页注意力**:通过序列在通道上的布局,可用KV页面数量翻倍(从5,141增至10,283),在并发128时吞吐量提升16.5%,中位TTFT降低95%[148][149] 其他重要但可能被忽略的内容 * **与英伟达的竞争格局**:在解耦式服务对比中,GB200/300 NVL72目前更具竞争力,但预计差距将在几个月内缩小[41][42] * **TPUv8i展望**:TPUv8i将具备原生FP4支持,公司坚信其将能与Rubin NVL72竞争[18] * **Anthropic的TPU使用**:Anthropic是TPU的最大用户,其用量预计到2029年将超过DeepMind自身的用量[2] * **软件文化对比**:与仍在学习构建测试优先软件文化的AMD不同,谷歌拥有数十年的软件工程经验和质量驱动文化,预期外部TPU软件将快速成熟[8] * **MXU利用率**:由于脉动阵列尺寸,模型形状对MXU利用率至关重要,例如Llama 3 8B的注意力头维度为128,在256x256 MXU上利用率最高只能达到50%[166][167]