Workflow
Google Frozen V2
icon
搜索文档
GoogleFrozenV2:模型与芯片协同进一步深化,推理竞争转向Token/w
海通国际证券· 2026-07-22 09:06
报告行业投资评级 - 报告未对特定公司或行业给出明确的“优于大市”、“中性”或“弱于大市”的投资评级 [1] 核心观点 - **Google探索模型专用推理芯片**:Google正在研发代号为Frozen v2的新型服务器AI芯片,旨在将Gemini模型的部分元素直接融入硬件,预计最早于2028年部署,其单位功耗Token产能可能达到Google最新自研AI芯片的6-10倍 [1][16] - **核心增量在于围绕具体模型定义芯片**:与传统TPU针对通用计算优化不同,Frozen v2可能围绕Gemini中较稳定、重复率高的模型结构和执行路径进行定制,通过减少通用指令、运行时调度和数据搬运来提升效率 [2][17] - **解决“内存墙”问题的下一步**:在Decode阶段,生成每个Token都需要持续读取模型权重和KV Cache。Frozen v2通过将优化边界从通用推理工作负载收窄至Gemini模型本身,是Google应对这一挑战的深化举措 [2][18] - **对标NVIDIA的异构推理方向**:Frozen v2与NVIDIA的“Rubin GPU+Groq 3 LPX”方向一致,目标都是提高单位电力可交付的Token产能,但两者路径不同:NVIDIA强调高带宽通用计算平台,而Google依赖超大规模专有互联与特定工作负载优化 [4][20] - **平台广度与专用化深度的路线差异**:NVIDIA需要服务广泛客户,因此保留CUDA平台的通用性;Google拥有从模型、芯片到流量的完整闭环,可以围绕特定模型进行更激进的硬件固化 [5][21] - **主要经济价值在于释放电力与推迟数据中心扩建**:6–10倍的Token/W提升意味着芯片侧功耗理论上可下降约83%–90%。静态情景测算显示,一个100MW IT负载的推理集群中,可迁移负载原本消耗35MW,迁移后仅需约3.5–5.8MW,每年可节省约3.1亿–3.3亿度电及2,150万–2,320万美元电费,基础设施Capex的延期价值可能更高 [6][22][24] - **对Alphabet和NVIDIA的影响**:对Alphabet而言,Frozen v2首先解决算力供给约束,有望在不增加园区电力的情况下扩大AI服务规模,并改善相关服务的毛利率 [8][25]。对NVIDIA短期影响有限,但中长期看,头部模型厂商可能将稳定、高频的推理流量迁移至自研ASIC,NVIDIA在成熟模型Decode环节的份额将面临分流压力 [9][26] 技术细节与产业基础 - **Google具备规模化经济基础**:Frozen v2建立在百万颗级自研TPU平台、成熟编译器和海量Gemini流量之上,并非从零开始的实验项目 [3][19] - **供应链持续扩大**:Google TPU制程已由N5P升级至N3E/N3P,并持续采用CoWoS-S封装;新一代项目除Broadcom外,也出现MediaTek参与 [3][19] - **技术实现路径**:Frozen v2并非将完整Gemini权重永久写入芯片,而是将变化较慢的模型架构和执行逻辑硬件化,同时保留参数和部分软件层的更新能力 [2][17] - **系统规格对比**:Google Ironwood采用64颗TPU、约80–100kW机架设计;NVIDIA Vera Rubin NVL72采用72颗GPU、约187–227kW机架设计,单GPU互联带宽达到3.6TB/s,是Ironwood的3倍,反映了不同的设计优先级 [4][20] - **互联市场格局**:NVLink目前仍占据约80%–90%的Scale-up互联市场,而Google ICI仅服务内部TPU Pod [5][21]