晶圆级芯片设计
搜索文档
Cerebras:不切晶圆的芯片“怪兽”,有希望挑战英伟达?
36氪· 2026-10-09 22:00
文章核心观点 - 绝大多数芯片设计公司将大硅片切成小芯片再互联做AI加速器,Cerebras则直接把整块硅片当成一个芯片,塞进4万亿个晶体管和90万个核心[1] - GPU推理瓶颈是“内存墙”,英伟达绕着走,Cerebras用晶圆级芯片把墙拆掉,护城河主要在台积电之外的设计、容错和封装环节[2] - 文章围绕Cerebras的WSE产品是什么、能解决GPU什么问题、WSE如何制造以及难点在哪展开[2] 一、Cerebras做什么 - Cerebras核心是WSE(晶圆级引擎),区别于常规芯片的Die级别而非晶圆Wafer级别[2] - 同行常规做法是把一张晶圆切成几十上百颗800mm²的裸片,再用高速互连拼回去当成一个大加速器用[2] - Cerebras逻辑是既然最后还要拼回去,为什么要先切,于是把全部各类计算都刻在一整片晶圆上[2] - Cerebras将整片晶圆划分成12列x7行的84个完全相同的网格die,84块之间互为邻居互联,构成“一整个芯片”[2] - 每个die中有1.07万个激活核心core,每个核心仅0.05平方毫米,一个晶圆对应90万个激活核心,实际有97万个左右物理核心,结合良率约有7%的设计冗余[3] - 单个核心中塞了三个东西:一个路由器、一个计算引擎和48KB的SRAM,单晶圆97万个核心大致对应44GB的SRAM,面积大约对半分,一半给逻辑一半给存储[4] - WSE单核面积仅为0.05平方毫米,英伟达、苹果的单元面积在3平方毫米左右,尺寸标准只此一家[4] - WSE单核内的计算核心、路由器、SRAM组合架构由Cerebras自研,但SRAM上bit cell设计和代工由台积电完成,包含在晶圆报价中[4] - GPU像一座图书馆,全套百科全书权重放在书库HBM,上百个读者SM坐在阅览室,每要写一个字所有读者都得把整套书完整翻一遍,书库到阅览室只有一条走廊每秒能过8TB的书[4] - WSE没有建图书馆,雇了90万个人核心每人背下整套书里的一小段,没有书库没有走廊也没人需要跑腿,要写一个字时只要把题目念一遍每个人立刻从记忆里报出自己那一段的答案汇总即可[4] - SRAM主要部分用来存放权重,一小部分用来放激活值、KV cache等[5] - 计算单元主要在一个数激活值送过来时负责乘一次加一次,没有数传过来就坐着不动不耗电[5] - 路由器用来传题目和收答案,主要工作是把题目念给所有人、把大家的答案收回来汇总、把答案送去下一站[5] - WSE能克服GPU最主要面临的问题就是缩短了运输时间,解决“内存墙”[6] - GPU的权重在HBM,每个Token都要完整搬一次,B200/B300带宽8TB/s,而WSE直接将权重搬进了SRAM就在计算单元旁边[6] 二、GPU针对“内存墙”的努力 - HBM的搬运时间远远大于GPU的计算时间,以Llama 70B模型FP8为例参考B300,HBM搬运时间约为8.8ms,GPU计算所用时间仅为0.028ms,相对搬运时间不到0.5%[7] - 这意味着99.5%的时间都在等权重从HBM搬过来,导致GPU算力闲置,这也是推理场景主要瓶颈[7] - HBM搬运时间=70B参数x单参数占用1B空间/8TB/s带宽=8.8ms,GPU计算时间=2次运算x70B参数/5PFLOPS GPU计算速度=0.028ms[7] - 即便下一代Rubin将HBM带宽提升2.75倍到22TB/s,但Rubin GPU 17.5PFLOPS的计算速度提升了3.5倍,GPU闲置时间仍有99.5%[8] - GPU想到的方案是拼团Batching,所有用户都要读同一套权重,既然这一趟已经花时间去搬运了顺手把其他人的题目也一起算了[8] - 拼团目的在一次搬运任务完成后让上百个计算任务同时进行,抹平搬运数据所需的时间,可测算出目前理论上的拼团上限值313到398[8] - 在这个临界点之下意味着还在浪费算力,高于这个临界点表明在浪费带宽[8] - KV cache会限制拼团上限,虽然权重是共享的但每个用户的对话记忆KV Cache都是私有的[9] - 在Llama 70B模型里每个token按照FP8精度要占用160 KB空间,一个用户对话如有8K上下文单用户KV Cache就要占用1.3GB,即8192x160KB=1.3GB[9] - 以B300单卡为例显存288GB,在装完70B FP8模型参数后HBM还剩217GB空间,一个用户占1.3G的KV Cache,一张卡也就同时服务167个8K上下文长度的用户[9] - 此前测算的batch临界值在313,实际拼团上限在167这个位置就到顶了,KV Cache已经把HBM塞满限制了拼团的上限[10] - 延迟与吞吐的死结,在吞吐改善的同时拼团会带来首字延迟、字间延迟的情况,导致所有GPU推理API都有“快但贵”和“慢但便宜”的两档[10] - 方法一从单卡迈向机架扩大整个机架的显存打破KV Cache的天花板,从英伟达的H100到B300到VR200机架来看机架级显存方案能克服KV Cache上限的困扰[10] - 方法二系统级分解解耦推理,把Prefill预填充生成KV Cache和Decode解码消费KV Cache拆成两套独立的GPU集群,中间由KV Cache池连接[11] - 预填充阶段Prefill是处理完整的输入上下文,是计算密集型的非常适合GPU处理[11] - 解码阶段Decode负责预测新token且受限于内存带宽,解码阶段对延迟非常敏感因为模型是逐个预测新token的[11] - 传统GPU方案中Attention和FFN是抢着用HBM争带宽,英伟达购买Groq之后新一代架构VR200引入了以Groq的LPU为核心的LPX机架,进一步将Decode拆分成Attention和FFN两部分[12] - Attention回看前文,如果有前文需读历史上所有token的K和V即KV Cache,VR200中的Attention能独享全部HBM带宽不用和FFN抢带宽[12] - FFN前馈网络使用自身知识来做计算,无或无需前文只看当前token来算就使用LPX机架的LPU计算芯,这种芯片上的片上内存SRAM非常大主要存FFN权重,由于权重常驻SRAM不需要从HBM搬运可实现极低的延迟计算[12] - 系统级分解将推理阶段拆成了三段:Prefill计算要求高、Decode的Attention KV Cache带宽密集、Decode的FFN/MoE参数带宽密集但不依赖KV[13] - Prefill环节对算力要求高但对HBM带宽要求低,可以选择英伟达“读题”专用芯片如Rubin CPX[13] - Decode中的Attention需要在意KV Cache的读取速度,仍需要通用GPU如Rubin、B300[13] - Decode中的FFN在意权重读取速度,可以采用SRAM预存权重如LPU、Groq机柜,节省了从HBM输送的时间[13] - 在解耦推理后相对理想的状态是GPU仅执行Attention操作,其HBM容量可以完全分配给KV Cache,从而能增加其处理的Token总数也提高了单个专家平均处理的数量/利用率[13] - 在英伟达从H100到B200/B300到VR200 NVL72的变化中,从H100到B200/B300主要是在算力的提升结构上没有变动,主要有助于Prefill阶段,而从B200/300到VR200的改变更大直接从结构上将推理拆成了三段[14] - LPU的片上SRAM放模型FFN权重参数,但KV Cache的读取仍在HBM,单次读取的延迟时间没变主要是减少搬运量[15] - 综合英伟达的VR200+LPU的方案相对更适合于“长上下文+高交互+大MoE”的场景如DeepSeek-V4、Kimi K3等,而在“短上下文+低交互+Dense”的场景中如GPT-3 175B、Llama 70B等解耦方案并不适合[15] - 短上下文是指短对话几K token,超大Hidden Dim是指模型每一层的数据宽度很大,32k+的超大模型每层FFN达到11.3GB[16] - 由于LPU只承接了权重部分,KV Cache依然存在HBM还是会受到HBM带宽22TB/s的影响[16] - 在Cerebras WSE方案里KV Cache也直接存取在片上SRAM,片上带宽21PB/s,读取延迟不到1ns,对比GPU方案0.1-1us,更适用于低延迟、愿意为速度买单的客户[16] 三、Cerebras的WSE是怎么造的 - Cerebras的晶圆级芯片WSE是半导体工程史上最具颠覆性的设计之一,传统GPU一般采用的是晶圆切割成小芯片Die再封装,而WSE采用的是一整块晶圆能切出来的最大正方形就是一个大硅片的方案[16] - WSE只是对单个直径300mm的晶圆切割出21.5cmx21.5cm的最大正方形,而内部并未切割,采用“光刻视场缝合Reticle Stitching”技术[17] - 这块硅片是4.6万mm²,但光刻机曝光有面积上限,单次最大曝光面积约26mm×33mm=858mm²称为一个视场/Reticle[17] - 一台光刻机要在晶圆上重复曝光84次才能打满这块正方形区域,这也对应着WSE的84个Die[17] - 传统做法中这84个曝光区域之间留有物理划片槽等待后续切割刀切开,而WSE的做法是物理划片槽依然存在但在制造芯片顶层金属线时利用特殊的掩膜版跨越划片槽绘制出微米级的铜走线,从而把这84个原本独立的网格Die直接在硅片内部“缝合”连接成一条高带宽的二维网格[17] - WSE需经历“硅片->版图设计及布线->前道工艺光刻->中道测试与容错->后道封装/组装->系统级集成”的过程,与传统晶圆/芯片的大体流程基本一样区别点在于部分环节的操作[18] - 环节1硅片制造与常规完全相同,WSE也是从标准的12英寸300mm高纯度硅片起步,从冶炼高纯度石英砂二氧化硅开始经过提纯、拉单晶、切割、抛光和清洗最终得到晶圆[19] - 环节2版图设计与布局走线是WSE特有,常规芯片通常是芯片设计厂用EDA软件设计版图后交给代工厂做掩膜版,而WSE的单核微架构太特殊是Cerebras自己主导[19] - 芯片上的“布局走线”不只是物理版图还包含编译器在运行时的逻辑布局,芯片走计算任务时84个计算区块中要绕过有缺陷的区块,这是WSE容错机制的关键支撑[19] - 单核微架构设计一个38,000µm²的核,48KB SRAM(8个6KB bank每bank 32-bit宽)+计算引擎(SIMD ALU、8个微线程上下文)+5端口路由器,自研ISA指令集架构不是ARM也不是RISC-V[19] - 核阵列版图复制把单核版图在reticle光刻视场范围内阵列复制,reticle的物理上限858mm²(26mm×33mm单次曝光),Cerebras的一个计算区块约550mm²容纳约11,548个核[19] - 冗余与绕行逻辑设计在版图里预埋冗余计算核、冗余路由、区块时效时的绕行机制,这是设计阶段就付掉的成本不随台积电的缺陷密度波动[20] - 划片道走线设计跨die的短线图案,这需要台积电专门提供的划片道设计规则,这不在设计厂给代工厂的施工说明书PDK里[20] - 设计图交付用外购的传统EDA工具做综合、布局布线、DRC/LVS,唯一公开披露的外购IP是Synopsys DesignWare的片上传感与监测模块SLM,主要是在4.6万mm²的大硅片上分布温度、电压、工艺偏差传感器[20] - 环节3前道工艺光刻是WSE的技术分叉点,参考半导体前道标准流程清洗→氧化/扩散→沉积→光刻→离子注入→CMP→金属化,WSE同样经历了这些环节,这部分和跑一颗普通5nm芯片没有任何区别[20] - WSE是用步进重复曝光把同一张掩模版图案重复曝光84次550mm²的die,步进重复曝光是光刻机的一种工作方式,掩模版上的图案通过投影物镜缩小后曝在晶圆的某个位置然后晶圆台移动一步再曝一次[20] - 目前量产的WSE3是采用台积电5nm工艺,N5一般大约是15层金属[21] - 每一层都是同样的四步循环:沉积介质层整片、光刻打图案步进84次、刻蚀出沟槽和通孔整片、填铜+CMP磨平整片,就这样重复15次打造15层楼[21] - 在前面的12层基本是相似的,区别主要在13层及之上WSE的掩模版变了[22] - 常规芯片的掩模版上划片道那条带是留给工艺监控结构、套刻标记、测试键的,那是准备被锯掉的地方画什么都无所谓[22] - Cerebras的掩模版上那条带被改成了走线通道,跨越die边界的短金属线长度不到1mm,这里用到了跨划片线晶圆级互连技术类似于在高层架天桥[22] - 这是最关键的地方,一根跨界的线一半画在曝光场的右边缘一半画在左边缘,第N次曝光die本体+右侧半截天桥,晶圆台移动一步,第N+1次曝光左侧半截天桥+die本体,两个半截在划片道上空对接连成一根完整的线[23] - 由于要设计跨界的线所以要替换掩模版,天桥不需要额外的曝光次数,两次曝光的天桥对接是靠晶圆台的步进精度完成[23] - 划片道上的铜和die内部的铜都是同一次沉积、同一次刻蚀、同一次CMP的产物,用的也是同样的设备、同样的材料和同样的参数[23] - 高层做是因为低层的线太细了,纳米级的对接误差会直接断线或短路良率归零,高层微米级的容差宽松两三个数量级[24] - 实际上“高层架1层天桥”是理论上够用的,但考虑布线灵活性和冗余推测大概率会架2到3层,普通晶圆的划片线是切割芯片时的“禁区”,Cerebras在划片线上进行布线从而将84个die全部连成一个整体[25] - 环节4中道测试与容错,传统晶圆过程中要在切割前对晶圆上每颗die做电学测试,坏die需要打墨点或记入电子地图,在沿划片道全部锯开后把坏的die丢弃掉好的die送去封装[26] - WSE测试的目的不是挑出好die而是摸清整片晶圆上哪些核心坏了、坏在哪,WSE中的84个die被金属线缝成一体对外的I/O只在整片的边缘,没有任何物理通道去单独访问中间某个核因而WSE采用的是全片测试[26] - 网格中每个core都自带SRAM 48KB和路由器,即每个core具备“自己运行测试程序+通过路由器网络把结果传出去”的物理条件,这正是“自测”的最小硬件基础[26] - 一个core的路由器坏了等于路坏了,自己区块的数据报不了其他区块数据无法经过等于区域性失联了,这种需识别是单一区块坏了还是这个区块的数据路径断了[26] - 这需通过冗余路径探测如从多个方向、多个边缘端口交叉验证才能判别,因此一开始就对core设计了从东南西北四个方向的冗余路径[26] - “坏核”WSE的Core=计算单元+本地SRAM+路由器,即计算和路由在物理上是分离的部件,路由器活着计算和存储坏了这个区块可以继续当纯转发节点,但路由器废掉无论计算和存储是否可用这个Core就算坏死了[27] - 环节5后道封装/组装,台积电主要参与了“前道晶圆制造+晶圆级互联Fab内”工作,之后封装和整机系统集成Fab外基本都是由Cerebras完成[28] - 在前道制造完成后台积电在晶圆交付前完成了以下关键的中后道处理:跨划片槽金属互连台积电和Cerebras联合研发,和全晶圆级钝化及凸块台积电在未切割的整块300mm晶圆表面做全盘钝化保护并制作高密度的Micro-bumps/C4凸块用于引出电源和信号触点[28] - 台积电交付的是一张打好了金属凸块、带有跨掩模互连线的300mm硅晶圆,接下来的系统级物理封装台积电没有参与全部由Cerebras自研[28] - 这是一块300mm的硅晶圆775微米厚,没有一个电源接口没有一条数据通道没有任何散热方式,Cerebras接下来要做的是把这个硅晶圆变成一台机器[29] - 首先对直径300mm的硅晶圆沿着215mmx215mm的外框切一刀,把圆片四周的月牙形边角料就是废料大约浪费35%的面积得到一个正方形硅片[29] - 接下来的问题主要是对外数据连接与通电两大难题,面积太大功率23千瓦相当于十几台家用电磁炉同时全功率运转,传统封装下一通电就把自己烧死了[29] - Cerebras设计了四层三明治结构“冷板+晶圆+柔性连接器+PCB”,公司将其称之为“engine block”引擎缸体,这也是Cerebras的核心技术[29] - 首先需要将215mm见