破解智算拥塞的行业难题,这家成立两年的公司拿下近亿元融资
英伟达英伟达(US:NVDA) 创业邦·2026-10-09 11:05

文章核心观点 - 恒瀚微完成近亿元天使轮融资,投资方包括北京国泰、成都科创投、成都高新创投和中信聚信投资,资金用于产品迭代、人才引进和市场拓展 [2] - 大模型推动GPU集群扩大,GPU间数据传输效率影响算力利用率,RDMA智能网卡是智算集群关键连接设备 [2] - 高性能RDMA智能网卡长期由海外厂商主导,英伟达ConnectX系列在AI智算场景市场份额达95%,受出口管制影响高端产品对华供货周期延长至平均6个月,国产替代需求迫切 [2] - 恒瀚微瞄准国产替代缺口,首款400G RDMA智能网卡已完成送样和验证并拿到正式订单 [3] - 恒瀚微创始人兼CEO胡超博表示,部分测试场景中首款400G RDMA智能网卡动态时延远低于英伟达同类产品CX-7 [4] 锚定AI算力刚需,打造RDMA网卡 - 胡超博为芯片科班出身,海外学成归国后一直从事网络芯片研发,曾在中兴微电子、奕行智能工作 [6] - 胡超博曾研究2020年大火的DPU,英伟达将DPU、CPU、GPU统称为未来计算三大支柱,国内掀起DPU创业浪潮,DPU专门接管服务器网络、存储、加密等杂活帮CPU减负,主要用于云计算场景 [9] - 胡超博最终未做DPU,原因在于不同云计算客户对DPU需求差异较大,产品往往需要定制,同一款DPU覆盖客户有限,芯片或以芯片为核心的产品需较强通用性和足够大的销售量以摊薄流片成本 [10] - 2022年之后GPT-3引发大模型涌现,大模型参数量飙升,训练和推理所需GPU指数级飙升,GPU卡数量增加后网络带宽和延迟痛点极大限制GPU间数据传输效率从而影响算力 [11] - 大模型训练将任务拆分,每个GPU领取计算任务完成后将数据传输给下游GPU,只要一部分数据没有按时到达,下游其他GPU就要等待 [11] - GPU之间数据传输效率成为限制算力的因素之一,RDMA智能网卡是解决这一问题的设备,RDMA是一种服务器高速通信技术,可让一台服务器数据更直接进入另一台服务器内存,减少数据搬运造成的等待 [12] - RDMA智能网卡安装在GPU服务器中,负责将本机GPU产生的数据发送到其他服务器,同时接收其他GPU传送来的数据 [12] - 胡超博认为RDMA智能网卡是适合自己的机会点,市场需求方面智能网卡需求本身很大,GPU和智能网卡配置是1比1,GPU集群扩容带来大量智能网卡需求 [13] - 供给侧存在缺口,从2022年起大模型和GPU集群快速发展,但400G以上的RDMA智能网卡仍主要由海外厂商提供,存在国产替代迫切需求 [13] - 产品角度方面,RDMA智能网卡是技术壁垒较高的标准化产品,网卡本质上解决高带宽、低时延和流量管控问题,RDMA智能网卡起步就要做到400Gbps,在带宽、时延和流量管控都要做到极致 [13] - 胡超博一直从事网络芯片研发工作,积累了不少相关研发经验,并联系老同事组成一支15人的初始团队 [14] - 初始团队人员一直从事网络芯片相关工作,分别来自中兴微电子、华为海思、阿里巴巴、腾讯等头部科技企业的一线 [14] - 团队具备全链条能力,覆盖芯片架构设计、芯片实现、网卡开发、产品工程化、商业化等环节 [14] - 2024年胡超博创办恒瀚微电子,瞄准RDMA智能网卡创业 [15] 自研拥塞管理,400G网卡实现性能突破 - 历经一年多打磨,恒瀚微于2025年推出首款产品400G带宽RDMA智能网卡 [17] - 恒瀚微起步就做400G,是因为400G是目前AI智算中心跨服务器通信的主流带宽规格之一,可以快速进入已经形成需求的市场 [19] - 从2022年开始400G网卡已大范围应用于GPU集群,相关GPU、交换机和客户测试环境都较为成熟 [19] - 恒瀚微首款产品差异性体现在解决拥塞状态下的带宽稳定和动态时延等问题,这都是业内长期存在的痛点 [19] - 大模型训练过程中常出现GPU多打一现象,即多张GPU可能同时向一张GPU发送数据,大量流量集中进入接收端网络会出现拥塞,数据开始排队后传输时延上升,带宽发生波动,等待数据的GPU也无法继续计算 [19] - 恒瀚微自研RDMA架构,并将其与credit-based主动拥塞管理方案结合,Credit可理解为接收端向发送端发放的数据传输额度 [20] - 发送数据前发送端先向接收端提出请求,接收端根据自身能够处理的数据量向发送端发放相应额度,发送端获得额度后再开始传输数据 [20] - 这是恒瀚微与传统方案的最大区别,传统方案通常在网络已经出现拥塞后再进行调节,恒瀚微的方案将流量管理提前到拥塞发生之前,由接收端决定允许多少数据进入 [21] - 该方案让恒瀚微产品具有两重功能优越性,一是提高拥塞场景下的带宽稳定性,接收端提前控制进入的流量可减少大量数据同时涌入造成的排队和波动 [21] - 二是降低动态时延,动态时延是指网络负载不断变化时数据从一端传输到另一端实际需要的时间,胡超博透露在部分测试场景中恒瀚微400Gbps网卡的动态时延可以达到英伟达同类产品的1/2至1/3 [21] - 恒瀚微还在网卡中加入可编程队列,队列是网卡内部等待处理的数据通道,可编程意味着客户可以根据不同任务调整部分流量的处理方式 [21] - 对智算中心运维人员而言,可编程队列意味着能够实现更可控的网络管理,观察不同任务的数据流量,并定位网络拥塞和性能异常发生在哪个环节 [21] - 产品实现上恒瀚微采用FPGA,FPGA是一种可以反复编程、调整功能的芯片,开发和修改速度较快,客户提出新需求后研发团队可以直接调整部分功能缩短产品适配周期 [22] - 胡超博表示希望快速切入市场先锁定一些客户,在客户验证过程中团队也能进一步了解真实业务需求,再针对这些需求设计后续产品 [22] 首款产品拿下订单,布局下一代智算互联生态 - 恒瀚微400G RDMA智能网卡已完成送样和验证,拿到正式订单 [24] - 第一批客户主要是中小规模的模型训练、模型推理企业以及AI Token工厂,这些企业会直接采购网卡将其安装在GPU服务器中,主要用于Scale-up网络业务场景 [24] - 从送样到PoC恒瀚微用了三个月时间,测试规模从双卡逐步增加到4卡、8卡、32卡和128卡,包括产品功能测试以及复杂流量下的稳定性测试 [24] - 经过这一过程恒瀚微实现从研发到订单的商业闭环 [24] - AI网卡需要与GPU、交换机以及智算中心的建设周期相匹配,一代网卡产品的市场周期大约为3至4年 [25] - 以400Gbps网卡为例,其从2022年开始大规模应用,到2026年仍有大量市场需求 [25] - 网卡用的芯片研发必须走在市场前面,胡超博表示从芯片行业来说要提前一代去研发,因为研发预期和市场会有差异,所以要留够足够的buffer [25] - 胡超博认为buffer刚好可以卡在半代到一代的时间点上,因此恒瀚微将一代产品的研发周期控制在1.5年左右 [25] - 在首款400G网卡产品研发上,胡超博采取加速切入市场的策略,并没采取自研ASIC芯片,而是先采用可以反复编程、快速调整功能的FPGA方案,希望用400G网卡快速切入市场,拓展不同类型的客户,形成更为多元的客户结构 [25] - 在二代产品800G和1.6T网卡上,恒瀚微将采用自研的ASIC芯片,ASIC是针对特定功能设计的专用芯片,研发投入更大、周期更长,但在性能、功耗和成本方面更适合规模化量产 [26] - 胡超博表示把目光放得更远,800G网卡和1.6T网卡才是未来 [26] - 在胡超博设想中,恒瀚微将网卡产品做到逐步从Scale-up场景向Scale-out场景延伸,Scale-up是先把几十颗GPU组成一台超级计算机,Scale-out是再把许多台超级计算机连成算力集群 [26] - 未来3至5年,胡超博希望在400G网卡取得市场突破的基础上,进一步推出更高带宽的下一代产品800Gbps和1.6Tbps网卡,抢占AI智算Scale-out互联市场 [26] - 其中800G网卡产品主要面向国内市场,1.6T网卡产品计划进入东南亚等海外智算中心 [26] - 在此基础上胡超博和恒瀚微还会探索Scale-mix场景,尝试用一套融合架构连接Scale-up和Scale-out两层,让GPU内部组网与集群之间的网络能够在同一套架构下协同 [26] - 胡超博表示未来会构建Scale-mix的新生态,希望用一套架构兼顾GPU之间和算力集群之间的连接,减少不同网络之间的适配,让算力扩容和管理变得更高效、更简单 [27]

破解智算拥塞的行业难题,这家成立两年的公司拿下近亿元融资 - Reportify