H100
搜索文档
黄仁勋,终于站队了
创业家· 2026-07-29 18:49
文章核心观点 - 英伟达首席执行官黄仁勋在2025年7月24日于社交媒体X上发布了其人生第一条推文,公开为开源AI站台,此举标志着其从保持中立转向明确选边,并联合20多家企业签署公开信,旨在构建产业联盟以应对闭源巨头垄断和监管收紧带来的潜在风险,从而维护其算力供应商的核心地位和增长模型 [4][6][9][10][16][22] 黄仁勋首次公开表态 - 黄仁勋作为掌管数万亿美元公司的领导者,几十年来首次在社交媒体发声,其内容反常地未提及Blackwell、GB300等硬件产品,而是公开支持开源AI [6][9] - 过去英伟达无需站队,因为无论开源或闭源AI路线最终都需要购买其GPU,保持中立即可受益于行业竞争 [10] - 当前华盛顿政策层讨论限制开源AI,可能通过前置审查或行政冻结等方式为开源模型设置上限,这将直接减少训练和部署需求,从而冲击英伟达的算力消耗和增长模型,迫使黄仁勋采取行动 [10] 站队开源的深层原因 - 中国创业公司DeepSeek和Kimi K3通过MoE架构创新、注意力机制优化(MLA)及极致工程能力,以较低成本将开源模型性能提升至世界第一梯队,证明了开源顶级模型可以不来自硅谷 [12] - 这一成就打破了闭源神话,即无需烧掉几十亿美金或被少数硅谷巨头垄断也能产出顶级模型,并刺激美国监管层将开源问题从技术路线讨论升级为产业竞争工具 [12][13] - 开源模型通过提升算法效率和降低成本,能指数级扩大AI应用场景,根据杰文斯悖论,最终将成倍拉动算力总需求,使英伟达成为最大受益者 [13] 构建产业联盟的行动 - 黄仁勋不仅发声,更联合超过20家企业签署名为《开放权重与美国在AI领域领导地位》的公开信,扮演了产业组织者的角色 [15][16] - 签署方包括Meta、微软、a16z、Y Combinator、Hugging Face、Mistral AI、Perplexity、IBM等,这些公司在商业上存在竞争,但在支持开源以获取技术自主权、打破闭源数据入口封锁等方面利益一致 [16] - 通过组建联盟,黄仁勋将英伟达的硬件需求与硅谷中下游生态链的利益绑定,将商业诉求包装为行业公共利益 [17] 闭源巨头的缺席与垄断风险 - OpenAI、Anthropic、Google三大闭源前沿实验室集体缺席此次联合行动,暴露了其维持封闭商业生态的意图 [18][19] - 闭源巨头希望维持一种结构,掌握顶级模型、流量入口和分发管道,使应用开发者沦为API框架下的按次付费“打工人”,导致产业链附加值向上游极少数入口集中 [19] - 这些闭源巨头(如OpenAI联合博通、Google的TPU、微软的Maia、亚马逊的Trainium)正在积极自研ASIC芯片,若其凭借入口垄断彻底接管底层算力,英伟达可能从不可或缺的底座沦为可被议价的配件商,毛利率神话面临威胁 [20] 行业规则与竞争格局的拐点 - 黄仁勋的行动标志着一个拐点:行业从“GPU决定AI”转向“规则决定GPU”,监管政策和开源走向将直接影响算力购买需求 [22] - 面对行政监管、法案合规与反垄断审查,仅靠CUDA等技术生态护城河已不足够,英伟达必须构建联盟与规则的护城河,从供应商转变为规则制定者 [22] - AI行业已告别仅凭技术情怀竞争的青春期,进入需要争夺入口、搭建生态、博弈监管的成熟产业阶段,参与者必须在规则、权力与生态间选边站队 [23][24] 历史类比与行业本质 - 当前AI开源与闭源之争,类似于历史上微软Windows垄断催生开源Linux与浏览器联盟,以及苹果App Store闭源帝国催生Android开源阵营的反击 [24] - 当英伟达作为“卖铲人”开始牵头讨论“矿场”管理规则时,行业曾经技术至上、百花齐放的黄金时代已经结束,未来竞争将围绕改变和制定规则展开 [25]
英伟达营收净利千亿,美国出题中国解题,谁才是AI真正的赢家?
搜狐财经· 2026-07-29 16:42
英伟达的财务表现与市场地位 - 2026财年全年营收达到2159亿美元,净利润为1200亿美元,净利润率接近56% [1] - 数据中心业务是核心支柱,收入为1937亿美元,毛利率常年维持在70%以上,支撑了公司万亿级别的市值 [1] - 公司盈利能力极强,日均进账约3.3亿美元,其净利润率是苹果公司(约25%)的两倍多 [1] 产业链中的角色与利润分配矛盾 - 英伟达赚取的巨额利润,意味着下游购买其芯片的AI公司(如OpenAI、微软、谷歌及中国大模型公司)需要支付高昂成本 [2] - 英伟达通过定义GPU架构、建立CUDA生态和设定AI算力标准,掌握了定义权和定价权,成为“出题人” [2] - 中国厂商擅长基于英伟达芯片进行组装、集成和解决方案落地(即“解题”),但利润微薄,组装利润可能仅约5%,而英伟达芯片的利润率则高达60% [2][3] 生态垄断与国产替代挑战 - 英伟达的垄断地位由其积累了十几年的CUDA生态巩固,全球数百万开发者已形成依赖,短期内难以被替代 [3] - 中国国产GPU公司(如寒武纪、海光、摩尔线程、华为昇腾、阿里平头哥、百度昆仑)正在加速发展,但面临生态重建的巨大挑战 [3] - 中国庞大的市场需求和完整的供应链能力为国产芯片提供了发展土壤,但突破英伟达的生态壁垒需要时间 [4] 历史对比与市场可持续性担忧 - 当前英伟达与1990年代末的思科有相似之处:均为基础设施提供商,在技术革命中占据主导地位并被资本市场高度追捧 [4][5] - 思科在2000年互联网泡沫破裂后股价暴跌超过75%,市值逻辑从成长预期转向盈利兑现能力 [5] - 英伟达2026年收入增速高达90%,市盈率约30倍,虽比思科当年(市盈率138倍)更“便宜”,但高增速已将未来增长预期充分计入股价,增速放缓可能带来巨大股价压力 [5] 近期市场波动与“毒性繁荣”风险 - 2026年7月,英伟达股价在不到两个月内蒸发超过1万亿美元市值,跌回热潮前水平,并曝出规模超过7500亿美元的关联交易,引发市场对其真实需求的质疑 [5] - 英伟达的业绩越亮丽(如下游疯狂购买GPU),市场越焦虑,反映出整个AI行业对其依赖过深,形成“毒性繁荣”:上游吸走产业链大部分利润,导致下游公司越努力越亏损 [6] - 市场对英伟达的角色存在分歧:它是推动产业发展的“发动机”,还是仅收取过路费的“收费站”,这取决于AI应用端能否在其芯片上建立真正盈利的商业模式 [6] 核心问题与未来不确定性 - 英伟达究竟是“AI的赢家”还是“AI的成本”,取决于AI应用端(如大模型公司)能否创造出足够大的商业价值 [7] - 如果AI应用找到盈利模式,英伟达将作为成功背后的关键基础设施;如果始终无法盈利,其高昂的GPU成本可能成为压垮AI产业的负担 [7] - 历史教训表明,市场需警惕过度依赖和估值泡沫,结局是“赢家通吃”还是“一败涂地”,棋局尚未结束 [7]
传出去!本地运行 Kimi K3 很简单!
程序员的那些事· 2026-07-29 15:57
Kimi K3模型开源发布 - 北京时间7月27日23点起,Kimi在X平台发布预告片,并正式开源K3模型[1] 模型技术规格与存储要求 - 模型参数量为2.8T,采用MoE架构,具体为16/896[2] - 模型原生格式为MXFP4,即训练时即采用的4-bit精度,且不可再进行INT4量化[2] - 运行模型所需的总VRAM约为1,750 GB[2] - 模型权重文件大小约为1.4 TB,由97个safetensors文件组成[2] - 存储要求为NVMe SSD,容量需大于等于2 TB,若使用SATA加载则需30分钟以上[2] 硬件配置方案与成本估算 - 绝对最低配置需4张H100 80GB GPU,总VRAM 320 GB,支持64K上下文,硬件成本估算约12万美元[3] - 实用甜点配置需5-6张H100 80GB GPU,总VRAM 400-480 GB,支持128K-256K上下文,硬件成本估算约15万至18万美元[3] - 推荐生产配置需8张H100 80GB GPU,总VRAM 640 GB,支持512K上下文,硬件成本估算约24万美元[3] - 官方推荐配置需22张H100 80GB GPU,总VRAM 1,750 GB,支持1M上下文,硬件成本估算约55万至70万美元[3] - 有网友调侃本地运行Kimi K3需8张H100 GPU,并需自备小型变电站[3] - 有博主估算,开发者Ning提出的使用80张RTX 5090游戏显卡的方案成本相对更低[5][7]
Kimi K3 开源!有人用 80 张 RTX 5090 跑通了
程序员的那些事· 2026-07-29 08:56
Kimi K3大模型开源与部署 - 北京时间7月27日23点起,Kimi在X平台发布预告片,随后正式开源K3大模型[1] - 7月28日05:23,有开发者使用80张RTX 5090游戏显卡成功跑通2.8万亿参数(2.8T params)的K3大模型[2] 硬件配置与性能对比 - 开发者部署的集群采用80张RTX 5090,使用GDDR7显存和25GbE以太网组网,未使用HBM高带宽显存和NVLink[2] - 该集群总显存为2.56 TB,聚合显存带宽达到143 TB/s[3] - 在硬件对比中,80张RTX 5090集群的总显存与32张H100 SXM 80G(2.56 TB)持平,但聚合显存带宽(143 TB/s)高于后者(107 TB/s)[3][4] - 该集群在刚跑通未调优时,单条对话输出速度已达到20 token/s,且后续仍有优化空间[3] 行业影响与替代方案 - 以往超大前沿模型普遍依赖高价、供货紧张的H100、H200等专业加速卡[5] - 此次验证表明,消费级游戏显卡集群(如RTX 5090)有机会成为替代方案[5] - 这一方案可能降低部署门槛,让更多实验室和初创团队有条件自主部署顶级开源大模型[5]