Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
钛媒体 · 2026/7/30 11:00:40

黄仁勋,给中国超节点带货

AI 中文解读
黄仁勋提出的“超节点”概念正在引爆AI算力革命,中国厂商华为迅速跟进,让这项技术从理念走向现实。简单来说,超节点就像把几十台传统电脑的芯片“塞进”一个巨大机柜里,变成一台超级计算机,彻底解决了过去用多台服务器联网训练大模型时通信慢、功耗高、运维难的问题。以前训练一个万亿参数模型需要上千台服务器频繁交换数据,现在一个超节点就能高效完成,相当于把一堆小水管并成一根大管道。对于普通人来说,这意味着未来更聪明、更快的AI应用会加速出现——比如手机里的AI助手能瞬间理解复杂指令,用AI生成的视频、文档也会更流畅。同时,芯片短缺和算力成本可能逐步缓解,普通企业甚至个人开发者租用AI算力的价格有望下降。这场从“卖芯片”到“建AI工厂”的转变,正在重塑整个科技产业链。
(本文作者为 硅基研究室,钛媒体经授权发布)文 | 硅基研究室,作者 | kiki2024年3月,英伟达创始人黄仁勋在GTC上率先提出了「超节点」这一概念,他在台上清晰展示了英伟达的NVL72系列如何将36个Grace CPU和72个Blackwell GPU「装」进一个液冷机柜中。和传统「8卡一个服务器、一个服务器为一个节点」的不同,所谓的「超节点」是指通过高速互联技术,将大量GPU、CPU从过去「多台服务器」的协作整合为单个物理节点,也就是黄仁勋口中的「一台超级计算机」。但彼时,皮衣老黄振臂高呼的「超节点」还未迅速成为一个风口,甚至NVL72系列还一度因为「散热问题」推迟交付,被不少媒体质疑又是画饼。但后来巨头们用「千卡、万卡乃至百万卡AI集群」的实际行动,回应了对黄仁勋「超节点」的追捧。有媒体后来报道,马斯克为了自家的xAI找黄仁勋加价插队下单1600台GB200 NVL72服务器机柜,甚至还和甲骨文董事长拉里·埃里森一起攒局,请黄仁勋吃饭。两年之后,深谙饭桌礼仪的黄仁勋才悠悠辟谣:“确实一起吃了饭,气氛也很好,但他们从来没有求过GPU,只需要正常下单就行。”黄仁勋说的确实也对,因为巨头们现在确实求的不是GPU,而是装着芯片的AI机柜。今年7月,英伟达硬件工程高级副总裁Andrew Bell向外界透露一组数据,通过和十家制造伙伴的合作,最终能做到每天产出最高1000个Vera Rubin机柜。大洋彼岸外的中国,距离皮衣老黄提出「超节点」的一年后,华为反手端出了自家的超节点CloudMatrix 384——14个机柜连接384张卡,卡是NVL72的5倍多,占地面积是其16倍。关键这种以量取胜的方式,还能弯道超车。据Semianalysis的拆解,单个CloudMatrix 384集群BF16性能总体是NVL72的1.7倍,总内存容量是NVL72的3.6倍,总内存带宽为后者2.1倍。图源:SemiAnalysis华为点起来的这把「超节点火」,随后一年多里,被整个国产算力生态捧为圣杯,仅在刚刚过去的WAIC上,就有20多家企业发布了超节点相关方案。超节点当然是一门被逼出来的创新。一头是摩尔定律逼近极限锁死单颗芯片的性能上限,另一头大模型参数竞争没有停止,持续推高算力需求,因此它是兵家必争之地。但超节点又是一块诱人的蛋糕。就像从卖芯片到卖机柜的黄仁勋所反复说的,英伟达不是卖芯片,它是造超级计算机、开AI工厂的,从芯片、互联、软件、存储和工程部署,围绕「超节点」上下游每个环节皆有利可图。1、被逼出来的创新说超节点是一门被逼出来的创新,这点并不为过。在杨植麟和月之暗面用近3万亿参数的Kimi K3掀翻硅谷模型生态的同时,很少有人注意到,另一边的阿里云悄悄在微信公众号上认领了K3,表示阿里云灵骏真武M890超节点在Day0就适配了Kimi K3。图源:阿里云按照阿里云的表述,Kimi K3部署在了64张平头哥真武M890组成的超节点上。为什么这么需要超节点?Kimi后来在其47页的技术报告其实回应了一个关键:过去从学术界到业界一直讨论大模型Scaling有没有饱和,兜兜转转Kimi用实际行动告诉你,不仅没有消失,而且你部署前、部署后都要投算力。Kimi给同行们总结了大模Scaling的两条路:第一条路,部署前投算力,预训练阶段,更大的参数规模、更多的数据量,模型越智能;第二条路是,部署后继续投算力,在后训练和推理阶段,推理优化、强化学习、Agent长程执行,对算力需求持续增长,更多的算力投入,模型的深度思考能力才越强。换言之,尽管各家都在各出技术奇招、相互致敬,来提升模型scaling效率,但前提共识是模型参数规模的「军备竞赛」没有停止,甚至以每年10倍的速度增长,迈入十万亿级的阶段。这样的形势下,算力集群规模也逐步迈向千卡级、万卡级、十万卡,乃至马斯克和黄仁勋在卷的百万卡级别。算力的需求规模不同,建集群的方式也不同。传统算力集群的节点通常就是一台8卡服务器,厂商们用横向扩展(Scale Out)的方式,通过传统以太网来连接大量AI服务器,增加节点数,来构建千卡、万卡集群。但这种方式,模型厂商们很快发现性价比不高,因为有三堵墙:第一堵墙是,通信。大模型MoE架构的普及,专家并行(EP)和张量并行(TP)等分布式并行策略在模型训练中,通信量大,对带宽要求较大,传统以太网根本难以承受。第二堵墙是,功耗。你随手用豆包生成一个PPT,用CodeX跑一个自动化任务,距离你数千公里外的AI集群压力山大。英伟达的芯片越强,但绝对功耗却在上升。单颗GPU功耗从A100的400W、H100的700W,到Blackwell时代,单颗B200的功耗已突破了1000W大关,GB200更是直接突破到2700W,传统风冷无法满足散热需求,过去标准化的机柜也压根扛不住。第三堵墙,是复杂度。万级处理器带来故障常态化,放大了传统集群运维复杂度。Meta在2024年训练Llama 3时,就有最直接的体感,54天的预训练中,用于训练模型的16384个英伟达H100显卡集群共出现了419次意外故障,平均每三小时就有一次。三堵墙下,被逼出来的超节点放大了另一个策略的先进性:纵向扩展(Scale Up)。简单来说,超节点可以将过去分散在数十台服务器里成百上千颗芯片在一个低延迟、高带宽的域内,整合为逻辑统一的一颗「超级大芯片」,实现协同高速计算,这个工作的地方也被称为HBD(High Bandwidth Domain,超带宽域)。所以超节点的单节点已不再是过去意义上的1台服务器了,而是由多台服务器和网络设备共同组成的计算单元。好处也显而易见。一方面,通过内部高速互联,当机柜里塞进更多的GPU、实现更高效的互联,GPU间的参数交换和数据同步也会越顺利,这有利于缩短大模型的训练周期。另一方面,理论上部署和运维难度也降低了。超节点本身就是一个高度集成的、预调优的超级计算机,在供电、散热等方面用上效率更高的技术和系统,综合来看,降低组网和运维的难度。不仅从集群的搭建角度看,超节点是一个被逼出来的性价比选择,对国产厂商而言,超节点也是一个被逼出来的务实选择。原因很简单:大力出奇迹、用量取胜。既然单颗芯片性能距离还存在差距,那不妨用更多芯片、更快互联的方式,用更高的系统效率来弥补单卡差距,这种以系统取胜的策略也是中国科技过往的优势所在。有券商总结的好:超节点就是中国AI的「韬定律」。2、诱人的蛋糕关于超节点,黄仁勋虽然最先提出概念、硅谷大厂AI集群火热,但在实际推进过程中,理想丰满、现实骨感。图源:天风国际证券分析师郭明錤一边,尽管早早拿出了AI工厂的路线图、鸿海等服务器厂商们产能拉满,但具体到英伟达下一代的AI机柜的量产交付时间却会被各种问题卡住。据SemiAnalysis的爆料,原计划2023年下半年推出的Kyber NVL144机架架构,由于制造工艺的问题将推迟至2028年。另一边,马斯克的xAI、扎克伯格的Meta都开始出租算力,连带着市场开始质疑CoreWeave、Nebius此类算力租赁商的成长性,甚至又回到了「算力是否建设过度」的老问题。相反在中国,各类超节点方案似乎如雨后春笋般涌现,各家在比规模、比参数、比方案,甚至有厂商将今年称为「中国超节点元年」。元年不元年并不重要,市场早已听了太多的元年故事,更关键的是为什么中国厂商对超节点如此激进?有三股看得见的手,在加速拉满国产超节点的进度条。第一只手,就是国产芯片厂商。超节点为国产芯片们提供了一条跳出和英伟达「比单卡性能」的思路:用Scale Up堆卡数、以系统换性能。摩尔线程副总裁马鉴在接受媒体采访时提到:“通过系统上的提升去对标国际先进领先的超大规模的集群,去训练出同样先进的模型。”而从拼单卡到拼系统的另一个好处是,超节点其实给给国产芯片提供了最直接的练兵场,国产芯片厂商能进一步绑定上下游产业链生态,从能用走向好用。第二只手,则是国产大模型厂商。这之中,不同模型厂商也各有意图。像DeepSeek、月之暗面此类模型厂商大力推崇国产超节点,本质上还是为了争夺更多的算力来提升模型智能。而像阿里、百度等同时拥有芯片、云、模型和应用的全栈厂商,超节点也是一本万利。一方面,芯片为模型定制,模型反哺芯片迭代;另一方面,哪怕是建设过度,超节点本身也可以以云服务的形式,按词元调用,阿里云也已经开始这么做了。第三只手,则是国产服务器厂商。摩尔线程们毛利率60%,浪潮信息们的毛利率不到5%,传统服务器厂商赚的是组装厂的辛苦钱。但超节点给国产服务器厂商们带来了翻身的机会,这一点英伟达NVL72系列已经给他们上了一课。因为,超节点更贵了,组装厂也跟着能赚。英伟达上一代GB200 NVL72售价约300万美元,今年量产的新一代Vera Rubin NVL72单柜物料成本进一步攀升至780万美元。交付单元从单台到整柜,服务器厂商做的不只是组装,而是涵盖了整机柜集成、Scale-up组网、供电与结构件、上架联调在内的完整系统级交付。工程复杂度提升了、利润空间也会更大,据大摩的研究报告,在Rubin时代,ODM的附加值将增加35-40%。鸿海们甚至也学起存储厂商们大谈商业模式的转变,从过去「买断制」转向「寄售制」,曾经高高在上的甲方愿意低头垫付资金,代工厂不用大额垫资备货。因此在超节点这件事上,浪潮信息、新华三等国产服务器厂商显得尤为积极,不仅和芯片厂商搞联合创新,也推出更丰富的产品和服务。尽管超节点是如此诱人的一块蛋糕,但距离它的大规模落地还有很长一段路要走。3、革命尚未成功一个月前,黄仁勋现身
分享
阅读原文