为何所有人都在造超节点?
文|赵艳秋
编|牛慧
“中国大型互联网企业会在下半年大量部署超节点方案。”一位算力资深人士告诉数智前线市场的走向。虽然超节点整机价格通常高于同等卡数的普通服务器,“但它的账算得过来,算力密度更高、空间占地更小。现在企业必须在有限空间承载更多算力,超节点是个‘大杀器’。”新华三人士补充道。
即便此前没有采用超节点的DeepSeek,“最近也明确要用,正在议价。”一位云计算大厂人士告诉数智前线,这具有风向标意义。
这一热潮在2026世界人工智能大会上表现也很突出。华为展出了20个机柜组成的1024卡超节点真机、中科曙光展示了沸腾着冷却液的640卡超节点,百度天池、阿里云灵骏真武M890、浪潮信息元脑以及沐曦曦景S600,都被放在各自展台的突出位置。
什么是超节点?简单来说,它通过高速互联技术,把大量GPU或加速卡从“多台服务器”深度整合成逻辑上像一台“超级计算机”的系统,解决了传统集群跨机器通信的带宽和延迟瓶颈,从而大幅提升GPU或加速卡的利用率,带来单位Token成本的下降。“超节点已成为目前AI Infra建设的一个主流趋势。”华为资深人士对数智前线说。
一年前,超节点还是少数厂商展示系统能力的旗舰产品;一年后,它正在成为主流算力企业必须参与的军备赛。“国产超节点从去年推出,目前已发展到可批量落地阶段。”百度昆仑芯人士说,“到今年底,每家算力企业基本上都具备交付能力。”
01
谁在造超节点
超节点不是新概念了。2024年,英伟达发布GB200 NVL72,将72颗Blackwell GPU纳入一个高速互联域,推动该架构进入业界视野,但最初需求并不算旺。到2025年,随着大模型参数暴涨,超节点才成为热点。国内厂商也早在2024年前后开始做技术预研,最早一批在2025年上市,华为、百度智能云、浪潮信息、新华三、中兴等各家都开始发布。超节点赛道开始涌入多个玩家。
但各家争夺的焦点不太一样,目前似乎形成了三条不同路线:一派不断扩大单个超节点的规模,一派更强调部署效率和经济性,还有一派试图用新的芯片和互联架构重新定义超节点。
数智前线观察,其中华为、中科曙光和百度,在走向“大节点”。
华为已向业界展示由20个机柜组成的1024卡的昇腾950超节点真机,并将在今年第四季度批量交付8192卡超节点,理论上这是该超节点满配技术上限。华为的判断是,随着大模型参数、上下文长度和推理并发量持续增加,单个计算域需要容纳更多芯片和更大的内存空间。而其去年推出的384卡超节点已在互联网、金融、能源、教育和医疗等行业,商用落地750多套,证明了超节点的商业规模部署能力。
中科曙光选择了浸没式液冷支撑更高密度部署。单机柜640张加速卡,一台冷却设备带两个机柜。由这一超节点构建的十万卡算力集群曙光8000(登峰),已落地国家超算互联网郑州核心节点。“目前已跑满了90%,很多需求来自模型训练,也有AI for Science。”曙光人士告诉数智前线。
百度智能云天池超节点则从256卡向512卡演进,后者将在年底推出。它强调从互联协议、交换芯片到液冷系统的全栈自研。百度智能云混合云部总经理杜海介绍,其超节点已经交付多个万卡集群。文心5.1重要版本的训练在全国产集群上完成,能源电力行业支撑80多个行业场景推理,也支撑了自研电力大模型的训练。
另一批厂商并不认同“越大越好”。
阿里云推出的灵骏真武M890,以64卡为一个Scale-up单元,再通过Scale-out网络扩展至更大集群。与多数超节点主要面向私有化部署不同,阿里还将这种算力形态放到公共云上,客户不必采购设备,也可以按需调用。
浪潮信息、沐曦也选择了类似方向。浪潮信息去年推出64卡超节点,今年再推32卡产品。32卡可以支撑万亿大模型推理。浪潮信息副总裁赵帅介绍,“我们自己内部用万亿大模型做AI Coding,效率绝对比用千亿大模型好。这就是万亿参数大模型带来的价值。所以再次推出32卡产品,让更多企业真正用得起。”沐曦则以单柜64卡为基础,强调CUDA生态兼容和向万卡集群的横向扩展。
还有一些厂商试图跳出英伟达GPU或华为加速卡路线,走了第三条路径。清微智能采用可重构数据流架构,每颗芯片同时承担计算和数据转发,芯片之间可直连,无交换机。清微智能产品副总裁陈逸伦告诉数智前线,已推出4096卡、峰值算力为500PFLOPS的超节点。北京某训练场已部署,内蒙、新疆、浙江的金融行业、国央企也已落地。采用同样路线的还有7月产品刚刚上市的东方算芯。
此外,摩尔线程也计划年底伴随新一代GPU推出相关产品。寒武纪虽然目前没有超节点,但业界判断下一代芯片也将推出超节点。至此,国内主要算力芯片、服务器企业,几乎都已进入这一赛道。
02
为什么是今年
超节点为什么会在今年爆发?业内认为有三大原因。
第一,模型训练和推理需求足够大。训练端,模型参数量在飙升。7月Kimi发布参数达2.8万亿的大模型K3。“下一个春节,模型参数会变成3万亿,再下一个6万亿,在后面是10万亿。而海外中等规模模型参数量已达5万亿。”沐曦CTO杨建博士告诉数智前线。业界通常认为,1万亿参数模型训练需要约5000张卡,3万亿参数模型大约需要1万张卡,6万亿需要2万张卡训练。解决方案最好是把多个芯片连成一体化去运作。
推理端,华为人士举例,AI Coding场景中,一个任务触发的操作调用已是几万次,复杂长程任务是几十万甚至上百万次。“这意味着更多并发、更长上下文,这正是超节点大内存池的核心卖点。”从训推需求比例来看,阿里云资深人士告诉数智前线,目前线上推理和训练比已接近5:1~10:1,“1万张卡里,大约70%~90%都在做推理,只有少部分在做训练”。
第二,账算得过来。超节点的价格比同样卡数服务器总价要贵,但客户算的是总体效能账。“你不能单看卡的数量,它涉及风火水电基础设施,超节点更集约。为什么大企业都去部署超节点,肯定是算得过来这个账。”新华三人士告诉数智前线。浪潮信息副总裁赵帅曾举例:“通过超节点,如果推理性能提升10倍,但耗电可能只提升2倍,算下来还有收益的。”
昆仑芯人士介绍,传统模式下10台机器的算力相加不等于10,“只能等于6”,超节点通过高速互联把损耗降到最低,让更多算力发挥效能。如用超节点做PD分离推理,系统比普通同卡数机器提升30%到50%的性能。
第三,批量交付节点到了。“超节点是工程化产物,它包含GPU芯片、存储、通信、交换、散热、供电、软件,不是单一厂商能独立搞定的。”昆仑芯人士说,“目前,超节点已发展到可批量落地阶段了。”另一位人士补充,“无论性能做得怎么样,大家都可以把整机交付出来”。
不过,超节点更适合训练还是推理?各家的说法并不同。
华为人士认为,训练、推理都有价值,万亿参数大模型训练需要巨大内存池,Agent推理需要海量上下文并发,超节点要具备大内存卡。摩尔线程认为,超节点要面向1万亿到5万亿参数大模型训练,以及高速推理的tokens工厂场景。而沐曦人士认为,“经过严密论证,超节点在推理的Decode阶段,也就是逐Token生成答案时,价值更为突出。”清微智能陈逸伦分析,“目前超节点在训练侧跑微调较多,拿它做推理性能更好。”
03
分歧与共识
爆火之下,超节点技术路线有诸多分歧,目前还没有标准答案,取决于各企业的技术商业判断。
第一个分歧是规模之争,超节点应该做多大?是64卡/128卡,还是更大规模?行业分成两个阵营,这里说的是超节点Scale-up的规模,就是用高带宽、低时延互联,把多少芯片纳入一个紧耦合计算域。
一些企业人士是“小节点派”。“在我个人认知里,64卡就够了。TP并行、EP并行的最大规模可能就是64卡,剩下的通过PP和DP并行、Scale-out去连起来。你没必要把单个节点的Scale-up做到足够大,因为任何通信都有延迟,TP和EP对延迟极度敏感,即便千卡互联中间几个微秒的延迟,GPU其实都在等。”一位人士告诉数智前线,“对时延和稳定性都要有考虑,这是一个工程上的平衡,并不是scale up越大越好。”另一位人士持相同立场,“64到128卡是最经济的形态,再大就浪费了。”
另一些企业则是“大节点派”,华为最新超节点扩展至1024卡,中科曙光640卡,百度天池、新华三均推进至512卡。“进入Agent时代后,万亿参数、百万Token上下文和海量并发推理下,64/128卡小节点统一内存池太小”,“64卡更像基础机柜单元,适合中小规模模型微调、离线推理;万亿大模型完整训练、大规模多智能体并发,必须依靠更大规模超节点”。
第二个分歧是CUDA兼容之争。阿里平头哥、沐曦、海光等走CUDA兼容路线,代码迁移成本低。华为昇腾、昆仑芯等走自研生态路线。
一位大厂人士对数智前线分析,自研生态虽然迁移成本高,但可控性和长期演进空间更大。他坦诚,也许两三年后,CUDA兼容就没有那么重要了。“我们回归技术第一性,CUDA当年的胜出,是很多人做向量编程,心智负担很大,而CUDA方案让人在心智上的耗费极大降低,所以在过去10多年取得成功。但到今天有了Agentic coding后,不一定是人去编程,都走向让Agent去干,所以CUDA就不那么重要了。”
一位华为人士介绍,华为是国内最先支持mxfP8和fp4精度的厂商,mxfP8的可变量比fp8更好。“有人说昇腾从CANN走向了CUDA,其实并不完全正确。”他说,“华为增强了向量处理能力,而英伟达增强了矩阵处理能力,两家都走向了‘矩阵和向量综合型’方向。”
还有其他的分歧,如连接中铜缆与光纤,液冷中的风冷和液冷,尤其是浸没式液冷,这些新旧技术转换中,因技术瓶颈、故障率与运维成本产生的矛盾和挑战,让业界有不同的技术商业选择。
一个共识是软硬架构协同。超节点演进与模型技术路线密切相关。国内模型架构如何演进?阿里人士告诉数智前线,国内模型企业Attention正在分化为两条路线,其中千问GDN、Kimi KDA走向Linear Attention;DeepSeek走Smart Attention(MLA、DSA、CSA),智谱目前也采用DeepSeek 3.2的DSA架构。两个阵营相对独立,仍需观察未来两三年的演进,这也将影响超节点的硬件适配方向。
浪潮信息董事长彭震最近介绍,过去基础设施主要沿摩尔定律演进,最近的新进展是软硬件联合创新,一端提出新算法,另一端用新介质、硬件和网络适配,收益显著。他看到美国企业也在开展类似探索。
在沐曦杨建博士看来,这条赛道“未来二三十年都停不下来”。今年,他已看到一些企业开始用AI参与设计,道路、房屋、机械等设计本质上都属于知识生产,AI的影响早已超出coding,正在渗透到各行各业。一位大型企业管理者希望,到2027年底实现“白天开会写规范,下班前交给大模型,第二天看结果”,人负责定义和发现问题,大模型负责求解。目前,AI知识创造的进程,“很多企业还没开始,因为总经理和董事长还没作出对数字员工的定岗决定。”资深人士观察。这正是AI要渗透的市场。
而算力越便宜,行业扩张就越快,“整个链条就再也停不下来了”。美国算力约为中国的9倍。超节点正成为这条产业链向下延伸的重要算力底座。随着更多厂商具备整机交付能力,真正激烈的竞争已经开始。
“现在比拼的是能否批量交付、稳定运行,并真正降低每Token成本。”一位大厂人士说。供应链是其中更大的挑战,“无论国产还是海外供应都存在不足。锁定供应链,未来发展才更有确定性。”



