超节点冲上限,多元算力拼产能,AI计算进入双轨时代

一条路冲上限,一条路拼产能,几乎每个客户都说要“both”。

“整个产业的需求变得高度收敛和一致。”一位计算行业资深人士告诉数智前线,年初开始,几乎所有用户都会同时关注至少两个模型,一个追求能力最强,一个量大管饱、成本更优。模型名字或许会换,组合逻辑不会变。

浪潮信息首席AI战略官刘军说得更直接:几乎每个客户提的要求都是“both”,“既要能跑Kimi K3,也要跑DeepSeek V4 Flash”。企业买算力的方式也变了,不再只问跑分,而是直接提业务场景影响。供需压力在加大,IDC预计,2026年Token及云服务价格全年涨幅可能达到30%—50%。

缺口之下,9月21日,在北京举办的2026人工智能计算大会(AICC2026)上,AI计算未来的发展路径逐渐清晰:一个向上,突破智能上限;一个向广,实现智能的充分供给。承接Agent规模化部署的爆发,靠的将不再只是更多的算力,而是更对路的算力。

01

“既要又要”成为新常态

2026年,被业界视为Agent规模化部署元年。大量应用在千行百业涌出。截至今年6月,中国日均Token调用量已突破500万亿,较2024年初增长约5000倍。

Agent时代,模型跑进大量真实场景,Token速度要快,上下文要长,还要支撑多轮、多天的任务,和上一轮Chatbot时代消耗的算力完全是两个量级。IDC预测,国内活跃Agent数将从2026年的495万增长到2030年的2亿个。Token消耗总量等于任务次数、单任务Token消耗、多智能体协同放大系数,三者相乘,每一项都在涨。

买家也不一样了。过去买AI服务器的多是专业用户,自己搭环境、调框架,关心芯片型号和集群规模,像老中医“按方抓药”,逐项核对参数;今天越来越多企业是通用用户,不关心底层参数,只关心能不能直接拿到又快又稳的Token。

刘军打了个比方:OpenClaw真正用上的人不多,WorkBuddy一键安装、开箱即用。“今天每个企业都像用WorkBuddy一样用AI服务器。”刘军说。

采购逻辑也在变。当企业内部越来越多员工同时使用AI,并发用户越多,首字时延和产出速度就越关键。有AI coding团队算过一笔账:首Token时延从10秒缩到2秒,同样算力下,一分钟能响应的并发请求翻了五倍。而单位时间吐出的Token更多,摊到每个Token上的成本就更低。首字时延和产出速度,正在取代算力参数,成为新的采购标尺。

更有意思的是,场景走向千行百业,“既要又要”正在成为默认组合。

一方面,探索性任务要求最强模型随时可用。AI‑Coding、新药研发、AI for Sciense、证券公司的研报分析,需要最强模型处理复杂推理。

另一方面,企业日常有大量高频、流程确定的重复性任务,追求效率和成本,需要“量大管饱型”模型。浪潮信息AI架构师Owen Zhu观察到,调用规模化后,以DeepSeek V4 Flash为代表的这类模型,在企业Token消耗中占比已接近一半甚至更多。同一个任务里两类模型还会接力,快的先干,干不动换强的,强的给出指导后再交回快的。

用量也会自我强化。刘军给出一组数字:Agent任务首轮对话上下文约10-20K Token,100轮后膨胀到300K到400K。用得越多,Agent和应用长得越多,Token消耗越滚越大,最终形成对容量的基本刚需,“一旦用上就丢不开,AI能力的盒子已经打开了。”

但两类需求,满足起来都不简单。

要让前沿模型真正跑起来,智算系统必须满足三个核心要求 —— 让更大的模型承载得住、让推理时延足够低、让长程任务稳定运行。而本土AI芯片长期存在一个困境:能跑大模型,但跑不快;跑不快,就用不起来。用户要看实际产出,速度上不去,再大的模型也只能停留在演示阶段。

生产足够多、足够便宜的智能同样不容易。Prefill计算密集、Decode吃内存带宽、Attention要频繁访问不断增长的KV Cache,负载特征各不相同,还会随上下文长度和并发规模动态变化,简单堆服务器带不来线性增长,反而可能一部分算力闲置、一部分过载。

浪潮信息据此把Agent时代的AI计算分为两个方向。

一是能力型智算(Capability AI Compute),支撑突破智能上限,让AI帮助人类探索未知、解决过去解决不了的问题。超节点是代表。IDC数据显示,超过90%的企业视其为重要能力。

二是容量型智算(Capacity AI Compute),实现智能充分供给,让高水平智能越来越丰富、经济和易于获取。

两者是互补关系。从OpenAI、Anthropic到国内开源模型,走的都是顶尖模型定义上限、小模型覆盖更广市场的路子。需求侧已经投票,压力来到了供给侧。

02

三笔账与两条新路

需求已经摆上台面,但矛盾点在于,一边是供不应求的算力缺口,另一边却是大量闲置。信通院数据显示,2025年国内智算供应约38亿卡时,实际使用14亿卡时,利用率仅36%。问题核心不是卡不够,而在同样的投入能产出多少可用Token。

业内算了三笔账:

第一,成本账。受先进制程、高带宽存储等制约,国内算力平台单位功耗是国际先进水平的1.7到2.8倍,同等建设成本为1.2到3.2倍。算力贵,Token就贵。

第二,效率账。芯片对标峰值算力,网络看端口密度,框架追求易用性,模型研发比评测分数,各环节各管一段,没围绕同一个真实负载做设计。真正落地时,瓶颈就总在软硬件栈的衔接处,比如多卡推理的Decode阶段,卡住系统的是显存带宽和卡间通信,而不是芯片算力本身。

第三,适配账。芯片厂商“各建小院、各筑高墙”,十几种加速卡叠加数十个主流模型,每种组合都要单独做算子、通信、精度、调度适配,衍生出成百上千项重复开发。“多元本来是我们的产业优势,但封闭把多元的红利变成了组合爆炸的问题。”一位行业人士说。

三笔账指向同一件事:过去那套“通用化、各管一段”的研发逻辑,越来越对不上今天的负载,研发和协作方式要发生变革。

刘军解释,过去应用场景多且不确定,芯片、系统、框架、算子等每层厂商只能各建一套通用堆栈,靠通用性覆盖尽可能多的需求。现在前沿模型就摆在那里,需求已经收敛,他认为出现了两条新的创新路径:

一条是“从下往上”,服务能力型智算。围绕Kimi K3这样的前沿模型,从芯片、系统、软件到算子做贯穿式定制,不再每层各做各的通用件再拼起来,而是以一个真实负载为牵引,打穿纵向链条。

另一条是“从前往后”,服务容量型智算。受制于高端GPU供应和制造工艺,一颗通用GPU已撑不起Capacity需求。更现实的办法是把推理链路拆开,一段一段配最合适的芯片:Prefill计算密集,用PCIe卡配手机级LPDDR颗粒做大算力,绕开全球缺货的HBM;Decode里的Attention吃显存容量和带宽,就把稀缺的HBM用在这里;FFN带宽要求高、算力要求低,交给忆阻器、3D DRAM等新工艺芯片。最后搭出一个多元算力、投资回报最高的系统。

为什么这种极致优化今天才划算?“就在于Agent的Token一旦用上就丢不开。”刘军说,对量和成本的追求已经成为生产要素级的逻辑,“完全值得为它做极致优化”。

两条路都不是一家企业能走完的,生态各层已动起来,多方面协同。

开源社区在搭桥。智源研究院林咏华判断,AI负载不会收敛,计算架构也不会只剩一种,硬件创新要转化为可用算力,需要共享软件生态支撑,众智FlagOS正试图用统一编译器、算子、通信和训推框架,降低多元芯片的重复适配成本。SGLang核心贡献者张晓雨看到,推理优化正在从单点算子加速走向系统协同,甚至让Agent参与算子生成、调优和验证。

芯片厂商不再追求大而全,转向“把一件事干到极致” ,存内计算、3D堆叠等新架构越来越多。清华大学教授吴华强判断,忆阻器存算一体有望在1至2年内于部分领域落地。主攻Chiplet的北极雄芯创始人、首席科学家马恺声则提出“五个1”目标,未来两年内,在他们优化的系统上实现:100T参数的模型上线、1K token/s 的推理速度、百万Agent协同、1K容器承载、Agent连续运行1000小时。

系统厂商以前卖服务器,现在要把不同芯片放在一起跑同一个推理服务,“这可能是单个芯片厂商解决不了的,必须系统厂商来做。”Owen Zhu说。当推理从单机变成跨芯片、跨机组的协同,系统厂商的角色正从“卖算力” 变成 “生产智能”。

产业关系也在改写。行业人士观察,过去同一条赛道是“你赢我输”的零和博弈;如今一套系统里可能Prefill用A家芯片、Decode用B家、FFN用C家、网络用D家,合力生产Token。“AI 的市场机会打开了,每家都有足够空间。”

03

两种解法:超节点与多元算力机组

AICC2026上,浪潮信息发布元脑SD200 Ultra超节点和元脑HC2000多元算力机组,分别对应能力型和容量型智算。一天后的云栖大会上,阿里平头哥也发布基于真武V900的超节点。一年前还是少数厂商旗舰产品的超节点,如今已成主流算力企业必争之地。

压力来自前沿模型体量,参数从DeepSeek R1的6710亿涨到Kimi K3的2.8万亿,走向10万亿;上下文从128K扩展到1M以上;Agent也从单体工作走向成百上千个协同。单卡装不下,切开分到一堆服务器上又跑不动。只有让多颗芯片像一台机器那样协同,才能接得住。

但“超节点”三个字,在业界一度用得很宽泛。浪潮信息刘军说得比较直接:“超节点最基本的特征就是显存统一寻址。做不到这一点,把模型切成8段、20段分到不同节点,那只能叫节点集群。”

统一内存寻址成为界定超节点的硬标准。Kimi K3官方建议跑在64卡以上统一内存超节点上。SD200 Ultra正是跨过这道线的产品:3D Hyper Mesh架构紧耦合128芯本土AI芯片,8TB统一编址显存加64TB内存,支持10万亿参数规模前沿模型。

装得下之后,还要跑得快。大规模推理中,跨GPU数据交换每秒数十万次,若仍由CPU调度、经网络中转,时延会层层累积。复杂Agent任务往往包含上百轮“推理—工具调用—反馈—重新规划”的循环,每轮慢几秒,整个任务就慢出数分钟。

SD200 Ultra的对策是对称内存加直连。刘军比喻,以前跨卡通信像串门要找物业开门条,“现在把物业省了,直接串门”。通过首次在基于本土AI芯片的超节点上实现GPU显存直连,SD200 Ultra将跨芯片访问时延压到0.69微秒,AllReduce通信时间降低3.5倍,与国际领先水平相当。

硬件通了,软件也要改。大模型推理里有大量算子,过去一个接一个执行,时间都耗在启动、搬运和等待上 ,就像“老绿皮火车,站站停”。为此,业界正探索MegaKernel,浪潮信息则把它叫做“超级算子”:模型确定后,把能合并的计算重写成边通信边计算的大算子,几百个算子的活儿一个算子干完。过去模型太多、逐个重写不划算,但现在头部模型集中,每个都有足够大的用户空间,“一个模型一套算子”变得可行。

浪潮信息已在SD200 Ultra上把这条路走通。Owen Zhu介绍,要让成百上千个计算单元每个时钟周期都算满,纯手工写不出来,因此工程师定目标、划路径,让Kimi K3参与算子生成、调优和验证,测试、再迭代。效果很直接:Kimi K3的KDA、Gated MLA、MoE基础算子被融合成大算子后,算子数量降为十分之一,推理性能提升3倍以上。

就在最近,vLLM原班人马创立的Inferact为谷歌TPU写了针对Kimi K3的Megakernel,把92层计算塞进一个程序,同样16颗芯片、同一个推理引擎,速度比英伟达GB200快了57%。国际上也在同步做“超级算子”,“一个模型一套算子”且效果明显。

统一内存寻址、对称直连、算子优化,这三道关迈过后,超节点的价值才真正体现——SD200 Ultra单机承载2.8万亿参数的Kimi K3,Token生成时延首次突破5.85毫秒,相当于单用户170 Tokens/s,达到业界平均水平的5倍。

行业里一个共识正在形成:过去评价算力,看的是峰值算力和跑分,现在看的是整套系统持续交付Token的能力。前沿模型的Token产出速度,已经成为衡量超节点实际价值的新标尺。

但刘军同时强调,“超节点的规模不重要。核心是你跑什么模型,为它匹配的架构能否发挥效果。”超节点不是越大越好,规模放大,通信成本和故障效应同步放大,长程任务一跑就是数周,中途崩溃的代价难以承受。

容量型智算一侧,HC2000走的则是另一条路:把推理链路拆开,Prefill、Decode、FFN各自匹配最适合的芯片,混编进一个高密液冷整机柜,再由自研的MCIS多元算力协同推理软件栈,通过构建“测量—分配—监控—调整”的优化闭环,解决多元算力选型、部署、定位、优化的难题,让负载按需匹配、动态优化。典型Agent场景下,同等投资Token产能提升10倍。

两条路径,一套逻辑:从“提供算力”走向“生产智能”。以超节点为代表的能力型智算把前沿模型跑到极致,作为容量型智算的多元算力机组把Token成本降下来。今天由超节点撑起的前沿能力,明天就要靠容量型智算大规模供给出去。

特别声明:本文为合作媒体授权DoNews专栏转载,文章版权归原作者及原出处所有。文章系作者个人观点,不代表DoNews专栏的立场,转载请联系原作者及原出处获取授权。(有任何疑问都请联系idonews@donews.com)

标签: 人工智能
Copyright © DoNews 2000-2026 All Rights Reserved
京ICP备2025120072号