2026年9月以来,华为昇腾960进度超预期、阿里平头哥真武V900与ICN全栈亮相、浪潮信息元脑SD200 Ultra单机跑通2.8万亿参数模型、新华三UniPoD系列以全互联架构主打Token成本……表面上是一场“谁参数更高、谁卡数更多”的算力规模比拼,真正的主线却悄然转移:算力瓶颈早已不在单颗芯片内部,而在于如何把成百上千颗芯片组织成逻辑上的“一台超级计算机”。
这才是超节点真正要回答的问题。

01
从“单卡焦虑”到“系统能力”的拐点
大模型进入万亿参数与Agent时代后,负载形态发生了三重变化。训练与推理的重心向推理倾斜,价值越来越多在稳定、低成本、低时延的Token产出中兑现;任务从单轮对话变成多步编排、工具调用与多智能体协作,通信频率与并发压力呈非线性放大;任何一个环节——计算、存储、网络、调度——成为瓶颈,都会让昂贵的算力空转。
部分传统Scale-out集群靠以太网堆叠的微秒级时延与百Gb/s带宽,在All-to-All通信主导的MoE架构面前捉襟见肘。卡间数据等待时间过长,算力利用率长期偏低;故障定位与运维成本随规模线性攀升。智能体7×24小时运行时,多步串联的失败率更让企业头疼。
于是,超节点不再是简单的“多卡机柜”,而是Scale-up域内统一内存编址、高带宽低时延全互联、软件语义与硬件拓扑深度协同的系统级方案。它试图把“多颗芯片”变成“一颗超级芯片”。这才是国产厂商集体发力的核心逻辑。

02
两条清晰路径:密度优先与规模优先
华为与阿里的路线差异,几乎浓缩了当前国产超节点的两种哲学。
华为坚持“超级节点”密度路线。从Atlas 900 A3 SuperPoD的384卡Scale-up,到后续Atlas 950/960系列规划的更高卡数,灵衢互联架构与统一内存编址是关键。昇腾960的研发进度超预期:960DT支持2 PFLOPS FP8与4 PFLOPS FP4算力,片上HBM最高288GB、带宽9.6TB/s,预计2027年一季度就绪;更高规格的960PR则进一步提升FP4算力。单节点内把成百上千张卡组织成逻辑统一的计算体,再用近封装光学等技术降低光模块依赖,是其重点。超节点在这里被定义为“一台计算机”的密度与效率。
阿里平头哥则更强调“巨集群”与全栈协同。据公开报道称,其性能较上一代显著提升,性能约为上一代M890的三倍,216GB显存,预计2027年一季度量产,较原计划提前两个季度。真正的杀手锏不在单卡,而在系统:自研ICN Switch与ICNLink协议实现千卡级全带宽互联与原生内存语义统一编址,一套代码可覆盖多种拓扑;叠加倚天CPU、磐脉网卡、镇岳存储主控,形成算、存、网完整自研栈。基于此构建的单一集群可扩展上限50万卡量级——远超当前国内已落地的十万卡级集群。据相关报道,已落地的灵骏超节点实例已支持超2万亿参数模型运行,阿里的逻辑很清晰:通过系统层面的深度优化,把上千颗芯片拧成一股绳,以集群规模优势最大化整体算力输出。
两条路并非对立。华为追求单节点极致密度与软件生态闭环,阿里追求可扩展集群规模与全栈芯片协同。共同指向同一个事实:在万亿参数与Agent时代,系统级能力比单点参数更决定最终可用算力。

03
更多玩家的差异化实践
浪潮信息的元脑SD200 Ultra给出了更贴近落地的答案。基于本土AI芯片,单机可承载运行2.8万亿参数的Kimi K3大模型,Token生成时延低至5.85毫秒。它不追求最高卡数叙事,而是强调实际推理效率与多元算力机组(HC2000)的工程化落地。对客户而言,时延与稳定性往往比峰值算力更直接。

新华三UniPoD系列则把重点放在全互联架构与Token成本。S81000 X1单Scale-Up域最大支持40张国产加速卡,通过一级CLOS全互联实现任意两卡间高带宽,正交无背板、纯电互联设计提升可靠性;40卡聚合为统一编址的超大显存池,支持风液协同散热,兼容标准机柜。面对智能体时代Token消耗激增与通信瓶颈,它试图用更低单位Token成本与更高利用率接住企业真实需求。

中科曙光、中兴、沐曦、摩尔线程、燧原、壁仞、东方算芯等厂商也在2025—2026年密集推出从40卡到千卡级、从正交无线缆到光互联、从成熟制程近存计算到自研GPU的不同方案。生态呈现“多芯片兼容+自研互联+液冷/正交结构”的多元化特征,而非单一技术路线通吃。
04
为什么系统协同才是真正的护城河
在单卡绝对性能上,客观存在的差距是当前产业界需要共同面对的现实。但训练与推理从来不是靠一颗芯片,而是靠几万颗芯片在可接受的时延与效率下协同工作。能把它们连起来不散架、不掉速、软件栈真正可用,才是系统能力。
平头哥八年积累的算存网全栈、华为灵衢与昇腾软件生态、浪潮与新华三在机柜级工程与运维上的沉淀,都在证明这一点。超节点的价值不在“联了多少卡”的数字,而在于是否实现了统一编址、内存语义一致、通信开销可控、故障域隔离清晰。只有这样,万亿级MoE模型与多步Agent任务才能真正跑出效率。
中美AI路径的差异在此也显现出来。美国超大规模云厂商以巨额资本开支换速度与先发;中国则更强调场景落地与系统生态构建。万卡集群数量、日均Token调用量、东数西算进入调度运营期等数据趋势显示,都在说明应用侧需求正在反向拉动硬件系统进化。芯片、互联、存储、调度与基础软件的协同,成为下一阶段的核心战场。

2027年一季度,昇腾960DT与真武V900几乎同时进入就绪/量产窗口。两家发布会仅隔数天,象征意义远大于产品本身——国产算力正从“追赶单卡”转向“构建系统”。超节点不是终点,而是通往可用、可控、可扩展算力底座的关键中间形态。
仍有未解之题:Scale-up密度与Scale-out规模如何更优平衡?软件生态能否真正降低迁移成本?液冷、光互联与正交结构在存量机房中的改造经济性如何?Token成本能否持续下降到支撑智能体规模化落地的水平?
但有一件事已经确定:构筑自主可控且高效的算力底座已是产业共识。无论选择密度路线还是规模路线,华为、阿里、浪潮、新华三以及更多厂商用真金白银投入系统级方案,正在把对单点参数的过度关注,转化为“系统能不能用”的实战。这或许才是国产芯片真正换道的开始。
而这些尚未完全解答的问题,正是产业共同前行的方向。从“芯片怎么拼”到“数据中心怎么接”,超节点正在重构服务器、网络、供电、散热与交付全链路,试图突破算力墙、通信墙与能耗墙。2026年12月11日上午,在第二十一届中国IDC产业年度大典(IDCC2026)期间,“国产超节点产业创新论坛”将在北京石景山首钢园举行,邀请芯片与服务器厂商、互联方案商、供电散热企业、数据中心与云服务商、AI与算力服务商、设计院及EPC、研究标准与投资机构、行业应用方齐聚一堂,共同探讨。
会议预告
会议时间:2026年12月11日09:00-12:00
主办单位:中国IDC圈
扫描下方二维码,立即抢占2026年终最硬核论坛限量席位!

(商务赞助与演讲席位同步招募中,详情请联系大会组委会)













