从单卡到系统:WAIC国产算力加速进化,开启新篇章
2026-07-19 11:09:07未知 作者:徽声在线
徽声在线记者 | 周末 佘晓晨
徽声在线编辑 | 文姝琪
在世界人工智能大会(WAIC)的展馆一侧,众多观众被一组气势恢宏的黑色机柜所吸引,纷纷驻足观看。这排由20个黑色机柜横向排列而成的装置,几乎占据了半面展墙,与其说它是一台服务器,不如说是一座被巧妙搬进展馆的小型数据中心,彰显着科技的魅力与力量。
昇腾950超节点真机亮相,展现国产算力新高度。图片来源:徽声在线记者周末摄
此次,华为首次在线下展出了其昇腾950超节点真机,引起了广泛关注。据华为公布的数据,该产品以单柜64张NPU卡为基本构建单元,最多可将1024张卡紧密连接成一个强大的计算节点,提供高达1 EFLOPS FP8和2 EFLOPS FP4的惊人算力,为国产算力的发展注入了新的活力。
在今年的WAIC算力展区,类似这样昂贵而庞大的机柜几乎随处可见,成为了展区的一大亮点。中兴通讯携手多家国产GPU厂商,共同展出了OEX超节点;阿里云则带来了由真武M890与磐久AL128芯片组成的超节点方案;中科曙光更是展示了面向十万卡规模的scaleX超智融合集群系统。几乎所有算力厂商都纷纷推出了卡数各异的超节点产品,展现出了国产算力的蓬勃发展态势。
这一现象背后,折射出的是算力竞争单元的深刻变化。虽然单颗芯片的峰值性能依然至关重要,但随着模型规模和集群规模的不断扩大,芯片之间的互联方式、计算任务的拆分策略以及故障发生后的恢复机制,都越来越直接地影响着一套系统能够输出的有效算力,成为了决定算力水平的关键因素。
回顾过去几年,国内厂商首先要攻克的是如何造出一张高性能的GPU。而如今,它们不仅要证明自己能够制造出优质的GPU,更要证明能够将这些GPU巧妙地组合成一套稳定运行、可交付使用的系统,实现算力的最大化利用。
从单卡到系统:国产算力的跨越式发展
模型的不断进步、Agent的爆发式增长以及推理和训练需求的日益增长,都对算力提出了更高的要求。这也是超节点逐渐热闹起来的一个重要背景,推动着国产算力向更高层次迈进。
传统的做法是以八张卡的服务器为基本节点,通过横向堆叠(Scale-out)的方式组成更大的集群。而超节点则试图扩大纵向扩展(Scale-up)的范围,让更多芯片通过高带宽、低时延的方式紧密连接在一起。让海量GPU高效协同运行,成为了超节点架构试图解决的核心难题,也是国产算力发展的关键所在。
沐曦联合创始人、CTO彭莉在接受徽声在线采访时表示,相较于训练过程,推理过程中包含更多高频、细粒度的通信需求。因此,超节点对于大规模推理来说更为关键,能够显著提升推理效率和准确性。一名联想工作人员也透露,目前国内超节点客户较多地将其用于推理场景,开始关注每秒能够生成多少Token以及单位Token的成本等关键指标。
此外,中国半导体先进制程仍面临一定的制约。在继续提升单颗芯片性能的同时,国内厂商也在力图在算力集群内集成更多GPU及AI芯片,以超节点作为系统性突破的选择之一,推动国产算力的整体发展。
然而,把更多芯片装进机柜只是迈向成功的第一步。
在硬件层面,GPU间需要通过交换设备实现紧密连接。联想此次展示的40卡超节点便由10个计算刀片巧妙组成,CPU和GPU通过机框后部的交换设备进行硬连接。联想工作人员介绍称,这一设计能够大大减少现场布线工作,并以整柜形式完成交付,提高了部署效率和便捷性。
中兴通讯的方案则更加全面,囊括了一系列自研的CPU、网卡、DPU以及机内和机间交换芯片。中兴工作人员对徽声在线表示,超节点的核心竞争力不仅仅取决于GPU的数量,还包括互联芯片的带宽和时延等关键因素,以及芯片、整机、集群和软件之间能否完成联合优化,实现整体性能的最佳化。
中兴超节点支持的国产算力,展现强大实力。图片来源:徽声在线记者周末摄
这不仅仅考验的是物理连接的能力。彭莉进一步解释道,超节点将硬件管理的对象从一张卡扩大到了“一堆卡”。厂商需要实时监控每张芯片的工作状态,在通信异常后迅速保存故障现场、恢复任务,并在软件层面将工作负载巧妙拆分至不同芯片,确保系统的稳定运行和高效性能。
而超节点间仍需通过Scale-out的方式组成万卡或更大规模的集群,以满足不断增长的算力需求。沐曦将卡数和算力的比率称为集群的“线性度”。彭莉认为,目前国内建设万卡规模集群已经基本可行,但进一步扩大至十万卡规模时,节点之间的长期稳定传输仍然是一个复杂的系统问题。此外,更高的芯片密度最终还会转化为更高的功耗、散热和承重要求,对系统的设计和运维提出了更高的挑战。
机柜背后的系统级竞争:国产算力的新篇章
必须承认的是,展台上不断增加的卡数并不意味着超节点产业已经完全成熟。国产算力的发展仍面临着诸多挑战和机遇。
彭莉认为,过去一年中,GPU厂商和交换机厂商之间的高速互联协议开始趋于收敛,为超节点的集中出现提供了重要条件。然而,另一方面,百花齐放的国产算力生态也使得底层协议尚未完全统一,给系统的兼容性和互操作性带来了一定的挑战。
浪潮信息工作人员对徽声在线表示,目前GPU间的互联协议、芯片厂商、互联网公司和运营商的技术路线尚未形成统一标准。对下游客户而言,这通常意味着仍需由一家服务器厂商牵头,与芯片厂商进行协调沟通,以确保系统的顺利部署和运行。
软件生态也是国产算力长期面临的门槛之一。芯片能够接入服务器并不代表应用层可以直接迁移使用。相较于英伟达早已成熟的生态体系,国产算力的编译器等开发工具仍需要逐一适配和优化,以提供更好的用户体验和开发效率。
此外,各家公司披露的卡数、峰值算力等指标口径并不完全一致。卡数更多并不必然意味着性能更强,最终仍要看系统在实际负载下的运行效率。据徽声在线了解,目前实际落地的超节点多在百卡以内;更大规模的扩展虽然能够体现技术能力,但并不一定对应当前市场的真实需求,需要厂商根据实际情况进行合理规划。
例如,沐曦此次先推出了单柜64卡方案,并预留了向128卡扩展的能力。彭莉对徽声在线表示,当前不少模型使用64卡已经能够满足需求,配置更大规模的超节点可能造成成本上的过度投入,不利于企业的长期发展。因此,厂商需要根据市场需求和成本效益进行合理规划,以实现可持续发展。
中科曙光副总裁李柳在WAIC论坛上表示,超节点正在从高端定制设备向标准化算力单元转变,标准化和模块化将成为规模化发展的关键。未来,超节点将进一步降低高端算力的使用门槛,为AI产业的规模化发展提供坚实的基础支撑,推动国产算力的普及和应用。
而“超节点”的集中呈现仍然透露出一个重要的行业信号:国产算力正进一步走向系统竞争的新阶段。在这个阶段中,厂商需要更加注重系统的整体性能和稳定性,而不仅仅是单颗芯片的性能指标。
芯片公司开始向下延伸其业务范围。华为、沐曦等厂商不再只提供芯片和软件工具,而是直接参与超节点的设计工作,以确保系统的整体性能和兼容性。服务器厂商则开始进入更上游的环节,中兴、联想和中科曙光等企业不再只是将CPU和GPU装入机柜,而是介入交换芯片、互联协议、液冷等关键环节的设计和优化工作。
阿里、字节、腾讯等互联网公司既是算力采购方也拥有大模型和云服务业务。它们能够根据自身需求参与芯片、服务器和网络架构的设计工作,甚至推出自有芯片以提升系统的整体性能。例如,服务器厂商浪潮信息展出的超节点产品就是与百度旗下的昆仑芯合作产出的成果,展现了跨界合作的强大潜力。
在国产算力集体突围的大背景下,各家公司的竞争已经从某款芯片的参数、峰值转向系统工程能力和综合落地能力的角逐。谁能够提供更稳定、更高效、更易用的系统解决方案,谁就能够在激烈的市场竞争中脱颖而出,成为国产算力的领军者。
在今年WAIC展区中,东方算芯首次公开展出了其全球首颗软件定义近存计算3D AI芯片DF1000,引起了广泛关注。该芯片基于国内成熟工艺打造而成,采用“软件定义+3D堆叠近存计算”的技术路线,通过DRAM-LOGIC Wafer-level混合键合3D垂直封装技术实现了高性能的突破。这一技术路线的核心价值在于实现基于14nm+成熟芯片制程工艺打造出性能对标4nm制程的世界先进AI算力芯片的壮举,为国产算力的发展注入了新的活力。
之所以能够实现这一成果,背后是东方算芯定下的战略:基于全国产化供应链体系研发高性能、高能效、高灵活性的大算力芯片产品,并搭建自主可控的生态系统。东方算芯创始人、董事长兼CEO魏少军认为,算力产业的竞争最终是体系与生态的竞争。只有构建起完善的生态体系和产业链合作机制,才能够在激烈的市场竞争中立于不败之地。
事实上,一些国内AI公司早期就有全栈自主可控的实践,并取得了显著的成果。如今,这些生态成果已经逐步得到验证和应用,为国产算力的发展提供了有力的支撑和保障。
例如,在2023年10月24日,科大讯飞与华为联合发布了国内首个全国产算力平台“飞星一号”。据徽声在线了解,“飞星一号”早期开箱训练效率约为同规模英伟达集群的30%;经过算子优化、分布式策略调整和工程调优后,这一比例已经提升至84%至93%,展现了国产算力的强大潜力和竞争力。
在这场系统级竞争到来之时,产业链上下游的企业也已经接收到增长的信号,并积极布局和应对。长飞光纤执行董事兼总裁庄丹在2026世界人工智能大会上的一场论坛中提出,全球光纤市场需求已经由电信驱动转向智算中心驱动。他判断称,受新一代高性能CPU、硅光光组件的拉动,未来1到2年保偏光纤需求将呈现10倍甚至20倍级的增长态势,为光纤产业的发展带来了新的机遇和挑战。
天数智芯副总裁邹翾在今年WAIC期间也表示,随着大模型加快进入各类业务场景,算力需求正从训练进一步扩展至推理和边端计算领域。峰值性能仍然是重要指标之一,但产品的实际表现越来越取决于芯片、软件、集群和应用之间的协同效率。在世界人工智能大会热议国产算力之后,行业的走向也逐渐清晰起来,国产算力正迎来前所未有的发展机遇和挑战。

