华为昇腾路线图更新:960DT提前上市,NPO方案引领AI算力新变革
2026-09-28 21:18:20未知 作者:徽声在线
华为正全力加速昇腾AI芯片的迭代进程,展现出在人工智能领域的强劲发展势头。
9月17日,“第十一届华为全联接大会2026”在上海盛大启幕。会上,华为副董事长、轮值董事长汪涛透露了重要消息:昇腾960芯片的研发进度远超预期,性能实现了倍增。其中,960DT比原计划提前三个季度,预计在2027年一季度就能完成就绪;960PR也比原计划提前一个季度,有望在2027年三季度就绪。
这是继2025年华为罕见地公开昇腾未来3年技术路线图之后,昇腾产品节奏迎来的又一次重大更新。按照华为2025年公布的规划,昇腾960原本计划于2027年四季度上市。此外,华为此次还将产品路线图延伸至2029年。汪涛表示:“2028年和2029年,华为将陆续推出昇腾970、980芯片。我们会坚持一年一代的演进节奏,依托τ(韬)定律的创新方向,让算力规格持续翻倍。”
然而,在AI领域的发展中,与单纯追求单颗芯片性能不同,随着大模型参数规模的不断增长,AI集群的规模也在从千卡向万卡甚至十万卡快速扩展。此时,单颗芯片的性能已经无法完全决定整个集群的有效算力,芯片之间的通信效率和系统协同能力变得愈发关键。如何降低大规模集群中的通信损耗,让更多的理论算力真正转化为有效算力,已然成为AI基础设施竞争的新焦点。
华为给出的应对路径是“超节点 + 集群”,目前这一技术路线已经开始进入规模商业部署阶段。汪涛称,截至目前,昇腾910C超节点累计部署已超过1000套,昇腾950超节点也实现了规模商用。同时,他还进一步公布了昇腾960超节点的进展情况——液冷超节点计划于2027年三季度推出,并且该超节点还将首次引入NPO(近封装光学)方案。这意味着华为将AI算力竞争进一步延伸到了光互联等系统层面,为AI算力的发展开辟了新的方向。
单颗芯片难定算力上限,超节点成破局关键
近年来,华为反复强调超节点概念,这一技术路线背后有着深刻的产业背景。华为在2025年发布灵衢(UnifiedBus)时就明确指出,由于先进工艺难以获取,需要从多芯片上寻求突破,希望把更多的计算资源联接在一起。这也表明,受先进工艺获取的限制,昇腾选择从系统架构层面进行突破,依托系统级协同调度,提升集群整体的有效算力。因此,超节点在一定程度上能够弥补国产芯片的工艺代差,成为华为提升AI算力的另一条重要途径。
然而,“把更多芯片连起来”并非简单的堆卡操作。随着集群规模从千卡扩大至万卡、十万卡,芯片之间需要交换的数据量急剧增加。汪涛称,一个由8卡服务器组成的10万卡集群,在模型训练过程中,集群内通信时间超过训练时间的40%,这严重制约了MFU(模型浮点算力利用率)。换句话说,芯片虽然都在集群里,但相当一部分时间没有用于真正的模型计算,而是在“等数据”,这无疑是对计算资源的巨大浪费。
根据华为马尔可夫实验室的仿真结果,在同样10万卡规模下,由4K规模超节点组成的集群,相比传统8卡服务器组成的集群,MFU能够提升至原来的2.75倍。汪涛表示,MFU每提升1个百分点,模型迭代时间可以提前约3天。这对于加快模型研发和优化,提升AI应用的效率具有重要意义。
因此,超节点真正要解决的除了“能连多少张卡”之外,还要解决当芯片数量大幅增加之后,如何尽可能降低彼此通信成本的问题。这是超节点技术发展的关键所在,也是提升集群整体性能的重要环节。
要做到这一点,首先需要改变芯片之间传统的互联方式。华为给出的技术方案是灵衢(UnifiedBus)。可以将其理解为是华为面向超节点打造的一套高速互联技术。通过统一的互联协议,它能够将原本分散在不同物理服务器中的CPU(中央处理器)、NPU(神经网络处理单元)、内存、存储等计算资源连接起来,并支持跨物理节点统一内存编址。灵衢可以让不同芯片和设备之间交换数据的路径更短、时延更低,从而让数千颗芯片在逻辑上更接近“一台计算机”,大大提高了芯片之间的协同工作效率。
不过,要组成一台拥有数千颗NPU的“超级计算机”,仅有互联协议是远远不够的。还需要有配套的硬件和技术支持,才能实现芯片之间的高效协同。
会上,据汪涛介绍,围绕灵衢,华为目前已经开发了11颗用于超节点和超节点集群的关键芯片,这些芯片覆盖了计算、互联、存储、管理等多个方面。这些关键芯片的开发,为超节点的构建提供了坚实的硬件基础,确保了超节点能够稳定、高效地运行。
从统一互联协议,到计算、存储等关键芯片,华为实际上是在围绕昇腾NPU搭建一整套超节点系统。而此次公布的昇腾960超节点(Atlas 960),则成为这套系统架构向下一代演进的最新载体,标志着华为在超节点技术领域又迈出了重要一步。
据悉,Atlas 960单个超节点可以实现4096颗NPU高速互联,最大可提供8E FP8的算力。依托灵衢架构及Hi - ONE光引擎,其RTT(往返时延)最低可达2微秒(人眨一次眼约需0.1秒 - 0.3秒)。RTT可以理解为数据从一端发出、到达另一端再返回所需要的时间,对于需要频繁交换数据的数千颗NPU而言,时延越低,芯片花在“等待通信”上的时间就越少,也就能把更多时间真正用于模型计算。华为称,这也是目前业界规模最大的超节点,展现了华为在超节点技术领域的领先地位。
从单颗NPU,到数千卡超节点,再到数十万乃至百万卡集群,华为追求的不是简单增加芯片数量,而是在单芯片性能之外,通过互联和系统架构降低通信开销,让更多理论算力最终转化为模型可以真正使用的有效算力。这是华为在AI算力发展上的独特思路,也是提升AI应用性能的关键所在。
算力竞赛向光互联、存储等多领域延伸
对于产业链而言,AI超节点持续扩容的意义,不仅仅体现在NPU本身,还对多个相关领域产生了深远影响。
当数千颗AI芯片需要在同一个超节点内部高速通信时,互联、光器件、内存、存储、散热和供电等环节都会随之成为影响系统效率的重要因素。这些环节相互关联、相互影响,任何一个环节出现问题都可能影响整个系统的性能。
华为此次把NPO引入昇腾超节点就是一个明显的变化。目前,大规模AI集群内部仍以铜缆作为高速电互联的主体。但当SerDes(串行器/解串器)速率迈入224G及以上时代,铜互联正逼近物理极限:插损、串扰与反射等信号损耗显著增加,传输距离越来越短;与此同时,数千乃至数万根高速铜缆汇聚在一个机柜内,不仅布线复杂、安装维护困难,也给散热与系统可靠性带来巨大挑战。这些问题严重制约了大规模AI集群的发展,需要寻找新的解决方案。
解决方案是要进一步缩短高速电信号的传输距离,使电信号更早转换为光信号,从而降低随着互联距离增加带来的信号损耗,并提升大规模芯片互联的带宽和效率。为此,华为研发了NPO形态光互联产品Hi - ONE。“昇腾960超节点中用5500个Hi - ONE替代原本需要的4.8万颗800G光模块,降低了超550千瓦功耗,系统无故障运行时间提升1倍。”汪涛说道。昇腾960超节点也由此成为全球首个采用NPO技术的超节点,为大规模AI集群的发展提供了新的思路和技术支持。
除了“芯片之间怎么传得更快”,存储也正在成为Agentic AI时代另一个不容忽视的瓶颈。随着AI技术的不断发展,存储问题日益凸显,成为制约AI应用进一步发展的关键因素之一。
汪涛表示,随着Agent任务持续时间拉长,模型上下文长度已经快速增长至百万级,与此同时,Agent与模型的交互频次明显高于传统人机问答,每张昇腾卡对应的KV Cache可能达到TB级。KV Cache可以简单理解为大模型在生成答案过程中需要反复调用的“临时记忆”。模型每生成一个新的Token(词元),都需要参考此前已经计算过的信息。如果这些信息每次都重新计算,速度会非常慢,因此系统会把它们暂时存下来。然而,当上下文越来越长、Agent连续工作越来越久,这份“临时记忆”也会迅速膨胀,给存储系统带来巨大压力。
但由于AI服务器中的HBM(高带宽内存)和DRAM(动态随机存取)容量有限,无法满足日益增长的存储需求。华为此次提出多层KV缓存架构,推出基于灵衢UnifiedBus的PB级KV缓存——OceanStor M900集群。同时,M900采用混合介质加优化Retention算法,可将SSD(固态硬盘)读写寿命提升16倍。可以理解为,华为建了一个超大、超快的“记忆仓库”M900,专门给大模型存聊天记忆用。它通过自研高速通道和计算芯片直连,计算芯片要查KV缓存时,不用经过一堆交换机、路由器层层转发,可以一步到位,并且里面混用不同存储介质,还加了智能算法,让SSD寿命延长16倍,有效解决了存储瓶颈问题。
可以看到,过去市场最关注的是GPU(图形处理器)或NPU本身,而随着大模型规模继续扩大,决定最终有效算力的因素正在延伸至HBM、互联网络、光模块、KV Cache、SSD、液冷等越来越多环节。AI算力正在从一场“芯片竞赛”,逐渐变成一场系统工程的竞争。这要求企业在多个领域进行全面布局和深入研究,才能在这场竞争中占据优势。
而硬件之外,生态仍然是国产算力规模商业化绕不开的另一道门槛。良好的生态系统能够吸引更多的开发者和用户,促进技术的交流和创新,推动产业的发展。
汪涛披露,目前鲲鹏全球开发者超过416万,支持560多个全球开源项目,openEuler装机量则已超过2000万套。昇腾方面,昇腾生态的根基是CANN,外部开发者数量首次超过内部开发者,占开发者总数的61%;基于昇腾 + CANN进行原生训练的模型已经超过40个。这表明华为在生态建设方面取得了显著成效,为国产算力规模的商业化奠定了坚实基础。
这也意味着,下一阶段AI基础设施的竞争可能越来越难以用单颗芯片的参数来衡量。当集群规模迈向十万卡乃至百万卡,芯片能否高效互联、数据能否快速存取、系统能否稳定运行,以及软件生态能否让开发者真正用起来,将共同决定一套AI算力基础设施的实际竞争力。企业需要全面提升自身实力,在多个方面进行优化和改进,才能在激烈的市场竞争中立于不败之地。
“人工智能也许是人类社会最后一次技术革命,它带来的变革之深、之广、之快,远超想象,没有任何一家公司能独自支撑整个智能世界。”汪涛表示,华为AI战略的核心是算力,未来华为将继续聚焦AI基础设施,坚持硬件变现、软件开源开放,为推动人工智能技术的发展和应用贡献自己的力量。


