WAIC聚焦:魏少军领衔、DF1000斩获SAIL奖,3D近存计算能否突破内存瓶颈?

2026-07-20 04:06:00未知 作者:徽声在线

在世界人工智能大会(WAIC)的舞台上,每年备受瞩目的最高奖项SAIL奖(卓越人工智能引领者奖)总是吸引着无数目光。而在本届WAIC中,SAIL奖共颁发了四个,东方算芯DF1000凭借其卓越表现,成功跻身其中,成为焦点之一。

SAIL奖,这一奖项名称蕴含着深意:S代表超越自我,A代表赋能未来,I代表创新无限,L代表引领潮流。东方算芯DF1000在本届SAIL奖中,正是凭借其引领性的技术突破,赢得了评委们的一致认可。

东方算芯,这一由国际欧亚科学院院长魏少军团队精心打造的品牌,自诞生以来便备受关注。7月18日,在WAIC的现场,东方算芯的相关负责人接受了《每日经济新闻》记者的专访。他透露:“如今,各大AI芯片厂商在发布会上已经很少再提及算力了,这与去年及以前的情况截然不同。”

这一转变的背后,是AI芯片行业比拼焦点的转移。从最初的芯片性能比拼,到如今的系统层面较量,从单芯片性能到整机、超节点的综合性能评估,各大厂商都在寻求在单位功耗下创造更多价值。特别是在大模型的应用场景下,单位功耗下获得的总token(词元)数量以及低延迟token的获取能力,成为了衡量芯片性能的新标准。同时,随着大模型从训练阶段向推理阶段的转变,带宽的重要性日益凸显。

带宽瓶颈凸显,成为AI芯片发展新挑战

东方算芯的负责人进一步解释道:“在当前架构下,大模型的推理过程主要分为Prefill(预填充)和Decode(解码)两个阶段。其中,Decode阶段面临着严重的内存带宽瓶颈。换句话说,在这个阶段,带宽往往已经达到了极限,但算力的利用程度却只有20%到30%。”

这意味着,在推理的Decode阶段,算力远未达到其上限。此时,即使增加算力,性能也不会得到显著提升。该负责人强调:“在内存带宽成为瓶颈的情况下,带宽增加多少,性能就能提升多少。性能的提升意味着在单位时间和单位功耗下能够产生更多的token,从而降低token的成本。”

那么,token成本的下降对AI行业意味着什么呢?上述负责人表示:“这将极大地降低AI应用的探索成本。当下,许多AI应用企业正在积极探索AI能力的边界。AI Coding(AI编程)已经被证明是一个巨大的市场,那么下一个类似Coding的市场在哪里呢?这需要企业去探索,而探索需要成本。带宽领域的优势将带来token成本的下降,使得AI应用企业能够探索得更远,从而更有可能发现下一个‘杀手级’应用,下一个AI Coding的市场。”

简而言之,当下AI硬件的主要瓶颈在于内存带宽。解决带宽问题,将使得token成本下降,进而促进应用探索行为的增多和探索场景的拓展。

传统的通用GPU采用2.5D封装技术,即计算核心的数据通过Interposer(中介层)传输到HBM(高带宽存储)。虽然相比使用LPDDR(低功耗双倍数据速率内存)或GDDR(图形双倍数据速率显存)的AI芯片来说,内存带宽有了显著提升,但过去几年访存带宽的提升速度仍然远低于AI芯片算力的提升速度。

为了突破这一瓶颈,英伟达去年底“收编”了Groq的LPU(语言处理单元),采用片上存储SRAM(静态随机存取存储器)来解决内存带宽问题。这种设计使得计算核心的隔壁就是内存,无需远距离传输数据,从而提高了数据传输效率。

然而,LPU虽然带宽很高,但容量却很小。与HBM相比,SRAM的容量较小但带宽极高,就像一个小水池虽然容量有限,但进出水速度极快。而英伟达推出的LPU,则是在容量和带宽之间做出了极端的选择。

3D近存计算:突破内存带宽瓶颈的新途径

在众多解决方案中,3D近存计算成为了突破内存带宽瓶颈的重要途径。东方算芯正是这一领域的佼佼者,其在保持较大内存容量的基础上,极大提升了AI芯片的访存带宽。

东方算芯的方案是在立体空间中寻求发展。其最下层是逻辑层,即计算核心;而上方则是(DRAM)内存。逻辑层晶圆与存储晶圆通过混合键合连接,实现了高速互联。这种设计使得数据传输路径大大缩短,提高了数据传输效率。

东方算芯的负责人表示:“逻辑芯片与存储芯片通过3D混合键合在物理层面堆叠,互联密度达到了很高的水平。与传统HBM相比,DF1000的带宽得到了大幅提升。”

据悉,某款LPU 3配备了500MB(兆字节)的片上内存容量,提供了高达150TB/s(太字节/秒)的内存带宽。而DF1000的带宽虽然略低于LPU,但仍然达到了6.4TB/s,远高于国内采用2.5D封装技术路线的AI芯片。

东方算芯的负责人认为:“LPU的带宽虽然更高,但其容量太低了。在实际应用中,容量和带宽都需要达到一定的平衡。”

以LPU机架为例,其中包含了256颗LPU芯片,但如此多的芯片其高速存储容量也仅有128GB(吉字节)。而128GB的容量,如果要将大模型的权重参数都放在高速的SRAM内存上运行,连当下“满血”参数的主流大模型都放不下。

换言之,传统GPU虽然算力强大,但在Decode阶段性能常常受限于内存带宽。而LPU虽然拥有极致的内存带宽,但内存容量又较小。而东方算芯的3D近存计算产品DF1000,则在保持较大内存容量的同时,大幅提升了内存带宽,实现了容量和带宽的平衡。

7月18日,在WAIC2026的主题演讲中,魏少军便表示,国内AI芯片需要跨过三堵墙:算力墙、内存墙和通信墙。而DF1000提供的3D近存计算思路,或许将引领国产芯片逐渐跨过内存墙这一重要障碍。

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 微信电脑端重大更新:可滚动截长图与支持发语音功能上线微信电脑端重大更新:可滚动截长图与支持发语音功能上线 上海布局太空算力新赛道,全球首颗光计算卫星研制正式启动上海布局太空算力新赛道,全球首颗光计算卫星研制正式启动
相关文章
直击WAIC|智能体加速落地:渗透车辆、手机与真实场景 “AI+终端”时代来临?直击WAIC|智能体加速落地:渗透车辆、手机与真实场景 “AI+终端”时代来临? 昇腾950超节点真机深度探访,全面解析!昇腾950超节点真机深度探访,全面解析! 人工智能开启全新“打开方式”|WAIC深度观察人工智能开启全新“打开方式”|WAIC深度观察 WAIC大咖谈|毕马威卢鹍鹏:AI产业告别“故事时代”,具身垂直领域率先破局WAIC大咖谈|毕马威卢鹍鹏:AI产业告别“故事时代”,具身垂直领域率先破局 东海海域火箭发射:上海海事局发布航行管制通告东海海域火箭发射:上海海事局发布航行管制通告 WAIC 洞察|物理 AI 产业迎来发展黄金期:Om AI 联汇端侧原生路线获广泛认可,标准共建率先落地WAIC 洞察|物理 AI 产业迎来发展黄金期:Om AI 联汇端侧原生路线获广泛认可,标准共建率先落地