大模型推理突破瓶颈:从“堆GPU”迈向存算协同新征程
2026-08-28 17:21:53未知 作者:徽声在线
徽声在线记者 | 肖芳
徽声在线编辑 | 文姝琪
大模型推理领域正面临全新的发展挑战与瓶颈。
在当下的大模型应用场景中,随着模型上下文长度不断拓展,多轮对话以及智能体(Agent)的应用愈发广泛,推理过程中需要处理的数据量呈现出爆发式增长。以往,主要依赖GPU算力来应对推理任务的方式逐渐暴露出诸多问题。尽管算力看似充足,但显存却常常率先被KV Cache(键值缓存)占满,成为制约大模型推理效率的关键因素。
KV Cache原本是大模型推理过程中的重要加速手段,可形象地将其理解为“模型的短期记忆草稿本”。当模型处理上下文时,会把已经计算好的Key、Value向量缓存起来,在后续生成新的Token时直接复用,以此避免重复计算,提高推理效率。然而,当上下文长度持续增加,KV Cache自身却演变成了新的成本和性能瓶颈。一方面,它占用了大量的显存资源,限制了模型处理更复杂任务的能力;另一方面,在跨对话、跨节点的大集群场景中,传统KV Cache只能消除单对话、单节点内的重复计算,其加速效用会迅速衰减。像AI智能体、知识库问答这类高频调用相同上下文的应用,大量基础Token会被成千上万次重复计算,导致GPU算力被白白浪费,增加了企业的运营成本。
针对这一难题,中科曙光北京公司总裁助理、分布式存储产品部总经理石静在接受徽声在线采访时指出,目前行业内已经形成了“以存换算”的共识。具体而言,就是将已经计算好的KV Cache保存下来,在后续的请求中直接复用,从而减少重复计算,提高资源利用效率。
为了有效解决传统KV Cache在大集群场景中的局限性,8月28日,中科曙光推出了ParaCache解决方案。该方案通过构建分布式共享KV Cache池,打通了GPU HBM、CPU DRAM、SSD和分布式存储四级缓存,实现了不同温度数据的分层存储。同时,它还支持跨GPU、跨节点的KV Cache复用,使得数据能够在整个集群中高效共享和利用。通俗来讲,中科曙光的这一思路是将大模型推理过程中用完即弃的计算中间结果,转化为全集群共享的长期记忆,即算一次、存下来,谁用谁取,避免了重复计算,大大提高了推理效率。
石静进一步解释道,ParaCache解决方案更适合长上下文占比较高、存在大量公共重复上下文,同时具有较大并发压力的场景。例如,在智能客服、知识库问答等应用中,能够充分发挥其优势。而对于一次性的短请求,缓存复用的价值则相对有限。根据中科曙光披露的测试数据,在高并发场景下,其Token吞吐量最高可以提升27倍;在多轮会话场景中,首Token时延(TTFT)降低超过80%。在实际的应用场景中,也取得了显著的效果。例如,某银行信用卡中心智能客服场景,并发吞吐量提升约3倍;某教科研知识库问答场景,并发度可提升15至20倍。
石静还向徽声在线表示,在长上下文、多轮对话、智能体等场景下,ParaCache解决方案能够帮助客户在内存与SSD配置上节省约三分之一的硬件采购成本。这对于企业来说,无疑是一笔可观的开支节省,有助于降低运营成本,提高企业的竞争力。
据徽声在线了解,国内一家头部互联网厂商已经与中科曙光完成了在线推理业务的KV Cache管理优化工作。这一合作不仅验证了ParaCache解决方案的可行性和有效性,也为其他企业提供了借鉴和参考。
这一系列的变化背后,反映的是AI基础设施建设逻辑的深刻转变。大模型基础设施建设正在从过去单纯“堆GPU”的模式,转向存算协同的发展方向。石静指出,过去做AI建设的思路是遇到瓶颈就增加GPU数量,但GPU成本高昂,且供给受到一定限制。同时,数据路径上的无效计算和额外搬运也在制约着GPU效率的发挥。因此,存算协同并非短期的技术改良,而是大规模训推生产的必然趋势。
在石静看来,AI的发展正在驱动数据基础设施发生结构性变化,这为国内厂商带来了更多的发展机遇。国内厂商可以凭借在存储领域的技术积累和创新能力,在大模型推理市场中占据一席之地。
中科曙光想要抓住这一轮发展机遇,其底气在于在存储领域多年的深厚积累。其ParaStor分布式存储与FlashNexus集中式存储是两大核心产品线,已经广泛应用于大模型训练、自动驾驶、具身智能、智算中心等AI场景。今年7月,国内首个全国产十万卡AI超集群“曙光8000”落成并接入国家超算互联网,ParaCache正是在十万卡集群中完成了验证,充分证明了其在大规模集群环境下的稳定性和可靠性。
更值得关注的是,ParaCache带来的不仅仅是工程层面的优化,更是大模型推理架构的范式变化。石静表示,以前GPU是整个架构的中心,KV Cache只是一个临时状态。而在新的架构下,KV Cache正在成为一种数据资产,GPU则应该围绕这些数据提供Prefill(处理用户Prompt)和Decode(逐字输出)计算能力。未来,KV Cache管理能力甚至可能影响推理服务成本、响应速度以及Agent的扩展能力,成为决定大模型推理性能的关键因素之一。
从行业的角度来看,这一轮基础设施的结构性变化,带来的更深层次影响在于算力的建设思路。AI集群的规划正在从单纯关注GPU算力,转向算力、存储、网络、缓存的一体化规划,并以总拥有成本(TCO)为衡量标尺。存储的定位也从过去被动的数据容器,转变为深度的数据调度、缓存复用与计算卸载,成为AI集群中不可或缺的重要组成部分。
可以说,在当今的大模型竞争环境中,管好记忆正在变得和提升算力同等重要。大模型竞争的下半场,不只是比拼谁的算力更强,还要比拼谁的数据存得更聪明、更高效。只有实现算力与存储的协同发展,才能在激烈的市场竞争中立于不败之地。

