AI算力新篇章:从GPU争夺到Token生产效率战
2026-09-03 15:08:12未知 作者:徽声在线
徽声在线记者 | 李明轩
徽声在线编辑 | 张思颖
在过去的两年里,AI算力领域经历了一场深刻的变革,其重心发生了显著转移。
起初,企业间的竞争焦点集中在GPU的争夺上。随着大型模型的迅猛发展,算力成为了AI应用得以落地的先决条件。地方政府和企业纷纷投身于数据中心的建设,竞相采购GPU,一时间,“拥有GPU即拥有算力”成为了行业内的共识。
然而,当企业真正着手将大型模型部署到自身的业务环境中时,问题逐渐浮现,从“是否拥有GPU”转变为“GPU能否真正高效运行”。
这背后隐藏着一套复杂的软件工程挑战。
GPUStack的首席执行官秦小康在接受徽声在线采访时指出,当前市场上GPU、模型和推理后端资源丰富,但不同硬件、模型和推理框架之间的组合关系错综复杂。即便一款模型获得了GPU的支持,也并不能直接投入运行,还需经过推理后端的适配以及针对具体硬件的性能优化。
因此,GPUStack的业务范围从最初的GPU资源管理,扩展到了涵盖GPU管理、模型部署、推理引擎适配和运营管理的全方位服务。
若将AI算力比作水电基础设施,GPU便是发电设备,而模型和应用则是用电、用水的一端。那么,GPUStack便如同一家“水力公司”,它不生产GPU,也不制造大型模型,而是致力于将分散的算力资源整合起来,根据需求进行灵活调度,确保算力能够稳定地转化为Token。
这一转变背后,是AI算力产业计量方式的深刻变革:从“拥有多少张卡”,逐渐转向“这些卡能够生产多少Token”。
从“GPU争夺战”到“GPU高效利用”
国产GPU正迎来一个关键的产业发展阶段。
秦小康认为,过去两年AI基础设施领域发生了两大显著变化:一是开源模型迅速崛起,并广泛应用于更多场景;二是非英伟达体系的GPU开始得到更多真实业务的验证。对于国产算力而言,这意味着行业的关注点正从芯片本身向软件生态和实际使用效率转移。
这正是GPUStack切入市场的核心位置。一块国产GPU要真正进入生产环境,所面临的不仅仅是硬件问题。秦小康向徽声在线表示,目前最常见的问题有两类:一是模型与GPU无法适配,导致GPU闲置;二是模型虽能运行,但硬件性能无法得到充分发挥。
他提及了一个金融行业的客户案例,该客户基于华为GPU运行模型,经过优化后,吞吐量提升了8至9倍,推理延迟降低了80%至90%。当然,这属于极致优化效果;对于原本已经具备较好优化基础的场景,平台方面认为,20%至30%的利用率提升已属行业领先水平。
这里真正值得关注的,并非某个平台能够提升多少利用率,而是国产GPU产业的竞争正逐渐向软件栈领域延伸。
“单纯进行GPU算力编排并非难事,真正复杂的是推理后端和推理引擎的适配优化。”GPUStack的首席技术官梁胜认为,不同GPU对应不同的软件体系,不同模型又有不同的运行要求,且模型架构仍在快速演变,这使得AI算力基础设施仍处于类似早期PC时代“驱动不断适配”的阶段。
GPUStack试图通过可插拔的推理后端机制来解决这一问题:当模型厂商推出新模型或定制化推理后端时,无需对整个平台进行改造,而是通过接口快速接入。
这也是GPUStack与传统GPU云、单纯GPU调度工具之间的显著区别。
该公司认为,目前市场上尚未出现与GPUStack完全对应的竞争对手。海外已经形成了多种GPU编排和AI基础设施方案,如NVIDIA旗下的Run:ai主要解决GPU调度、资源池化和集群编排问题;Kubernetes生态中的Kueue、Volcano等开源项目也在解决GPU工作负载调度问题;Anyscale则更多从分布式计算和AI工作负载扩展角度切入。欧盟委员会在分析GPU编排软件市场时,也将Run:ai与Slurm、ClearML、Anyscale、Kubeflow等视为不同程度的替代方案。
而GPUStack则试图将竞争位置进一步向上延伸:不仅管理GPU,还要将GPU、模型、推理引擎和Token服务串联起来。
这意味着它真正面临的竞争,并非仅来自另一家GPU调度软件公司,而是企业自建平台、芯片厂商自有软件栈、云厂商AI基础设施以及各种开源项目的综合竞争。
这也是开源模式对GPUStack的重要意义所在。其团队认为,AI硬件和模型都在高速迭代,不可能依靠单一企业完成所有适配工作,因此需要硬件厂商、模型厂商和开发者共同参与。GPUStack目前已经形成了11万级的部署体量,用户的真实使用和反馈成为产品迭代的重要驱动力。
算力竞争转向效率比拼
AI算力行业的商业模式也正在发生深刻变化。
秦小康认为,目前国内不少Token工厂仍采用项目制模式,主要服务于万卡以上的大型算力集群。但未来,不可能所有企业都依赖少数大型公有算力中心。对于金融、能源、制造等大量对数据安全、成本和业务场景有严格要求的企业而言,私有部署仍存在巨大需求。
这意味着,AI算力市场可能出现新的分层:少数超大型算力中心提供基础算力,而大量企业则建设自己的“小型Token工厂”。
GPUStack正瞄准这一市场,从商业逻辑上看,这与过去云计算的发展有一定相似之处:基础设施逐渐标准化后,企业无需再自己搭建所有底层系统,而是购买一套成熟的软件和服务,将底层复杂性屏蔽掉。
帝欧水华集团董事长朱江的经历,为我们提供了来自“买方”的独特视角。
作为传统产业企业,其团队此前已开始建设算力业务,并尝试自己搭建算力管理体系。朱江向徽声在线回忆,该公司曾投入上百万元进行自研,但AI工程化人才稀缺,GPU适配、软件部署和漏洞修复都需要大量投入。最终,开源的GPUStack降低了自研门槛,使企业能够更快地完成多品牌GPU的统一管理和算力服务搭建。
朱江对行业的判断是,GPU短缺不会永远持续。随着GPU供给的增加,企业竞争的重点将从“谁能获得GPU”转向“谁能更好地管理和利用GPU”。其所在企业已将算力业务视为第二增长曲线。
这实际上也是GPUStack试图解答的行业问题:当GPU逐渐从稀缺资源转变为一种可以被规模化采购的生产资料时,新的瓶颈将出现在哪里?
答案可能并非更多的GPU,而是如何将不同品牌的GPU、不同模型和不同推理引擎组织成一个稳定的生产系统。
因此,“Token工厂”并非仅为AI算力换了一个新名称,它更指向AI基础设施的一次深刻变革——AI行业正在从争夺算力资产,转向争夺算力效率;从建设算力中心,转向建设能够持续生产Token的基础设施。

