英伟达Groq机架全面量产 低延迟推理市场竞争白热化
2026-08-25 04:10:33未知 作者:徽声在线
徽声在线8月25日消息(记者 李轩)英伟达公司高层近日对外透露,其旗下的Groq 3 LPX机架已正式迈入全面量产的新阶段,这一里程碑式的进展标志着英伟达史上最大规模技术收购案所获取的核心技术成功实现了商业化应用。
据当地时间周一(8月24日)的报道,英伟达高级总监Dion Harris在公开场合表示,Groq机架将与Vera中央处理器及Rubin图形处理器共同部署于新型云服务提供商Nebius的数据中心内,并计划于今年年底前正式投入运营。
英伟达加速Groq芯片的生产进程并迅速向市场推出相关产品,这一举措凸显了低延迟推理技术在当前AI领域中的重要性日益凸显。低延迟推理技术能够显著提升AI智能体的响应速度,有效避免用户长时间等待,尤其在编程等对实时性要求极高的应用场景中显得尤为重要。
Harris进一步指出,云服务提供商可以针对这类token(词元)服务收取更高的费用,“对于那些提供token服务的企业而言,这为他们为对延迟极度敏感的用户和客户提供高级服务套餐创造了可能。”
回顾去年12月,英伟达与Groq达成了一项高达200亿美元的交易,成功获得了Groq的芯片技术授权,并吸纳了多位Groq的核心员工加入英伟达团队,其中创始人Jonathan Ross更是被委以重任,担任英伟达的首席软件架构师。
今年3月,英伟达正式发布了专为Vera Rubin平台研发的推理加速器Groq 3 LPX。Groq架构在芯片裸片上巧妙地集成了500兆字节的高速静态随机存储器(SRAM),这一设计有效减少了与内存相关的性能瓶颈,提升了整体运算效率。
据悉,Groq芯片由三星负责制造,而英伟达的GPU则继续由台积电生产。每一个LPX机架能够整合256颗Groq 3芯片,英伟达援引Artificial Analysis的基准测试数据称,整合后的机架每秒可处理高达3400个token,展现了强大的处理能力。
在当前的市场环境下,低延迟推理领域的竞争愈发激烈。AMD公司今年早些时候宣布,将把其机架级系统与Cerebras的芯片进行深度整合。而Cerebras作为近期刚刚上市的新兴企业,其业务重点同样聚焦于低延迟推理技术。
值得一提的是,OpenAI近期推出的“Ultrafast”模式也承诺每秒可处理750个token,且该服务由Cerebras提供技术支持,进一步加剧了市场竞争。
然而,需要明确的是,低延迟芯片并不能完全取代作为AI芯片主力的GPU。GPU在AI领域中扮演着举足轻重的角色,它既能够执行训练任务,也能够进行推理运算,同时具备足够的灵活性以适应新技术和新模型的不断涌现。
相比之下,Groq这类低延迟芯片则主要专注于模型服务中的一个特定环节,即“解码”(decode)阶段。Harris也强调:“我们的目标并不是要取代GPU,而是要针对工作负载的不同环节,使用价格合理、处理能力匹配的处理器,以实现最佳的性能和成本效益。”
目前,英伟达正在加快Vera Rubin系统的出货速度。公司CEO黄仁勋先前曾预计,到2027年,当前一代Blackwell芯片和新一代Vera Rubin系统的累计销售额将达到惊人的1万亿美元。
黄仁勋当时还表示,他计划将面向编程应用的数据中心空间中约四分之一分配给Groq芯片,以充分发挥其在低延迟推理方面的优势。“而我的数据中心其余部分将100%采用Vera Rubin系统,以确保在训练和推理任务上的全面领先。”
(徽声在线 李轩)




