英伟达Groq机架量产引爆AI低延迟推理市场,AMD、Cerebras竞相布局
2026-08-25 05:03:13未知 作者:徽声在线
徽声在线8月25日消息(记者 李明)英伟达高层近日透露,备受瞩目的Groq 3 LPX机架已正式迈入全面量产阶段,这一里程碑标志着英伟达史上最大规模技术收购案所获取的核心技术成功实现商业化应用。
据当地时间周一(8月24日)的报道,英伟达高级总监Dion Harris在发布会上表示,Groq机架将与Vera中央处理器及Rubin图形处理器共同部署于新型云服务提供商Nebius的现代化数据中心,预计将于今年第四季度正式投入运营。
英伟达加速Groq芯片的生产进程并迅速向市场推出相关产品,凸显了AI领域对低延迟推理技术的迫切需求。低延迟推理技术能够显著提升AI智能体的响应速度,减少用户等待时间,在实时编程、金融交易等对时效性要求极高的应用场景中具有不可替代的价值。
Harris进一步解释称,云服务提供商可针对此类高性能token(词元)服务收取溢价费用,为对延迟极为敏感的企业用户提供定制化高级服务套餐,从而开辟新的盈利增长点。
回溯至去年12月,英伟达以200亿美元完成对Groq的收购,不仅获得了其先进的芯片技术授权,还吸纳了多位核心研发人员加入团队,其中创始人Jonathan Ross更是出任英伟达首席软件架构师一职。
今年3月,英伟达正式发布了专为Vera Rubin平台设计的推理加速器Groq 3 LPX。该架构创新性地在芯片裸片上集成了500兆字节的高速静态随机存储器(SRAM),有效缓解了内存带宽瓶颈问题,提升了数据处理效率。
据悉,Groq芯片由三星电子负责生产制造,而英伟达的传统GPU产品则继续由台积电代工。每个LPX机架可集成256颗Groq 3芯片,根据Artificial Analysis的基准测试数据,整合后的机架每秒可处理高达3400个token,性能表现卓越。
当前,AI低延迟推理市场竞争日趋激烈。AMD公司今年早些时候宣布,将把其机架级系统与Cerebras的专用芯片进行深度整合。值得一提的是,Cerebras公司近期刚刚完成上市,其业务重心同样聚焦于低延迟推理技术的研发与应用。
在应用层面,OpenAI近期推出的“Ultrafast”模式承诺每秒可处理750个token,该服务正是由Cerebras公司提供技术支持。
需要强调的是,低延迟芯片虽在特定场景下表现优异,但并不能完全取代GPU在AI领域的主导地位。GPU凭借其强大的并行计算能力和灵活性,既能胜任模型训练任务,也能高效执行推理操作,是AI芯片市场的中流砥柱。
相比之下,Groq这类低延迟芯片则更专注于模型服务中的“解码”环节。Harris也明确表示:“我们的目标不是取代GPU,而是根据工作负载的不同特点,选择最适合、最具性价比的处理器方案。”
英伟达目前正在全力推进Vera Rubin系统的出货工作。公司CEO黄仁勋此前曾预测,到2027年,当前一代Blackwell芯片与新一代Vera Rubin系统的累计销售额有望突破1万亿美元大关。
黄仁勋还透露了公司的数据中心布局计划,他表示将把面向编程应用的数据中心空间中约四分之一的资源配置给Groq芯片,而剩余部分则将全部采用Vera Rubin系统。
(徽声在线 李明)




