英伟达发布智能体专用算力平台 Groq 3 LPX实现Token成本35倍优化
2026-08-25 12:01:33未知 作者:徽声在线
《徽声在线科技频道》8月25日报道(记者 李明轩)英伟达在硬件创新领域持续发力,正全力推进面向智能体(Agent)时代的新一代算力平台建设,为AI发展注入强劲动力。
当地时间8月24日,英伟达正式对外宣布,其专为智能体场景设计的推理加速器Groq 3 LPX机架已全面进入量产阶段。据英伟达高级总监Dion Harris透露,Groq机架将与Vera中央处理器及Rubin图形处理器协同部署于新型云服务商Nebius的数据中心,预计将于今年第四季度正式投入运营。
作为Vera Rubin平台的核心推理加速组件,Groq 3 LPX机架需与NVL72 GPU主机架配合使用——NVL72承担模型训练、推理及上下文处理等全流程任务,而LPX则专注于AI生成结果(Token)的极速输出,通过异构协同架构显著提升万亿参数级智能体在超长上下文场景下的推理效率与交互响应速度,实现每瓦特吞吐量的突破性优化。
英伟达此前明确将Vera Rubin平台定位为智能体AI与科学计算时代的机架级超级计算解决方案。此次Groq 3 LPX的量产并非要取代传统GPU架构,而是通过专项优化填补GPU在低延迟Token生成领域的性能短板,构建更完整的智能体计算生态。
根据英伟达公布的基准测试数据(采用SemiAnalysis AgentX测试体系,涵盖Kimi K3、MiniMax M3、GLM5.3、Qwen3.5、DeepSeek V4 Pro等主流模型),Vera Rubin平台在智能体工作负载下展现显著优势:
在Artificial Analysis测试中,搭载Gemma 4 31B模型处理100K Token上下文时,Groq 3 LPX实现每秒3400个Token的输出速度,刷新该模型性能纪录;针对智能体编程等低延迟场景,其响应速度较竞品平台提升最高达400%。这一突破使得智能体能够更高效地完成代码编写、自动化测试、工具调用及结果验证等复杂任务链。
更值得关注的是真实工作负载下的能效表现:基于DeepSeek V4 Pro模型的AgentX测试显示,Vera Rubin NVL72的每兆瓦吞吐量较上一代GB300 NVL72提升30倍,单Token成本降低35倍。对于数据中心运营商而言,这意味着在同等电力预算下可支持更高密度的智能体交互,或以更低成本提供相同规模的服务能力。
英伟达特别指出,智能体任务与传统聊天应用存在本质差异——其任务上下文会随执行步骤动态扩展至数十万Token级别。据OpenRouter数据显示,智能体AI工作负载的Token消耗量可达简单对话的15倍,这源于其需要串联数据库查询、多模态搜索、子智能体调用、代码执行与验证等复杂流程。
当前行业动态印证了这一技术趋势:腾讯、阿里、DeepSeek等科技巨头正加速推进AI智能体产品迭代与生态建设,AI应用层竞争已从模型参数规模转向终端场景落地能力与生态壁垒构建。天风国际证券最新研报分析称,随着Harness框架等执行层技术的开放迭代,前沿AI竞争正深入至Agent执行框架优化与商业化落地阶段。
面对智能体时代的计算需求变革,英伟达及时调整硬件优化方向。未来AI基础设施的评价标准将发生根本性转变:从单纯追求模型训练规模,转向衡量单位能耗的Token产出效率、单位成本的任务处理能力,以及复杂任务执行的端到端延迟。这一转型或将重新定义数据中心硬件的技术路线图。
(徽声在线科技频道 李明轩)



