)
芯片制造商英伟达表示,其专用AI推理加速芯片Groq 3 LPX已正式进入量产阶段,英伟达正以此巩固自身在AI计算领域的领先地位。
这款新芯片于Hot Chips 2026大会上正式发布,被定位为英伟达旗舰Vera Rubin数据中心平台的专属扩展组件。据英伟达介绍,该芯片专为实现超高速Token生成而设计,能够满足高响应性智能体AI工作负载的运行需求。英伟达还宣布,新云服务提供商Nebius Group N.V.已成为首批承诺采用该芯片的客户。
推理是AI行业对于运行已训练完成的AI模型的专业术语,当前这一环节越来越聚焦于能够代替人类执行任务的自主AI智能体。这些智能体需要完成从推理规划、编写与执行代码,到检查系统文件、调用第三方工具等一系列循环操作。在处理复杂的任务链时,智能体会快速消耗大量Token,这有时会导致严重的"解码延迟",带来令人沮丧的响应停顿。
为解决这一问题,AI数据中心需要更专业的计算架构,将庞大的上下文处理与Token生成解耦分离,从而提升AI智能体的推理与运行速度。
Vera Rubin NVL72机架级平台正是为此而生。该平台搭载了数十颗英伟达最强大的Vera Rubin GPU,专门负责大规模上下文的摄取与处理。如今,随着Groq 3 LPX的加入,解码工作负载可被卸载至新加速器上协同处理。
据英伟达介绍,在完整的机架级部署中,Groq 3 LPX可支持多达256块LP30加速器,并通过超高带宽芯片互联技术实现协同工作。这意味着语言处理单元(LPU)能够与GPU协同运行,共同处理AI智能体推理链中的每一个步骤,构成面向企业级应用的统一推理引擎。
英伟达表示,这将有助于消除吞吐量与响应时间之间的两难取舍。Groq 3 LPX让AI智能体能够实时扫描长上下文窗口、校验数据、调用第三方工具,并对最复杂的多步骤任务进行迭代,而不会给用户造成明显延迟。这一说法也有第三方数据佐证:在Artificial Analysis进行的基准测试中,Groq 3 LPX在运行开源Gemma 4 31B智能体模型、上下文窗口为10万Token的条件下,实现了每秒3400个Token的输出,创下历史纪录。英伟达认为,与竞争平台相比,该芯片在延迟敏感型工作负载上的响应速度提升了四倍,多步骤智能体任务的完成时间可从数小时缩短至数分钟。
这款新芯片采用了从初创公司Groq Inc.授权的技术。去年12月,英伟达斥资200亿美元获得该技术授权,并将Groq联合创始人Jonathan Ross与总裁Sunny Madra纳入麾下。Groq(请勿与SpaceX旗下的Grok AI模型混淆)专注于开发面向推理而非AI训练的处理器。
英伟达创始人兼首席执行官黄仁勋表示,公司已通过Grace Blackwell和NVL72平台在AI推理性能与效率方面实现了革命性突破。他说:"Vera Rubin在此基础上进一步延伸,以针对工作负载优化的AI工厂配置,引领智能体AI时代的到来。我们正通过LPX推进超高速Token生成的性能前沿。这将从根本上改变智能的生产方式,在AI吞吐量、效率与响应速度上再次实现跨越式提升。"
Nebius是首批同意部署Groq 3 LPX芯片的企业之一。该公司表示,将把这些芯片用于其生产推理平台"Nebius Token Factory",为客户提供极速Token生成能力,以支撑响应性要求最高的智能体应用场景。
"生成阶段决定了AI系统的实际响应速度,而这正是Groq 3 LPX所要加速的核心环节,"Nebius首席技术官Danila Shtan表示,"作为首家通过Nebius Token Factory将其推向生产的AI云平台,我们致力于让智能体循环的每一步都做到即时响应。"
英伟达在Hot Chips大会上还有更多重磅披露。英伟达宣布SpaceX已成为其最新旗舰客户,这家太空火箭与AI公司计划围绕Vera Rubin平台构建其下一代AI架构。具体而言,SpaceX将部署英伟达Vera CPU,用于横跨地面数据中心与轨道卫星的CPU密集型编排、工具执行及仿真任务。
英伟达还展示了多项面向AI工厂的配套技术,包括:Spectrum-X Multiplane——一种全新的AI优化以太网架构,通过将服务器连接拆分为并行路径,可支持最大规模达51.2万颗GPU的超大集群;Nvidia Scale-In——一款全新基础设施软件平台,可将安全、网络与数据管理任务从主机计算节点卸载并加速处理;以及Nvidia NVLink Fusion——支持定制CPU与数据处理单元接入其第六代NVLink机架系统。
Q&A
Q1:Groq 3 LPX是什么芯片,主要用来做什么?
A:Groq 3 LPX是英伟达推出的专用AI推理加速芯片,定位为Vera Rubin数据中心平台的扩展组件。它专为超高速Token生成设计,主要用于加速AI智能体的推理工作负载,能够在实时处理长上下文窗口的同时,大幅降低解码延迟,让多步骤智能体任务从数小时缩短至数分钟完成。
Q2:Groq 3 LPX的实际性能表现如何?
A:根据第三方机构Artificial Analysis的基准测试,Groq 3 LPX在运行开源Gemma 4 31B智能体模型、上下文窗口为10万Token的条件下,每秒可输出3400个Token,创下历史纪录。英伟达称,与竞争平台相比,该芯片在延迟敏感型工作负载上的响应速度提升了四倍。
Q3:英伟达和Groq Inc.是什么关系?
A:英伟达于去年12月以200亿美元获得初创公司Groq Inc.的技术授权,并引入了Groq联合创始人Jonathan Ross与总裁Sunny Madra。Groq Inc.专注于开发面向AI推理的处理器,英伟达正是基于其技术研发了Groq 3 LPX。需注意,Groq Inc.与SpaceX旗下的Grok AI模型是两个不同的主体。