NVIDIA发布Groq 3 LPX推理加速器:第三方基准显示 100K上下文下每秒生成 3431 个token
在Vera Rubin平台上,Groq 3 LPX通过编译器调度的确定性执行,实现了长上下文下的高交互性推理,第三方评测显示其速度可达每秒 3431 个输出token。
AI解读:Groq 3 LPX解决的是AI推理中“长上下文”与“高速度”难以兼得的问题。在智能体(Agent)这类多轮对话任务中,上下文会随轮次不断增长,甚至超过 10 万token,如果推理速度不够快,用户等待时间会急剧拉长。Groq 3 LPX采用编译器预调度所有芯片间通信的方式,消除了数据传输的实时仲裁延迟,使其在 10 万token的上下文下仍能达到每秒 3431 个token的生成速度。这意味着原本需要 50 秒才能生成的 5000 个token,现在只需约 1.5 秒,对开发者构建智能体编程工具或长文档处理应用来说,交互体验会有本质提升。不过,该芯片目前仅与NVIDIA的Vera Rubin NVL72平台搭配使用,并非独立产品,普通用户暂时无法直接购买。
NVIDIA于 2026 年 4 月发布Groq 3 LPX,这是一款专为NVIDIA Vera Rubin平台设计的交互式AI推理加速器。它与Vera Rubin NVL72搭配,可服务高达 2 万亿参数的多智能体系统,实现高交互性和长上下文支持。据第三方机构Artificial Analysis对Gemma 4 31B模型的 100K上下文基准测试,Groq 3 LPX实现了每秒 3431 个输出token的中位生成速度,达到“世界级”的交互性水平。
核心技术:编译器调度的确定性执行
Groq 3 LPX采用确定性执行模型,编译器在运行前对 256 个LP30处理单元、128 GB SRAM内存和每芯片 96 条 112 Gbps的C2C链路进行精确调度,规划出每个时钟周期的数据传输计划。这消除了实时仲裁的开销,使数据传输在准备好时立即开始,并在到达时立即消费,从而将“首比特延迟”降至最低。
此外,编译器以 320 字节向量为粒度,将矩阵乘法分解为点积序列,使计算结果在准备好一部分后即可立即发送,而非等待整个矩阵操作完成。这种细粒度的计算与通信重叠,在处理小张量时尤为重要。
- 确定性调度消除了实时仲裁,使首比特延迟最小化
- 以 320 字节向量为单位,实现计算和通信的深度重叠
- C2C链路每芯片 96 条,支持点对点路由,LPU兼具处理器和路由器功能
第三方基准与实测性能
Artificial Analysis对Groq 3 LPX系统(运行Gemma 4 31B模型)在 100K输入上下文下的中位生成速度为每秒 3431 个token;在 10K上下文下,速度为每秒 3382 个token。NVIDIA表示,预计速度可维持到数十万token的上下文长度,这得益于对SRAM的低延迟访问。
NVIDIA还使用开源编码基准SPEED-Bench进行了测试,同一系统在编码任务上的中位速度达到每秒 4767 个token,其中 20% 的任务生成速度超过每秒 5500 个token。NVIDIA与Artificial Analysis均确认,这些基准测试中没有精度损失或模型质量下降。
- 100K上下文:3431 tokens/s(中位数)
- 10K上下文:3382 tokens/s(中位数)
- SPEED-Bench编码任务:4767 tokens/s(中位数),P80为 5520 tokens/s
与Vera Rubin NVL72的协同配置
Groq 3 LPX与Vera Rubin NVL72机架配对时,支持多种服务配置:标准的预填充-解码分离(Vera Rubin处理预填充,Groq 3 LPX处理解码);注意力-FFN分离(Vera Rubin处理注意力并存储KV缓存,Groq 3 LPX执行FFN层);以及外部草稿模型投机解码(Groq 3 LPX运行小模型,Vera Rubin运行大模型并验证token)。这些配置旨在使每个机架专注于其最擅长的负载部分。
- 标准预填充-解码分离:每轮一次KV缓存传递
- 注意力-FFN分离:仅在注意层间传递中间token
- 外部草稿模型投机解码:分工验证token