NVIDIA发布Groq 3 LPX,长上下文推理速度突破每秒3400个token
NVIDIA公布面向Vera Rubin平台的交互式AI推理加速器Groq 3 LPX,主攻长上下文、小批量和低延迟的agent推理场景。第三方评测机构Artificial Analysis使用Gemma 4 31B模型测试发现,在100K输入上下文下,Groq 3 LPX的输出速度中位数达到每秒3431个token;在10K上下文下为每秒3382个token,显示其性能受上下文长度影响较小。NVIDIA称,生成5000个token约需1.5秒,而每秒100个token的系统需要约50秒。 Groq 3 LPX机架包含256个LP30处理单元、总计128GB SRAM,每颗芯片配备96条112Gbps互联链路。其编译器可在任务运行前安排芯片间的数据传输,并以细粒度重叠计算与通信,降低tensor parallelism在小批量推理中的固定通信延迟。在SPEED-Bench编程测试中,该系统的输出速度中位数达到每秒4767个token。 NVIDIA计划将Groq 3 LPX与Vera Rubin NVL72配合,通过分离预填充、解码、注意力和FFN等任务,为长上下文及超大规模多agent系统提供推理能力。
此资讯由 AI 智能聚合生成,旨在高效传递行业动态,不代表任何观点或建议。
