英伟达把 decode 阶段拆出来单独做了一台机架:Groq 3 LPX 进入量产,用 SRAM 换 HBM 带宽

8 月 24 日 Hot Chips 期间,英伟达宣布 Groq 3 LPX 推理加速器进入量产。这是它去年约 200 亿美元拿下 Groq 技术与团队之后的第一款产品,也是第一款以非 GPU 芯片为核心的机架级系统:一机架 256 颗 LP30,每颗片上 512MB SRAM、合计 128GB,靠片上存储绕开 HBM 带宽这道坎,专做长上下文下的 token 生成。它不替代 GPU——Vera Rubin NVL72 继续吃 prefill 阶段的长上下文,LPX 接手 decode,由 Dynamo 在两套硬件之间调度。英伟达给出的数字是 Gemma 4 31B 在 10 万 token 上下文下每秒 3431 个输出 token。首家客户是 neocloud 厂商 Nebius,机架年内上线。

分工的理由:两个阶段的瓶颈不一样

一次推理里,prefill 要把整段上下文读进来算 KV,是计算密集型,GPU 的强项;decode 一次只吐一个 token,每步都要把权重和 KV 从显存里搬一遍,卡在内存带宽上。把这两段塞进同一种芯片,等于让其中一段一直在等另一段。 LPX 走的是另一条路:不堆 HBM,改用片上 SRAM。单颗 LP30 带 512MB,一整机架 256 颗合起来 128GB,芯片之间靠 96 条 112Gbps 的 C2C 链路互联,整机液冷、建在 MGX 平台上。英伟达技术博客里给了三种和 Vera Rubin NVL72 的配合方式:标准的 prefill/decode 分离、把 attention 与 FFN 层拆到两套系统上、以及用外部草稿模型做投机解码并维护两份 KV cache。英伟达资深总监 Dion Harris 的说法是「这不是要取代 GPU」,而是让每段活跑在合适的处理器上。

数字要看清是谁跑的

官方引用的成绩:Artificial Analysis 基准上,Gemma 4 31B 在 10 万 token 上下文下每秒输出 3431 个 token,1 万 token 上下文下 3382 个;编码任务的 SPEED-Bench 中位数每秒 4767、P80 每秒 5520。英伟达同时称,LPX 机架配合 Vera Rubin NVL72 在万亿参数模型上的每兆瓦吞吐是 Blackwell NVL72 单打的 35 倍。 这些都是厂商自选并引用的跑分,模型、批量大小和上下文分布一换,收益就会变。真正可比的数据要等第三方在同一负载下复跑。黄仁勋在通稿里的话是「我们用 LPX 把性能前沿推向超快 token 生成」;Nebius CTO Danila Shtan 的说法更具体——生成阶段决定响应速度,而这正是 LPX 加速的那一段,他们会把它放进自家的 Nebius Token Factory 推理平台。

对开发者意味着什么

短期内你不会在自己机房里见到它。这类机架先落到 Nebius 这样的推理云上,普通团队感知到的形式是「某家平台上长上下文的首 token 后延迟明显变低」。真正值得记的是趋势:推理正在被拆成阶段各自优化,采购和调度的粒度从「几张卡」变成「哪一段跑在哪种硅片上」。选型时该问的问题也随之变了——不是「这家有没有最新 GPU」,而是「长上下文、高交互的负载在他们那儿走的是哪条路径」。

via: NVIDIA 技术博客《How NVIDIA Groq 3 LPX Unlocks Ultrafast Interactivity at Long Context》NVIDIA 官方通稿SiliconANGLE 报道