三星把算力塞进内存颗粒里:LPDDR5X-PIM 端侧带宽从 76.8 GB/s 拉到 614 GB/s,Llama 3.1 8B 生成从 27 tok/s 涨到 81.3

1 查看

三星在 8 月 25 日的 Hot Chips 2026 上介绍了 LPDDR5X-PIM——业界第一个基于 LPDDR 的存内计算方案。在 LPDDR5X-9600 上,PIM 带宽可达 614 GB/s,而走常规内存接口只有 76.8 GB/s,约八倍差距;做法是把 16 个 PIM 块铺进芯片全部 16 个 bank,MAC 树并行跑,ALU 同时处理 FP 和 INT。用 Llama 3.1 8B 在端侧加速器上实测,生成从 27 token/s 升到 81.3 token/s,任务耗时从 12.3 秒降到 5.4 秒。封装沿用标准 LPDDR5X 的 561 球,配常规内存控制器即可。

八倍带宽是怎么来的

端侧推理的瓶颈通常不在算力而在搬运——权重从内存搬到计算单元的这段路。PIM 的思路是别搬了,直接在内存里算:三星把 16 个 PIM 块分别放进芯片的全部 16 个 bank,每块里的 MAC 树并行工作,配一个能同时处理浮点和整型的 ALU。结果是在 LPDDR5X-9600 上,PIM 侧可用带宽达到 614 GB/s,而同一颗芯片走常规内存接口只有 76.8 GB/s,单颗容量 16 GB。 实测数据给的是 Llama 3.1 8B 跑在一颗端侧 AI 加速器上:生成速度从 27 token/s 到 81.3 token/s,输出提升 3.01 倍;同一个任务的完成时间从 12.3 秒降到 5.4 秒,即 2.28 倍。两个倍数不一样,因为一个量的是吞吐、一个量的是端到端耗时,引用时别混着说。

兼容性是这次方案最实际的部分

比性能数字更值得注意的是它怎么落地:LPDDR5X-PIM 沿用与标准 LPDDR5X 相同的 561 球封装,配常规内存控制器就能工作,规格上覆盖服务器、移动和客户端,每 rank 四颗die、共 16 GB。也就是说它不要求主板和控制器另起一套设计——这是历代存内计算方案最容易卡住的地方。 三星把自家 PIM 时间线追溯到 2021 年的 Aquabolt-XL HBM2-PIM 概念验证,到 2026 年 LPDDR5X-PIM 产品化。落地路径也点名了:在研的 AI PC 芯片组 GAIA 预计会用上它,那将是 PIM 第一次进入真正的 AI PC 芯片组,量产最早在 2027 年。该芯片今年 7 月已在圣克拉拉的 FMS 2026 公开亮相并拿了 Best of Show。

动机写在成本上

三星讲得很直白:HBM 太贵了。按其给出的数字,HBM 在 AI 芯片元件支出中的占比从 2024 年第一季度的 52% 涨到 2025 年第四季度的 63%。演讲者 Hwang Garam 的框定是,随着 AI 向推理为中心的负载迁移、跑到手机和 AI PC 上,需要一种新的内存形态。 需要说清楚的边界:三星把 LPDDR5X-PIM 定位成 HBM 的补充而不是替代,数据中心负载仍然是 HBM 更合适。对做端侧推理的团队,这条消息的实际含义是时间表——真要用上得等 GAIA 一类芯片组落地,最早 2027 年量产,现在能做的是把它列进未来两年的端侧性能预期里。

via: Tom's HardwareServeTheHomeTrendForce