拓十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving

Pimba: A Processing-in-Memory Acceleration for Post-Transformer Large Language Model Serving

文章主要内容总结

本文针对Transformer架构的大型语言模型(LLMs)在长上下文推理中面临的计算与内存成本随序列长度增长的问题,以及后Transformer模型(如状态空间模型SSMs、线性注意力、循环神经网络RNNs)的兴起,提出了一种基于存内处理(PIM)的加速方案Pimba,以统一支持Transformer和后Transformer模型的高效服务。

核心发现:Transformer的注意力机制和后Transformer的状态更新操作均受限于内存带宽,成为批处理推理的性能瓶颈。基于此,Pimba结合存内处理(PIM)和LLM量化技术,通过以下设计解决内存瓶颈:

  1. 状态更新处理单元(SPU):每个SPU由两个存储体共享,实现交错访问,在保证吞吐量的同时优化面积效率;
  2. 基于MX量化的状态更新处理引擎(SPE):采用Microsoft的MX8量化格式,在精度和面积之间达到帕累托最优,支持高效的状态更新和注意力操作;
  3. 端到端系统设计:将状态更新和注意力操作卸载到PIM,其他任务由GPU处理,兼容现有Transformer服务系统,可作为“即插即用”的替代方案。

实验结果显示,Pimba相比LLM优化的GPU和GPU+PIM系统,token生成吞吐量分别提升高达4.1倍和2.1倍,且面积开销较小。

创新点

  1. 统一架构支持:首次提出同时支持Transformer和后Transformer模型的存内加速方案,解决了两类模型共存的服务系统设计挑战;
  2. 资源共享设计<
返回列表