十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Adaptive Layer-Wise Transformations for Post-Training Quantization of Large Language Models

Adaptive Layer-Wise Transformations for Post-Training Quantization of Large Language Models 一、文章主要内容总结该研究聚焦于大型语言模型(LLMs)训练后量化(PTQ)的核心挑战——激活值和权重中的系统性异常值导致低比特量化时性能大幅下降,而现有基于变换的量化方法因采用全层统一变换类型,忽略了各层异构的分布特性,难以达到最优效果。为此,研究提出自适应层-wise变换选择框架:核心思路:不同层的统计特性(如异常值分布)决定了其适配的最优变换类型,需为每层单独选择 affine 变换(适用于分布较平坦的层)或 rotation 变换(适用于异常值集中的层)。技术路径:先将变换选择建模为可微分优化问题,实现精准层-wise 变换选择,但该方法计算开销大;进一步发现权重分布的峰度(kurtosis)与最优变换类型强相关(高峰度层含集中异常值,适配 rotation 变换;低峰度层分布均匀,适配 affine 变换);基于此提出异常值引导的启发式选择方法,通过鲁棒 z 分数归一化处理峰度值,高效确定每层变换类型,在大幅降低计算开销的同时保持与可微分搜索相当的性能。实验验证:在 LLaMA 系列模型(LLaMA-2 7B/13B/70B、LLaMA-3 8B/70B)的多比特量化设置(如 W3A3K2V2 等极端低比特场景)下,该方法在 WikiText-2、C4 数据集的困惑度(Perplexity)和 6 项零样本任务平均准确率上,持续优于 FlatQuant、QuaRot 等现有 SOTA 方法,最高实现 4
返回列表