十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

ACL‘26 | 0.01%参数就能接近全量微调!低数据微调极致省参方案来了

ACL‘26 | 0.01%参数就能接近全量微调!低数据微调极致省参方案来了 来自瑞典隆德大学与Google DeepMind的研究团队系统比较了注意力模块中Query、Key、Value三类偏置b(q)、b(k)、b(v)。大模型微调的极致省参方案要先回答一个更基本的问题模型里的偏置项究竟哪个最值得训练来自瑞典隆德大学与Google DeepMind的研究团队系统比较了注意力模块中Query、Key、Value三类偏置b(q)、b(k)、b(v)。团队给出的核心结论非常直接在低数据场景下直接微调Value投影中的b(v)通常比微调b(q)或b(k)获得更好的下游性能。该工作已被ACL 2026主会接收已集成进Hugging Face-PEFT库由Baichuan Huang、Ananth Balashankar和Amir Aminifar共同完成。其中Baichuan Huang、Amir Aminifar来自隆德大学Ananth Balashankar来自Google DeepMind。只调Bias还能再省一层吗全参数微调效果强但训练成本、显存占用和能耗都很高LoRA、Adapter、Prefix Tuning等参数高效微调方法虽然大幅降低了开销往往仍需新增模块、配置秩或长度并进行额外重参数化。相比之下Bias-only微调直接更新模型中已有的偏置项几乎不改网络结构天然具备“开箱即用”的优势。此前的BitFit等工作已经发现尤其在样本有限时微调全部偏置项可以接近全参数微调。但“全部Bias”仍然把不同位置一视同仁。Transformer注意力中b(q)、b(k)、b(v)究竟谁更关键如果只保留最有效的一类是否还能进一步减少参数这正是BEFT要解决的问题。△在SST-2低数据实验中微调b(v)绿色相比b(q)红色和b(k)蓝色获得更高准确率并以更少可训练参数接近或超过多种PEFT方案。技术方案为什么是Value Bias注意力模块可以写为QXWq[b(q)]、KXWk[b(k)]、VXWv[b(v)]再通过缩放点积注意力计算输出。BEFT的关键并非经验上“碰巧选中了b(v)”而是从softmax结构解释了三者为何不等价。b(k)在softmax前被“抵消”将同一个b(k)加到每个Key向量后对于任意Query所有注意力logit都会同时增加相同常数。由于softmax具有平移不变性注意力权重不会改变。直观地说这就像给所有候选项同时加同样的分数排序自然不变因此b(k)几乎不能提升注意力映射的表达能力。b(q)能影响注意力但容易被softmax压缩b(q)确实能改变softmax之前的打分但影响必须经过softmax传递。论文在编码器和解码器模型中观察到注意力权重普遍呈现尖锐且高度稀疏的分布此时softmax的雅可比矩阵中大多数元素接近0b(q)带来的变化容易被压缩表达能力提升有限。b(v)直接写入注意力输出由于每一行注意力权重之和为1有AV[b(v)]AV[b(v)]。也就是说b(v)不需要绕过一层“容易饱和”的softmax而是等价于直接在缩放点积注意力的输出后增加一个完整维度的线性自由度。△b(k)对注意力映射基本无效b(q)提升有限b(v)则等价于在SDPA输出后直接增加可训练自由度右侧分布展示注意力权重的尖锐与稀疏。从“变化大”到“变化有效”仅看参数变化的绝对幅度并不可靠。论文发现传统Magnitude方法经常把变化更大的b(q)排在前面但真正微调时b(v)的下游表现反而更好Fisher信息方法又容易给出跨数据规模不变的静态排序难以反映b(v)与b(q)性能差距随样本量变化而缩小的趋势。BEFT因此把微调前后偏置向量的模长变化与夹角变化结合起来并在Transformer各层上聚合得到更贴近真实下游性能的偏置重要性排序。需要说明的是论文在研究阶段通过全偏置微调分析三类偏置的变化一旦得到“直接微调b(v)”的结论实际使用时无需针对每个新任务再进行事后搜索。0.01%参数效果并不打折在BERTBASE的GLUE实验中b(v)在低、中、高三种数据规模下都稳定领先。论文汇总指标显示低数据时b(v)平均得分为64.5%b(q)和b(k)分别为57.8%、53.5%中等数据时为70.8%对比63.3%、50.4%高数据时为71.7%对比64.7%、50.4%。参数效率更直观。在RTE低数据实验中BEFT只训练全模型0.01%的参数准确率达到58.53±1.88%全部Bias微调需要0.09%的参数准确率为56.40±2.88%全参数微调使用100%的参数准确率为57.46±2.20%。对应训练时间分别为132.9秒、144.9秒和206.1秒。需要强调的是这是论文给出的一个具体实验案例但它清楚展示了“选对位置”比“多训练参数”更重要。关键结果一览△注不同任务采用论文对应评价指标RTE结果为3次不同随机种子实验的均值±标准差。这一规律并不局限于BERT。论文进一步覆盖RoBERTaBASE、BERTLARGE、OPT-1.3B和OPT-6.7B并延伸到分类、多项选择和生成任务。对于原本不含注意力Bias的LLaMA2-7B、GPT-J-6B和DeepSeek-Coder-Base-1.3B研究者手动加入b(v)后再训练结果依然优于加入并训练b(q)或b(k)。在自回归模型实验中BEFT使用的可训练参数比LoRA少约30倍、比Prefix Tuning少约10倍同时在多项任务上保持有竞争力或更好的性能。BEFT也可以与LoRA、VeRA、DoRA等方法组合无论直接训练还是叠加这些PEFT方法b(v)整体仍优于b(q)和b(k)。更少参数也是一条设计规则BEFT的价值不只在于把可训练参数压到更低。更重要的是它给出了一条清晰、可解释、可迁移的设计原则在标准softmax注意力中可训练自由度放在哪里比单纯增加自由度更关键。对于样本有限、算力受限的下游适配任务直接微调Value Bias几乎不需要额外结构和复杂配置对于已有LoRA、VeRA、DoRA方案b(v)又可以作为进一步削减参数的组合策略对于无Bias模型添加并训练b(v)也提供了一条轻量改造路径。当然论文也明确了边界目前主要研究标准softmax注意力及Query、Key、Value投影尚未覆盖线性注意力不同偏置对特征叠加与Scaling Law的影响也留待后续研究。从“微调所有Bias”到“只微调最有用的Bias”BEFT把大模型低数据适配再向前推进了一步。它提醒了从业者们参数高效微调的下一步未必是设计更复杂的模块也可能是更准确地理解模型中那些早已存在、却长期被忽略的小参数。
返回列表