十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

字典学习回顾

字典学习回顾 最近考古一些老的论文想起以前看的一些CT图像重构的论文其中有些论文用到了字典学习的方法。这里简单记录一下方便后续思考。字典学习简介假设有一批数据组成矩阵XXX字典学习希望找到一个字典矩阵DDD和表示系数AAA使得X≈DAX \approx DAX≈DA其中XXX为原始数据DDD学习得到的“字典”每一列叫一个字典原子atomAAA每个样本对应的表示系数。这里的字典和我们平时查的字典在功能上有一个很像的地方都提供一组可以拿来组合、解释其他东西的基本元素。字典学习通常还要求AAA是稀疏的也就是说一个样本只使用少量字典原子就可以表示。典型优化问题可以写成min⁡D,A12∥X−DA∥F2λ∥A∥1 \min_{D,A}\frac{1}{2}\|X-DA\|_F^2\lambda\|A\|_1D,Amin​21​∥X−DA∥F2​λ∥A∥1​其中第一项要求重构误差尽可能小第二项则鼓励系数AAA稀疏λ\lambdaλ用于平衡二者。字典学习一般采用交替优化Alternating Optimization来求解因为这个Loss 同时对 D和 A 优化通常是非凸问题但固定其中一个变量后另一个往往比较容易求。字典学习的一些经典应用场景降维和特征提取把原始高维信号转成更紧凑的稀疏表示。图像去噪噪声往往不符合学到的字典结构而真实图像可以被少数字典原子较好表示。图像压缩如果一个图像块只需要几个非零系数就可以只存这些系数和对应原子。信号恢复在缺失、受损或观测不足时根据稀疏表示恢复原信号。异常检测正常数据通常能被已有字典很好重构异常数据重构误差可能明显更大。模式发现学出来的字典原子本身可能对应有意义的局部结构比如边缘、纹理、频率成分。相关论文Olshausen Field, 1996核心线索为什么需要稀疏表示从自然图像中学习基函数发现稀疏表示能够自动产生类似视觉皮层感受野的结构。它奠定了“让数据自己学习表示基”的思想。Engan et al., 1999 — MOD核心线索字典具体怎么学提出 MOD通过“固定字典求稀疏系数、固定系数更新字典”的交替优化方式学习 (D)。这是早期经典的字典学习算法。Aharon, Elad Bruckstein, 2006 — K-SVD核心线索怎样更精细地更新字典K-SVD 每次更新一个字典原子并利用 SVD 同时调整该原子及其对应系数。它成为经典字典学习算法的代表。Elad Aharon, 2006 — Image Denoising核心线索字典学习有什么实际用途将 K-SVD 应用于图像去噪证明学习得到的过完备字典能够很好地表示自然图像 patch是字典学习的重要应用范例。Lee et al., 2006 — Efficient Sparse Coding核心线索怎么让稀疏编码更高效从机器学习角度研究高效的稀疏编码与字典优化使 sparse coding 更适合大规模特征学习也连接了字典学习与后来的无监督特征学习。Mairal et al., 2009 — Online Dictionary Learning核心线索数据很多怎么办提出在线字典学习不必反复使用完整训练集而是逐批处理数据并更新字典使字典学习能够扩展到大规模数据。字典学习与稀疏回归之前经常看符号回归的工作会涉及到一种方法——稀疏回归。这种方法一般是需要构造基函数库来拟合控制方程。发现跟字典学习的形式上是对得上的如下两者的区别在于稀疏回归通常认为设计矩阵 X 是给定的而字典学习连设计矩阵 D 都要学习。事实上也有人尝试使用字典学习去研究符号回归如下Lin, Wang Yue, 2024 — Free-Form Dynamic Load Model Synthesis With Symbolic Regression Based on Sparse Dictionary LearningIEEE Transactions on Power Systems。先构造大量物理驱动的数学函数再用 sparse dictionary learning 选出稀疏表示最后得到自由形式的符号模型。Wu, 2023 — Reconstruction of delay differential equations via learning parameterized dictionaryPhysica D 引入参数化字典让候选函数内部带未知参数。Goyal Benner, 2022 — Discovery of nonlinear dynamical systems using a Runge–Kutta inspired dictionary-based sparse regression approachProceedings of the Royal Society A。作者明确用一个大的非线性候选字典并假定真实动力学只由少数字典函数组成亮点是结合 Runge–Kutta使方法不必直接数值估计导数对噪声和稀疏采样更友好。LLM时代下的字典学习作为一种传统方法字典学习毫无疑问已经不是主流方法应用范围局限在一些垂直领域上。我发现有的人还是喜欢考古尝试做字典学习与LLM相关的工作。大概整理一些如下年份工作一句话概括2023Towards Monosemanticity用字典学习和 SAE 将 Transformer 激活分解为更可解释的稀疏特征。2023/2024Sparse Autoencoders Find Highly Interpretable Features证明 SAE 可以发现具有较强可解释性的语言模型内部特征。2024Gated Sparse Autoencoders改进 SAE 的稀疏机制缓解 L1 正则导致的特征激活收缩。2024End-to-End Sparse Dictionary Learning从重构中间激活进一步转向保留模型真实计算和输出行为。2024/2025Scaling and Evaluating Sparse Autoencoders将 SAE 扩展到 GPT-4 等大型模型并研究规模化和评估方法。2024/2026Scaling Monosemanticity在 Claude 等大型模型中学习千万级可解释特征。2024Gemma Scope为 Gemma 模型公开大规模 SAE 和特征字典。2024Transcoders Find Interpretable LLM Feature Circuits用稀疏特征描述 MLP 的输入输出计算关系。2025Sparse Feature Circuits从单个可解释特征进一步构建模型内部的因果计算回路。真是神奇明明是很古老的东西玩法却出奇地多。不过看起来更多是用于做解释性分析、评估上。
返回列表