理解为压缩：非线性复杂性视角

Oct, 2023

Grokking as Compression: A Nonlinear Complexity Perspective

Ziming Liu, Ziqian Zhong, Max Tegmark

TL;DR延迟记忆之后的泛化现象被归因于压缩。为了证明这一点，我们定义了线性映射数（LMN）来衡量网络复杂度，它是针对 ReLU 网络的线性区域数的一般化版本。LMN 可以很好地描述泛化前的神经网络压缩。尽管 L2 范数一直是描述模型复杂度的流行选择，但我们提出 LMN 的原因有很多：（1）LMN 可以自然地解释为信息 / 计算，而 L2 范数不能；（2）在压缩阶段，LMN 与测试损失呈线性关系，而 L2 范数与测试损失之间的关系非常复杂且非线性；（3）LMN 还揭示了 XOR 网络在两个泛化解之间切换的有趣现象，而 L2 范数却没有。除了解释 grokking 外，我们认为 LMN 是作为神经网络版的科尔莫哥洛夫复杂性的一个有希望的候选，因为它明确地考虑到与现代人工神经网络的性质相一致的局部或有条件的线性计算。

Abstract

We attribute grokking, the phenomenon where generalization is much delayed after memorization, to compression. To do so, we define linear mapping

grokking compression linear mapping number neural network $l_2$ norm

发现论文，激发创造

从稳健性视角理解揣摩探究

我们研究了神经网络中的一种异常现象叫做 “grokking”，发现使用 $l_2$ 权重范数和鲁棒性观点可以解释、测量和加速这一现象，同时研究发现在测试数据上，新的基于鲁棒性和信息理论的度量指标与 “grokking” 现象具有较好的相关性，并提出了提速泛化过程的方法。此外，我们还研究了基本群操作的学习过程，并发现在 “grokking” 之前，神经网络几乎没有学习到其他基本群操作，包括交换律。有趣的是，当使用我们提出的方法时，泛化过程加速的部分原因可以通过学习交换律来解释，这也是模型在测试数据集上实现 “grokking” 的必要条件。

Nov, 2023

超越神经网络的理解：模型复杂性的实证探索

网络神经元及其他建模方法中存在着 “不可解释” 的现象，其精确度远超过训练集的表现，本文试图寻找并研究这种神奇现象背后的机制。

Oct, 2023

线性估计器中的领悟 —— 一个可解决的模型，不需要理解的领悟

模型在训练数据拟合后依然能够泛化的现象被称为 “理解”（grokking），本文通过分析和数值实验发现线性网络在简单的教师 - 学生设置中，通过高斯输入也能够出现 grokking 现象。我们推导出模型的训练动态，并提供关于 grokking 时间与输入、输出维度、样本数量、正则化和网络初始化之间关系的准确预测。我们证明泛化准确度的显著提高并不一定意味着从 “记忆” 到 “理解” 的过渡，而可能只是一种测度准确度的一种艺术效果。我们还通过实证验证了计算结果，并初步结果表明一些预测也适用于深度网络与非线性激活函数。

Oct, 2023

Omnigrok: 超越算法数据的理解

通过分析神经网络损失景观和表示学习等机制，我们提出了 LU 机制，解释了算法数据的长时间过拟合和泛化现象 – Grokking 的根本原因，并在该认知基础上进行了图像、语言和分子的相关任务的训练与预测。

Oct, 2022

通过电路效率解释通俗易懂

一种最令人惊讶的神经网络概括性的难题是理解：一个在训练中完美的网络但在概括性上表现糟糕，经过进一步训练后会过渡到完美的概括性。我们提出了这样的观点：理解发生在任务允许概括性解和记忆化解的情况下，其中概括性解的学习速度较慢但更高效，用相同参数范数产生较大的对数后验概率。我们提出假设，记忆化电路在训练数据集越大时变得越不高效，而概括性电路则不会，这提示存在一个关键数据集大小，在这个大小上记忆化和概括性同样高效。我们提出并验证了有关理解的四个新的预测，为我们的解释提供了重要证据。最引人注目的是，我们展示了两种新的令人惊讶的行为：非理解，在这种情况下，网络从完美的测试准确性回退到低的测试准确性；半理解，在这种情况下，网络表现出对部分而不是完美的测试准确性的延迟概括。

Sep, 2023

深度网络始终能理解，理由如下

深度神经网络的一项研究探索了 “Grokking” 或延迟泛化的现象及其对网络鲁棒性和局部复杂性的影响。

Feb, 2024

深刻理解：深度神经网络是否能更好地泛化？

通过深度神经网络的研究，我们发现 grokking 现象对于深层网络更为敏感，且特征排名的减少与过拟合到泛化阶段的相变存在关联，特征排名可能比权重范数更能指示模型的泛化行为。

May, 2024

理解还是不理解：在损坏的算法数据集上分解概括和记忆

深度学习中的稳健泛化是一个重大挑战，特别是当可训练参数的数量非常大时。为了应对这一挑战，我们研究了一种可解释模型，通过分析理解广义表示，并从纪念表示中轻松区分出来。通过在模量算术任务上训练两层神经网络来研究该模型。我们证明：网络在记忆损坏标签及同时实现 100% 泛化的情况下是可能的；记忆神经元可以被识别和修剪，降低损坏数据的准确性，提高未损坏数据的准确性；正则化方法（如权重衰减、dropout 和 BatchNorm）会在优化过程中强制网络忽略损坏数据，在未损坏数据集上达到 100% 的准确性；并且这些正则化方法的效果是可以 “机械解释” 的：权重衰减和 dropout 强制所有神经元学习广义表示，而 BatchNorm 降低记念神经元的输出，并放大广义神经元的输出。最后，我们展示了在正则化的情况下，训练动态包含两个连续阶段：首先，在网络经历 “领悟” 动态过程中，达到高训练和测试准确性；第二，它通过将记忆表示逐渐抹除，从 100% 的训练准确性骤降到 100 (1-ξ)%。

Oct, 2023

关于层归一化的非线性性

研究论文通过理论和实验分析，探讨了层归一化在深度学习中的非线性和表示能力，并展示了利用层归一化的神经网络结构的有效性以及扩大其非线性的方法。

Jun, 2024

从惰性训练动态到丰富训练动态的领悟

神经网络在从懒散训练动力学过渡到强大的特征学习规则时，产生 ' 领悟现象 '，通过研究多项式回归问题上的两层神经网络，我们发现特征学习速率和初始特征与目标函数的对齐是产生 ' 领悟现象 ' 的关键因素。

Oct, 2023