预训练数据混合提高 Transformer 模型选择能力

Nov, 2023

预训练数据混合提高 Transformer 模型选择能力

Pretraining Data Mixtures Enable Narrow Model Selection Capabilities in Transformer Models

Steve Yadlowsky, Lyric Doshi, Nilesh Tripuraneni

TL;DR在这项研究中，我们研究了 Transformer 模型，特别是大型语言模型（LLMs），它们具有在上下文中学习的显著能力，即在未见过的输入 - 输出示例的提示下执行新任务，而无需任何显式的模型训练。我们的实证结果显示变压器在选择无监督模型和在上下文中学习不同任务家族方面表现出近乎最优的能力，但当面对超出预训练数据领域的任务或功能时，我们展示了变压器的各种失败模式和其泛化能力的退化，即使是简单的外推任务也是如此。总的来说，我们的结果强调了高容量序列模型令人印象深刻的上下文学习能力可能与其预训练数据组合的覆盖范围更紧密相关，而不是创造基本泛化能力的归纳偏差。

Abstract

transformer models, notably large language models (LLMs), have the remarkable ability to perform in-context learning (ICL) -- to perform n

transformer models large language models in-context learning pretraining data mixture generalization capabilities

发现论文，激发创造

多任务训练如何影响 Transformer 的上下文能力？对功能类别的研究调查

结合多任务学习和上下文学习，在大型语言模型中提出了有效的课程学习策略，使得模型能够高效地学习任务并对分布外的例子具有稳定的收敛性。

Apr, 2024

预训练任务多样性与回归非贝叶斯上下文学习的出现

通过研究预训练数据集中任务多样性的不同，探究在不同任务多样性阈值下，在新的情境下可以有多大能力。结果表明，如果预训练的数据具有足够的多样性，那么可以在新任务中解决问题，但是这种能力依赖于违背 Bayes 最优估计并将 Gauss 先验分布中所有任务的能力。

Jun, 2023

Transformers 作为统计学家：具有证明的上下文学习和上下文算法选择

本文提供了建立在 transformer 结构上的神经序列模型的全面统计理论，阐述其在上下文数据分布中能够实现一类广泛的标准机器学习算法，基于上下文梯度下降机制的实现，以及不同算法之间的自适应选择。

Jun, 2023

多层感知器学习上下文

在这项研究中，我们发现多层感知器（MLPs）和密切相关的 MLP-Mixer 模型可以像 Transformer 模型一样有效地进行上下文学习，并且在一些涉及关系推理的任务中，MLPs 表现更优，这一结果挑战了以往对简单连通模型的一些假设。

May, 2024

基于 Transformer 序列模型的 MIMO 均衡中的上下文学习

利用 ICL 对多输入多输出均衡问题进行了处理，并通过数值结果展示了基于 Transformer 的 ICL 模型具有阈值行为的潜力。

Nov, 2023

非线性变压器的高效上下文学习训练：理论学习和泛化分析

通过理论分析，我们首次探讨了具有非线性自注意力和非线性 MLP 的 Transformer 模型的训练动态和 ICL 泛化能力，重点关注一组二分类任务，研究了各种因素对 ICL 泛化性能的影响，探讨了不同组件对 ICL 性能的贡献，并首次理论分析了模型修剪对 ICL 性能的影响，证明合适的基于大小的修剪可以在降低推理成本的同时对 ICL 产生最小影响，并通过数值实验验证了这些理论结果。

Feb, 2024

用于稀疏检索任务的样本高效上下文学习机制

本文研究了大型语言模型展示的 “上下文学习” 现象，并解释了预训练的 transformer 模型如何在合理的假设下执行上下文学习。我们推出了一种机制，使得 transformer 模型能够正确划分上下文，推断出稀疏线性回归假说，并应用此假说进行预测，在该学习框架中的样本复杂度保证。

May, 2023

线性注意力下上下文学习的渐近理论

Transformers 在无需显式先前训练的情况下，基于输入示例学习和执行任务的能力，也称为上下文学习（ICL），是其成功的基础。本研究提供了关于所需样本复杂性、预训练任务多样性和上下文长度对成功 ICL 的明确答案，采用线性关注在 ICL 线性回归任务的可解模型中推导出了学习曲线的锐利渐近线。通过实验证明了随着先前训练示例数量增加，学习曲线具有双峰，且模型的行为在低和高任务多样性之间出现相变：在低多样性情况下，模型趋向于记忆训练任务，而在高多样性情况下，它实现了真正的上下文学习并在预训练任务范围之外进行泛化。这些理论洞见通过线性关注和完全非线性 Transformer 架构的实验进行了经验证实。

May, 2024

训练的 Transformer 学习上下文中的线性模型

研究注意力机制的神经网络 transformer 采用渐变流进行单个线性自注意层的训练，实现在新的预测任务中使用标记示例的测试提示时具有预测误差与测试提示分布上最佳线性预测器相竞争的能力，且在多种分布转换下具有鲁棒性。

Jun, 2023

线性回归的上下文学习需要多少预训练任务？

在这篇论文中，我们研究了通过预训练线性参数化的单层线性注意力模型进行具有高斯先验的线性回归的上下文学习（ICL），在一个最简单的设置中进行 ICL 研究。我们建立了注意力模型预训练的统计任务复杂性界限，证明了有效的预训练只需要少量独立任务。此外，我们证明了预训练模型与贝叶斯最优算法高度匹配，即在固定上下文长度下，在未见任务上实现几乎贝叶斯最优风险。这些理论发现补充了先前的实验研究，并阐明了 ICL 的统计基础。

Oct, 2023