ACLJun, 2023

你需要在可能的 tokenization 上做边缘化吗?

TL;DR本文研究自回归语言模型中计算字符序列概率的方法,提出了一种基于重要性采样的算法估计边缘概率,并在一系列尖端模型和数据集上进行比较,结果表明在大多数情况下,对边缘化的忽略导致的对数似然差异小于 0.5%,但对于长且复杂的数据则更加明显。