流式对话：通过最小损失的长上下文压缩实现长时间对话学习

Mar, 2024

流式对话：通过最小损失的长上下文压缩实现长时间对话学习

StreamingDialogue: Prolonged Dialogue Learning via Long Context Compression with Minimal Losses

Jia-Nan Li, Quan Tu, Cunli Mao, Zhengtao Yu, Ji-Rong Wen...

TL;DR通过将长对话历史压缩为最少损失的会话关注点（conv-attn sinks），我们的方法大幅减少了计算复杂度，并分别设计了短期记忆重构（SMR）和长期记忆激活（LMR）的学习策略，使得该方法在对话任务中优于强基线，并实现了 4 倍加速和 18 倍内存使用减少。

Abstract

Standard Large Language Models (LLMs) struggle with handling dialogues with long contexts due to efficiency and consistency issues. According to our observation, dialogue contexts are highly structured, and the special token of \textit{End-of-Utterance} (EoU) in dialogues has the poten

large language models (llms)dialogue contexts conversational attention sinks streamingdialogue compression

发现论文，激发创造

评估 LLM 代理商的非常长期对话记忆

通过使用基于 LLM 的代理体系结构和将对话与人物和时间事件图进行关联，我们介绍了一个机器 - 人类管道来生成高质量的非常长期的对话，并通过人类注释者对其进行检验和编辑，以确保其长程一致性和对事件图的关联。通过这个管道，我们收集了一个包含 300 个回合和平均 9K 个记号的非常长期对话的数据集。基于该数据集，我们提出了一个全面的评估基准来衡量模型中的长期记忆，在问题回答、事件摘要和多模态对话生成任务方面。我们的实验结果表明，LLM 在理解冗长对话和理解对话中的长程时间和因果动态方面存在挑战。使用长上下文 LLM 或 RAG 等策略可以提供改进，但这些模型仍然远远落后于人类的性能。

Feb, 2024

利用大型语言模型进行端到端语音识别的语境化

通过引入一种新方法，结合大型语言模型（LLMs）来进行上下文化的语音识别模型，我们证明通过添加适配器的少量可训练参数，可以在保持相同的文本输入功能的同时，实现预训练 LLM 的上下文化语音识别能力并显著提高性能。

Sep, 2023

UIO-LLMs：面向长上下文 LLMs 的无偏增量优化

通过使用 UIO-LLMs 方法，将大规模语言模型应用于长文本管理，成功处理了长上下文窗口的挑战，实现了扩展上下文窗口长度且保持推断成本线性增加的目标。

Jun, 2024

注意力汇聚的高效流式语言模型

部署大型语言模型（LLMs）在流式应用中的一个研究论文，介绍了两个主要挑战和一个有效的解决方案 StreamingLLM，用于长文本的流式部署，能够在无需微调的情况下实现 LLMs 的稳定和高效的语言建模。

Sep, 2023

通过语义压缩扩展大型语言模型的上下文窗口

提出了一种新颖的语义压缩方法，使得基于 Transformer 的大型语言模型（LLM）能够适用于长度为原先的 6-8 倍的文本，而无需进行显著的计算开销或需要微调。该方法通过信息论中的源编码概念和使用预训练模型，减少长输入的语义冗余后再传递给 LLM 进行下游任务。实验结果表明，该方法有效地扩展了 LLM 在包括问答、摘要、少样本学习和信息检索等任务中的上下文窗口，并且在减少相关计算开销的同时能够保持生成文本的流畅性。

Dec, 2023

LongLLMLingua：通过提示压缩加速和增强长背景下的 LLMs

通过压缩提示信息，提高大型语言模型对关键信息的感知能力，从而解决高计算 / 财务成本、延迟时间长和性能劣势等问题。在各种长篇上下文场景下，通过使用 LongLLMLingua 压缩的提示信息，大型语言模型的性能得到提高，成本降低，以及端到端延迟时间减少。

Oct, 2023

LLoCO：离线学习长上下文

通过上下文压缩和领域内参数高效微调，我们提出了一种解决大型语言模型处理长篇内容的挑战的新方法，使得 LLM 能够创建原始上下文的简洁表示，并有效地检索相关信息以准确回答问题。我们介绍了 LLoCO，一种通过使用 LoRA 组合上下文压缩、检索和参数高效微调的技术，将 4k 个令牌的 LLaMA2-7B 模型的有效上下文窗口扩展到处理高达 128k 个令牌。在几个长上下文问答数据集上对我们的方法进行评估，结果显示 LLoCO 在推理过程中使用 $30 imes$ 更少的令牌，显著优于上下文学习，实现了高达 $7.62 imes$ 的加速，大大降低了长文档问答的成本，为高效处理长上下文提供了有希望的解决方案。我们的代码公开可用于该 https URL。

Apr, 2024

走入记忆迷宫：通过互动阅读突破环境限制

我们提出了 MemWalker，这是一种将长上下文处理成摘要节点树的方法，模型通过迭代提示的方式导航该树以寻找相关信息并一旦收集足够信息便回答问题，在长文本问答任务上，我们方法的性能优于使用长上下文窗口、重复和检索的基线方法。通过交互式阅读文本，MemWalker 还提升了解释能力，突出了推理步骤，并准确指出与查询相关的文本片段。

Oct, 2023

面向任务的对话状态生成的长上下文建模

本论文提出了一种基于 TRADE 的可转移对话状态生成器，结合简单有效的话语标记技术和双向语言模型的多任务学习模型，旨在解决基线性能在长对话上大幅下降的问题，最终在 MultiWOZ 2.0 数据集上实现了 52.04％的联合目标准确性，相对提高了 7.03％，成为了最新的最先进技术。

Apr, 2020

在大型语言模型中，递归总结实现了长期的对话记忆

使用大型语言模型递归生成摘要 / 记忆，从而提高长期记忆能力，进而解决开放领域对话系统中遗忘重要信息的问题。实验证明，该方法可以在长对话环境中生成更加一致的回应。

Aug, 2023