ACLJun, 2022

多模态对话状态跟踪

TL;DR本文提出了一项新的多模式对话状态跟踪任务,用于跟踪视频对话中提到的视觉对象的信息;并介绍了 Video-Dialogue Transformer Network (VDTN) 作为实现该任务的基准模型。