CheckThat! 2024 中的事实查找者:通过数据修剪改善 LLMs 的适用于检查的陈述检测
自动事实核查(使用机器学习来验证主张)已经变得至关重要,因为虚假信息已经超出了人类事实核查的能力范围。大型语言模型(LLMs),如 GPT-4,越来越受人们的信任,可以验证信息并撰写学术论文、诉讼文件和新闻文章,强调了它们在分辨真假和能够验证其输出的重要性。在这里,我们通过让 LLM 代理人表达查询、检索上下文数据和做出决策来评估 LLMs 在事实核查中的使用。重要的是,在我们的框架中,代理人解释他们的推理并引用检索到的相关来源。我们的结果显示,在配备上下文信息的情况下,LLMs 表现出更强大的能力。GPT-4 优于 GPT-3,但准确性取决于查询语言和主张的真实性。虽然 LLMs 在事实核查方面显示出前景,但仍需要谨慎使用,因为准确性不一致。我们的调研呼吁进一步研究,以更深入地了解代理人何时成功以及何时失败。
Oct, 2023
我们提出了 FACT-GPT 这个系统,利用大型语言模型 (LLMs) 自动化事实核查中的索引匹配阶段。FACT-GPT 经训练后,可以识别与先前被揭穿的声明相符、相悖或无关的社交媒体内容。我们的评估结果表明,我们专门训练的 LLMs 在识别相关声明方面的准确性与更大型的模型相当,与人类判断非常接近。这项研究提供了一种高效的声明匹配自动化解决方案,展示了 LLMs 在支持事实核查员方面的潜力,并为该领域的进一步研究提供了宝贵的资源。
Feb, 2024
该研究通过对大型语言模型在事实检查方面的潜力进行初步调查,系统评估了它们在处理特定事实检查子任务中的能力,并与预训练和最先进的低参数模型进行了性能对比分析。实验证明大型语言模型在大多数场景中取得了与其他小型模型相媲美的性能,但在处理中文事实验证和整个事实检查流程中遇到了语言不一致和虚构的挑战,这些发现强调了进一步探索和研究以增强大型语言模型作为可靠事实检查器的能力,并揭示了在事实检查任务中可能面临的挑战。
Nov, 2023
通过使用 FACT-GPT 框架,我们介绍了一种自动化事实核查的方法,该方法利用大型语言模型 (LLMs) 的主张匹配阶段来识别新的社交媒体内容,无论是支持还是反驳之前被事实核查人员驳斥的主张。研究结果表明,我们的精细调节的 LLMs 在主张匹配任务中与更大型的预训练 LLMs 的性能相媲美,与人工标注结果密切一致。
Oct, 2023
通过使用零 - 和少 - 次学习模型,将事实和价值评估标准直接用于提示,我们评估了 LLM 在五个不同领域的声明检测和可信度检测数据集上的预测和校准准确性,并发现最佳的提示详细程度取决于领域,提供上下文信息并不改善性能,可信度评分可以直接用于生成可靠的评级。
Apr, 2024
该研究介绍了一种针对大型语言模型输出进行事实准确性注释的综合解决方案,包括多阶段的注释方案和注释工具的设计,以识别 LLM 输出中的可验证性和事实不一致性,并构建了三个层次粒度的开放领域文档级事实性基准。初步实验结果表明,已有工具在识别错误声明方面存在困难,最佳 F1=0.53。
Nov, 2023
本文提出一种基于自监督的零次学习框架 ——Self-Checker,旨在解决基于特定数据集进行事实检查的计算负担问题。实验结果表明,该框架在低资源环境下能够快速且高效地构建事实检查系统,其能力仍有待进一步提高。
May, 2023
本研究比较了经过调整的模型和极大语言模型在可检测可信度主张的任务中的性能。通过使用包含不同来源和风格的文本构建了一个多语种和多主题数据集,并基于此进行了基准分析,确定了最通用的多语种和多主题主张检测器。我们选择了三个最先进的模型进行了可检测可信度主张任务的调整,并选择了三个无需任何调整的最先进极大语言模型。通过对模型进行修改以适应多语种环境,并进行了广泛的实验和评估。在域内和跨域情景中,我们评估了所有模型的准确性、召回率和 F1 分数。我们的结果表明,尽管在自然语言处理领域取得了技术进步,但针对可检测可信度主张任务的调整模型在跨域设置中仍然优于零样本方法。
Nov, 2023
本文研究了使用 transformer 模型(BERT-m 和 XLM-RoBERTa-base)对社交媒体中存在的误导性信息进行事实核查的方法,实验结果表明,在荷兰语和英语中,transformer 模型优于 SVM 和 RF 模型,但在西班牙语中,情况则不同。
Jul, 2022
对多模态大型语言模型在事实检查方面的能力和局限性进行了系统评估,发现 GPT-4V 在识别恶意和误导性多模态论断方面表现出优越性能,具备解释不合理方面和潜在动机的能力,同时已有的开源模型存在强烈的偏见,并对提示非常敏感。这项研究为对抗虚假多模态信息和构建安全可靠的多模态模型提供了启示,据我们所知,这是第一次对多模态大型语言模型进行真实世界事实检查的评估。
Mar, 2024