TruthfulQA:衡量模型模仿人类虚假信息的程度

OpenAI Blog 论文

摘要

# TruthfulQA:衡量模型模仿人类虚假信息的程度 来源:[https://openai.com/index/truthfulqa/](https://openai.com/index/truthfulqa/) ## 摘要 我们提出了一个基准来衡量语言模型在生成问题答案时是否真实。该基准包含817个问题,跨越38个类别,包括卫生、法律、金融和政治。我们精心设计了一些问题,其中一些人会因为错误的信念或误解而错误地回答。要表现良好,模型必须

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:55

# TruthfulQA:衡量模型如何模仿人类错误 来源:https://openai.com/index/truthfulqa/ ## 摘要 我们提出了一个基准来衡量语言模型在生成问题答案时的真实性。该基准包含 817 个问题,涵盖 38 个类别,包括健康、法律、金融和政治等领域。我们精心设计了一些问题,这些问题中有些会因为人类的错误信念或误解而被人类错误地回答。为了获得良好的表现,模型必须避免生成从模仿人类文本中学到的虚假答案。我们测试了 GPT-3、GPT-Neo/J、GPT-2 和基于 T5 的模型。最好的模型在 58% 的问题上是真实的,而人类的表现是 94%。模型生成了许多虚假答案,这些答案模仿了流行的误解,有可能欺骗人类。最大的模型通常是最不真实的。这与其他自然语言处理任务形成对比,在这些任务中,性能会随着模型规模的增加而提高。然而,如果虚假答案是从训练分布中学到的,这个结果是意料之中的。我们建议,仅通过扩大模型规模对改进真实性的帮助较小,使用除了网络文本模仿之外的训练目标进行微调更加有前景。

相似文章

推出 SimpleQA

OpenAI Blog

OpenAI 推出 SimpleQA,一个新的事实性基准数据集,包含 4,326 个简短事实性问题,旨在评估前沿语言模型在提供准确答案而不产生幻觉的能力。该数据集通过双独立标注、严格标准实现高质量,估计错误率仅为 ~3%,GPT-4o 得分不到 40%。

大型语言模型响应的全面评估:多因素评分系统

arXiv cs.CL

本文提出了一种用于评估大型语言模型(LLM)响应的多因素评分系统,综合了准确性、简洁性、事实一致性、可读性和连贯性。应用于TruthfulQA数据集,揭示了主流模型的优势与局限,提供了一个透明的评估框架。

"你撒谎了吗?" 跨模型规模与信念验证模型实体的谎言检测评估

arXiv cs.AI

本文评估了四种针对语言模型的谎言检测方法,覆盖了提示谎言和训练好的模型实体,发现基于激活和logprob的检测器在训练好的模型实体上性能急剧下降,而思维链评判器仍然表现强劲。本文引入了新的测试平台以及“你撒谎了吗?”(DYL)后续探针方法,并发布了数据集和模型实体。