factuality

标签

Cards List
#factuality

面向异构知识的LLM反事实基准测试与训练:实现事实一致性和顺序稳健的接地推理

arXiv cs.AI · 2026-08-11 缓存

本文介绍了TKFQA,一个包含10,130个基于表格、文本和知识图谱的问答对的反事实基准,用于评估LLM的事实一致性和顺序稳健推理,并提出了ORLF,一种训练框架,可提高推理链准确性并降低对输入顺序的敏感性。

0 人收藏 0 人点赞
#factuality

注意力引导的大语言模型对比解码层选择策略

arXiv cs.CL · 2026-07-28 缓存

提出了三种注意力引导的大语言模型对比解码层选择策略,在TruthfulQA上相比DoLa基线提高了事实准确性。

0 人收藏 0 人点赞
#factuality

面向事实的推理学习

arXiv cs.CL · 2026-07-27 缓存

本文提出了一种新颖的在线强化学习方法,通过设计兼顾事实精确性、细节丰富度和回答相关性的奖励函数,来提升推理大语言模型的事实准确性。在六个基准测试上,该方法将幻觉率降低了23.1个百分点。

0 人收藏 0 人点赞
#factuality

自我判断混淆下正确性探测的诊断

arXiv cs.CL · 2026-07-21 缓存

本文研究了神经网络探针在预测语言模型输出正确性时,是否真正捕捉了客观正确性还是模型自身的自我判断。通过构造两者不一致的冲突案例,作者发现可转移的方向主要保持了自我判断的极性,从而挑战了正确性读数的解释。

0 人收藏 0 人点赞
#factuality

@mylifcc: http://Arena.ai 刚刚把「事实性(Factuality)」正式加入模型排名。 现在排行榜支持「人类偏好 + 事实性」加权查看(默认 25% 事实性权重)。他们已标注超过 200 万个真实对话中的 claims(Text Ar…

X AI KOLs Timeline · 2026-07-15 缓存

Arena.ai 将事实性(Factuality)加入模型排名,支持人类偏好与事实性加权,并展示了各模型排名变化。

0 人收藏 0 人点赞
#factuality

这不是烟斗:AI系统作为语义抽象

arXiv cs.AI · 2026-07-13 缓存

本文提出了一种语义框架来描述AI系统,区分合理的声明与误导性的输出,并定义了常见的失败现象,如幻觉和无根据的断言。

0 人收藏 0 人点赞
#factuality

聚焦医疗LLM问答中的差异

arXiv cs.CL · 2026-07-09 缓存

本文系统研究了五种语言下基于LLM的医疗问答中的跨语言差异,发现了事实对齐方面的显著差距,并提出了MultiWikiHealthCare数据集。

0 人收藏 0 人点赞
#factuality

通过混合模式优势正则化减轻大型推理模型中的事实幻觉

arXiv cs.CL · 2026-07-08 缓存

介绍了MARGO,一种强化学习框架,通过比较思考和非思考轨迹,使用混合模式优势正则化来减轻大型推理模型中由思考引发的幻觉。

0 人收藏 0 人点赞
#factuality

预算约束下RAG系统中的事实错误诊断与修复

arXiv cs.AI · 2026-06-30 缓存

本文提出D2R-RAG,一个模型无关且资源感知的框架,在延迟和VRAM约束下诊断和修复RAG系统中的事实错误,在FEVER和HotpotQA上实现了更好的准确性与效率权衡。

0 人收藏 0 人点赞
#factuality

ConflictScore: 识别与衡量语言模型如何处理矛盾证据

arXiv cs.CL · 2026-06-26 缓存

ConflictScore是一种新度量,用于量化语言模型在面对其基础文档中的矛盾证据时的识别能力,它将响应分解为原子声明并衡量矛盾平衡。论文还引入了ConflictBench,这是一个涵盖多种矛盾形式的基准测试,并展示了该度量可以提高TruthfulQA上的真实性。

0 人收藏 0 人点赞
#factuality

@FinanceYF5: 3/ 准确性提升 GPT-5.5 Instant 在事实准确性上有明显提升。 尤其是在医学、法律、金融等对准确性要求更高的领域。

X AI KOLs Following · 2026-05-10 缓存

Report claims that GPT-5.5 Instant shows significant improvements in factual accuracy, particularly in high-stakes fields like medicine, law, and finance.

0 人收藏 0 人点赞
#factuality

MoshiRAG:面向全双工语音语言模型的异步知识检索

arXiv cs.CL · 2026-04-20 缓存

MoshiRAG 将紧凑的全双工语音语言模型与异步检索增强生成相结合,在保持实时交互性的同时提高事实准确性。该方法利用对话中自然的时空间隙来检索外部知识,而不会打断对话的自然流程。

0 人收藏 0 人点赞
#factuality

FACTS基准测试套件:系统性评估大语言模型的事实性

Google DeepMind Blog · 2025-12-09 缓存

Google DeepMind与Kaggle联合推出了FACTS基准测试套件,这是一套涵盖参数化知识、检索增强、多模态和 grounding 的综合评估体系,用于系统性衡量大语言模型的事实性。

0 人收藏 0 人点赞
#factuality

FACTS Grounding:评估大语言模型事实性的新基准

Google DeepMind Blog · 2024-12-17 缓存

DeepMind推出FACTS Grounding,这是一个包含1,719个示例的全面基准测试,用于评估大语言模型在源材料中的事实依据能力以及避免幻觉的准确性。该基准包括一个公开数据集和一个在线Kaggle排行榜,用于追踪LLM在事实准确性和事实依据任务上的表现。

0 人收藏 0 人点赞
#factuality

推出 SimpleQA

OpenAI Blog · 2024-10-30 缓存

OpenAI 推出 SimpleQA,一个新的事实性基准数据集,包含 4,326 个简短事实性问题,旨在评估前沿语言模型在提供准确答案而不产生幻觉的能力。该数据集通过双独立标注、严格标准实现高质量,估计错误率仅为 ~3%,GPT-4o 得分不到 40%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈