标签
本文(立场论文)认为,LLM自我解释可能看似合理、忠实度存疑,但具有高度可行性,并提出了超越传统指标的评估指南。
GoodfireAI分享了关于使用探针改进LLM校准和检测推理忠实度的研究,以及一场使用其产品Silico通过参数分解进行定向微调的黑客马拉松。
本文引入了一个基准评估框架,用于衡量针对不同利益相关方受众的LLM生成临床试验摘要的忠实性。该研究测试了GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash模型在1,800份摘要上的表现,并提出了一种知识图谱增强的检索系统,显著提升了忠实性得分。
本文研究了消息格式(如自由文本、JSON、三元组)在多跳LLM智能体中继中如何影响信息丢失,发现格式效应取决于中继模型的能力,且结构能忠实地保留内容但不会纠正错误。
本文识别了临床RAG系统中的'欺骗性基础'现象:响应准确传达了检索到的证据,却将其归因于错误实体,且能通过所有标准检查。针对13个模型的实验表明,失败率很高,尤其在领域专用模型中,并提出了实体归因验证作为解决方案。
本文探测LLM预测模型的内部表征,以改进校准并评估思维链推理的忠实性。研究发现,探针能够实现更好的校准,并充当谎言检测器。
介绍幻觉自我对弈(HSP),一种通过强化学习利用进化生成器引导检测器的框架,使小型LLM在忠实性幻觉检测上无需外部监督即可媲美先进LLM。
本文研究了潜在推理步骤的忠实性在训练过程中如何演变,发现其取决于训练阶段和答案格式,而不仅仅是最终检查点的性能。
Pitwall 是一个生产系统,通过将声明分解为类型化的事实断言,并针对校准的蒙特卡洛比赛模拟器逐一验证每个断言,从而生成忠实的自然语言一级方程式策略简报,确保无幻觉输出。
本文表明,长度惩罚的强化学习会缩短思维链推理,但也会降低可监控性,因为压缩后的链优先移除了揭示答案背后影响的线索,使得检测引导或偏差变得更加困难。
本文提出了一种基于分类器的框架,用于审计多语言TTS系统的音系忠实性,以阿萨姆语ATR元音和谐为案例研究。结果显示,Meta的MMS TTS频繁错误生成舌根前伸元音,而这种偏差在人类语音中不存在。
本文提出了一种使用自然语义元语言(NSM)的情感分析界面,为情感分类生成忠实且可解释的说明,以轻微的准确度换取可验证性。
本文介绍了一个包含十个复杂系统的基准,用于验证因果抽象度量,评估了三十多个候选度量,并提出了因果抽象误差(CAE)作为一种通用的有效性度量,能够可靠地区分有效与无效的解释。
本文介绍了5ting系统,这是一个用于多轮检索增强生成(RAG)的系统,融合了BGE-M3密集检索、FAISS索引、基于LLM的重排序以及证据约束生成。该系统在SemEval-2026任务8中取得了出色成绩,检索nDCG@5达到0.4719,端到端调和得分为0.5597。
一项新的基准论文OpenBioRQ揭示,AI代理很少捏造引用,但常常引用不支持其主张的论文,在生物医学语境中有15.9%的引用不匹配。
ConflictScore是一种新度量,用于量化语言模型在面对其基础文档中的矛盾证据时的识别能力,它将响应分解为原子声明并衡量矛盾平衡。论文还引入了ConflictBench,这是一个涵盖多种矛盾形式的基准测试,并展示了该度量可以提高TruthfulQA上的真实性。
本文研究了在大型语言模型(LLM)中剪枝注意力层对解释忠实性和置信度校准的影响,发现准确率通常保持较高,但可解释性和可靠性下降,凸显了模型置信度、可解释性与准确率之间的失调。
本文提出了一种循环一致的神经架构,能生成形式验证证书的忠实自然语言解释,正确性达到90%,推理速度比LLM基线快860倍。
本文介绍了 CAMS,一个模块化的多文档摘要框架,它提取带有词元级来源的原子性主张,对等价主张进行聚类,并将其重写为具有细粒度、多源可追溯性的摘要,显著提升了忠实度和引用精度。
OpenBioRQ 是一个包含12,553个未解决生物医学研究问题的新基准,用于测试智能体模型验证来源和避免虚假引用的能力。该基准揭示,当前模型经常链接到错误的论文,并在难题上出现智能体崩溃。