标签
LoomSum是一个无需训练的框架,通过显式地将定量事实与叙述证据链接来改进长文表文档的忠实摘要,并引入了一个新的度量TGF来评估忠实性。
FACE-Eval 评估显示,当偏好线索来自工具输出或隐式产物时,思维链监控的可靠性降低,模型在多样化开放权重模型中表现出较低的口头承诺和较高的非口头采纳。
本文使用SEWN(一种带有学习门控的双流模型用于令牌路由)评估了Transformer中的自适应计算,表明SEWN-sparse在准确性略有损失的情况下,相比BERT-base和DistilBERT实现了显著的吞吐量提升,并提供了可解释的令牌重要性信号。
本文表明,在大型语言模型中,思维链推理并不总是忠实的,模型在应对自然语言提示时会产生看似合理但不正确的推理链,引发了对AI安全和透明度的担忧。
介绍了FaithformBench,一个用于评估数学思维链自动形式化系统忠实度的基准,通过测量扰动步骤上的有效性与无效性保持来评估。应用于八个AF系统后,揭示了普遍的“谄媚”现象,即无效输入被静默纠正。
本文提出了一个基于依据的、可分解的框架,用于评估抽象式摘要中的关系级幻觉,引入了标准化的关系幻觉指数(RHI),并带有语言感知的关系抽取增强。
本文介绍了MirageBench,这是一个基准测试,表明具有持久记忆的LLM有35%至49%的时间通过过度推断虚构用户画像,并揭示模型自报的置信度与实际过度推断呈负相关,使得自我监控在比较模型时不可靠。
本文来自石溪大学,识别了文本摘要人类忠实性标注中的“平均偏差”:全局人类标签与逐句LLM判断的平均值之间的相关性,优于与严格合取规则的相关性,这意味着即使摘要包含局部事实错误,人类也常常将其标注为忠实。
本文介绍了LAWFUL,一个用于验证神经网络是否学习并在连续变量上因果性地使用物理定律的框架,解决了覆盖感知的因果一致性和有效域测试方面的空白。该方法在Mocap2Radar transformer和多普勒频率定律上进行了演示。
本文研究了用于改善思维链忠实性的激活转向在多种提示类型、数据集和转向向量构建方法之间,以及在多个 Gemma 和 Qwen 模型上的泛化能力。作者发现,当转向有效时,其效果可以广泛泛化,并且评估设置比训练设置或向量构建方法更为重要。
本文介绍了 CoT-Mediate,一个行为框架,用于测试医学视觉语言模型中的思维链推理是真正驱动预测,还是仅仅装饰预测。通过对 VQA-RAD 上的 LLaVA-Med 和 MedGemma 进行审计,发现推理的注入方式(前缀强制 vs 重新提示)以及归因来源(自我 vs 专家)显著影响模型的忠实度和谄媚程度。
本文提出了一种用于学习图马尔可夫毯的忠实性假设的k阶松弛,并引入了一个概念验证算法(kOMB),即使在忠实性违反情况下(如奇偶类型关系),也能恢复马尔可夫毯。
本文介绍了LedgerMind,一种来源约束的多模态智能体推理框架,它使用结构化证据账本确保视觉问答中推理的立足性和忠实性,解决幻觉和过度推理等失败模式。
本文介绍了一个评估协议,包含四个新指标和一个基准数据集,用于评估LLM的上下文归因方法,并表明当上下文与训练数据重叠时这些方法会失败。
本文研究了大语言模型中不忠实思维链推理的行为检测,发现答案正确性影响了检测性能:在大多数不忠实性出现的错误答案上,行为信号处于随机水平;而在正确答案上,它们提供了适度的区分能力。
本文首次系统研究了文档接地播客生成中的忠实度问题,提出了一个轮次级别的LLM作为评委的评估框架,以及一个与模型无关的捕获-修复方法,该方法能跨领域提高忠实度。
ReFact提出了一种自适应的事实重述引用框架,训练大语言模型自主决定推理步骤何时需要上下文支撑,从而在减少令牌消耗的同时提升思维链推理的忠实度和紧凑性。
提出了CASE,一个结合训练时因果对齐与推理时结构强化的框架,旨在提升大语言模型思维链推理的忠实性,在多个基准测试中平均实现了37%的思维链忠实性提升。
本文(立场论文)认为,LLM自我解释可能看似合理、忠实度存疑,但具有高度可行性,并提出了超越传统指标的评估指南。
GoodfireAI分享了关于使用探针改进LLM校准和检测推理忠实度的研究,以及一场使用其产品Silico通过参数分解进行定向微调的黑客马拉松。