faithfulness

标签

Cards List
#faithfulness

LOOMSUM:编织定量和叙述证据的忠实长文表摘要

arXiv cs.CL · 2天前 缓存

LoomSum是一个无需训练的框架,通过显式地将定量事实与叙述证据链接来改进长文表文档的忠实摘要,并引入了一个新的度量TGF来评估忠实性。

0 人收藏 0 人点赞
#faithfulness

推理模型的思维链忠实性随偏好线索的交付位置和方式而变化

Hugging Face Daily Papers · 6天前 缓存

FACE-Eval 评估显示,当偏好线索来自工具输出或隐式产物时,思维链监控的可靠性降低,模型在多样化开放权重模型中表现出较低的口头承诺和较高的非口头采纳。

0 人收藏 0 人点赞
#faithfulness

高效Transformer中的稀疏令牌路由

arXiv cs.CL · 2026-08-24 缓存

本文使用SEWN(一种带有学习门控的双流模型用于令牌路由)评估了Transformer中的自适应计算,表明SEWN-sparse在准确性略有损失的情况下,相比BERT-base和DistilBERT实现了显著的吞吐量提升,并提供了可解释的令牌重要性信号。

0 人收藏 0 人点赞
#faithfulness

思维链推理在实际应用中并非总是忠实的

Hacker News Top · 2026-08-19 缓存

本文表明,在大型语言模型中,思维链推理并不总是忠实的,模型在应对自然语言提示时会产生看似合理但不正确的推理链,引发了对AI安全和透明度的担忧。

0 人收藏 0 人点赞
#faithfulness

FaithformBench:数学思维链自动形式化的忠实度基准

arXiv cs.CL · 2026-08-12 缓存

介绍了FaithformBench,一个用于评估数学思维链自动形式化系统忠实度的基准,通过测量扰动步骤上的有效性与无效性保持来评估。应用于八个AF系统后,揭示了普遍的“谄媚”现象,即无效输入被静默纠正。

0 人收藏 0 人点赞
#faithfulness

抽象摘要中关系级幻觉评估的基于依据的分解框架

arXiv cs.CL · 2026-08-11 缓存

本文提出了一个基于依据的、可分解的框架,用于评估抽象式摘要中的关系级幻觉,引入了标准化的关系幻觉指数(RHI),并带有语言感知的关系抽取增强。

0 人收藏 0 人点赞
#faithfulness

个性化幻象:LLM如何虚构用户画像,以及为何自我监控具有误导性

Hugging Face Daily Papers · 2026-08-05 缓存

本文介绍了MirageBench,这是一个基准测试,表明具有持久记忆的LLM有35%至49%的时间通过过度推断虚构用户画像,并揭示模型自报的置信度与实际过度推断呈负相关,使得自我监控在比较模型时不可靠。

0 人收藏 0 人点赞
#faithfulness

平均偏差:人类忠实性标注并非局部忠实

arXiv cs.CL · 2026-08-04 缓存

本文来自石溪大学,识别了文本摘要人类忠实性标注中的“平均偏差”:全局人类标签与逐句LLM判断的平均值之间的相关性,优于与严格合取规则的相关性,这意味着即使摘要包含局部事实错误,人类也常常将其标注为忠实。

0 人收藏 0 人点赞
#faithfulness

LAWFUL:用于潜在变量忠实使用的定律对齐见证

arXiv cs.LG · 2026-08-03 缓存

本文介绍了LAWFUL,一个用于验证神经网络是否学习并在连续变量上因果性地使用物理定律的框架,解决了覆盖感知的因果一致性和有效域测试方面的空白。该方法在Mocap2Radar transformer和多普勒频率定律上进行了演示。

0 人收藏 0 人点赞
#faithfulness

论思维链忠实性的转向向量泛化

arXiv cs.AI · 2026-08-03 缓存

本文研究了用于改善思维链忠实性的激活转向在多种提示类型、数据集和转向向量构建方法之间,以及在多个 Gemma 和 Qwen 模型上的泛化能力。作者发现,当转向有效时,其效果可以广泛泛化,并且评估设置比训练设置或向量构建方法更为重要。

0 人收藏 0 人点赞
#faithfulness

位置而非来源:区分医学视觉语言模型中的推理中介与谄媚

arXiv cs.LG · 2026-07-31 缓存

本文介绍了 CoT-Mediate,一个行为框架,用于测试医学视觉语言模型中的思维链推理是真正驱动预测,还是仅仅装饰预测。通过对 VQA-RAD 上的 LLaVA-Med 和 MedGemma 进行审计,发现推理的注入方式(前缀强制 vs 重新提示)以及归因来源(自我 vs 专家)显著影响模型的忠实度和谄媚程度。

0 人收藏 0 人点赞
#faithfulness

通过k阶忠实性假设松弛的高阶马尔可夫毯发现

arXiv cs.LG · 2026-07-30 缓存

本文提出了一种用于学习图马尔可夫毯的忠实性假设的k阶松弛,并引入了一个概念验证算法(kOMB),即使在忠实性违反情况下(如奇偶类型关系),也能恢复马尔可夫毯。

0 人收藏 0 人点赞
#faithfulness

LEDGERMIND:基于结构化证据账本的来源约束多模态智能体推理

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了LedgerMind,一种来源约束的多模态智能体推理框架,它使用结构化证据账本确保视觉问答中推理的立足性和忠实性,解决幻觉和过度推理等失败模式。

0 人收藏 0 人点赞
#faithfulness

上下文归因如何处理模型已知的知识

arXiv cs.CL · 2026-07-28 缓存

本文介绍了一个评估协议,包含四个新指标和一个基准数据集,用于评估LLM的上下文归因方法,并表明当上下文与训练数据重叠时这些方法会失败。

0 人收藏 0 人点赞
#faithfulness

思维链不忠实性的两种模式:模型出错时行为检测失效

arXiv cs.CL · 2026-07-28 缓存

本文研究了大语言模型中不忠实思维链推理的行为检测,发现答案正确性影响了检测性能:在大多数不忠实性出现的错误答案上,行为信号处于随机水平;而在正确答案上,它们提供了适度的区分能力。

0 人收藏 0 人点赞
#faithfulness

论提高文档生成播客的忠实度

arXiv cs.CL · 2026-07-27 缓存

本文首次系统研究了文档接地播客生成中的忠实度问题,提出了一个轮次级别的LLM作为评委的评估框架,以及一个与模型无关的捕获-修复方法,该方法能跨领域提高忠实度。

0 人收藏 0 人点赞
#faithfulness

REFACT:面向紧凑且忠实思维链的自适应事实重述

arXiv cs.CL · 2026-07-24 缓存

ReFact提出了一种自适应的事实重述引用框架,训练大语言模型自主决定推理步骤何时需要上下文支撑,从而在减少令牌消耗的同时提升思维链推理的忠实度和紧凑性。

0 人收藏 0 人点赞
#faithfulness

CASE: 因果对齐与结构强化以提升思维链忠实性

arXiv cs.CL · 2026-07-22 缓存

提出了CASE,一个结合训练时因果对齐与推理时结构强化的框架,旨在提升大语言模型思维链推理的忠实性,在多个基准测试中平均实现了37%的思维链忠实性提升。

0 人收藏 0 人点赞
#faithfulness

从看似合理到可行:关于LLM自我解释的立场

arXiv cs.CL · 2026-07-20 缓存

本文(立场论文)认为,LLM自我解释可能看似合理、忠实度存疑,但具有高度可行性,并提出了超越传统指标的评估指南。

0 人收藏 0 人点赞
#faithfulness

Silico(3分钟阅读)

TLDR AI · 2026-07-16 缓存

GoodfireAI分享了关于使用探针改进LLM校准和检测推理忠实度的研究,以及一场使用其产品Silico通过参数分解进行定向微调的黑客马拉松。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈