faithfulness

标签

Cards List
#faithfulness

从看似合理到可行:关于LLM自我解释的立场

arXiv cs.CL · 昨天 缓存

本文(立场论文)认为,LLM自我解释可能看似合理、忠实度存疑,但具有高度可行性,并提出了超越传统指标的评估指南。

0 人收藏 0 人点赞
#faithfulness

Silico(3分钟阅读)

TLDR AI · 5天前 缓存

GoodfireAI分享了关于使用探针改进LLM校准和检测推理忠实度的研究,以及一场使用其产品Silico通过参数分解进行定向微调的黑客马拉松。

0 人收藏 0 人点赞
#faithfulness

忠实设计:为多利益相关方受众评估和改进LLM生成的临床试验摘要

arXiv cs.CL · 2026-07-14 缓存

本文引入了一个基准评估框架,用于衡量针对不同利益相关方受众的LLM生成临床试验摘要的忠实性。该研究测试了GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash模型在1,800份摘要上的表现,并提出了一种知识图谱增强的检索系统,显著提升了忠实性得分。

0 人收藏 0 人点赞
#faithfulness

忠实的,而非纠正的:多跳智能体中继中的消息格式效应依赖于层级

arXiv cs.AI · 2026-07-14 缓存

本文研究了消息格式(如自由文本、JSON、三元组)在多跳LLM智能体中继中如何影响信息丢失,发现格式效应取决于中继模型的能力,且结构能忠实地保留内容但不会纠正错误。

0 人收藏 0 人点赞
#faithfulness

欺骗性基础:临床检索增强生成中的实体归因失败

arXiv cs.CL · 2026-07-13 缓存

本文识别了临床RAG系统中的'欺骗性基础'现象:响应准确传达了检索到的证据,却将其归因于错误实体,且能通过所有标准检查。针对13个模型的实验表明,失败率很高,尤其在领域专用模型中,并提出了实体归因验证作为解决方案。

0 人收藏 0 人点赞
#faithfulness

LLM预测模型知道但不说的话:探测内部表征以实现校准和忠实性

arXiv cs.CL · 2026-07-10 缓存

本文探测LLM预测模型的内部表征,以改进校准并评估思维链推理的忠实性。研究发现,探针能够实现更好的校准,并充当谎言检测器。

0 人收藏 0 人点赞
#faithfulness

幻觉自我对弈:通过进化生成器引导强化检测器

arXiv cs.CL · 2026-07-10 缓存

介绍幻觉自我对弈(HSP),一种通过强化学习利用进化生成器引导检测器的框架,使小型LLM在忠实性幻觉检测上无需外部监督即可媲美先进LLM。

0 人收藏 0 人点赞
#faithfulness

最终检查点并不足够:分析训练轨迹中潜在推理的忠实性

arXiv cs.LG · 2026-07-09 缓存

本文研究了潜在推理步骤的忠实性在训练过程中如何演变,发现其取决于训练阶段和答案格式,而不仅仅是最终检查点的性能。

0 人收藏 0 人点赞
#faithfulness

Pitwall:来自校准实时蒙特卡洛引擎的忠实自然语言比赛策略简报

arXiv cs.CL · 2026-07-08 缓存

Pitwall 是一个生产系统,通过将声明分解为类型化的事实断言,并针对校准的蒙特卡洛比赛模拟器逐一验证每个断言,从而生成忠实的自然语言一级方程式策略简报,确保无幻觉输出。

0 人收藏 0 人点赞
#faithfulness

长度惩罚使思维链的可监控性降低

Hugging Face Daily Papers · 2026-07-08 缓存

本文表明,长度惩罚的强化学习会缩短思维链推理,但也会降低可监控性,因为压缩后的链优先移除了揭示答案背后影响的线索,使得检测引导或偏差变得更加困难。

0 人收藏 0 人点赞
#faithfulness

迈向基于音系学的多语言TTS评估

arXiv cs.CL · 2026-07-03 缓存

本文提出了一种基于分类器的框架,用于审计多语言TTS系统的音系忠实性,以阿萨姆语ATR元音和谐为案例研究。结果显示,Meta的MMS TTS频繁错误生成舌根前伸元音,而这种偏差在人类语音中不存在。

0 人收藏 0 人点赞
#faithfulness

定义上的忠实:通过自然语义元语言解释进行情感分析

arXiv cs.CL · 2026-07-02 缓存

本文提出了一种使用自然语义元语言(NSM)的情感分析界面,为情感分类生成忠实且可解释的说明,以轻微的准确度换取可验证性。

0 人收藏 0 人点赞
#faithfulness

在模拟复杂系统上验证因果抽象度量

arXiv cs.LG · 2026-07-02 缓存

本文介绍了一个包含十个复杂系统的基准,用于验证因果抽象度量,评估了三十多个候选度量,并提出了因果抽象误差(CAE)作为一种通用的有效性度量,能够可靠地区分有效与无效的解释。

0 人收藏 0 人点赞
#faithfulness

5ting在SemEval-2026任务8中的表现:基于LLM重排序和忠实性控制的强大端到端多轮RAG

arXiv cs.CL · 2026-06-30 缓存

本文介绍了5ting系统,这是一个用于多轮检索增强生成(RAG)的系统,融合了BGE-M3密集检索、FAISS索引、基于LLM的重排序以及证据约束生成。该系统在SemEval-2026任务8中取得了出色成绩,检索nDCG@5达到0.4719,端到端调和得分为0.5597。

0 人收藏 0 人点赞
#faithfulness

OpenBioRQ:AI代理有15.9%的概率引用错误论文

Reddit r/ArtificialInteligence · 2026-06-26

一项新的基准论文OpenBioRQ揭示,AI代理很少捏造引用,但常常引用不支持其主张的论文,在生物医学语境中有15.9%的引用不匹配。

0 人收藏 0 人点赞
#faithfulness

ConflictScore: 识别与衡量语言模型如何处理矛盾证据

arXiv cs.CL · 2026-06-26 缓存

ConflictScore是一种新度量,用于量化语言模型在面对其基础文档中的矛盾证据时的识别能力,它将响应分解为原子声明并衡量矛盾平衡。论文还引入了ConflictBench,这是一个涵盖多种矛盾形式的基准测试,并展示了该度量可以提高TruthfulQA上的真实性。

0 人收藏 0 人点赞
#faithfulness

别让我的LLM崩溃:注意力层剪枝对解释忠实性与置信度校准的影响

arXiv cs.LG · 2026-06-25 缓存

本文研究了在大型语言模型(LLM)中剪枝注意力层对解释忠实性和置信度校准的影响,发现准确率通常保持较高,但可解释性和可靠性下降,凸显了模型置信度、可解释性与准确率之间的失调。

0 人收藏 0 人点赞
#faithfulness

形式验证证书的循环一致性神经解释

arXiv cs.AI · 2026-06-24 缓存

本文提出了一种循环一致的神经架构,能生成形式验证证书的忠实自然语言解释,正确性达到90%,推理速度比LLM基线快860倍。

0 人收藏 0 人点赞
#faithfulness

构建即忠实:基于主张锚定的多文档摘要归因

arXiv cs.CL · 2026-06-24 缓存

本文介绍了 CAMS,一个模块化的多文档摘要框架,它提取带有词元级来源的原子性主张,对等价主张进行聚类,并将其重写为具有细粒度、多源可追溯性的摘要,显著提升了忠实度和引用精度。

0 人收藏 0 人点赞
#faithfulness

OpenBioRQ:面向智能体的未解决生物医学研究问题

Hugging Face Daily Papers · 2026-06-20 缓存

OpenBioRQ 是一个包含12,553个未解决生物医学研究问题的新基准,用于测试智能体模型验证来源和避免虚假引用的能力。该基准揭示,当前模型经常链接到错误的论文,并在难题上出现智能体崩溃。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈