hallucination-detection

标签

Cards List
#hallucination-detection

分解引发的上下文-记忆冲突:当事实核查流程与其源文本自相矛盾时

arXiv cs.CL · 3天前 缓存

本文识别并描述了分解引发的上下文-记忆冲突(DI-CC),这是分解后验证流水线中的一种故障模式,其中分解会用模型的参数化信念替代源文本。作者表明它在机制上与经典的上下文-记忆冲突相关,SelfCheckGPT 无法检测到它,而上下文感知解码可以抑制它,但会引入严重的解析失败。

0 人收藏 0 人点赞
#hallucination-detection

可操作的幻觉检测:将潜在不确定性转化为智能体批判

arXiv cs.LG · 3天前 缓存

本文介绍了 Latent Critic,一种轻量级 LoRA 适配器,它通过将 Transformer 的残差流重构为局部自然语言反馈,实时检测幻觉智能体行为,达到 0.966 的 AUROC,并支持自我纠正。

0 人收藏 0 人点赞
#hallucination-detection

提示嵌入探针(PEP):从隐藏状态检测大语言模型幻觉

arXiv cs.CL · 4天前 缓存

本文介绍了提示嵌入探针(PEP),一种参数高效的线性探针扩展方法,利用隐藏状态上的可学习提示嵌入来检测冻结的大语言模型中的幻觉。在 TriviaQA、GSM8K 和 MedQA 上使用 Qwen3 模型的评估显示,相比标准线性探针,该方法在预生成和跨模型设置中均有改进。

0 人收藏 0 人点赞
#hallucination-detection

分解蕴含用于事实性检查与幻觉检测

arXiv cs.CL · 2026-08-07 缓存

本文提出HallDetect,一种轻量级、无需参考的幻觉检测框架,它将生成内容分解为原子声明,并通过紧凑的蕴含模型进行验证。在多个基准测试中,它优于资源相当的基础模型,并提供了从声明到文本片段的审计轨迹。

0 人收藏 0 人点赞
#hallucination-detection

TriQua:调和事实性评估中的粒度与上下文

arXiv cs.AI · 2026-08-07 缓存

本文介绍了TriQua,一个用于LLM事实性评估的框架,它自适应地将事实表示为三元组或带有上下文限定符的超关系事实,并提出了TriQuaScore用于细粒度的事实性评分。实验表明,TriQua与人工标注结果高度一致,并且在基于证据的验证方面优于现有方法。

0 人收藏 0 人点赞
#hallucination-detection

没有通用的幻觉检测器,但有一个通用的底线——预注册,10个模型。来打破它。[R]

Reddit r/MachineLearning · 2026-08-03

一项预注册研究提出了一种使用内部模型信号跨10个模型进行首token幻觉检测的方法,发现没有通用检测器,但存在一个普遍高于随机水平的底线,并公开了代码和验证脚本。

0 人收藏 0 人点赞
#hallucination-detection

推理降噪器:对推理轨迹进行降噪以检测大型推理模型中的幻觉

Hugging Face Daily Papers · 2026-07-24 缓存

介绍了ReDe框架,该框架通过过滤无关和重复步骤来对推理轨迹进行降噪,从而改进大型推理模型中的幻觉检测,在TruthfulQA上达到了高达87.32的AUROC。

0 人收藏 0 人点赞
#hallucination-detection

从依存到组合性:通过组合范畴语法对LLM输出的神经符号提升

arXiv cs.AI · 2026-07-22 缓存

本文提出了一种神经符号框架,利用组合范畴语法将LLM输出提升为类型化组合推导,从而实现结构检查和早期幻觉检测。

0 人收藏 0 人点赞
#hallucination-detection

超越语义等价:用于LLM不确定性量化的逻辑图

arXiv cs.AI · 2026-07-21 缓存

本文提出逻辑图不确定性(LGU)框架,该框架对答案之间的蕴含关系与不相容性进行建模,以改进大语言模型的不确定性估计。在多个基准测试中,LGU相较语义熵基线方法,AUROC最高提升7.1%,AUARC最高提升3.5%。

0 人收藏 0 人点赞
#hallucination-detection

面向多样性的微调方法用于基于不确定性的幻觉检测

arXiv cs.AI · 2026-07-21 缓存

本文提出了面向多样性的微调策略,通过鼓励多样化的生成来改进大型语言模型中基于不确定性的幻觉检测,从而通过语义熵使幻觉更易检测。

0 人收藏 0 人点赞
#hallucination-detection

ASK-NN:一种检测自然语言中分布漂移的非对称最近邻测试

arXiv cs.LG · 2026-07-20 缓存

ASK-NN 是一种非对称最近邻测试,用于检测参考样本与查询样本之间的分布漂移,可应用于LLM幻觉检测和人工文本检测。该方法计算高效,具有理论保证,并且在合成和真实世界基准测试中与基线方法相比表现出竞争力。

0 人收藏 0 人点赞
#hallucination-detection

开源本地LLM训练工具(面向消费级硬件)

Reddit r/artificial · 2026-07-14

一个用于在消费级硬件上训练LLM的开源工具,具备实时神经可视化功能,可用于幻觉检测和模型自省,目前支持小规模模型。

0 人收藏 0 人点赞
#hallucination-detection

使用分流解码的大语言模型幻觉检测

arXiv cs.CL · 2026-07-14 缓存

本文提出分流解码(diversion decoding)方法,通过在解码阶段主动挑战模型响应来提取特征,训练不确定性启发式模型,从而检测大语言模型中的幻觉,实现了更优的性能和更低的计算复杂度。

0 人收藏 0 人点赞
#hallucination-detection

忠实设计:为多利益相关方受众评估和改进LLM生成的临床试验摘要

arXiv cs.CL · 2026-07-14 缓存

本文引入了一个基准评估框架,用于衡量针对不同利益相关方受众的LLM生成临床试验摘要的忠实性。该研究测试了GPT-4o、Claude Sonnet 4.6和Gemini 2.5 Flash模型在1,800份摘要上的表现,并提出了一种知识图谱增强的检索系统,显著提升了忠实性得分。

0 人收藏 0 人点赞
#hallucination-detection

评估J-space熵在Qwen3-4B上的7个数据集中作为错误预测器的效果 [R]

Reddit r/MachineLearning · 2026-07-13

本研究评估了灵感来自Anthropic的Jacobian Lens的J-space熵能否在Qwen3-4B上的七个数据集中作为错误预测器。结果显示,它可以补充事实检索中的输出置信度,但它并非通用的幻觉检测器,且具有很强的任务依赖性。

0 人收藏 0 人点赞
#hallucination-detection

我在Qwen3-4B上跨越7个数据集映射了Anthropic的J-Space幻觉信号,以找出其有效和失效的地方

Reddit r/LocalLLaMA · 2026-07-12

本文在Qwen3-4B上跨越7个数据集评估了Anthropic的J-Space幻觉检测方法,发现该方法在捕捉事实检索中的高置信度错误方面有效,但对内化的虚构内容视而不见,并且在阈值无法迁移的数学任务上失效。

0 人收藏 0 人点赞
#hallucination-detection

当思考带来伤害:视觉语言模型推理链中的认知信号

arXiv cs.LG · 2026-07-10 缓存

本文对思考模式下的视觉语言模型的不确定性进行了实证分析,表明思考链熵比传统的答案令牌分布(在这种模型中会失效)是更可靠的幻觉检测信号。

0 人收藏 0 人点赞
#hallucination-detection

幻觉自我对弈:通过进化生成器引导强化检测器

arXiv cs.CL · 2026-07-10 缓存

介绍幻觉自我对弈(HSP),一种通过强化学习利用进化生成器引导检测器的框架,使小型LLM在忠实性幻觉检测上无需外部监督即可媲美先进LLM。

0 人收藏 0 人点赞
#hallucination-detection

Bielik 知道它不知道什么吗?激活分散性在模型规模上区分实体熟悉度与事实可靠性

arXiv cs.CL · 2026-07-09 缓存

本文研究了波兰 Bielik 大语言模型中的激活模式是否能在生成前检测到实体熟悉度,使用了无监督的分散度量,在模型规模上实现了已知实体与虚构实体的近乎完美分离,同时表明事实可靠性随规模急剧提升,但更难从激活中预测。

0 人收藏 0 人点赞
#hallucination-detection

我在开放模型上测试了Anthropic的新Jacobian Lens,然后它变成了一个本地模型幻觉路由器

Reddit r/LocalLLaMA · 2026-07-07

作者在开放模型上测试了Anthropic的Jacobian Lens,然后它演变成了一个用于检测AI幻觉的本地模型幻觉路由器

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈