deception-detection

标签

Cards List
#deception-detection

超越 Liars' Bench:谎言类型、深度和稀疏性对LLM欺骗检测的影响

arXiv cs.AI · 4天前 缓存

本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。

0 人收藏 0 人点赞
#deception-detection

穿越幻境:一种用于鲁棒性误导图表问答的双路径智能体框架

Hugging Face Daily Papers · 2026-07-14 缓存

本文介绍了ChartCynics,一种将感知与验证解耦的智能体双路径框架,用于鲁棒地回答关于误导性图表的问题。它通过使用诊断视觉路径和OCR驱动的数据路径,以及用于推理蒸馏和对抗对齐的两阶段协议,实现了最先进的准确率。

0 人收藏 0 人点赞
#deception-detection

ThinkDeception: 一种可解释的多模态欺骗检测的渐进式强化学习框架

arXiv cs.AI · 2026-06-18 缓存

ThinkDeception提出了一种新颖框架,利用多模态大语言模型和带有思维链推理的渐进式强化学习策略进行可解释的欺骗检测,在标准基准上取得了最新的最优结果。

0 人收藏 0 人点赞
#deception-detection

解码推理型LLM中隐藏的欺骗:用于欺骗审计的激活解释器

arXiv cs.CL · 2026-06-17 缓存

提出了STATEWITNESS,一种用于审计推理型LLM中欺骗的激活解释器,相比现有监测器取得了显著改进,并提供了可供人工检查的证据。

0 人收藏 0 人点赞
#deception-detection

Rift:语言模型中欺骗行为的冲突标记

arXiv cs.LG · 2026-06-17 缓存

本文介绍了Rift,一种利用隐藏状态的残差秩来检测语言模型欺骗性响应的方法。该方法在多种欺骗类型、模型家族和语言中实现了完美分离,并在无需重新训练的情况下展示了跨家族的零样本迁移能力。

0 人收藏 0 人点赞
#deception-detection

RogueAI:一种用于检测对话中特许AI欺骗的反向图灵测试

arXiv cs.CL · 2026-06-12 缓存

本文介绍了RogueAI,一个以交互式网络应用形式实现的反向图灵测试,其中人类玩家审问两个LLM智能体,以识别在共享虚构场景中被特许欺骗的那个。初步部署显示,启发式检测(准确率75.6%)与人类表现(准确率56.6%)之间存在差距,凸显了该系统作为AI欺骗与诚实数据收集和教学工具的潜力。

0 人收藏 0 人点赞
#deception-detection

大语言模型中欺骗探测探头的压力测试:可伸缩性、鲁棒性与欺骗表征的几何特性

Hugging Face Daily Papers · 2026-05-27 缓存

本文系统测试了用于大语言模型欺骗检测的线性探头,发现它们在分布偏移下失效,但风格增强型探头能恢复性能,并揭示欺骗是通过分布式亚阈值特征编码的。

0 人收藏 0 人点赞
#deception-detection

不归点:语言模型推理中欺骗承诺的反事实定位

arXiv cs.CL · 2026-05-19 缓存

引入反事实定位方法,用于识别语言模型在推理过程中何时对欺骗做出承诺。该方法使用五个环境,包含四个推理模型的146万句子语料库。研究表明,基于注意力的转换特征在不同环境中具有泛化能力,可用于检测欺骗承诺。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈