truthfulness

标签

Cards List
#truthfulness

@josephdecker: 我的16款模型评测中,冠军在审计中被发现编造了5次。第二名仅差0.1分,零编造……

X AI KOLs Timeline · 2026-07-24 缓存

Joseph Decker 为他的产品 Condensr 评估了16个AI模型的真实性,发现排行榜冠军在审计中五次编造内容,于是转而部署了零编造的第二名模型。这篇文章详细介绍了评估过程、LLM判断器中的一个漏洞(由于截断的转录而惩罚了准确的摘要),以及自定义评估优于通用基准的重要性。

0 人收藏 0 人点赞
#truthfulness

推理降噪器:对推理轨迹进行降噪以检测大型推理模型中的幻觉

Hugging Face Daily Papers · 2026-07-24 缓存

介绍了ReDe框架,该框架通过过滤无关和重复步骤来对推理轨迹进行降噪,从而改进大型推理模型中的幻觉检测,在TruthfulQA上达到了高达87.32的AUROC。

0 人收藏 0 人点赞
#truthfulness

GrAInS:基于梯度的归因方法用于大语言模型和视觉语言模型的推理时引导

arXiv cs.CL · 2026-07-13 缓存

GrAInS 是一种基于对比梯度的归因方法,利用积分梯度识别影响最大的词元,并构建引导向量,在推理时对大语言模型(LLM)和视觉语言模型(VLM)进行引导,从而提升真实性并减少幻觉,同时不损害流畅性。

0 人收藏 0 人点赞
#truthfulness

@jchudnov: Pass@k 和自洽性在数学和代码上效果很好;多采样并验证。于是我们问:同样的技巧能否扩展……

X AI KOLs Following · 2026-07-05 缓存

一篇新论文显示,通过自洽性等方法扩展推理计算提高了LLM在数学和代码上的准确性,但在没有外部验证器的领域未能提高真实性,因为模型错误过于相关。

0 人收藏 0 人点赞
#truthfulness

ConflictScore: 识别与衡量语言模型如何处理矛盾证据

arXiv cs.CL · 2026-06-26 缓存

ConflictScore是一种新度量,用于量化语言模型在面对其基础文档中的矛盾证据时的识别能力,它将响应分解为原子声明并衡量矛盾平衡。论文还引入了ConflictBench,这是一个涵盖多种矛盾形式的基准测试,并展示了该度量可以提高TruthfulQA上的真实性。

0 人收藏 0 人点赞
#truthfulness

@elonmusk: Grok 是极致诚实的

X AI KOLs Following · 2026-06-11 缓存

Elon Musk 声称 Grok 是极致诚实的,并引用了一个说法:Fable 5 有96%的时间在说谎。

0 人收藏 0 人点赞
#truthfulness

TriEval:一种资源高效的LLM偏见、毒性及真实性评估流水线

arXiv cs.AI · 2026-06-03 缓存

TriEval是一个新的流水线,用于同时评估LLM的偏见、毒性和真实性,设计为资源高效并可在标准笔记本电脑上运行。已在Llama 3 8B、Mistral 7B、Gemma 2 9B和Claude Haiku上测试,并以开源形式发布。

0 人收藏 0 人点赞
#truthfulness

幻觉可从量化大语言模型中间层隐藏状态线性解码

arXiv cs.LG · 2026-06-03 缓存

本文研究开源量化大语言模型的隐藏状态中是否编码了线性可分的真实性信号。在三个7B-8B指令调优模型上,对单个网络中间层的线性探针在幻觉检测基准上达到0.904-1.000 AUROC,优于基于采样的方法。

0 人收藏 0 人点赞
#truthfulness

Claude让我意识到大多数AI模型优化的是自信而非真相

Reddit r/artificial · 2026-05-22

反思许多AI模型如何更注重听起来自信而非真实,以Claude为例,它似乎更注重内部一致性和逻辑诚实。

0 人收藏 0 人点赞
#truthfulness

谎言只是一个阶段:语言模型缩放中的隐藏对齐转变

arXiv cs.LG · 2026-05-20

本文识别了语言模型缩放中的一种相变:在低于关键参数数量时,推理和真实性呈负相关,但高于该值时则相互协作。它提供了用于改进跨模型家族对齐的诊断和干预措施。

0 人收藏 0 人点赞
#truthfulness

FineSteer: 大规模语言模型推理时细粒度控制的统一框架

arXiv cs.CL · 2026-04-20 缓存

FineSteer 是一个新颖的推理时控制框架,将控制分解为条件控制和细粒度向量合成两个阶段,采用子空间引导条件控制(SCS)和混合控制专家(MoSE)机制来提高安全性和真实性,同时保持模型效用。实验表明在 TruthfulQA 上相比最新方法有 7.6% 的性能提升,且效用损失最小。

0 人收藏 0 人点赞
#truthfulness

TruthfulQA:衡量模型模仿人类虚假信息的程度

OpenAI Blog · 2021-09-08 缓存

# TruthfulQA:衡量模型模仿人类虚假信息的程度 来源:[https://openai.com/index/truthfulqa/](https://openai.com/index/truthfulqa/) ## 摘要 我们提出了一个基准来衡量语言模型在生成问题答案时是否真实。该基准包含817个问题,跨越38个类别,包括卫生、法律、金融和政治。我们精心设计了一些问题,其中一些人会因为错误的信念或误解而错误地回答。要表现良好,模型必须

0 人收藏 0 人点赞
← 返回首页

提交意见反馈