truthfulqa

标签

Cards List
#truthfulqa

IDEEA:通过激活聚类匹配实现免训练的输入依赖式引导

arXiv cs.CL · 2026-09-03 缓存

IDEEA提出了一种免训练的、依赖于输入的引导方法,适用于大型语言模型,通过对激活进行聚类并使用最优匹配,在TruthfulQA上比基线提升真实性高达23.5%。

0 人收藏 0 人点赞
#truthfulqa

注意力引导的大语言模型对比解码层选择策略

arXiv cs.CL · 2026-07-28 缓存

提出了三种注意力引导的大语言模型对比解码层选择策略,在TruthfulQA上相比DoLa基线提高了事实准确性。

0 人收藏 0 人点赞
#truthfulqa

多样性指标真的在衡量多样性吗?一种能力控制下LLM集成中多数投票增益的审计

arXiv cs.CL · 2026-07-24 缓存

本文审计了LLM集成的五个多样性指标,发现它们与多数投票增益的关联与模型能力高度纠缠,且在控制能力后不稳定。唯一稳健的信号是适度的残差成对共失败关联。

0 人收藏 0 人点赞
#truthfulqa

大型语言模型响应的全面评估:多因素评分系统

arXiv cs.CL · 2026-07-09 缓存

本文提出了一种用于评估大型语言模型(LLM)响应的多因素评分系统,综合了准确性、简洁性、事实一致性、可读性和连贯性。应用于TruthfulQA数据集,揭示了主流模型的优势与局限,提供了一个透明的评估框架。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈