llm-calibration

标签

Cards List
#llm-calibration

模型能否免费捕捉自身的幻觉?:无标签怀疑信号在拒绝回答任务中与标签数据集相媲美

arXiv cs.CL · 2026-08-28 缓存

本文提出了一种无标签方法,使大型语言模型在不确定时拒绝回答,利用内部置信信号,并展示其在性能上与监督式拒绝回答调优相匹配。

0 人收藏 0 人点赞
#llm-calibration

Silico(3分钟阅读)

TLDR AI · 2026-07-16 缓存

GoodfireAI分享了关于使用探针改进LLM校准和检测推理忠实度的研究,以及一场使用其产品Silico通过参数分解进行定向微调的黑客马拉松。

0 人收藏 0 人点赞
#llm-calibration

@dair_ai: 来自谷歌的新研究。LLMs 以高置信度产生幻觉,忽视自身知识边界,并错误报告不确定性…

X AI KOLs Timeline · 2026-07-02 缓存

一篇新的研究论文介绍了 RLMF(Reinforcement Learning with Metacognitive Feedback),一种两阶段方法,利用模型自身的自我判断来校准置信度并忠实地表达不确定性,在保持准确性的同时,在多种任务上实现了最先进的校准,并且比标准 RL 提升了高达 63%。

0 人收藏 0 人点赞
#llm-calibration

多智能体LLM校准的反事实图

arXiv cs.CL · 2026-06-01 缓存

本文介绍了CAGE,一种基于反事实图的多智能体LLM系统校准方法,在TriviaQA和MMLU-Pro等基准测试上进行了评估,涵盖了多种通信拓扑结构。该方法优于现有的事后校准和LLM引导校准方法。

0 人收藏 0 人点赞
#llm-calibration

检索增强的语言校准

arXiv cs.CL · 2026-05-20 缓存

本文提出检索增强的语言校准(RALC),一种事后流水线方法,通过将语言置信度建模为分布并使用检索增强重写来校准大语言模型中的置信度信号。它引入了忠实度散度指标,并在多个基准测试中展示了显著改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈