标签
本文提出了一种无标签方法,使大型语言模型在不确定时拒绝回答,利用内部置信信号,并展示其在性能上与监督式拒绝回答调优相匹配。
GoodfireAI分享了关于使用探针改进LLM校准和检测推理忠实度的研究,以及一场使用其产品Silico通过参数分解进行定向微调的黑客马拉松。
一篇新的研究论文介绍了 RLMF(Reinforcement Learning with Metacognitive Feedback),一种两阶段方法,利用模型自身的自我判断来校准置信度并忠实地表达不确定性,在保持准确性的同时,在多种任务上实现了最先进的校准,并且比标准 RL 提升了高达 63%。
本文介绍了CAGE,一种基于反事实图的多智能体LLM系统校准方法,在TriviaQA和MMLU-Pro等基准测试上进行了评估,涵盖了多种通信拓扑结构。该方法优于现有的事后校准和LLM引导校准方法。
本文提出检索增强的语言校准(RALC),一种事后流水线方法,通过将语言置信度建模为分布并使用检索增强重写来校准大语言模型中的置信度信号。它引入了忠实度散度指标,并在多个基准测试中展示了显著改进。