声明级可靠性评估:实现高效测试时推理
摘要
声明级可靠性评估(CLR)是一种无需训练的框架,通过验证关键声明而非采样更多解决方案来提升LLMs的推理准确性,减少令牌消耗的同时提高性能。
查看缓存全文
缓存时间: 2026/08/17 03:45
论文页面 - 面向高效推理时验证的陈述级可靠性评估
来源:https://huggingface.co/papers/2608.11994 发布于 2023年8月12日
·
由https://huggingface.co/SenXu1123提交
Sen Xu (https://huggingface.co/SenXu1123)于2023年8月17日
摘要
陈述级可靠性评估通过验证关键陈述而非采样更多解决方案来提高推理准确性,在提升性能的同时减少了Token使用量。
我们提出陈述级证伪(https://huggingface.co/papers?q=claim-level%20falsification)作为推理时缩放(https://huggingface.co/papers?q=test-time%20scaling)的原则,并通过陈述级可靠性评估(Claim-Level Reliability Assessment)(CLR)——一个无需训练的框架来实现它,该框架将推理时计算资源从额外的解决方案采样重新分配到针对性的验证。由于整条推理链的评估常常因常规Token的信号稀释而掩盖决定性错误,CLR将每条推理链(https://huggingface.co/papers?q=reasoning%20trace)压缩为一组紧凑的、决定关键性的陈述集合,从而隔离其逻辑锚点。此外,认识到在固定模型能力下生成完全正确的解决方案固有困难,CLR将重点转移到语义证伪(https://huggingface.co/papers?q=semantic%20falsification)上。这种方法利用了构建解决方案与证伪陈述之间根本性的不对称性。构建一个有效的解决方案需要一条无懈可击的推理路径,而证伪一个错误的陈述仅需找到一个决定性的缺陷即可。这种针对负面证据的定向搜索,系统性压缩了高置信度错误推理链的生存空间,通过非线性可靠性评分(https://huggingface.co/papers?q=nonlinear%20reliability%20scoring)有效抑制了错误共识。在四个大语言模型和四个推理基准测试中,在匹配的预算下,CLR普遍优于pass@1和自一致性(self-consistency)(https://huggingface.co/papers?q=self-consistency)。例如,在GPT-OSS-20B/CMIMC25上,CLR比pass@1高出27.15个百分点,并在使用减少37.0%的Token的情况下,将自一致性(https://huggingface.co/papers?q=self-consistency)准确率从77.50%提升至82.19%。
查看arXiv页面 (https://arxiv.org/abs/2608.11994) 查看PDF (https://arxiv.org/pdf/2608.11994) GitHub1 (https://github.com/WeiboAI/CLR) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.11994)
引用本文的模型:0
无模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2608.11994 以从本页面链接。
引用本文的数据集:0
无数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2608.11994 以从本页面链接。
引用本文的Spaces:0
无Space链接本文
在Space的 README.md 中引用 arxiv.org/abs/2608.11994 以从本页面链接。
包含本文的收藏集:0
无包含本文的收藏集
将本文添加到一个收藏夹 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
LGMT:基于逻辑的变形测试用于评估LLM推理可靠性
本文介绍了LGMT,这是一个利用一阶逻辑生成语义不变测试用例以评估LLM推理可靠性的框架。在六个LLM上的实验表明,LGMT暴露了静态基准遗漏的隐藏缺陷,提示评估应侧重于逻辑不变性下的鲁棒性。
CheckRLM:检索增强推理中的有效知识-思维一致性检查
CheckRLM是一个利用检索增强生成来检测并纠正推理语言模型推理链中事实错误的框架,提升了连贯性并减少了错误累积。
CoRA: 面向可靠思维链推理的置信度-理由对齐
本文介绍了CoRA,一种基于GRPO的强化学习框架,旨在将LLM的置信度与生成的理由对齐,以提高思维链推理的可靠性,在多个基准测试中将不对齐误差降低了高达26.51%。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
通过结构不确定性量化LLM逻辑推理的一致性
本文引入结构不确定性框架,通过测量采样推理解中自偏好排名的稳定性来评估LLM推理一致性,补充了传统的答案离散度方法,用于识别不可靠的推理。