answer-correctness

标签

Cards List
#answer-correctness

思维链不忠实性的两种模式:模型出错时行为检测失效

arXiv cs.CL · 2026-07-28 缓存

本文研究了大语言模型中不忠实思维链推理的行为检测,发现答案正确性影响了检测性能:在大多数不忠实性出现的错误答案上,行为信号处于随机水平;而在正确答案上,它们提供了适度的区分能力。

0 人收藏 0 人点赞
#answer-correctness

LLM弃权的两个维度:答案正确性与问题可回答性

arXiv cs.CL · 2026-07-10 缓存

本文研究了LLM弃权的两个维度:答案正确性与问题可回答性。研究表明,单一的置信度阈值会混淆这两种失败模式,并提出了一种带有独立预算的三类选择性接受框架。在五个经过指令微调的模型上进行的实验表明,可回答性在内部是可读的,但输出置信度或自我评估难以捕捉。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈