correctness-probes

标签

Cards List
#correctness-probes

自我判断混淆下正确性探测的诊断

arXiv cs.CL · 2026-07-21 缓存

本文研究了神经网络探针在预测语言模型输出正确性时,是否真正捕捉了客观正确性还是模型自身的自我判断。通过构造两者不一致的冲突案例,作者发现可转移的方向主要保持了自我判断的极性,从而挑战了正确性读数的解释。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈