linear-readouts

标签

Cards List
#linear-readouts

相同证据,不同目标:从语言模型状态解码诊断证据如何关联因果问题

arXiv cs.CL · 2天前 缓存

本文研究语言模型是否能正确判断诊断证据如何支持或挑战不同的因果主张,并引入了仅改变因果目标的配对提示。在Qwen2.5-7B-Instruct等模型的倒数第二个Transformer隐藏状态上进行的线性读出显示,平衡准确率适中(0.654-0.659),并在49对中恢复了18-21对,表明因果相关性具有一定程度的线性可解码性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈