标签
本文通过分析人类对道德场景的标注,探究效价特征是否能够反映自然语言中的道德性,发现显著相关性,并在二元道德分类中实现了0.764的马修斯相关系数。
本文发现了现代大语言模型与人类脑电图信号之间共有的效价轴(V-axis),表明LLM内部表示中的一个单一方向与对情感刺激的神经反应一致。它还识别了饱和规律,解释了为何基于LLM的监督无法改善脑电图解码,以及如何利用残差多样性提升性能。