标签
本文以心理学文献中的人类言语不确定性标记为基准对大模型进行评测,并提出 VOCAL——一种基于优化的算法,可直接从大模型的输出中学习最优的标记-不确定性映射,揭示了大模型与人类在语言表达置信度方面存在的系统性差异。