标签
本文重新评估了针对大型语言模型的未完成体悖论基准测试,识别出概念和评估上的误规范,并引入了词汇匹配的最小对以揭示模型语义推理中的充分性偏差。
斯坦福NLP宣布,一篇题为《大语言模型中的未完成体悖论》的语言学视角NLP论文在ACL 2026上获得最佳论文奖,鼓励对大语言模型进行更细致的语言学评估。