epistemic-modals

标签

Cards List
#epistemic-modals

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL · 昨天 缓存

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈