combinatorial-counting

标签

Cards List
#combinatorial-counting

CombEval: 评估大语言模型中组合计数能力的框架

arXiv cs.AI · 2026-06-20 缓存

CombEval 是一个动态基准测试,用于评估大语言模型中的组合计数能力,通过类型化规范生成带有求解器验证答案的问题。它在直接设置和代码增强设置下测试了11种大语言模型,并发现模型在处理有序对象、不可区分元素、相对约束和嵌套依赖时存在脆弱性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈