code-augmented

标签

Cards List
#code-augmented

CombEval: 评估大语言模型中组合计数能力的框架

arXiv cs.AI · 2026-06-20 缓存

CombEval 是一个动态基准测试,用于评估大语言模型中的组合计数能力,通过类型化规范生成带有求解器验证答案的问题。它在直接设置和代码增强设置下测试了11种大语言模型,并发现模型在处理有序对象、不可区分元素、相对约束和嵌套依赖时存在脆弱性。

0 人收藏 0 人点赞
#code-augmented

SPEAR:代码增强的智能体提示优化

arXiv cs.CL · 2026-05-27 缓存

SPEAR 是一个代码增强的智能体提示优化器,它利用 Python 沙箱进行结构错误分析,在包括工业裁判任务、BBH 和 GSM8K 在内的多个 LLM 评估套件上取得了最先进的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈