FindStatBench:评估大语言模型在组合代码合成中的表现

arXiv cs.AI 论文

摘要

FindStatBench是一个用于评估大语言模型在组合代码合成任务上的基准测试,源自一篇arXiv论文。

arXiv:2607.18260v1 公告类型:新论文 摘要:我们提出了FindStatBench,一个用于评估大语言模型在组合代码合成任务上的执行基准测试。该基准测试基于FindStat构建,包含24个类别中的2,329个任务以及552万个隐藏实例,涵盖统计合成(将对象映射到整数)和映射合成(将对象映射到对象)。每个任务给出一个数学描述以及最多五个公开输入输出示例;模型必须输出一个Python solve函数,且不允许检索、工具使用、执行反馈、投票或重新排序。提交结果通过对保留的组合对象进行精确沙盒执行来评分。我们评估了11个系统:四个闭源生产模型和七个通过同一推理提供商服务的开源权重模型。FindStatBench揭示了三个主要模式。第一,最强的开源和闭源系统在实例准确率上相差在1个百分点以内,并且一个覆盖所有系统的Oracle以及从单个中档模型进行五次采样仅能带来有限的任务准确率提升。第二,示例可能产生负面影响:多个经典双射在零示例下完美解决,但在五个示例提示下反而失败。第三,一些失败反映了输出预算机制,因为推理可能在生成代码之前耗尽可见响应。总体而言,统计合成比映射合成容易得多,某些类别准确率接近零,长提示会导致准确率急剧下降,而精确的符号规则归纳仍然脆弱。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:20

# FindStatBench:评估大型语言模型在组合代码合成中的表现
来源:https://arxiv.org/abs/2607.18260
文献工具

## 文献与引用工具

文献浏览器 切换

代码、数据、媒体

## 本文相关的代码、数据和媒体

演示

## 演示

相关论文

## 推荐与搜索工具

关于arXivLabs

## arXivLabs:与社区合作者共同进行的实验项目

arXivLabs是一个框架,允许合作者直接在我们的网站上开发和分享新的arXiv功能。

与arXivLabs合作的个人和组织都接受并认同我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。

有一个为arXiv社区增添价值的项目想法吗?**了解更多关于arXivLabs** (https://info.arxiv.org/labs/index.html)

相似文章

QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准

Hugging Face Daily Papers

# 论文页面 - QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准 来源:[https://huggingface.co/papers/2604.15151](https://huggingface.co/papers/2604.15151) ## 摘要 QuantCode\-Bench 通过测试大语言模型能否将自然语言描述转化为可在历史金融数据上正确运行的功能性代码,来评估其生成可执行交易策略的能力。

CombEval: 评估大语言模型中组合计数能力的框架

arXiv cs.AI

CombEval 是一个动态基准测试,用于评估大语言模型中的组合计数能力,通过类型化规范生成带有求解器验证答案的问题。它在直接设置和代码增强设置下测试了11种大语言模型,并发现模型在处理有序对象、不可区分元素、相对约束和嵌套依赖时存在脆弱性。

PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型

arXiv cs.AI

PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。