FindStatBench:评估大语言模型在组合代码合成中的表现
摘要
FindStatBench是一个用于评估大语言模型在组合代码合成任务上的基准测试,源自一篇arXiv论文。
arXiv:2607.18260v1 公告类型:新论文
摘要:我们提出了FindStatBench,一个用于评估大语言模型在组合代码合成任务上的执行基准测试。该基准测试基于FindStat构建,包含24个类别中的2,329个任务以及552万个隐藏实例,涵盖统计合成(将对象映射到整数)和映射合成(将对象映射到对象)。每个任务给出一个数学描述以及最多五个公开输入输出示例;模型必须输出一个Python solve函数,且不允许检索、工具使用、执行反馈、投票或重新排序。提交结果通过对保留的组合对象进行精确沙盒执行来评分。我们评估了11个系统:四个闭源生产模型和七个通过同一推理提供商服务的开源权重模型。FindStatBench揭示了三个主要模式。第一,最强的开源和闭源系统在实例准确率上相差在1个百分点以内,并且一个覆盖所有系统的Oracle以及从单个中档模型进行五次采样仅能带来有限的任务准确率提升。第二,示例可能产生负面影响:多个经典双射在零示例下完美解决,但在五个示例提示下反而失败。第三,一些失败反映了输出预算机制,因为推理可能在生成代码之前耗尽可见响应。总体而言,统计合成比映射合成容易得多,某些类别准确率接近零,长提示会导致准确率急剧下降,而精确的符号规则归纳仍然脆弱。
查看缓存全文
缓存时间: 2026/07/22 08:20
# FindStatBench:评估大型语言模型在组合代码合成中的表现 来源:https://arxiv.org/abs/2607.18260 文献工具 ## 文献与引用工具 文献浏览器 切换 代码、数据、媒体 ## 本文相关的代码、数据和媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于arXivLabs ## arXivLabs:与社区合作者共同进行的实验项目 arXivLabs是一个框架,允许合作者直接在我们的网站上开发和分享新的arXiv功能。 与arXivLabs合作的个人和组织都接受并认同我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。 有一个为arXiv社区增添价值的项目想法吗?**了解更多关于arXivLabs** (https://info.arxiv.org/labs/index.html)
相似文章
QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准
# 论文页面 - QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准 来源:[https://huggingface.co/papers/2604.15151](https://huggingface.co/papers/2604.15151) ## 摘要 QuantCode\-Bench 通过测试大语言模型能否将自然语言描述转化为可在历史金融数据上正确运行的功能性代码,来评估其生成可执行交易策略的能力。
CombEval: 评估大语言模型中组合计数能力的框架
CombEval 是一个动态基准测试,用于评估大语言模型中的组合计数能力,通过类型化规范生成带有求解器验证答案的问题。它在直接设置和代码增强设置下测试了11种大语言模型,并发现模型在处理有序对象、不可区分元素、相对约束和嵌套依赖时存在脆弱性。
语言模型在统计问题表述上的基准测试
本文介绍了StatFormBench,这是一个用于评估LLMs在统计问题表述上的基准测试,发现当前模型在分类问题和识别变量方面存在显著局限性。
CSTutorBench:面向积木编程的小型语言模型辅导能力基准测试
CSTutorBench是一个基准测试,用于评估小型语言模型在积木编程环境中作为辅导员的性能,重点关注教学行为。初步结果显示,模型在较深层的辅导技能(如避免答案泄露)上表现不佳,而提示词修订能提升分数。
RepBench:将基准测试编译为大语言模型的能力表示
RepBench是一个基于基准测试的表示探测数据层,由13,427篇基准测试论文和353个公共数据集构建,生成涵盖94种能力的46,149条探测文本。它评估了能力向量在模型和读出方法之间的迁移。