FindStatBench:评估大语言模型在组合代码合成中的表现
摘要
FindStatBench是一个用于评估大语言模型在组合代码合成任务上的基准测试,源自一篇arXiv论文。
查看缓存全文
缓存时间: 2026/07/22 08:20
# FindStatBench:评估大型语言模型在组合代码合成中的表现 来源:https://arxiv.org/abs/2607.18260 文献工具 ## 文献与引用工具 文献浏览器 切换 代码、数据、媒体 ## 本文相关的代码、数据和媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于arXivLabs ## arXivLabs:与社区合作者共同进行的实验项目 arXivLabs是一个框架,允许合作者直接在我们的网站上开发和分享新的arXiv功能。 与arXivLabs合作的个人和组织都接受并认同我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。 有一个为arXiv社区增添价值的项目想法吗?**了解更多关于arXivLabs** (https://info.arxiv.org/labs/index.html)
相似文章
QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准
# 论文页面 - QuantCode-Bench:评估大语言模型生成可执行算法交易策略能力的基准 来源:[https://huggingface.co/papers/2604.15151](https://huggingface.co/papers/2604.15151) ## 摘要 QuantCode\-Bench 通过测试大语言模型能否将自然语言描述转化为可在历史金融数据上正确运行的功能性代码,来评估其生成可执行交易策略的能力。
CombEval: 评估大语言模型中组合计数能力的框架
CombEval 是一个动态基准测试,用于评估大语言模型中的组合计数能力,通过类型化规范生成带有求解器验证答案的问题。它在直接设置和代码增强设置下测试了11种大语言模型,并发现模型在处理有序对象、不可区分元素、相对约束和嵌套依赖时存在脆弱性。
CSTutorBench:面向积木编程的小型语言模型辅导能力基准测试
CSTutorBench是一个基准测试,用于评估小型语言模型在积木编程环境中作为辅导员的性能,重点关注教学行为。初步结果显示,模型在较深层的辅导技能(如避免答案泄露)上表现不佳,而提示词修订能提升分数。
ComBench:一个用于奥林匹克级组合数学严谨证明推理与构造实现的基准
ComBench 是一个奥林匹克级组合数学基准测试,包含100道题目,旨在评估大语言模型的严谨证明推理与构造实现能力。结果表明,像GPT-5.5这样的前沿模型仅达到65.4%的总体平均分,并且这两种能力是截然不同的。
PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型
PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。