规范优先于生成:一个预注册、五模型配对评估的规范框架,用于评估大语言模型在涉及金钱、时间、幂等性和访问控制任务中生成的代码
摘要
本文基于一项预注册的五模型研究,评估了一个旨在通过减少大语言模型生成代码在关键领域(如资金运算和访问控制)缺陷的规范框架。该研究覆盖了金融、医疗和保险领域的任务。
查看缓存全文
缓存时间: 2026/09/30 00:13
论文页面 - 生成前规范:针对LLM生成代码在金额、时间、幂等性及访问控制任务中的规范框架预注册五模型配对评估
来源:https://huggingface.co/papers/2609.23270
摘要
大型语言模型生成的代码通过安全检查的比率在四年间几乎未变。在受监管的后端系统中,最关键的缺陷类别包括金额计算、时间处理、重试安全性和访问控制。团队通过指令文件应对,但迄今为止规模最大的受控研究发现指令文件并无效益。本文测试一个更精确的设想:当提示词包含规范框架(即声明生成结果必须满足条件的固定前言)时,生成的代码质量会提升。我们预注册了假设、反驳条件、分析代码及单次生成规则,随后通过来自五大厂商谱系的五个前沿模型,对金融、医疗和保险领域的50个真实后端任务进行测试——每个任务执行两次:一次无提示,一次前加267字填充式规范框架。九个基于AST的确定性检查器对输出进行评分,而不知晓框架的Bandit安全扫描器独立进行评分。规范框架使所有五个模型的缺陷均有所减少(平均每任务减少0.16至0.70个问题点,所有Holm校正符号检验均显著,所有自助法置信区间均排除零值)。在存在差异的测试中,规范框架组在100次对比中胜出95次。该框架从未在任何领域降低任何模型性能。Bandit在裸提示组发现53个中高危问题,在规范框架组仅发现11个,且方向性在所有模型中保持一致。当模型自身未受提示时的默认能力越弱,框架效果越显著——它提供了模型所缺失的约束力。全部500份输出、提示词、检查器、评分代码及预注册文件均通过DOI发布,任何团队无需信任作者即可复现结果。
查看arXiv页面 (https://arxiv.org/abs/2609.23270)查看PDF (https://arxiv.org/pdf/2609.23270)项目主页 (https://acuity.press/)GitHub (https://github.com/sandeep-dhuri/specification-frame)添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.23270)
在您的代理中获取此论文:
hf papers read 2609\.23270
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无模型链接本文 在模型README.md中引用arxiv.org/abs/2609.23270以从本页关联。
引用本文的数据集1
sandeepdhuriauthor/delta-frame-validation-study (https://huggingface.co/datasets/sandeepdhuriauthor/delta-frame-validation-study)
引用本文的Spaces0
暂无Space链接本文 在Space README.md中引用arxiv.org/abs/2609.23270以从本页关联。
包含本文的合集0
暂无包含本文的合集 将本文添加至合集 (https://huggingface.co/new-collection)以从本页关联。
相似文章
我的LLM一直实现它遇到的每个方法,所以我添加了研究和规范门控[D]
一位LLM开发者添加了研究和规范门控,以防止模型实现它遇到的每个方法,从而提高了代码生成质量。
走向安全的LLM代理:关于规范、验证与执行的综述
这篇综述论文回顾了38项关于安全LLM代理的研究,强调了关键挑战,如规范翻译瓶颈、运行时监控等执行方法的不完全安全保障,以及阻碍安全任务完成的验证者税。
无资源,无基准,没问题?评估与改进针对无资源语言的代码生成LLMs
本文通过构建基准测试并提出一种方法,将进一步预训练与权重差异迁移相结合,以更低的成本创建专门的指令遵循模型,从而解决无资源编程语言的代码生成问题。
镜头下的Auto-DSM:面向基于LLM的DSM生成的黑盒评估框架
本文提出了一个黑盒评估框架,用于评估大型语言模型从结构化技术文档生成设计结构矩阵(DSM)的能力。该框架引入了可复现的度量指标和复合质量评分,结果表明,虽然LLM能够生成看似合理的DSM,但它们仍然对歧义和提示措辞敏感。
面向基础模型综合评估的细粒度基准生成
一种新的自动化基准生成框架能够实现基础模型的细粒度、全面评估,具有更低的错误率和更丰富的元数据,在机器学习、公司金融和个人金融基准上得到了验证。