规范优先于生成:一个预注册、五模型配对评估的规范框架,用于评估大语言模型在涉及金钱、时间、幂等性和访问控制任务中生成的代码

Hugging Face Daily Papers 论文

摘要

本文基于一项预注册的五模型研究,评估了一个旨在通过减少大语言模型生成代码在关键领域(如资金运算和访问控制)缺陷的规范框架。该研究覆盖了金融、医疗和保险领域的任务。

由大语言模型生成的代码通过安全检查的比例,在过去四年中几乎没有提升。在受监管的后端系统中,最重要的缺陷类别包括资金运算、时间处理、重试安全性和访问控制。团队通常通过提供指令文件来应对,但迄今为止规模最大的指令文件对照研究并未发现其带来益处。本文测试了一个更具体的想法:当提示中包含一个规范——即一个说明结果必须满足条件的固定前言——时,生成的代码会得到改进。我们预注册了假设、验证方法、分析代码以及一次性生成规则,随后使用来自金融、医疗和保险实践中的50个真实后端任务,对来自五个供应商系列的五个前沿模型进行了测试。每个任务执行两次:一次是裸提示,一次是在一个267字的填充规范框架之后进行提示。九个基于确定性AST的检查器对输出进行了评分。Bandit安全扫描器(它对框架一无所知)独立地进行了评分。该规范框架在所有五个模型上都减少了缺陷(每个任务的平均发现数减少0.16至0.70项,所有经过Holm调整的符号检验均显著,所有自助法置信区间均不包含零)。在存在差异的对比中,规范框架组在100次中有95次胜出。它从未在任何领域使任何模型表现变差。Bandit在裸提示组发现了53个中等或高危问题,在规范框架组发现了11个,且方向对所有模型都一致。在模型未经提示的默认设置最弱的地方,效果最为显著:该规范框架提供了模型所缺乏的纪律。所有500个输出、提示、检查器、评分代码以及预注册信息都已发布并附有DOI,因此任何团队都无需信任作者即可复现该结果。
查看原文
查看缓存全文

缓存时间: 2026/09/30 00:13

论文页面 - 生成前规范:针对LLM生成代码在金额、时间、幂等性及访问控制任务中的规范框架预注册五模型配对评估

来源:https://huggingface.co/papers/2609.23270

摘要

大型语言模型生成的代码通过安全检查的比率在四年间几乎未变。在受监管的后端系统中,最关键的缺陷类别包括金额计算、时间处理、重试安全性和访问控制。团队通过指令文件应对,但迄今为止规模最大的受控研究发现指令文件并无效益。本文测试一个更精确的设想:当提示词包含规范框架(即声明生成结果必须满足条件的固定前言)时,生成的代码质量会提升。我们预注册了假设、反驳条件、分析代码及单次生成规则,随后通过来自五大厂商谱系的五个前沿模型,对金融、医疗和保险领域的50个真实后端任务进行测试——每个任务执行两次:一次无提示,一次前加267字填充式规范框架。九个基于AST的确定性检查器对输出进行评分,而不知晓框架的Bandit安全扫描器独立进行评分。规范框架使所有五个模型的缺陷均有所减少(平均每任务减少0.16至0.70个问题点,所有Holm校正符号检验均显著,所有自助法置信区间均排除零值)。在存在差异的测试中,规范框架组在100次对比中胜出95次。该框架从未在任何领域降低任何模型性能。Bandit在裸提示组发现53个中高危问题,在规范框架组仅发现11个,且方向性在所有模型中保持一致。当模型自身未受提示时的默认能力越弱,框架效果越显著——它提供了模型所缺失的约束力。全部500份输出、提示词、检查器、评分代码及预注册文件均通过DOI发布,任何团队无需信任作者即可复现结果。

查看arXiv页面 (https://arxiv.org/abs/2609.23270)查看PDF (https://arxiv.org/pdf/2609.23270)项目主页 (https://acuity.press/)GitHub (https://github.com/sandeep-dhuri/specification-frame)添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.23270)

在您的代理中获取此论文:

hf papers read 2609\.23270

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无模型链接本文 在模型README.md中引用arxiv.org/abs/2609.23270以从本页关联。

引用本文的数据集1

sandeepdhuriauthor/delta-frame-validation-study (https://huggingface.co/datasets/sandeepdhuriauthor/delta-frame-validation-study)

引用本文的Spaces0

暂无Space链接本文 在Space README.md中引用arxiv.org/abs/2609.23270以从本页关联。

包含本文的合集0

暂无包含本文的合集 将本文添加至合集 (https://huggingface.co/new-collection)以从本页关联。

相似文章

镜头下的Auto-DSM:面向基于LLM的DSM生成的黑盒评估框架

arXiv cs.AI

本文提出了一个黑盒评估框架,用于评估大型语言模型从结构化技术文档生成设计结构矩阵(DSM)的能力。该框架引入了可复现的度量指标和复合质量评分,结果表明,虽然LLM能够生成看似合理的DSM,但它们仍然对歧义和提示措辞敏感。

面向基础模型综合评估的细粒度基准生成

arXiv cs.LG

一种新的自动化基准生成框架能够实现基础模型的细粒度、全面评估,具有更低的错误率和更丰富的元数据,在机器学习、公司金融和个人金融基准上得到了验证。