AISPA:面向用户的大语言模型应用系统提示审计
摘要
本文介绍AISPA,一个面向用户的框架,用于审计商业大语言模型应用中的系统提示。对88个产品中3,249条指令的审计揭示了保护性覆盖不一致、采用深度不足以及问题指令普遍存在的情况。
查看缓存全文
缓存时间: 2026/08/03 05:30
论文页面 - AISPA:面向大型语言模型应用的以用户为中心的系统提示审计
来源:https://huggingface.co/papers/2607.28617 发布于 7 月 30 日
#2 今日论文 (https://huggingface.co/papers/date/2026-08-03) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
系统提示(System Prompts)是由开发者配置的指令,用于管理 AI 应用中基础模型的行为。它们在商业 AI 产品中广泛使用,但很少向公众或监管机构披露,这在 AI 系统的广泛部署中造成了严重的信任与问责缺口。在本文中,我们提出了人工智能系统提示保障(AISPA)——一个以用户为中心、用于系统性审计 AI 系统提示的框架。AISPA 检查系统提示的特定部分,并沿着对用户重要的八个维度对其进行评估。然后,我们使用该框架审查了 88 个商业 AI 产品中系统提示的 3,249 条指令,将每条指令分类为“保护性”(保护用户)或“问题性”。我们的审计揭示了四个核心发现。首先,系统提示设计在不同产品和开发者之间存在显著差异,一些组织平均每个产品包含超过 60 条保护性指令,而其他组织平均不到 5 条。其次,保护性指令被广泛采用但范围较浅:98.9% 的产品至少包含一条保护性指令,但只有 24% 覆盖了 AISPA 分类法的全部八个维度。第三,系统提示已逐渐变得更长且对用户更具保护性,这表明用户保护正成为商业提示设计中一个更受关注的议题。第四,尽管取得了这些进展,问题性指令仍然普遍存在:大约 40% 的产品包含至少一条违背用户利益的指令,并且保护性与问题性指令经常共存于同一个提示中。我们的研究结果强调了在商业 AI 产品的系统提示中提高透明度、标准化和独立监督的必要性。
查看 arXiv 页面 (https://arxiv.org/abs/2607.28617) 查看 PDF (https://arxiv.org/pdf/2607.28617) 项目页面 (https://systempromptindex.org/) GitHub5 (https://github.com/SystemPromptIndex/SystemPromptIndex) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28617)
获取此论文到你的智能体中:
hf papers read 2607\.28617
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2607.28617 即可从本页链接到它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.28617 即可从本页链接到它。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2607.28617 即可从本页链接到它。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到它。
相似文章
PromptAudit:审计基于LLM的漏洞检测中的提示敏感性
PromptAudit是一个受控评估框架,通过隔离提示表述对基于LLM的漏洞检测的影响,发现思维链提示在整体性能上表现最佳,同时提示敏感性必须被视为一级系统属性。
IntelliAudit: Using Large Language Models to Evaluate Audit Controls
This paper presents IntelliAudit, a retrieval-grounded multi-agent system that uses large language models to evaluate IT audit controls against evidence corpora, generating cited recommendations and remediation guidance. The authors instantiate it on ISO/IEC 27001 and find it useful for audit preparation while emphasizing the need for human oversight.
每8个AI支持提示中就有1个包含个人数据。我认为我们在以错误的方式保护LLM。
对10,000条生产环境AI支持提示的分析发现,12.4%包含个人身份信息(PII),并认为LLM安全应聚焦于数据最小化和脱敏,而不仅仅是提示注入或越狱。
你在说我的语言吗?关于多模态大语言模型中的口语遵循问题
本文解决了多模态大语言模型在ASR中的口语遵循问题,提出了一种软提示方法和新颖的度量标准来量化语言违规。它评估了三种缓解策略——零样本提示、监督微调和思维链推理——在多种语言上的效果,以提高转录保真度。
大型语言模型中的不完整提示越狱
本文正式定义了不完整提示越狱(IPJ),这是一种漏洞,当不完整的恶意提示导致大型语言模型生成有害的延续内容时,并分析了吸引子类型和神经元层面的防御机制。