AISPA:面向用户的大语言模型应用系统提示审计

Hugging Face Daily Papers 论文

摘要

本文介绍AISPA,一个面向用户的框架,用于审计商业大语言模型应用中的系统提示。对88个产品中3,249条指令的审计揭示了保护性覆盖不一致、采用深度不足以及问题指令普遍存在的情况。

系统提示是由开发者配置的指令,用于控制AI应用中基础模型的行为。它们广泛应用于商业AI产品,但很少向公众或监管机构披露,这在AI系统的广泛部署中造成了严重的信任和责任缺口。在本文中,我们介绍了人工智能系统提示保障(AISPA),这是一个以用户为中心的框架,用于系统性地审计AI系统中的系统提示。AISPA检查系统提示的具体部分,并沿八个对用户重要的维度对其进行评估。然后,我们使用该框架审查了88个商业AI产品中系统提示的3,249条指令,将每条指令分类为保护性(对用户)或问题性。我们的审计揭示了四个核心发现。首先,系统提示设计在不同产品和开发者之间差异很大,一些组织每个产品平均包含超过60条保护性指令,而其他组织平均不到5条。其次,保护性指令被广泛采用但范围较浅:98.9%的产品包含至少一条,但只有24%覆盖了AISPA分类法的全部八个维度。第三,系统提示持续变得更长且对用户更具保护性,表明用户保护正在成为商业提示设计中一个更受关注的问题。第四,尽管取得了这些进展,问题性指令仍然普遍存在:大约40%的产品包含至少一条违背用户利益的指令,并且保护性和问题性指令常常共存于同一提示中。我们的研究结果强调了对商业AI产品中的系统提示需要更高的透明度、标准化和独立监督。
查看原文
查看缓存全文

缓存时间: 2026/08/03 05:30

论文页面 - AISPA:面向大型语言模型应用的以用户为中心的系统提示审计

来源:https://huggingface.co/papers/2607.28617 发布于 7 月 30 日

#2 今日论文 (https://huggingface.co/papers/date/2026-08-03) 作者:

摘要

系统提示(System Prompts)是由开发者配置的指令,用于管理 AI 应用中基础模型的行为。它们在商业 AI 产品中广泛使用,但很少向公众或监管机构披露,这在 AI 系统的广泛部署中造成了严重的信任与问责缺口。在本文中,我们提出了人工智能系统提示保障(AISPA)——一个以用户为中心、用于系统性审计 AI 系统提示的框架。AISPA 检查系统提示的特定部分,并沿着对用户重要的八个维度对其进行评估。然后,我们使用该框架审查了 88 个商业 AI 产品中系统提示的 3,249 条指令,将每条指令分类为“保护性”(保护用户)或“问题性”。我们的审计揭示了四个核心发现。首先,系统提示设计在不同产品和开发者之间存在显著差异,一些组织平均每个产品包含超过 60 条保护性指令,而其他组织平均不到 5 条。其次,保护性指令被广泛采用但范围较浅:98.9% 的产品至少包含一条保护性指令,但只有 24% 覆盖了 AISPA 分类法的全部八个维度。第三,系统提示已逐渐变得更长且对用户更具保护性,这表明用户保护正成为商业提示设计中一个更受关注的议题。第四,尽管取得了这些进展,问题性指令仍然普遍存在:大约 40% 的产品包含至少一条违背用户利益的指令,并且保护性与问题性指令经常共存于同一个提示中。我们的研究结果强调了在商业 AI 产品的系统提示中提高透明度、标准化和独立监督的必要性。

查看 arXiv 页面 (https://arxiv.org/abs/2607.28617) 查看 PDF (https://arxiv.org/pdf/2607.28617) 项目页面 (https://systempromptindex.org/) GitHub5 (https://github.com/SystemPromptIndex/SystemPromptIndex) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28617)

获取此论文到你的智能体中:

hf papers read 2607\.28617

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2607.28617 即可从本页链接到它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.28617 即可从本页链接到它。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2607.28617 即可从本页链接到它。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接到它。

相似文章

IntelliAudit: Using Large Language Models to Evaluate Audit Controls

arXiv cs.AI

This paper presents IntelliAudit, a retrieval-grounded multi-agent system that uses large language models to evaluate IT audit controls against evidence corpora, generating cited recommendations and remediation guidance. The authors instantiate it on ISO/IEC 27001 and find it useful for audit preparation while emphasizing the need for human oversight.

大型语言模型中的不完整提示越狱

arXiv cs.AI

本文正式定义了不完整提示越狱(IPJ),这是一种漏洞,当不完整的恶意提示导致大型语言模型生成有害的延续内容时,并分析了吸引子类型和神经元层面的防御机制。