超越提示工程:提示词法敏感性的系统性分析及其对质量的影响

arXiv cs.CL 论文

摘要

本文对大型语言模型中的提示词法敏感性进行了大规模分析,揭示了提示性能稳定性的缩放定律,并引入了一个自动化的Prompt-Refining Agent,以减少代码生成等任务中的性能方差。

arXiv:2608.20349v1 公告类型:新 摘要:大型语言模型 (LLMs) 对提示表面变化表现出极端的敏感性,其中微小的词法变化可以触发不成比例的性能波动。超越黑盒优化和粗粒度模板,我们首次提出了大规模的、基于n-gram词元级别的提示稳定性机制性分析,利用了一个包含132,000个提示变体的数据集。我们的研究揭示了一个基本的提示性能稳定性缩放定律:更高的平均任务性能与更低的方差和更强的提示扰动鲁棒性密切相关。我们识别了支撑这种鲁棒性的两个核心语言驱动因素:(1) 领域特定术语,它紧密锚定语义边界;(2) 显式操作指令,它形式化推理轨迹。这些元素共同约束了解释空间,有效地“锁定”了更确定性的生成行为。基于这些见解,我们引入了一个自动化的Prompt-Refining Agent,通过注入领域锚定和操作约束来系统地重构输入查询。实证评估表明,我们的方法在代码生成任务中将性能方差降低了40.7%,同时保持或提高了平均性能。这些发现为实现鲁棒的提示工程提供了一个统计上合理且机制上可解释的框架。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:08

# 超越提示工程:提示词汇敏感性及其对质量影响的系统分析

来源:https://arxiv.org/html/2608.20349

谢启鹏1,5††贡献同等, 梁梓21脚注标记:1, 吴佳飞32脚注标记:2, 陈宇飞3, 王卫正2, 马文灏42脚注标记:2, 明仲1, 杨海钦1††通讯作者, 吴开顺5
1深圳技术大学, 2香港理工大学, 3之江实验室
4香港中文大学, 5香港科技大学(广州)
1\{qxieaf@connect\.ust\.hk, wuks@hkust\-gz\.edu\.cn\}
2\{zi1415926\.liang@connect\.polyu\.hk, weizheng\.wang@ieee\.org\}
3\{wujiafei@zhejianglab\.org, cyf200409@gmail\.com\}
4wenaoma@gmail\.com
5\{yanghaiqin@sztu\.edu\.cn\}

###### 摘要

大语言模型(LLM)对表层提示变化表现出极端敏感性,微小的词汇修改可能引发不成比例的性能波动。本文超越黑箱优化与粗粒度模板,首次对提示稳定性进行大规模n-gram token级机理分析,利用包含132,000个提示变体的数据集。研究揭示了提示性能稳定性的基本缩放定律:更高的平均任务性能与更小的方差及更强的扰动鲁棒性密切相关。我们识别出支撑这种鲁棒性的两个核心语言驱动因素:(1)领域特定术语,可紧密锚定语义边界;(2)明确行动指令,可形式化推理轨迹。这些要素共同约束模型的解释空间,有效“锁定”更确定性的生成行为。基于这些发现,我们提出了自动化提示优化智能体,通过注入领域锚定与操作约束系统重构输入查询。实验评估显示,该方法在代码生成任务中将性能方差降低40.7%,同时保持或提升平均性能。这些发现为实现鲁棒提示工程提供了具有统计基础与机理可解释性的框架。

---

## 1引言

随着大语言模型的快速发展,系统评估其在不同提示表述下的鲁棒性与一致性变得日益关键Liu等人(2023a);Dong等人(2024);Mei等人(2025)。如图1(顶部)所示,提示工程常受“蝴蝶效应”困扰:即使是细微词汇变异也可能导致同一任务上的显著性能波动Lu等人(2024)。

这种现象被称为提示不稳定性,会损害可信LLM部署所需的可靠性与可重复性。尽管提示工程已成为缓解此问题的实用方案,但其仍主要依赖启发式方法与试错机制,缺乏对底层机制的原理性理解。因此,核心问题仍然存在:什么决定一个提示是否能同时实现高平均性能与风格扰动下的稳定行为?

图1:提示敏感性挑战与我们的解决方案。顶部:提示中的细微词汇变异引发剧烈性能波动(高方差)。底部:我们的自动化提示优化智能体通过注入领域特定术语与明确行动指令稳定生成过程(低方差)。

现有研究通常遵循两个主要方向。第一个方向聚焦性能优化,采用校准Zhao等人(2021)、集成Sclar等人(2024)、正则化训练Liu等人(2021)与格式混合Perez等人(2021)等技术。尽管这些方法在实践中常有效,但它们主要针对性能提升,对支配提示有效性与鲁棒性的机制洞察有限。第二个研究方向进行模板级Zhu等人(2024b);Pezeshkpour与Hruschka(2024)或解码级Sclar等人(2024)分析。然而,这些研究通常在粗粒度层面操作,难以精确揭示细粒度token模式如何影响模型鲁棒性。此外,现有敏感性分析往往过于抽象,或依赖基于梯度的显著性方法Mizrahi等人(2024)应用于小规模样本,限制了其统计效力与可推广性。

为弥合这一差距,我们采用机制导向的互补视角。我们不提出新优化技术,而是通过大规模统计检验,在前所未有的粒度层级——n-gram token级——进行提示敏感性的系统分析。与近期仅限于单个样本的基于梯度方法Mizrahi等人(2024)不同,我们分析了12,000条指令及其11种风格变体(共132,000次评估)。这使我们能揭示表征高鲁棒性提示的可解释token级模式。此外,我们揭示了连接提示平均性能与稳定性的基本缩放定律(见图1底部),为提示工程提供了新的机制性视角。

我们的主要贡献如下:

- 我们首次基于132,000个提示变体的综合数据集,进行大规模n-gram级提示敏感性统计分析,提供细粒度、统计稳健的提示行为洞察。
- 我们通过实证发现并验证了提示性能与鲁棒性之间的缩放定律,证明平均性能更高的提示在风格扰动下持续表现出更强的稳定性。
- 我们识别出支撑高鲁棒性提示的两种关键语言模式:领域特定术语与明确行动指令。基于这些发现,我们开发了自动化提示优化智能体,通过约束模型解释空间实现性能方差降低40.7%,同时保持或提升平均性能。

## 2相关工作

##### 提示工程与敏感性分析

提示工程旨在通过精心设计的输入释放LLM能力。然而研究持续表明,LLM对表层提示变化表现出超敏感性:即使是语义等价的扰动也可能引发剧烈性能波动。这一现象的普遍性被系统量化,识别出模型对虚假特征依赖与格式转变的易感性为主要原因Sclar等人(2024);Voronov等人(2024)。这种敏感性超越词汇表述延伸至上下文结构。实证证据Pezeshkpour与Hruschka(2024)揭示多选题中答案选项的排列会显著影响决策。此外在少样本学习场景Lu等人(2022)中,示例排序的影响常超过示例数量本身。为量化此类敏感性,近期研究Zhuo等人(2024);Lu等人(2024)提出基于指标的框架。例如PROSA指标Zhuo等人(2024)用于评估提示扰动下的鲁棒性,其他方法Lu等人(2024)利用基于梯度的显著性分析表征敏感性差异。然而这些方法主要在粗粒度模板层面操作,缺乏对大规模指令数据集细粒度词汇单元的系统性统计归因。

##### 提示优化与校准

为缓解提示敏感性导致的不稳定性,先前研究Zhao等人(2021);Zhou等人(2024);Yao等人(2024)探究推理时校准与训练时一致性约束。推理时,“先校准后使用”策略Zhao等人(2021)通过重新校准输出分布最小化提示间方差,另一方法Zhou等人(2024)扩展至上下文学习的批量校准。训练时,Yao等人(2024)提出提示扰动一致性学习,正则化模型在释义输入间保持输出一致。不同于那些将提示敏感性视为需消除噪声的研究,本工作认为敏感性是结构化统计现象。通过大规模细粒度分析,我们旨在揭示高性能提示的内在语言特性,从而解释其内在鲁棒性的机制。

## 3方法论

本节详细阐述基于正交重写策略的系统性提示扰动框架。与依赖随机噪声或单一释义的先验工作不同,该设计支持在真实用户输入变化下对提示进行多维度压力测试。

### 3.1系统性扰动策略

为模拟真实世界用户输入的多样性并检验模型多维度敏感性,我们定义了五种语义等价但风格迥异的重写策略。对于每条原始指令,使用Gemini-2.5-flash模型Comanici等人(2025)在每种策略下生成对应变体,详见附录A.1。

五种策略定义如下:(1) 语义等价释义(SEP):涉及大规模句法重组与同义词替换,该策略严格保持核心任务语义,同时模拟不同用户表达相同意图的自然差异Zhu等人(2024a);Moore与Shah(2025)。(2) 添加上下文信息(ACI):通过注入大量无关背景信息(如历史琐事或小说内容),挑战模型注意力稳定性,检验其从嘈杂长尾上下文中提取核心指令的能力Shi等人(2023);Yoran等人(2024)。(3) 改变格式/风格(CFS):将指令语气转换为不同语用语域(如法律、学术或休闲语体),评估模型对语言风格与正式度显著变化的鲁棒性Ngweta等人(2025)。(4) 引入模糊性(IA):通过模糊限定词(如“大约”)与条件从句引入不确定性,评估模型在面对非刚性或概率约束时推理过程的稳定性Kim等人(2024)。(5) 句法噪声(SN):模拟低质量用户输入,通过拼写错误(包括错别字与不规则空格)扰动表层形式,同时保持字符级基本可读性Liu等人(2025)。

### 3.2方法验证

我们通过检验策略集在嵌入空间中的正交性及其语言特征覆盖度,验证其作为测量工具的有效性。

#### 3.2.1扰动方向正交性

需验证不同策略探测模型能力的不同维度,而非冗余测试相同特征。为此,我们对每条重写指令计算嵌入空间中的差值向量Δv\\Delta\\mathbf{v}。

Δv=vrewrite−voriginal,\\Delta\\mathbf{v}=\\mathbf{v}\_{\\text{rewrite}}\\-\\mathbf{v}\_{\\text{original}},(1)
其中v(⋅)\\mathbf{v(\\cdot)}表示本实验使用的嵌入函数。

##### 聚类分析

对Δv\\Delta\\mathbf{v}进行主成分分析(PCA)Maćkiewicz与Ratajczak(1993)显示,不同策略的样本在投影空间中形成分离良好的独立簇。如图2所示,SN与ACI相对于原点呈现大幅位移,而IA则聚集在中心附近。

图2:差值向量的PCA可视化。每个点代表一条重写提示引发的嵌入位移;原点对应零位移。

##### 余弦相似度

我们计算不同策略Δv\\Delta\\mathbf{v}间的成对余弦相似度。图3(a)结果显示平均非对角线相似度约0.22。值得注意的是,SN与其他策略的相似度更低(≈0.12)。这些发现表明五种策略诱导高度独立的扰动方向,最小化评估冗余。

图3:(a) 扰动方向的成对余弦相似度矩阵。(b) 各策略相对于原始指令的平均语义距离,展示分级扰动谱系。(c) 词汇特征分析,显示策略在表层形式与结构上诱导可测量变异。

#### 3.2.2扰动强度覆盖度

除语义向量分析外,我们还分析词汇特征以验证非语义维度的覆盖度。

##### 字面与信息覆盖度

图3(c)的词汇特征分析表明SN产生高归一化编辑距离,有效覆盖字面与表层形式扰动。同时ACI产生显著大于1.0的长度比,实现系统信息扩展。

##### 强度谱系

我们进一步...

相似文章

基于交互的LLM提示敏感性评估与解释

arXiv cs.LG

本文介绍了一种基于交互的提示敏感性 (IPS) 指标,通过分析交互来评估和解释大语言模型中的提示敏感性。该指标应用于50个开源LLM,识别了如微调和模型规模等因素通过低阶交互降低敏感性。