大规模提示设计:格式、指令数量和上下文长度如何影响大型语言模型的指令遵循与幻觉
摘要
本文通过在合成语料库上进行受控实验,研究了格式、指令数量和上下文长度如何影响大型语言模型(LLM)的指令遵循与幻觉。研究发现,无论何种格式,当规则数量超过80条时,指令遵循会崩溃;而回忆准确率在64-128k token之后急剧下降,且受格式影响。本文还发布了VeyraBench工具包以支持复现。
arXiv:2607.19257v1 公告类型:新
摘要:从业者在几乎没有任何受控证据支持的情况下,会做出三个提示设计决策:如何格式化指令和上下文(markdown、纯文本、散文式或表格形式);系统提示在不损害遵循度的情况下能承载多少条并发指令;以及模型在不损害回忆准确性和诚实性之前能处理多少上下文。我们报告了在两个受控实验中,对这三个因素进行交叉组合,使用一个保留的、无污染的合成语料库("Veyra之书",包含8,780个具有唯一名称的实体,可通过固定种子确定性再生),在五个模型上进行评估。
实验1(每个模型960次调用)测量了当规则数量N从10增长到160时,指令遵循的衰减情况,并与四种格式以及系统提示与用户轮次放置进行交叉。在N=80时,所有模型、格式和放置的完美响应率降至零。在大多数模型中,放置产生的影响至少与格式相当(在N=160时),但方向因模型而异。没有模型显示出可靠的markdown优势;一个35B模型反而偏好纯文本。
实验2(每个模型5,520次调用)测量了回忆准确性、虚假前提的附和以及不存在事实的捏造,使用相同的四种格式在2k到512k token的上下文阶梯上进行。回忆准确率在64-128k token内接近上限,然后急剧下降且依赖格式:一个模型在128k token时的准确率差异达到48个百分点。从未出现捏造(0/5,760次探测),附和也保持在可忽略水平(≤8.3%)。在每个模型的上下文上限附近急剧上升的是直接拒绝回答(从0%到79-90%),这与附和或捏造不同。预先注册的格式顺序均不成立,而token开销(比纯文本高22%至37%)进一步改变了在准确率差异真实存在时哪种格式更优。
我们发布了完整的工具包、语料库生成器和原始结果(VeyraBench):https://github.com/iNetanel/veyrabench
查看缓存全文
缓存时间: 2026/07/22 08:25
# 格式、指令数量与上下文长度如何影响大型语言模型的指令遵从与幻觉
来源:https://arxiv.org/html/2607.19257
Netanel Eliav 机器人类智能实验室 \(MHIL\) netanel@mhil\.orginetanel@me\.com https://mhil.org/
\(2026年7月预印本 — 提交至arXiv cs\.AI, cs\.CL 本文未经同行评审\)
###### 摘要
实践者在设计提示词时会做出三个几乎没有受控证据支持的决策:如何格式化指令和注入的上下文(markdown、纯文本、散文或表格);系统提示能承载多少条同时指令后遵从性会下降;以及在回忆和诚实性下降前,模型能容纳多少上下文。我们报告了两项受控实验,在一个受控、无污染的合成语料库(“Veyra之书”,包含8,780个唯一命名实体,可从固定种子确定性重新生成)上交叉检验了这三个因素,评估了跨越两个能力层级和三个模型系列的五种模型(Claude Sonnet 5、Claude Haiku、Gemini Flash 以及两个Qwen开源权重版本)。
实验1(每个模型960次调用)测量了指令遵从性随规则数量N从10增长到160的衰减,并与四种渲染格式以及系统提示与用户轮次放置进行交叉。完美响应率在每个模型、每种格式和两种放置方式下,当N=80时都降至零,这是一个基本与格式无关的底线效应。在N=160时,对五个模型中的四个,放置方式产生的影响至少与格式一样大,但方向是模型特定的(对两个模型有帮助,对两个有害,对一个无影响)。没有模型显示出可靠的markdown优势,一个35B开源权重模型反而稳定偏好纯文本。
实验2(完整上下文中每个模型5,520次调用)在相同四种格式下,跨越2k到512k令牌的上下文阶梯,测量了召回准确率、虚假前提谄媚和不存在事实的编造。召回在大约64–128k令牌之前保持接近上限,然后急剧且依赖格式地下降:一个模型在128k令牌时,不同格式间的准确率差距达到48个百分点;测试到512k的两个模型显示,格式准确率差距与接近每个模型自身有效上下文上限的程度成比例,而不是与绝对令牌数量成比例。编造从未发生(所有模型、梯级和格式的5,760个不存在事实探针中为0),谄媚在整个过程中保持可忽略(≤8.3%)。在每个模型自身上限附近急剧上升的是直接拒绝回答(从0%到79–90%),这是一种不同于谄媚或编造的不同故障模式。两个预先注册的格式排序均不成立:相同的格式对一个模型/梯级是性能最好的,对另一个则是最差的。考虑格式的测量令牌开销(比纯文本增加+22%到+37%)进一步改变了在存在真实准确率差距的案例中哪种格式更可取。
我们发布了完整的工具链、语料库生成器和原始结果(VeyraBench),用于精确、字节相同的复现。111https://github.com/iNetanel/veyrabench
关键词:大型语言模型;提示工程;提示格式化;markdown;指令跟随;长上下文;幻觉;谄媚;上下文窗口;基准测试;合成语料库;可复现性。arXiv分类:cs.AI(主要);cs.CL(交叉列表)
目录
## 1 引言
考虑一下2026年实践者构建基于LLM的系统时的两个常规时刻。首先,一位工程师在编写系统提示时累积了三十条,然后是八十条,接着是一百六十条同时存在的格式规则、语气约束和安全指令,并假设只要每条规则表述清晰,模型就能跟上。其次,一个检索增强型流水线将不断增长的文档存储(今天是两千令牌,明天是五十万令牌)送入单个上下文窗口,以任何摄入脚本恰好格式化的方式渲染,团队信任模型能够找到、记住并诚实报告实际存在的内容。这两个时刻都涉及关于*格式*的决策:markdown标题和项目符号、扁平纯文本、流畅散文或表格。但两者同样关乎*规模*:一次性对模型提出了多少要求,以及要求模型在记忆中容纳多少。实践者不断争论第一个问题。第二个问题通常被假设掉。
本文将其视为一个错误,并论证格式不能脱离规模来评估。一个markdown项目符号列表和一个纯文本句子可能在十条指令时表现相同,而在百条指令时急剧分化。一个表格和一个段落可能在两千令牌上下文时返回相同答案,而在五十万令牌时急剧分化。现有的受控工作研究格式敏感性时大致固定了规模(Sclar et al., 2024 (https://arxiv.org/html/2607.19257#bib.bib13); He et al., 2024 (https://arxiv.org/html/2607.19257#bib.bib4)),或者研究规模(增长指令数量、增长上下文长度)时大都没有变化格式(Zhou et al., 2023 (https://arxiv.org/html/2607.19257#bib.bib15); Jaroslawicz et al., 2025 (https://arxiv.org/html/2607.19257#bib.bib7); Liu et al., 2023 (https://arxiv.org/html/2607.19257#bib.bib9); Hong et al., 2025 (https://arxiv.org/html/2607.19257#bib.bib5))。据我们所知,没有公开可用的研究在一个受控语料库上同时交叉格式与两个规模轴(指令数量和上下文长度)。本文做到了这一点。
我们报告两个共享同一设计原则的实验。我们将相同底层内容以四种格式(markdown、纯文本、散文和markdown表格)渲染,并将每种格式沿着其自然规模轴推至极限。
**实验1(指令)**。一个系统提示或用户轮次携带N∈{10,20,40,80,120,160}条同时存在的、可通过编程验证的规则(字数范围、必需和禁止词语、精确的开头/结尾文本、段落数),以四种格式中的每一种渲染,规则块放置在系统提示或用户轮次中。我们测量由此产生的指令跟随*衰减曲线*,即遵从性如何随N增长而下降,分别按格式、放置方式和模型进行。
**实验2(上下文)**。一个确定性的、无污染的512,000令牌合成语料库(Veyra之书:8,780个唯一命名的虚构实体,具有相互交织、重叠的属性,从固定种子生成,无需LLM参与)以相同的四种格式渲染,并切分为从2,000到512,000令牌的上下文阶梯。在每个梯级,我们分别按格式和上下文长度测量召回准确率、对虚假前提的谄媚性同意以及从未陈述事实的编造。
两个实验都在五个模型上运行,这些模型跨越一个供应商内的两个能力层级(Claude Sonnet 5, Claude Haiku)和一个额外的供应商/架构点(Gemini Flash),加上一个族内开源权重尺寸比较(Qwen 27B, Qwen 35B)。表1 (https://arxiv.org/html/2607.19257#S1.T1)报告了每个查询的确切模型标识符。第2节 (https://arxiv.org/html/2607.19257#S2)将本设计定位在关于格式敏感性、指令计数缩放、结构化与非结构化上下文、长上下文谄媚和合成幻觉基准测试的最接近先前工作中。其中几项工作独立地预示了我们发现的部分内容,我们直接与之互动,而不是回避重叠。
**表1:评估模型:本文中使用的显示名称与查询的确切标识符**
*用于决定实验2中评估模型在上下文阶梯的哪些梯级的配置上限(第5节 (https://arxiv.org/html/2607.19257#S5)),在应用每个模型的实测真实令牌与预估比率乘数(1.1–1.6×,取决于供应商)作为针对模型广告窗口的安全裕度后;不一定等于每个供应商自己声明的最大值。两个Qwen模型在两个实验中都通过API禁用了扩展思维/推理生成。所有模型都在其自身供应商默认温度下采样(无温度覆盖),实验2中每个问题重复3次,实验1中每个单元格进行20次试验。
### 1.1 贡献
本文做出以下贡献:
1. **指令跟随的联合衰减与放置分析**。我们在一个指令池上比较了四种格式和两种提示放置方式(系统与用户轮次)下遵从性与N的衰减曲线。指令计数中的阈值或“拐点”衰减已被并发工作独立记录在大规模下(Jaroslawicz et al., 2025 (https://arxiv.org/html/2607.19257#bib.bib7); Harada et al., 2025 (https://arxiv.org/html/2607.19257#bib.bib3))。我们的贡献更窄且更具体:我们将该衰减曲线与格式*和*放置方式进行交叉,而先前工作这两者都没有变化。我们发现放置方式产生的影响与格式相当或更大,且方向本身是模型特定的。
2. **长上下文幻觉的四格式、四模型、六梯级因子分析**。召回错误、谄媚和编造在一个单一的、无污染语料库上,跨越2k–512k令牌的阶梯,以四种格式联合测量。据我们所知,之前没有研究同时将格式与上下文长度交叉用于所有三种故障模式。
3. **结构与语法分解**。通过在列表结构的markdown格式、表格格式、非结构化的纯格式和非结构化散文之间保持内容字节相同,我们分离了*任何*结构是否有帮助与*表格*结构是否特别有帮助。最近的工作独立显示表格在其他语料库上优于非结构化文本(Oh et al., 2024 (https://arxiv.org/html/2607.19257#bib.bib11); Liu et al., 2025 (https://arxiv.org/html/2607.19257#bib.bib10))。我们的贡献是在一个受控语料库上进行更紧密的四向分解,并额外将此问题与上下文长度交叉,而该工作没有做到这一点。
4. **令牌开销调整后的准确率**。使用真实的子词令牌计数,我们证明格式的准确率优势并不总是能在其成本下存续。在最清晰的测试案例中,转换为每令牌准确率要么逆转了明显的排名,要么强化了已更便宜格式的胜出。
5. **VeyraBench**:完整的基准测试工具链、Veyra之书语料库生成器和所有原始模型输出,从固定种子释放用于字节相同的复现。该语料库本身遵循关于合成、防泄漏基准构建的活跃工作路线(Bang et al., 2025 (https://arxiv.org/html/2607.19257#bib.bib1); Li et al., 2024 (https://arxiv.org/html/2607.19257#bib.bib8))。我们的具体贡献是一个以四种并行、内容相同格式渲染的单一语料库,专门为隔离格式效应而构建,而不是仅仅测试召回。
### 1.2 论文结构
第2节 (https://arxiv.org/html/2607.19257#S2)回顾了关于提示格式敏感性、指令计数缩放、结构化上下文、长上下文谄媚和合成基准的相关工作,并直接定位我们的贡献。第3节描述了Veyra之书语料库及其四种渲染形式。第4节和第5节介绍了实验1和实验2。第6节介绍了结构与语法分解。第7节介绍了成本调整后的准确率分析。第8节提炼了实用指南。第9节阐述了局限性。第10节概述了未来工作。第11节得出结论。
## 2 相关工作
我们的设计位于五个文献的交汇处,这些文献迄今为止在很大程度上独立发展:提示格式敏感性、指令计数缩放、结构化与非结构化上下文、长上下文谄媚和合成无污染基准。每个依次进行回顾,并明确说明我们的设计有何不同。
### 2.1 提示格式敏感性
Sclar et al. (2024 (https://arxiv.org/html/2607.19257#bib.bib13))表明,语义等效的提示仅在表面格式(间距、分隔符、大小写)上有所不同,就会在某些模型上产生高达76个百分点的准确率波动,确立了格式不是一个装饰性问题。He et al. (2024 (https://arxiv.org/html/2607.19257#bib.bib4))直接在GPT-3.5和GPT-4上比较了纯文本、markdown、JSON和YAML系统提示格式,发现没有普遍最佳格式,格式敏感性在更高能力层级下会降低但不会消失。两项研究在变化格式时大致固定了任务复杂度。两者都没有在格式旁边变化指令数量或上下文长度,这是本文增加的维度。
### 2.2 指令计数缩放
另一系列文献研究遵从性如何随着同时指令数量增长而下降,而不变化提示格式。Zhou et al. (2023 (https://arxiv.org/html/2607.19257#bib.bib15))引入了一种可验证指令方法论(IFEval),本文实验1的规则设计借鉴了该方法。Jaroslawicz et al. (2025 (https://arxiv.org/html/2607.19257#bib.bib7))将指令密度从10扩展到500条关键词包含规则,跨越20个模型和7个供应商,并为其池中最强的模型识别出一种“阈值衰减”模式——稳定表现随后在超过某个拐点时更急剧下降。Harada et al. (2025 (https://arxiv.org/html/2607.19257#bib.bib3))在多达十条同时指令上,跨五个模型系列拟合出提示级准确率与每指令准确率之间的封闭形式关系。两项工作都独立确立了随指令计数衰减是一个稳健的、现已多次复现的现象,但两者都没有将提示格式作为一个因素变化。我们的实验1测量了相同的底层衰减现象,但将其与格式以及系统与用户轮次放置进行交叉,指令计数范围更窄(10–160),但包含了这两个额外因素。
### 2.3 长上下文检索与谄媚
Liu et al. (2023 (https://arxiv.org/html/2607.19257#bib.bib9))记录了跨越六个模型系列的、按信息位置呈现的U形检索准确率曲线,Hong et al. (2025 (https://arxiv.org/html/2607.19257#bib.bib5))将退化测量扩展到18个生产模型,跨越10,000–500,000令牌范围,发现没有模型能可靠地在其完整广告窗口内检索。两项研究都没有变化注入上下文的格式。具体到谄媚,近期工作操纵的是对话或记忆上下文而非文档格式。Jain et al. (2026 (https://arxiv.org/html/2607.19257#bib.bib6))显示,随着累积的对话和记忆上下文增加,对用户先前陈述观点的同意度在38个真实用户中上升。Prasad (2026 (https://arxiv.org/html/2607.19257#bib.bib12))在一个大型非同行评审试验集(80,433次试验,6个模型)中发现,原始对话上下文长度对谄媚具有架构依赖性的影响,仅在大约20–24B有效参数以下可靠存在。该上下文的*组成*(倾向于同意与倾向于纠正的填充内容)是一个比其长度大得多的效应。我们的实验2测量谄媚,以及分开测量的直接编造和简单召回错误,作为单文档上下文长度*和*格式的联合函数,这是两个先前工作路线都没有做到的。
### 2.4 结构化与非结构化上下文
将注入的数据具体结构化为表格,而非任何结构化形式,是否能提高事实准确性?相似文章
从架构到输出:大型语言模型中幻觉的结构根源及数据的放大作用
本文分析了大型语言模型中的幻觉,将其视为三个架构决策的结构性后果:自注意力的共现学习、最大似然估计训练目标以及自回归解码的左到右承诺。它将每种机制映射到特定的幻觉类型,并论证了数据集病态会放大但不会导致这些脆弱性。
幻觉作为承诺失败:大型语言模型在知晓答案的情况下仍然犯错
本文研究了大型语言模型在其生成时间分布中已有正确答案时仍产生幻觉的现象。通过引入答案可用性的语义概念,作者表明16-47%的指令调优模型幻觉发生在正确概念已经表示的情况下,并且这一比例随着模型规模增加而上升。他们指出,指令调优强化了答案承诺,使得有用性和自信幻觉成为同一枚硬币的两面。
语言塑造多语言大语言模型中指令层级遵循度
本文介绍了XIH-Bench,一个用于评估多语言大语言模型中指令层级遵循度的基准,揭示了语言依赖的不对称性以及语言边界效应,即跨语言冲突比同语言冲突产生更高的遵循度。
词汇扰动破坏LLM推理:Attention Diversion的实证研究
本文实证研究了词汇扰动如何通过Attention Diversion破坏大语言模型推理,发现字符级噪声显著降低性能,而填充插入则影响甚微。
注意力衰减、功能标记锚定与大型语言模型中基于注意力的干预的局限性
本文研究了大型语言模型中的短期注意力衰减,发现了一种普遍的指数衰减后趋于平稳的模式,并且功能标记锚定依赖于架构。因果测试表明,增加功能标记上的注意力权重并不会改善检索性能,这表明注意力衰减是描述性的而非规范性的。