单一提示不够:指令敏感性削弱嵌入模型评估

arXiv cs.CL 论文

摘要

本文通过实证表明,对指令调优嵌入模型进行单一提示评估是不够的,因为性能随提示措辞显著变化,且排行榜排名可通过提示选择被操纵。

arXiv:2605.22544v1 Announce Type: new 摘要:指令嵌入模型在最新模型中已变得常见,但每项任务仅使用单一提示进行评估。这种单点评估忽略了基于指令的方法的一个主要问题:对指令措辞的敏感性。我们针对6个嵌入模型、11个数据集和每个数据集15个任务特定提示(总共990个)进行了提示敏感性的实证研究。研究表明,报告得分歪曲了在合理提示上的得分分布。默认提示可能系统性地低估或高估性能。此外,我们还发现排行榜排名对提示选择不具有鲁棒性:通过选择有利的提示,我们研究中的任何模型都可以被提升至第一名。我们的发现表明,单一提示评估不足以评估指令调优嵌入模型,基准测试应纳入提示鲁棒性——要么通过评估多个提示,要么在报告点估计的同时报告敏感性。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:48

# 一条提示不够:指令敏感性削弱了嵌入模型评估
来源:https://arxiv.org/html/2605.22544
Kenneth Enevoldsen∗ 奥胡斯大学 kenneth\.enevoldsen@cas\.au\.dk

###### 摘要

00footnotetext:∗同等贡献。

指令嵌入模型已成为最先进模型中的常见类型,但它们的评估仅基于每个任务使用一条提示。这种单点评估忽略了一个主要问题,即基于指令的方法的一个核心问题:对指令措辞的敏感性。我们针对6个嵌入模型、11个数据集、每个数据集15条任务特定提示(总共990条)进行了提示敏感性的实证研究。我们表明,报告的分数错误地代表了在合理提示上的分数分布。默认提示既可能系统性低估也可能高估性能。此外,我们证明排行榜排名对提示选择并不稳健:通过有利地选择提示,我们研究中的任何模型都可以被提升至第一名。我们的发现表明,单提示评估对于指令微调的嵌入模型是不够的,基准测试应纳入提示鲁棒性,要么通过多提示评估,要么在报告点估计的同时报告敏感性。

代码可在我们的GitHub仓库找到111https://github.com/centre-for-humanities-computing/instruction-sensitivity-evaluation

一条提示不够:指令敏感性削弱了嵌入模型评估

Yevhen Kostiuk∗ 奥胡斯大学 ykost@cas\.au\.dk
Kenneth Enevoldsen∗ 奥胡斯大学 kenneth\.enevoldsen@cas\.au\.dk

## 1 引言与背景

嵌入是现代自然语言处理应用的基础,作为检索增强生成(RAG)、语义搜索、零样本聚类以及较新的任务(如智能体记忆)的支柱Lewis等 (2020 (https://arxiv.org/html/2605.22544#bib.bib25)); Xu等 (2026 (https://arxiv.org/html/2605.22544#bib.bib24))。最近,由Su等 (2023 (https://arxiv.org/html/2605.22544#bib.bib19))最初推广的指令微调嵌入模型已成为顶级性能嵌入模型中的常见类型,例如Qwen或e5系列Zhang等 (2025 (https://arxiv.org/html/2605.22544#bib.bib16)); Wang等 (2024 (https://arxiv.org/html/2605.22544#bib.bib11)); Enevoldsen等 (2025 (https://arxiv.org/html/2605.22544#bib.bib26))。指令(或提示)使模型能够捕捉文本任务特定的细微差别,为各种领域和目标提供了更高的灵活性。然而,虽然指令允许高度的用户灵活性,但它们也允许调整指令以获得更好的基准性能,从而对如何最好地测量、报告和比较这些模型而不夸大也不低估其能力提出了根本性挑战。

参见图注图1:我们方法的概览,显示合理提示上目前未报告的性能分布,与点估计(即报告的结果)的对比。下方展示了三种可能情况:要么报告结果代表分布,要么低于(提示缩水)或高于(提示膨胀)分布。参见图注图2:在部分评估任务和模型样本上展示的提示缩水和膨胀示例。所有分数和分布见附录A (https://arxiv.org/html/2605.22544#A1)。评估嵌入质量最常见的基准是通过beir(用于信息检索)Thakur等 (2021 (https://arxiv.org/html/2605.22544#bib.bib17)); Kamalloo等 (2024 (https://arxiv.org/html/2605.22544#bib.bib18))和多任务mteb框架实现的,其中包括流行的基准如MTEB、MMTEBMuennighoff等 (2022 (https://arxiv.org/html/2605.22544#bib.bib23)); Enevoldsen等 (2025 (https://arxiv.org/html/2605.22544#bib.bib26))。mteb使用仅一条提示(由任务或模型贡献者提供)来评估基于指令的模型。这种方法忽略了这些模型的一个决定性特征:它们对指令措辞敏感。依赖单一提示有错误代表实际模型性能的风险。此外,可以在模型实现中覆盖提示——允许自定义特定提示方案——使得模型开发者可以为给定任务选择性地选择性能最佳的提示。

当前关于提示敏感性的研究主要集中在生成式大语言模型上Wahle等 (2024 (https://arxiv.org/html/2605.22544#bib.bib2)); Leidinger等 (2023 (https://arxiv.org/html/2605.22544#bib.bib3)); Romanou等 (2026 (https://arxiv.org/html/2605.22544#bib.bib1)); Mizrahi等 (2024 (https://arxiv.org/html/2605.22544#bib.bib27)),而基于指令的嵌入模型在很大程度上仍未被探索。尽管最近的工作通过释义来应对过拟合问题Frank和Afli (2026 (https://arxiv.org/html/2605.22544#bib.bib4)),但没有工作系统地研究提示变化对嵌入评估的影响。我们的工作通过将提示作为主要变量来量化其对报告性能的影响,从而填补了这一空白。

在本文中,我们质疑单提示评估对指令微调嵌入模型的有效性。我们研究以下研究问题:

(RQ1) 指令微调嵌入模型在多大程度上对与任务相关的提示变化敏感? (RQ2) 这些变化如何影响报告的基准排名? (RQ3) 基准操控在多大程度上通过提示操控实现Qiu等 (2026 (https://arxiv.org/html/2605.22544#bib.bib8))?

为了回答这些问题,我们进行了一项实证研究,涵盖11种不同任务类型,包括检索、分类、聚类和语义文本相似度(STS)。对于每个任务,我们综合生成一组15条任务特定提示,并评估一系列不同的开源权重嵌入模型,总共产生165条提示。我们的发现表明,报告的基准分数经常错误地代表预期性能:默认提示可能作为异常值,人为地降低或抬高模型的感知质量(图1 (https://arxiv.org/html/2605.22544#S1.F1))。更关键的是,我们表明,通过对抗性选择提示,我们研究中的任何模型都可以在模拟排行榜上显得排名第一。

我们建议基准测试从单点估计过渡到多提示评估——报告分数分布或鲁棒性指标以及点估计——并且模型开发者要么优化提示鲁棒性,要么采用有限的提示方案,例如Jina v5系列所使用的Akram等 (2026 (https://arxiv.org/html/2605.22544#bib.bib14))。

## 2 方法

为了测试提示对基准性能的影响,我们从mteb(我们使用mteb中的数据集名称以确保可重复性)选择了以下多样化的任务和数据集列表:检索(MIRACLRetrievalHardNegatives.v2, Touche2020Retrieval.v3, FEVERHardNegativesZhang等 (2023 (https://arxiv.org/html/2605.22544#bib.bib29)); Thakur等 (2024 (https://arxiv.org/html/2605.22544#bib.bib39)); Thorne等 (2018 (https://arxiv.org/html/2605.22544#bib.bib38)))、分类(TweetSentimentClassification, ImdbClassification, AmazonCounterfactualClassificationBarbieri等 (2022 (https://arxiv.org/html/2605.22544#bib.bib37)); Maas等 (2011 (https://arxiv.org/html/2605.22544#bib.bib36)); O’Neill等 (2021 (https://arxiv.org/html/2605.22544#bib.bib35)))、聚类(MedrxivClusteringP2P.v2, StackExchangeClustering.v2Enevoldsen等 (2025 (https://arxiv.org/html/2605.22544#bib.bib26)); Geigle等 (2021 (https://arxiv.org/html/2605.22544#bib.bib30)))和语义相似度(STS15, STS14, STS22.v2Biçici (2015 (https://arxiv.org/html/2605.22544#bib.bib34)); Bandhakavi等 (2014 (https://arxiv.org/html/2605.22544#bib.bib33)); Chen等 (2022 (https://arxiv.org/html/2605.22544#bib.bib32)))。我们选择的任务要么源自MTEBMuennighoff等 (2022 (https://arxiv.org/html/2605.22544#bib.bib23)),要么源自MMTEBEnevoldsen等 (2025 (https://arxiv.org/html/2605.22544#bib.bib26))。为了允许与仅英语的BGE模型进行比较,我们仅评估英语子集。

对于每个任务,我们使用gpt-oss-120bOpenAI (2025 (https://arxiv.org/html/2605.22544#bib.bib10)) 配合vLLMKwon等 (2023 (https://arxiv.org/html/2605.22544#bib.bib7))的结构化输出和默认参数生成了15条提示的列表。该模型被指示基于语言、任务描述和任务名称的组合生成提示。提示经过手动评估以确保其连贯且与任务相关(见附录C (https://arxiv.org/html/2605.22544#A3)和附录D (https://arxiv.org/html/2605.22544#A4)以获取默认提示)。提示生成的设置是为了模拟真实用例,其中从业者将依赖于定制的、面向任务的提示。我们使用合成提示生成来反映真实的从业者行为并避免作者偏见对报告效果的影响。生成的提示短小(平均5.24个词,标准差2.33),与文档化的模型使用示例一致。我们验证了合成提示和人工编写的提示产生大致可比的分数分布,并且当存在差异时不影响我们的结论(见附录C (https://arxiv.org/html/2605.22544#A3))。

我们寻求评估广泛的选择,包括多语言模型:Qwen3-Embedding-0.6BZhang等 (2025 (https://arxiv.org/html/2605.22544#bib.bib16)), multilingual-e5-large-instructWang等 (2024 (https://arxiv.org/html/2605.22544#bib.bib11)), KaLM-embedding-multilingual-mini-instruct-v2.5Hu等 (2025 (https://arxiv.org/html/2605.22544#bib.bib22)),以及各种规模的英语模型:bge-small-en-v1.5, bge-base-en-v1.5和bge-large-en-v1.5Xiao等 (2023 (https://arxiv.org/html/2605.22544#bib.bib20))。我们在每个任务上针对每个任务特定提示运行模型,并将结果与mteb上报告的分数进行比较。模型的修订版本和版本信息见附录B (https://arxiv.org/html/2605.22544#A2)。

## 3 分析与讨论

参见图注图3:提示敏感性:各模型和提示的变异系数分布。我们看到某些模型在提示间具有高度方差。### 3.1 提示膨胀与缩水

我们检查报告的单提示结果是否代表模型的预期性能。在附录A (https://arxiv.org/html/2605.22544#A1)(图6 (https://arxiv.org/html/2605.22544#A1.F6))中,展示了每个模型/任务组合在各提示上的分数分布,并标注了报告的mteb分数。

我们观察到两种系统性的模式。首先,几个模型表现出**提示缩水**:报告分数远低于预期水平。例如,BGE模型在TweetSentimentClassification、AmazonCounterfactualClassification和STS22.v2任务上显示提示缩水(见图2 (https://arxiv.org/html/2605.22544#S1.F2)),其报告分数处于分布的下尾。在少数情况下,我们甚至看到报告的MTEB分数远低于主分布。这表明这些任务上这些模型使用的默认提示并非最优,且与预期性能不符。

其次,我们观察到**提示膨胀**:报告分数落在分布的上尾,夸大了预期性能。例如,Qwen3在MIRACL(见图2 (https://arxiv.org/html/2605.22544#S1.F2))任务上的报告分数与分布较高范围的一个次模重合,高于主峰。这表明默认提示产生了一个非典型的强结果。

参见图注图4:对抗性提示选择下的排行榜敏感性。我们为每个模型展示两种情景。左:模型使用其最佳提示,而其他模型使用默认提示。右:模型使用其最佳提示,而其他模型使用其最差提示。排名通过所有任务上的Borda分数计算。在两种情况下,我们都与默认配置(MTEB报告值)进行比较。
### 3.2 提示敏感性分析

为了回答RQ1,我们分析了每个模型在各任务上获得的分数分布和变异系数(CV)(见图3 (https://arxiv.org/html/2605.22544#S3.F3))。CV越高,模型对提示变化的鲁棒性越低。我们选择CV是因为它是无量纲的,允许我们比较不同任务的分数。虽然中位数CV适中(2–6%),但分布呈现长尾:对于BGE模型,单个任务的CV达到30–45%,证实了特定的模型-任务组合对提示选择高度敏感。

### 3.3 对排行榜排名的影响

针对RQ2,我们调查提示敏感性是否可以被利用来改变模型排名。由于mteb允许模型贡献者指定自定义提示,模型开发者可以选择最大化其模型分数的提示。为了模拟这一点,我们构建了对抗性排行榜配置:对于每个目标模型,我们在所有任务中为其分配表现最佳的提示,同时为所有其他模型分配其表现最差或默认的提示,并计算聚合的Borda排名。每种配置下的排名变化见图4 (https://arxiv.org/html/2605.22544#S3.F4)。

在默认提示下,KaLM和Qwen3占据第1–2位,e5-large第3位,BGE变体第4–6位。然而,在对抗性选择下,我们研究中的**每个模型都可以被提升至第1位**——包括bge-small,它在分配给最佳提示而竞争对手最差提示时从最后一名上升。这种情况并非纯假设:一个公司为部署而评估模型,自然会报告其选择模型的最佳提示案例,而竞争对手的分数反映的是任意默认值,从而产生误导性比较。

重要的是,在目标模型使用最佳提示而其他模型使用默认提示的较温和情景下,仍然产生了有意义的排名变化。例如,bge-large在此配置下从第5位上升到第3位,超过了e5-large。这表明,即使单个模型贡献者仅仅优化其提示,而没有任何针对竞争对手的对抗意图,也可能扭曲排行榜。

### 3.4 报告分数中的提示膨胀

最后,为了检查某些模型是否存在系统性过拟合(RQ3),我们分析了报告的MTEB分数与观察到的分数分布之间的对应关系。对于每个模型-任务组合,我们计算了报告分数在所得分数中的经验概率(见图5 (https://arxiv.org/html/2605.22544#S3.F5))。我们的结果揭示了一个系统性问题:大多数模型持续报告远高于其预期分数的性能,这表明实践中有利的提示选择很常见。这种模式类似于p-hackingSimmons等 (2011 (https://arxiv.org/html/2605.22544#bib.bib9)),因为它利用了评估中未披露的自由度,而并不构成对提交政策的明确违反——我们称之为**提示操控**Qiu等 (2026 (https://arxiv.org/html/2605.22544#bib.bib8)):在保持合规的同时选择性报告一个有利的提示,而不修改模型权重、训练数据或架构。重要的是,提示操控不一定是故意的:正如分析偏见一样

相似文章

Pigeonholing:不良提示导致模型崩溃并犯错

arXiv cs.CL

本文介绍了“Pigeonholing”这一现象,即不良提示导致大语言模型崩溃并重复错误,造成38-40%的性能下降。跨越10个任务和10个模型的实验表明,随着对话轮次增加,问题恶化,并提出了结合合成错误的RLVR作为缓解措施。

自改进的上下文学习

arXiv cs.CL

本文提出一种方法,通过在测试时优化固定小样本提示的连续嵌入来改进上下文学习,该方法利用模型对数概率导出的自监督置信代理,无需微调或生成令牌。