偏好并非干预:读者特定证据效用的结构与稳定性边界
摘要
本文研究检索增强生成中的证据效用,发现读者特定的序数偏好是稳定的,但无法可靠预测不同读者间的干预结果。
查看缓存全文
缓存时间: 2026/08/19 10:02
# 偏好不等同干预:读者特定证据效用的结构与稳定性边界
来源:https://arxiv.org/html/2608.17781
###### 摘要
机器学习系统越来越多地根据下游模型身份来调整决策,但这仅当模型特异性差异形成可复用结构而非输入局部交互时才有意义。我们在检索增强生成(RAG)场景中对此进行了检验,在该场景下,证据效用可通过受控干预来度量。在固定查询、证据、任务、评分和干预条件下,九位读者在33%的联合受影响单元上对效应方向存在分歧;读者×查询交互解释了29.8%的效用方差,而置换零假设的中位数为8.4%;且读者自选证据将F1值提高了+0.031(t=3.39)。接着我们提出更尖锐的问题:*这种异质性中哪些成分是跨查询稳定的读者属性?*通过分离三个可度量对象——证据*活跃度*、*序数偏好*和*条件有符号方向*——我们发现序数读者几何在四个独立设置中保持稳定(分半折半相关系数ρ=0.60–0.83):留一法干预、PRISM偏好、RAMDocs和RAGuard。有符号几何受任务约束:在开放式问答中较弱(0.14、0.35),尤其对误导性和无关证据;但在二元事实核查中较强(0.75),且无显著序数差距,尽管仍低于其稀疏性匹配的上界。稀疏性、解码噪声和度量伪影无法解释主要的序数-有符号差距。最后,稳定的序数相似性无法预测跨读者干预转移(神谕距离ρ=-0.27;遗憾可靠性-0.28)。读者特定效用存在,但偏好不等同干预:稳定的排序相似性并不保证辅助/损害决策的可转移性。
## 1引言
现代机器学习系统越来越多地根据消费其输出的模型身份来调整行为:检索针对不同生成器个性化,查询按模型路由,集成按成员加权。此类策略仅当观察到的模型特异性差异包含*可复用结构*(模型的稳定属性)而非随新输入消散的情境局部交互时才有效。我们在一个能异常可控地研究此问题的试验平台中探讨其成立条件:检索增强生成(RAG)中的证据效用。
RAG中的证据选择正日益针对*下游效用*进行优化:文档实际帮助生成器的程度,而非其对检索器的表面相关性。这提出了一个文献尚未清晰回答的问题:效用是否具有系统性的*读者特异性*成分?已知检索器偏好与LLM友好证据存在分歧——检索器-LLM偏好差距[4];多系统排序研究也针对不同RAG*代理*个性化检索[8];但其中代理在任务、数据集、骨干模型和策略上同时存在差异,因此仅改变读者身份的影响无法被识别。缺失的是一个受控的答案:*在固定查询、证据、任务和干预的情况下,阅读模型本身的身份是否会引发段落效用的可复现差异——如果存在,这些差异的结构是什么?*
我们同时回答这两个部分。首先,读者特定效用是真实存在的。在9位读者和100个NQ/HotpotQA查询的留一法干预中,读者在33%的联合受影响单元上对文档是辅助还是损害存在分歧(95% CI [0.283, 0.377]);在文档至少影响一对读者中一人的情况下,72%的情况只影响其中一人;每位读者的非零效用比率范围为13–37%;且读者自身测量的证据选择比其他读者选择的平均值高出+0.031 F1(按查询聚类t=3.39)。读者身份不是干扰变量——它是证据效用的一个承重轴。效用张量的方差分解进一步明晰:读者×查询交互解释了29.8%的效用方差,而零假设中位数为8.4%(p<10⁻⁴),而读者主效应仅为0.4%。涉及读者的项代数和为68%,但包含一个不可复现的三向成分(37.1%),该成分也吸收了残差变异。因此,主导的读者信号是与查询-证据上下文的交互——这种结构的稳定性必须被确立,而非假设。
其次,读者特异性并非单一现象。在证实效用存在读者差异后,我们探究这些差异是否构成一种*可复用的读者属性*——此问题对持久性读者档案和跨读者转移具有直接意义。我们表明“读者特定效用”可分解为三个具有不同跨查询稳定性的可度量对象:*活跃度*(哪些文档能影响读者)、*序数偏好*(读者如何排序候选证据)以及*条件有符号方向*(在同时影响两位读者的文档中,某文档是辅助还是损害)。这种分解很重要,因为不同系统消费不同对象:排序式监督度量序数对象,而纳入决策依赖于有符号对象——系统可能继承“读者偏好”结构而不继承任何关于干预方向的信息。
这正是我们的发现。序数读者几何在我们评估的每个设置中都*一致地跨查询稳定*(在我们留一半支上、独立PRISM偏好数据[3]、RAMDocs、RAGuard的分半信度分别为0.60/0.79/0.83/0.69)。条件有符号几何*显著更弱且受任务约束*:在开放式问答中接近下限(内部0.14;在RAMDocs上0.35)——远低于稀疏性匹配的稳定世界零假设——但在二元事实核查中非常稳定(RAGuard 0.75,无显著序数差距,尽管低于其稀疏性匹配上界):这是一个边界条件,局限于误导性和无关证据(0.10/0.09),而对部分稳定的支撑证据(0.33)则不然。
第三,该区分在下游具有实际意义。在一个真实的跨读者转移实验(9×9源-目标对,50个预注册查询,4050个单元)中,我们确立的读者特异性无法组装成可转移的结构:转移遗憾既不被行为档案预测(ρ=0.05),也不被样本内*神谕*效用距离预测(ρ=-0.27,不显著),且遗憾矩阵本身无分半信度(-0.28)。稳定的序数相似性——*确实*稳定的东西——并不授权跨读者干预决策。
#### 贡献。
- •C1 — 读者特定效用的受控表征。在固定查询、证据、任务、评分和干预的情况下,我们表明仅改变读者身份会在段落效用上产生显著且结构化的差异,并通过显著的自我读者选择优势进行行为验证——据我们所知,这是首个将读者异质性的*存在*与其成分*稳定性*分离的受控、多读者表征(§5.1)。
- •C2 — 稳定性分解及其边界。证据活跃度和序数偏好几何在四个独立设置中均跨查询稳定;条件辅助/损害几何显著更弱、受任务约束,且在开放式问答中局限于误导性/噪声证据;固定校准表明稀疏性、解码和度量伪影无法解释主要的序数-有符号差距(§5.2–§5.4)。匹配的强制选择扰动提供了提示性证据,表明约束答案空间能稳定对误导性证据的响应(§5.5)。
- •C3 — 实际后果。稳定的序数读者相似性并不为跨读者干预转移提供稳定基础(§5.6)。
## 2相关工作
#### 取决于消费者的检索与下游效用。
[4]确立了检索器相关性偏好与下游LLM可利用内容的分歧;多代理排序研究利用下游反馈为18个RAG代理个性化检索[8,7];R3AG[15]按生成器路由检索器。在所有这些工作中,消费者在任务、数据集、骨干模型和策略上同时存在差异,因此读者身份与任务混淆;我们在其他条件固定的情况下将其分离。
#### LLM特定的效用概念。
同期预印本工作提出LLM特定的段落效用,并报告效用性段落在生成器间有限转移[14]。我们独立地在受控干预下确立了读者条件效用差异,但提出不同问题:异质性中哪些成分构成跨查询的稳定读者结构。Rank4Gen[3]从PRISM学习生成器条件排序,我们用其作为序数成分的独立外部复制资源。跨读者转移的生成器无关效用重排序器[11,1]与我们的分解一致:可预测的效用主要存在于查询/证据侧及活跃度/序数结构中。
#### 冲突鲁棒性与方法论。
RAMDocs[9]和RAGuard[13]提供分类型证据(支撑/误导/噪声);MAGIC[6]评估上下文间冲突解决。此文献询问模型在冲突下*是否正确回答*;我们询问文档效应的*方向*是否为稳定读者属性——并发现不稳定性恰好集中在这些对抗性证据类型上。我们的方案建立在经典的分半信度基础上,采用分层分割和稀疏性匹配的置换校准。
## 3读者特定效用的三个稳定性
### 3.1读者与效用
*读者*是在固定部署配置下的模型端点——研究期间模型、解码策略和服务栈固定——而非架构内在特性。这使读者身份可操作,也是转移系统在部署时实际依赖的条件。
*效用算子*将(读者m、查询q、文档d)映射为相对于基线的标量U[m,q,d]。我们使用两种算子:
LOO: U[m,q,d] = score_m(q, D) − score_m(q, D \ {d}), (1)
单文档: U[m,q,d] = score_m(q, {d}) − score_m(q, ∅), (2)
其中D是top-k检索上下文,∅是闭卷条件。分数是确定性的任务度量(按数据集协议采用token-F1或精确/二元匹配)。
### 3.2三个可度量对象
从效用张量中我们推导出三种读者对几何。对于读者i、j和查询q:
- •活跃度:全支持符号一致,将零模式计为信号——文档是否影响读者。
- •序数偏好:两位读者在q上效用向量的斯皮尔曼相关性——相对偏好,即偏好对和列表式监督所捕获的对象。
- •条件有符号方向:符号一致仅限于对*两位*读者均非零的文档(双非零单元)——干预方向:辅助vs.损害。
每个对象在i和j之间诱导每个查询的距离;跨查询聚合(中位数)产生读者对距离矩阵D——该对象的*读者几何*。图1说明为何这些对象必须分离:两位读者可以完全相同地排序六篇文档(斯皮尔曼=1),同时对其三分之一的符号存在分歧。
图1:相同排序,不同过零点(示意图)。两位读者间的序数一致可能与辅助/损害符号相反共存。相对偏好监督度量前者;纳入决策依赖后者。
### 3.3稳定性作为几何的分半信度
对象的*跨查询稳定性*是其几何的分半信度:将查询分为两层各半(按数据集源,以及适用时按黄金判定),在每一半上计算D,然后跨读者对关联两个距离向量(斯皮尔曼ρ;1000次随机分割;我们报告中位数和2.5/97.5百分位数)。稳定的读者属性产生D_A ≈ D_B;查询局部交互产生不相关的两半。配对几何是基于相似性个性化所依赖的最弱对象,且不对读者档案做参数承诺;其是否足以进行档案级预测直接在§5.6中检验。
### 3.4针对稀疏性的置换校准
有符号效用是稀疏的:大多数文档不改变大多数读者的分数,因此双非零单元稀少,且*部分*分半信度损失仅来自稀疏性是可预期的。为区分测量稀疏性与真实不稳定性,每个有符号估计都针对特定支*稳定世界置换*进行校准。所有变体保留观测到的稀疏支持和相关冲突计数边际,同时施加跨查询的稳定读者对冲突倾向。内部支在每个读者对内置换观测到的冲突指标;外部支在读者对×证据位置层内置换(2000–5000次模拟)。附录E给出了两种构造。观测到的ρ远低于零假设中位数则拒绝“稀疏性解释了弱点”。一个平行零假设仅针对类型级结构校准序数稳定性;重复解码运行限制解码随机性(§6)。
### 3.5稳定性可保证什么
如果条件有符号几何稳定,那么在一个查询集上估计的读者辅助/损害模式将转移到新查询,读者档案可以一次建立并复用,且读者条件选择可以针对干预方向。如果仅序数几何稳定,排序式读者条件可能仍有效——但纳入决策和干预选择的跨读者转移不被相同证据授权。第5.6节直接检验转移后果。
## 4实验设置
### 4.1读者
内部留一半支使用9个核心读者:五个API端点(Qwen3.6-Flash、DeepSeek-V4-Flash、GLM-5.2、GPT-5.6-Luna、K3)和四个本地8-9B GGUF端点(Qwen3.5-9B-Instruct、Ministral-8B-Instruct、Llama-3.3-8B-Instruct、Llama-3.1-8B-Instruct),在单台RTX-4060主机上服务(完整名单及解码配置:附录A)。外部单文档支使用13位读者:上述9个核心读者加上Qwen3.7-Plus、Qwen3.7-Max、Qwen3.8-Max和相似文章
Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?
The paper investigates whether retrieving more evidence helps visual retrieval-augmented generation with diffusion language models, finding that unconditionally expanding evidence hurts accuracy due to semantic conflict, and proposes a training-free Entropy-Based Candidate Filter (ECF) to selectively admit evidence, improving accuracy across benchmarks.
当证据冲突时:检索增强生物医学问答中的不确定性与顺序效应
本文在冲突证据条件下评估了六个开放权重的大语言模型在生物医学问答中的表现,揭示了准确率下降和预测翻转,并提出了一个冲突感知的弃权评分,提高了选择性准确率。
为什么检索增强生成会失败:图视角
本文探讨了检索增强生成(RAG)系统即使在获取到正确证据的情况下仍然失败的原因。通过电路追踪和归因图,作者发现正确的预测展现出更深的推理路径和更分散的证据流,而失败则表现为浅层、碎片化的模式。他们提出了一个基于图的错误检测框架和有针对性的干预措施,以提高RAG的可靠性。
面向偏好变化的记忆检索
本文提出了一种针对长上下文对话系统中记忆访问与选择的统一框架,利用贝叶斯因子量化历史轮次对建模变化用户偏好的效用。实验表明,在偏好密集型任务中,该框架优于基于嵌入的检索方法。
部分证据基准:对智能体系统中授权受限证据的评估
本文提出了 Partial-Evidence-Bench,这是一个用于衡量智能体 AI 系统中“授权受限证据”失败模式的确定性基准测试。它评估模型在处理访问控制限制可见性的任务时的表现,重点考察其识别并报告信息不完整的能力,而非悄无声息地生成看似完整实则遗漏关键信息的回答。