检索何时有益:针对单轮心理健康问答的选择性检索

arXiv cs.CL 论文

摘要

本文研究了检索增强生成在单轮心理健康问答中的效果,并引入了一种选择性检索策略,以平衡回答的特异性和安全性。

arXiv:2609.03454v1 公告类型:新 摘要:检索增强生成(RAG)可以提高大型语言模型回答的特异性和基于性,但在单轮心理健康问答中,其效果并非普遍有益,因为用户查询常常结合情绪困扰、治疗关注和安全敏感需求。我们研究了检索在心理健康问答中何时有益或有害,以及一个轻量级选择性检索策略是否能更好地控制这一权衡。我们使用三个基于草稿的效用维度来操作化检索需求:心理教育需求、应对需求和回答特异性,以及一个基于规则的安全触发器。遵循如 coTherapist 这样的基于心理治疗的RAG系统,我们构建了一个紧凑且可控的指南语料库,包括应对策略、心理教育和安全资源。我们使用 QLoRA 在 MentalChat16K 上微调了一个指令调优的生成器,并在 CounselBench-Eval 和 CounselBench-Adv 上比较了闭书、始终检索和选择性检索设置。实验表明,检索在这一领域并非普遍有益。始终检索提高了特异性,但降低了整体质量,并引入了额外的安全敏感失败。选择性检索在低需求情况下保留了闭书行为,同时避免了无条件检索造成的额外退化,支持了检索激活是一个安全敏感控制决策的观点。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:00

# 检索何时有效:单轮心理健康问答的选择性检索策略
来源:https://arxiv.org/html/2609.03454
会议:2026年8月9-13日;韩国济州岛(KDD '26),2026年8月9-13日,韩国济州岛  
CCS:信息系统 信息检索  
CCS:计算方法 自然语言处理  
CCS:应用计算 医疗保健信息系统  
作者:Hyunseo Oh, Chong-Kwon Kim  
单位:韩国能源技术研究院,罗州,韩国  
邮箱:[[email protected]](mailto:[email protected])  
作者:Yoonhyuk Choi  
单位:淑明女子大学,首尔,韩国  
邮箱:[[email protected]](mailto:[email protected])

© 保留所有权利

###### 摘要

检索增强生成(RAG)能够提升大语言模型响应的针对性和事实依据性,但在单轮心理健康问答场景中,其效果并非始终有益——用户查询常交织着情绪困扰、治疗关切与安全敏感需求。本研究探讨检索在心理健康问答中何时有益或有害,并验证轻量级选择性检索策略能否更好地权衡此效益。我们基于草案生成后的效用维度(心理教育需求、应对支持需求与响应特异性),结合基于规则的安全触发机制,来操作化检索需求。参照coTherapist等以心理治疗为基础的RAG系统(Adhikary等,2026年),我们构建了包含应对策略、心理教育资源及安全指引的紧凑型可控指南语料库。通过QLoRA微调指令微调生成器(基于MentalChat16K数据集,Xu等,2025年),并在CounselBench-Eval(Li等,2025年)与CounselBench-Adv(Li等,2025年)测试集上对比闭卷模式、始终检索模式与选择性检索模式的效果。实验表明,检索在此领域并非普遍有益。始终检索模式虽提升响应特异性,但整体质量下降并引入额外的安全敏感失效案例。选择性检索模式能在低需求案例中保持闭卷行为特性,同时避免无差别检索导致的性能退化,证实了检索激活应作为安全敏感的控制决策。

###### 关键词

心理健康问答,检索增强生成,选择性检索,大语言模型

## 1. 引言

大语言模型(LLMs)正日益应用于心理健康支持,但开放式心理健康问答的评估与控制仍具挑战(Stade等,2024年;Li等,2025年;Badawi等,2026年;Guo等,2024年;Hua等,2025年)。与事实查询型问答不同,单一查询可能同时包含情绪困扰、症状描述、治疗关切及应对策略需求。因此,有效回应需兼具共情与特异性,同时避免过度自信的诊断、不当医疗建议或不安全指导。这使得单轮心理健康问答成为安全敏感场景——流畅的回应未必是可靠的回应。

检索增强生成(RAG)为将模型响应基于外部知识提供了自然途径(Lewis等,2020年)。然而,检索并非自动有益:检索到的段落可能过于笼统、与用户关切关联微弱或指令性过强,导致响应偏向不当临床建议(Mallen等,2023年;Hsia等,2025年)。因此,无差别添加证据虽可能提升特异性,却也可能在其他情况下引入噪声或安全风险。这促使我们采用选择性检索视角:仅在外部证据可能改善响应时使用检索。

近期自适应RAG方法通常基于查询复杂度、自我反思、事实不确定性或模型置信度决定是否检索(Jiang等,2023年;Jeong等,2024年;Asai等,2023年;Yao等,2025年)。这些标准对开放域问答有效,但未能完全捕捉心理健康支持需求。简短查询仍可能需要安全依据、应对指导或具体心理教育内容。这将核心问题从“检索平均而言是否提升心理健康问答效果”转向“哪些查询应获得外部证据支持”。

本研究将单轮心理健康问答的检索视为领域特定控制问题。心理健康问题常融合解释性依据、具体应对指导与安全边界管理,因此我们将检索效用分解为三种功能需求:心理教育、应对支持与安全依据。我们通过QLoRA微调指令微调生成器(基于MentalChat16K数据集,Xu等,2025年),并在闭卷、始终检索与选择性检索三种模式下保持生成器固定,以隔离检索策略的效应。受coTherapist等以心理治疗为基础的RAG系统启发(Adhikary等,2026年),我们构建了与上述三种功能对齐的紧凑型指南语料库。在推理时,硬安全触发机制为安全敏感查询激活检索,而轻量级效用门控仅在闭卷草案缺乏依据、应对支持或特异性时检索证据。本研究通过对检索在单轮心理健康问答中利弊的对照分析,揭示保守型检索门控如何改变质量-安全权衡。

我们的贡献总结如下:
- • 将单轮心理健康问答的检索激活构建为基于信息需求、应对支持、响应特异性与安全风险的领域特定控制问题。
- • 在同一领域适配生成器下对闭卷、始终检索与选择性检索进行对照比较,从而隔离检索策略的独立效应。
- • 通过标准评估、对抗压力测试、阈值分析与专家审核表明:无差别检索可能以提升特异性为代价导致安全敏感性能下降,而保守型选择性检索则可避免无差别检索导致的额外失效案例。

## 2. 相关工作

### 2.1. 用于心理健康问答的大语言模型

大语言模型(LLMs)与指令微调助手已展现出强大的通用语言与指令遵循能力(Brown等,2020年;Ouyang等,2022年)。其在医疗健康与患者问答场景的应用亦得到研究,模型不仅评估答案准确性,还关注临床安全性与沟通质量(Singhal等,2023年;Ayers等,2023年)。心理健康问答尤具挑战性,因为回应需平衡共情、特异性、事实谨慎性与专业边界。MentalChat16K提供了结合合成咨询问答对与匿名化干预记录的单轮心理健康对话数据集,表明轻量级LLMs可通过QLoRA微调适应咨询式响应(Xu等,2025年)。CounselBench基于临床依据维度评估开放式心理健康问答,涵盖整体质量、共情、特异性、医疗建议、事实一致性与毒性,并引入对抗性提示以暴露安全相关失效案例(Li等,2025年)。近期基准研究亦表明,心理健康领域的LLM-as-judge评估并非普遍可靠,尤其针对情感与安全敏感属性(Badawi等,2026年)。更广泛的系统综述强调,心理健康LLM系统需谨慎评估,因为幻觉、过度依赖、隐私泄露与不安全建议仍是核心风险(Guo等,2024年)。我们利用此评估背景研究更具体的设计问题:检索策略如何改变单轮心理健康问答的质量与安全。

### 2.2. 自适应RAG

检索增强生成结合了参数化模型知识与外部非参数证据,已成为知识密集型NLP的标准方法(Lewis等,2020年;Guu等,2020年;Karpukhin等,2020年;Izacard和Grave,2021年;Borgeaud等,2022年;Izacard等,2023年)。LoRA与QLoRA等参数高效适配方法使有限算力下的领域适配变得可行(Hu等,2022年;Dettmers等,2023年)。然而,检索并非普遍有益:语言模型并非对所有查询都需要外部证据(Mallen等,2023年),且噪声上下文可能使检索比闭卷生成更不可靠(Hsia等,2025年)。

自适应检索方法根据查询复杂度、自我反思、生成时信息需求、多维效用标准或模型不确定性控制检索(Asai等,2023年;Jeong等,2024年;Jiang等,2023年;Su等,2024年;Cheng等,2024年;Yao等,2025年;Huanshuo等,2025年)。这些方法主要针对事实知识缺口与生成置信度。我们则通过涉及心理教育、应对支持、响应特异性与安全的心理健康特定功能定义检索需求,并在标准与对抗性心理健康问答场景中评估生成策略。

### 2.3. 领域依据检索语料库

心理健康RAG系统需要谨慎设计语料库,因为开放网络证据可能不可靠、过于笼统或临床不当。先前心理健康系统日益依赖领域依据资源而非无限制网络检索。coTherapist从治疗手册、临床心理学文本、讲座材料及诊断或实践指南构建心理治疗知识语料库,将响应根植于专业治疗知识(Adhikary等,2026年)。此设计契合心理健康LLM研究的广泛关切:生成应由可解释且临床谨慎的资源支持,而非不受控的证据来源(Guo等,2024年;Li等,2025年;Badawi等,2026年)。基于此原理,我们未构建大规模治疗师辅助语料库,而是构建了针对单轮问答的紧凑型指南语料库,包含公开的应对策略、心理教育资源及安全导向资源。这使检索来源保持可解释性,同时让我们能分析检索何时有益或损害响应生成。

主图图1 所提选择性检索框架概览。(a) QLoRA领域适配,(b) 按来源类型组织的指南语料库BM25索引,(c) 基于草案生成的检索激活、来源路由及基于证据的响应生成。

## 3. 预备知识

我们研究单轮心理健康问答。给定用户查询q,目标是生成支持性响应y。我们使用通过领域适配基础LLM获得的生成器Mtuned(基于MentalChat16K数据集,Xu等,2025年)。在推理时,模型可选择性从由权威心理健康资源组成的小型指南语料库C检索支持证据。我们将检索视为可选干预,其对响应质量与安全的影响必须被测量而非预设。

## 4. 方法论

我们提出了一种面向单轮心理健康问答的紧凑型选择性检索框架。如图1所示,该框架包含三个阶段:(i) 基础生成器的QLoRA微调,(ii) 小型指南语料库构建与BM25检索索引(Robertson和Zaragoza,2009年),(iii) 推理时选择性检索。核心思想是将生成器微调与检索策略解耦。我们在MentalChat16K上微调单一生成器(Xu等,2025年),并在闭卷、始终检索与选择性检索三种模式下保持固定。此设计使检索策略成为主要对比中唯一变化的组件。

### 4.1. 微调基础生成器

我们使用Gemma-4-E4B-it作为基础指令微调语言模型,并通过在MentalChat16K上进行QLoRA微调(Xu等,2025年),将其适配至心理健康咨询领域。MentalChat16K提供单轮心理健康咨询问答对,与我们的单轮问答设置匹配。

令Mbase表示原始模型,Mtuned表示微调后的生成器:
(1) Mbase →[在MentalChat16K上进行QLoRA] Mtuned
我们使用Mtuned作为所有检索条件下的共享生成器。

### 4.2. 指南语料库构建

我们从公开可用的心理健康资源构建小型可控指南语料库C。其设计遵循coTherapist等以心理治疗为基础的RAG系统的语料库原理,其心理治疗知识语料库(PsyKC)使用治疗手册、临床心理学文本、讲座材料、精神病学参考及实践指南作为权威检索来源(Adhikary等,2026年)。

相似文章

高風險醫療檢索增強生成的聲明選擇性認證

arXiv cs.CL

本文針對高風險醫療檢索增強生成(RAG)提出聲明選擇性認證,將響應分解為可驗證的聲明,並根據證據進行評分,通過意圖感知選擇器產生操作(完整、部分、衝突、棄權),實現了低無支持聲明風險和高操作準確性。

当病例罕见时:面向非指南临床问答的检索基准

arXiv cs.CL

介绍 OGCaReBench,这是一个自由形式的检索基准,用于评估 LLM 在需要超越标准指南推理的临床问题上的表现。实验表明,即使是最好的模型也仅能达到 56% 的准确率,但检索增强将性能提升至 82%。