提问还是回答:多轮健康错误信息干预的决策框架
摘要
本文介绍了RO-PnR,一个决策框架,用于在多轮健康错误信息干预中学习何时提出澄清问题与提供纠正,以更少的轮次实现更高的成本调整效用。
arXiv:2608.21721v1 公告类型:新
摘要:在对话中纠正健康错误信息不仅需要提供事实反驳:用户在知识、信念和需要听到的内容上存在差异,因此有效的干预往往取决于首先提出正确的澄清问题。然而,现有方法要么立即回应,要么不加区分地探询,将澄清视为不必要或总是有益的。我们提出了奖励优化探询与响应(RO-PnR)框架,用于学习提问何时值得其成本。在每一轮中,RO-PnR在探询更多信息与承诺最终纠正之间做出选择,由轮次级奖励引导,该奖励权衡探询的预期收益与其交互成本。为了捕捉用户异质性如何影响探询价值,我们通过健康素养和信念承诺的潜在状态对每个模拟用户进行建模。实验表明,RO-PnR在三个健康错误信息数据集和三个基础模型上实现了最高的成本调整效用,比始终探询的基线少使用30%的轮次。
查看缓存全文
缓存时间: 2026/08/25 04:24
# 询问或回答:多轮健康错误信息干预的决策框架
来源:https://arxiv.org/html/2608.21721
Anirban Saha Anik
隶属机构:北德克萨斯大学
Jinyu Liu
隶属机构:北德克萨斯大学
Qitao Tan
隶属机构:佐治亚大学
\{xiaoyingsong, anirbansahaanik, jinyuliu\}@my\.unt\.edu, lingzi\.hong@unt\.edu
\{qitaotan, geng\.yuan\}@uga\.edu
Geng Yuan
隶属机构:佐治亚大学
\{xiaoyingsong, anirbansahaanik, jinyuliu\}@my\.unt\.edu, lingzi\.hong@unt\.edu
\{qitaotan, geng\.yuan\}@uga\.edu
Lingzi Hong
隶属机构:北德克萨斯大学
###### 摘要
在对话中纠正健康错误信息,不仅仅是提出事实性的反驳:用户在他们所知、所信和需要听到的内容上各不相同,因此有效的干预往往首先取决于提出恰当的澄清问题。然而,现有方法要么立即回应,要么不加区分地探询,将澄清视为不必要或总是有益的。我们提出 **奖励优化探询与响应框架**,该框架能够学习何时提问是值得付出代价的。在每个对话轮次,RO-PnR 根据一个轮次级别的奖励,在探询更多信息和给出最终纠正之间进行选择,该奖励权衡了探询的预期收益与其交互成本。为了捕捉用户异质性如何影响探询的价值,我们为每个模拟用户建模了一个沿着健康素养和信念承诺的潜在状态。实验表明,RO-PnR 在三个健康错误信息数据集和三个基础模型上,实现了最高的成本调整后效用,比总是探询的基线方法使用了约 30% 更少的对话轮次。
## 1 引言
参考图例 图1:针对同一错误信息帖子的不同策略。RO-PnR 在行动前权衡收益与成本。
健康错误信息扭曲公共卫生,破坏疫苗接种和公共卫生指导的遵从性,而基于对话的代理正成为纠正它的日益有前景的渠道。有效的纠正不仅取决于准确的事实,更取决于特定用户知道什么、相信什么以及为何相信。先前关于健康错误信息纠正的研究集中于响应本身:生成基于证据的反驳;或根据用户特征(如健康素养)进行定制。这些方法提升了单个响应的质量,但它们仅基于原始帖子内容就决定了回复,而没有与用户互动以揭示其潜在关切。
另一系列关于多轮对话的研究使用澄清问题来处理歧义,最近的决策理论方法权衡了提问的价值与其成本。然而,这些方法通常是为了澄清用户模糊的查询以完成任务而提出后续问题,并未考虑用户的潜在状态。在健康错误信息干预中,用户在知识和信念上存在差异,因此提问与直接回答的效果可能因人而异。这使得纠正成为一个决策问题,而不仅仅是一个生成问题。
在每个交互轮次,代理必须决定是使用现有信息立即回答,还是先向用户提出一个澄清问题。过于急躁地回应,会在用户的真实关切浮现之前就进行泛化的纠正(图 1a)。过于急躁地提问,在每次机会都进行探询,会浪费用户的注意力,并且当上下文已经足够时收效甚微(图 1b)。正确的行为取决于一个问题的预期收益是否超过了提问的成本。
这种权衡因用户异质性而变得更加尖锐。用户在健康素养(即他们能理解和推理的内容)和信念承诺(即他们持有错误观念的坚定程度)上各不相同。一个可能愿意修正错误的低素养用户,可能需要一个有针对性的探询;一个已经清晰表达关切的高素养用户,可能不需要任何提问;而一个坚定的信念持有者,可能恰恰需要仔细的探询来收集背景信息,以使纠正过程不那么具有对抗性。因此,提问的价值本身是依赖于用户的。未建模这种异质性的代理系统性地过度探询或探询不足。
我们提出 **奖励优化探询与响应框架**,该框架能够学习何时提问是值得付出代价的。在每个轮次,RO-PnR 基于一个轮次级别的决策奖励,在探询和响应之间进行选择,该奖励权衡了探询的预期收益与多一个问题的成本。由于探询的价值取决于隐藏的用户特征,我们为每个模拟用户建模了一个沿着健康素养和信念承诺的潜在状态,并在轮次级别的决策上训练策略。如图 1c 所示,RO-PnR 学会在上下文缺失时提出一个针对性问题,而在上下文充足时直接给出最终响应。
我们在三个健康错误信息数据集和三个基础模型上验证了这种方法。RO-PnR 实现了最高的成本调整后效用,同时比总是探询的基线方法使用了 30% 更少的对话轮次,在低素养和信念坚定的用户群体上收益最大,而这些恰恰是探询决策最重要的群体。
我们的贡献包括:
(a) 我们将健康错误信息干预构建为一个基于特定领域用户动态的 **探询或响应决策问题**,超越了先前反话语研究中的单轮次、一刀切的范式。
(b) 我们引入了 **RO-PnR**,这是一个专为健康错误信息干预定制的决策理论策略,它学习何时提问是值得的,同时考虑了用户在健康素养和信念承诺上的异质性。
## 2 相关工作
### 2.1 健康错误信息干预
关于健康错误信息干预的研究,已从通用的事实性反驳,发展到基于检索增强生成(将纠正建立在科学证据之上)以及受众感知的方法(根据用户的健康素养或信念承诺定制响应)。这些方法提升了单个响应的质量,但仍然是单轮次的:代理仅基于错误信息内容决定回复,没有与用户互动以揭示潜在关切,也没有根据新出现的信息调整响应。这在用户异质性高的环境中尤其受限,因为正确的干预取决于上下文。
### 2.2 对话中的决策理论探询
近期工作将澄清视为一个主动决策,而非默认行为。一些方法训练模型在请求模糊时选择提问或回答;另一些使用固定计划的探询,在回答前提出一组预定问题;而决策理论方法则权衡提问的收益与其通信成本。
更接近我们研究背景的工作是,引入了多轮次感知的奖励,通过模拟未来对话来评估响应的长期价值,并添加了好奇心奖励以减少关于用户潜在状态的不确定性。我们基于这一方向进行研究,将前瞻性奖励估计与明确的交互成本相结合,并将潜在用户状态建立在特定领域维度(健康素养和信念承诺)上,而非通用的用户变量。
### 2.3 用户异质性建模
近期研究通过使对话代理适应用户特定特征来调整响应,要么基于明确的用户档案进行条件生成,要么从交互中推断潜在表示。研究表明,根据用户素养水平定制的响应更有效。
我们的工作不同之处在于:(1) 我们将用户状态视为一个隐藏变量,它驱动代理的 **探询决策** 并塑造其响应;(2) 我们建模了两个相互关联的用户状态维度——健康素养和信念承诺,它们共同塑造了错误信息易感性,是健康错误信息干预的关键。
参考图例 图2:RO-PnR 框架概述。上(训练):策略根据查询和隐藏的用户状态生成候选动作;一个冻结的参考模型和奖励模型对对话进行评分,奖励比较了当前响应质量与探询的预期未来质量减去成本。通过分组归一化优势值,然后使用 GRPO 更新策略。下(推理):策略与用户进行多轮交互,在每一步决定是探询还是给出最终的自适应响应。
## 3 方法论
### 3.1 任务定义
我们将问题表述为一个在隐藏用户异质性下的多轮健康错误信息干预任务。给定一个健康错误信息帖子 x,代理与用户进行简短的对话交互,并遵循 RO-PnR 范式。在每个轮次,代理可以 **探询** 以引出用户未表达的关切,或者直接 **响应** 给出最终纠正。
### 3.2 RO-PnR 策略
该策略将干预建模为一个序贯决策问题:代理不仅要决定 **何时** 探询,还要决定 **何时** 停止收集信息并给出最终响应。令第 t 轮的对话历史为 \( h_{t}=\{x,(u_{1},a_{1}),\ldots,(u_{t-1},a_{t-1}),u_{t}\} \),其中 \( u_{t} \) 表示当前用户话语。基于 \( h_{t} \),代理选择一个动作 \( a_{t}\sim\pi(\cdot\mid h_{t}) \),其中 \( \pi \) 表示 RO-PnR 策略,且 \( a_{t}\in\{\textsc{Probe},\textsc{Respond}\} \)。在每个轮次,代理必须决定 \( h_{t} \) 中的当前信息是否足以生成最终的自适应响应,或者多问一个澄清问题是否可能带来足够的收益来证明其交互成本是合理的。因此,策略仅在获取额外用户信息的预期价值超过继续对话的成本时才选择 **探询**;否则选择 **响应**。
### 3.3 潜在用户模拟
RO-PnR 策略基于观测到的对话历史 \( h_{t} \) 运作。然而,该历史的演变取决于不同用户对干预的反应。为了捕捉这种隐藏的异质性,我们为每个模拟用户建模了一个潜在状态 \( z\in\mathcal{Z} \),该状态支配着他们对代理动作的反应。先前的工作确定了两个对于健康错误信息干预至关重要的维度:**健康素养** 和 **信念承诺**。
健康素养指用户理解和处理健康相关信息的能力,这直接影响他们如何解释证据并做出健康决策。信念承诺反映了用户持有与错误信息相关的信念的强度,以及他们对纠正性信息的抵制程度。这两个维度紧密耦合:用户对纠正的反应既取决于其理解证据的能力,也取决于其修正先前信念的意愿。因此,有效的干预必须同时考虑理解能力和信念修正的开放性。
受这些发现的启发,我们沿着这两个维度对每个用户进行建模,并将潜在状态空间定义为 \( \mathcal{Z}=\mathcal{L}\times\mathcal{B} \),其中 \( \mathcal{L} \) 表示健康素养,\( \mathcal{B} \) 表示信念承诺。参考先前工作,我们将健康素养离散化为 \( \mathcal{L}=\{\textit{functional},\ \textit{interactive},\ \textit{critical}\} \),对应于理解、应用和批判性评估健康信息能力的递增。由于没有关于信念承诺的公认分类,我们参考先前工作定义 \( \mathcal{B}=\{\textit{strong},\ \textit{hesitant},\ \textit{open}\} \),反映了对信念修正抵制程度的递减。综合来看,\( (L,B)\in\mathcal{Z} \) 提供了一个简洁的用户异质性特征,支持自适应干预。我们在附录 A 和图 3 中提供了用户建模的详细解释。
### 3.4 奖励设计
我们使用一个轮次级别的决策奖励来训练 RO-PnR 策略,该奖励分为两层,每层处理探询或响应权衡的不同方面。
(1) **前瞻性价值**。提问的价值不在于问题本身,而在于它能促成对话后期更好的干预。仅对下一个话语评分的奖励会错失这一点:一个探询可能立即增加价值不大,但能解锁长远的、显著的收益,例如更好的最终响应。因此,我们将当前可用的响应质量与探询后对话结束时的预期质量进行比较:
\[ r_{t}(\textsc{Respond}) = R(h_{t}), \]
\[ r_{t}(\textsc{Probe}) = \mathbb{E}\big[\,R(h_{\mathrm{end}})\mid h_{t},\,\textsc{Probe}\,\big], \]
其中 \( R(\cdot) \) 使用受众对齐度、个性化接地度等指标的平均值来评分对话质量。相似文章
评估大语言模型在多轮医疗对话中的误解纠正能力
本文介绍了ThReadMed-QA多轮医疗对话数据集,并评估了五种大语言模型在纠正患者误解方面的表现,发现后续轮次中性能显著下降。
一个知识引导的代理框架,用于减轻健康查询中的患者上下文歧义
本文介绍了一个知识引导的代理框架,该框架识别健康查询中缺失的患者上下文,并提出针对性的后续问题,以提高下游语言模型响应的准确性和一致性。
超越有效性:用于比较实际社会技术干预的多标准框架
本文提出了一个多标准框架来评估社会技术干预,以虚假信息为案例研究,揭示了有效性、用户接受度和实施可行性之间的权衡。
TAF-MED:大型语言模型在声明自我治疗意图下的多轮安全拒绝崩溃
介绍了TAF-MED,一个经过医生审查的500个多轮医疗安全场景基准,表明当用户声明自我治疗意图时,大型语言模型常常从安全的初始拒绝崩溃为不安全的响应。对8个大型语言模型在4000个对话中的评估发现,71.6%的对话包含不安全响应,而首轮安全性不足以作为对话安全持续性的代理指标。
优化数字治疗干预:在内生依从性下的在线学习
本文提出了一个数字治疗决策支持框架,将患者依从性建模为内生变量,并利用在线学习优化治疗建议,实现了次线性遗憾。