GUIDE: 生成式效用推理与决策引擎

arXiv cs.LG 论文

摘要

GUIDE是一个LLM驱动的架构,用于偏好诱导,它使用贝叶斯自适应采样和符号学习来推断人工智能对齐中的用户偏好,从而提高冷启动性能并减少推荐遗憾。

arXiv:2609.12137v1 Announce Type: new 摘要:衡量人类用户的偏好仍然是人工智能对齐的一个基本挑战。现有的诱导方法难以高效发现多维偏好或准确地将这些推断建立在领域知识之上。为了解决这个问题,我们介绍了 GUIDE,一个 LLM 驱动的诱导架构,它通过结合用于问题选择的贝叶斯自适应采样和符号表示学习来初始化特定领域的偏好模型,从而通过对话推断用户偏好。GUIDE 通过一个可扩展的类型系统,将自适应采样推广到多种诱导问题上,该系统基于参数化偏好状态的变换。GUIDE 通过一个初始化过程生成特定领域的偏好表示,该过程使用基于符号规则的学习来捕获世界知识,并基于决策替代方案的数据设置偏好维度的先验。该架构提供了可观察性和可操控性,以促进部署和分析诱导过程。在投资组合优化的计算机模拟实验中,与先前工作、仅 LLM 的基线和简化版 GUIDE 相比,GUIDE 在早期诱导交互中,针对不同用户角色,一致地提高了冷启动性能并最小化了推荐遗憾。
查看原文
查看缓存全文

缓存时间: 2026/09/14 08:35

# 指南:生成式效用推理与决策引擎
来源:https://arxiv.org/html/2609.12137

作者:Anagha Tiwari, Alexander G. Gray, Nick Feamster  
单位:芝加哥大学计算机科学系、Centaur人工智能研究所  
邮箱:[email protected], [email protected], [email protected]

作者:Brian Jabarian, Alex Imas, Alex Kale  
单位:卡内基梅隆大学海因兹学院与计算机科学学院、芝加哥大学布斯商学院、芝加哥大学计算机科学系  
邮箱:[email protected], [email protected], [email protected]

**注:** 海因兹信息系统与公共政策学院(卡内基梅隆大学),同时兼顾计算机科学学院人机交互研究所。

###### 摘要
衡量人类用户的偏好仍是人工智能对齐(AI alignment)的基本挑战。现有的偏好引导方法难以高效地发现多维偏好,或无法准确地将这些推理与领域知识相结合。为解决这一问题,我们推出了GUIDE——一个大语言模型(LLM)驱动的引导架构。它通过对话推断用户偏好,结合了贝叶斯自适应采样(用于问题选择)和符号表示学习(用于初始化特定领域的偏好模型)。GUIDE通过可扩展的参数化偏好状态变换类型系统,将自适应采样推广至多样化的引导问题。GUIDE通过使用基于符号规则学习的初始化流程来捕获世界知识,并基于决策选项数据为偏好维度设定先验,从而生成特定领域的偏好表示。该架构提供了可观察性和可控性,便于部署和分析引导过程。在投资组合优化领域的计算机模拟实验表明,与先前工作、纯大语言模型基线以及消融版GUIDE相比,GUIDE能持续改善冷启动性能,并在早期引导交互中,针对不同用户画像,最小化推荐遗憾(recommendation regret)。

## 引言
偏好引导(PE)——衡量和建模人类偏好与期望结果的过程——是知情决策和人工智能对齐的基础。例如,在金融领域,PE用于捕捉投资者的风险偏好、构建个性化投资组合、管理财务风险敞口以及支持符合监管标准(Chen et al. 2026 (https://arxiv.org/html/2609.12137#bib.bib17))。然而,未能准确捕捉用户偏好可能引入偏差、错误地表征人群特征、扭曲用户真实偏好的估计,并最终降低下游决策质量(Parapar and Radlinski 2021 (https://arxiv.org/html/2609.12137#bib.bib18))。尤其是在用户偏好复杂且异质的情境下,PE方法必须能够从微妙的人类输入中进行可靠推理(Cuthbertson and Penney 2023 (https://arxiv.org/html/2609.12137#bib.bib4); Béchard et al. 2024 (https://arxiv.org/html/2609.12137#bib.bib5))。

现有的贝叶斯方法改进了PE,但其能获取的偏好信息仍受限制。通过维护用户潜在效用函数的不确定性,选择查询问题,并用新证据更新后验分布,贝叶斯方法可以高效地识别信息量大的问题(Chapman and Fisher 2025 (https://arxiv.org/html/2609.12137#bib.bib19))。然而,当前大多数方法使用的是两项强制选择题,这在单次引导轮次中的信息增益方面存在结构性限制(Yang et al. 2021 (https://arxiv.org/html/2609.12137#bib.bib12); Vendrov et al. 2019 (https://arxiv.org/html/2609.12137#bib.bib13); Christakopoulou et al. 2016 (https://arxiv.org/html/2609.12137#bib.bib14); Guo and Sanner 2010 (https://arxiv.org/html/2609.12137#bib.bib15); Neiswanger et al. 2022 (https://arxiv.org/html/2609.12137#bib.bib9))。因此,这些方法需要从狭窄的查询范围内进行多轮引导,难以通过开放式的非结构化引导格式更自然地捕捉复杂偏好。

因此,近期研究直接使用大语言模型(LLMs)进行PE,因为它们允许用户通过自然语言对话表达偏好,并能生成信息丰富的引导问题(Li et al. 2023 (https://arxiv.org/html/2609.12137#bib.bib6); Montazeralghaem et al. 2025 (https://arxiv.org/html/2609.12137#bib.bib3))。然而,作为独立PE系统使用的大语言模型面临两个相关限制。首先,它们缺乏对偏好不确定性的显式表示,以及在多步引导中进行一致性推理的合理机制(Capstick et al. 2025 (https://arxiv.org/html/2609.12137#bib.bib16))。其次,由于其领域知识是隐式的而非显式建模的,大语言模型可能产生不一致的推理、专注于无关的对话细节、产生幻觉,最终生成与特定领域知识或用户偏好脱节的推荐(Ferrara 2023 (https://arxiv.org/html/2609.12137#bib.bib8); Yang et al. 2023 (https://arxiv.org/html/2609.12137#bib.bib7))。

这些限制促使我们将大语言模型用作结构化引导过程中的接口,而非偏好模型本身。这也表明需要人工监督和引导,以使基于大语言模型的PE过程与特定领域知识保持对齐。鉴于这些挑战,我们认为,一个能够支持多样化决策问题的PE系统必须满足三个要求:(R1) 表达性查询:能够高效地向用户提出多样化问题类型并可靠地解释其回答;(R2) 经验基础:将推理建立在限制合理偏好和结果空间的经验性领域知识之上;(R3) 可观察性:引导过程足够透明,以便于专家监督、推动系统性分析并促进跨领域适应。

我们推出了GUIDE(生成式效用推理与决策引擎),一个大语言模型辅助的PE框架,它在单一架构中满足了所有这三个要求。为此,我们贡献了:
(i) 一个贝叶斯引导框架,包含由多样化、可扩展的问题类型驱动的维度发现和偏好校准过程(满足R1);
(ii) 一个符号化领域初始化流程,用于构建可解释的规则和特定领域的群体先验(满足R2);
(iii) 一个透明结构,能够分析引导交互和输出、模型覆盖范围,并支持专家引导和监督(满足R3)。

我们在金融投资组合优化领域评估GUIDE,旨在(1)验证其在多种投资者画像中恢复真实偏好的能力,以及(2)将其性能与消融变体、纯大语言模型方法以及先前工作(特别是OPEN和PEBOL)进行比较(Handa et al. 2024 (https://arxiv.org/html/2609.12137#bib.bib2), Austin et al. 2024 (https://arxiv.org/html/2609.12137#bib.bib11))。通过这些评估,我们表明GUIDE在有限的交互预算下,持续改善了冷启动和早期轮次的推荐质量,而异质变换在后期稳定性方面引入了权衡。

我们认为GUIDE更广泛的科学贡献在于使基于大语言模型的PE方法设计更具可学习性。由于引擎的偏好表示以及生成和选择引导问题的策略是显式的、可观察的和可编辑的,我们的架构将通常纠缠在提示或模型权重中的设计选择,转变为可以系统性研究的组件。因此,我们将GUIDE呈现为一个研究引导策略、自适应问题选择以及统计与生成式AI方法之间相互作用的框架,同时为引导动力学的原理性研究提供了可能。

## 预备知识与相关工作
我们的目标是通过大语言模型辅助的问题生成,采用自适应采样方法来准确引导和表示用户偏好。我们的方法改进并扩展了OPEN框架,该框架利用贝叶斯最优实验设计来选择引导问题,以学习偏好状态的后验分布(Handa et al. (2024) (https://arxiv.org/html/2609.12137#bib.bib2))。我们改进的核心机制是基于粒子滤波器效用模型中期望信息增益(EIG)的下一问题选择。然而,OPEN仅限于对决策选项组合进行两两比较,而GUIDE支持多样化、可扩展的问题类型(例如,成对比较、规则引导、维度主导、维度提议和自由文本输入)以及对底层偏好状态的相应变换。此外,由于OPEN依赖大语言模型根据其生成的领域描述虚构决策选项的合理特征,其对用户效用模型的参数化可能在现实决策问题中缺乏预测性。为解决此问题,GUIDE的偏好维度通过一个初始化过程从真实决策选项的数据中学习,从而建立经验性基础。

**决策空间。** 存在\( K \)个决策选项。这些是具有测量特征值的特定领域推荐选项,可由开发者提供或根据先前数据生成。例如,在投资组合管理中,模型投资组合在风险等级、波动性、回报率、费用等方面进行评分。每个选项是一个归一化到单位区间的\( F \)维连续特征向量\( \mathbf{f}_k \in [0,1]^F \)。

**维度与加载映射。** 一个偏好维度\( d \)是一个潜在的评估轴(例如,“风险容忍度”),由投资组合特征上的带符号加载(signed loadings)定义,其中符号表示偏好方向,大小表示特征重要性。GUIDE支持开发者定义的初始轴以及在对话中发现并经过验证才使用的LLM提议的轴。非线性或内部偏好通过编码所需形状的特征来表示(例如,一个在股票/债券比例为50/50时达到峰值的多元化平衡特征)。定义和实现见补充材料A.1节。

**作为变换类型的引导问题。** 变换将用户对问题的回答映射为后验分布中的证据。形式上,每个变换类型为候选问题\( q \)定义了其可能回答\( y \)上的似然函数\( p(y \mid \mathbf{w}, q) \);观察到\( y \)后,每个粒子的对数后验权重被加性更新,\( \ell^{(i)} \mathrel{+}= \log p(y \mid \mathbf{w}^{(i)}, q) \),同时粒子位置保持不变。不同的变换类型使用不同的似然函数,但共享单一的更新形式,允许异质问题作用于单一共同后验。

**效用与后验。** 效用在维度得分上是线性的,\( u_k(\mathbf{w}) = \sum_d \tilde{w}_d \, \phi_d(\mathbf{f}_k) \),其中\( \mathbf{w} \in \mathbb{R}_{\geq 0}^M \)是一个非负的维度权重向量(每个维度一个权重)。我们用一组\( N \)个带权重的粒子\( \{(\mathbf{w}^{(i)}, \pi^{(i)})\} \)(默认\( N=200 \))来近似\( \mathbf{w} \)的后验分布。权重仅在计算效用时归一化,因此在对话中途通过发现添加新轴永远不会稀释现有维度权重。偏好符号编码在加载\( \phi_d \)中,因此非负权重保留了完全的表达能力。先验以及维持粒子多样性的标准退化控制程序见补充材料A.2和A.3节。

**信息状态。** 每个粒子根据递减的效用诱导出一个对选项的排序\( \sigma^{(i)} \)。排序熵\( H(\text{ranking}) = -\sum_{\sigma} \hat{P}(\sigma) \log \hat{P}(\sigma) \),其中\( \hat{P}(\sigma) = \sum_{i: \sigma^{(i)}=\sigma} \pi^{(i)} \),总结了后验分布的集中度,并提供了核心收敛度量。

**EIG概述。** GUIDE根据候选问题对排序不确定性的期望降低来评分,通过为每个可能结果反事实更新后验来计算。它在一个共同的信息增益尺度上评估所有类型的问题,并选择得分最高的问题(详见补充材料C.1节)。

**具有异质问题类型的自适应选择。** 将EIG扩展到异质问题类型带来一个挑战:贪婪最大化可能偏爱名义上一步增益更大的类型,即使这些增益很少实现,而高信息量的回答可能使后验分布集中化并损害后续推理。因此,我们使用针对粒子退化、近期问题有效性(以减少不确定性和探索)的自适应校正来增强原始EIG,同时降低已解决偏好维度的优先级(详见补充材料C.2节)。

**符号化偏好知识。** GUIDE用符号层补充其数值偏好后验,用于处理无法表示为简单轴权重的类别型和条件型偏好。规则可以是硬性的(违反的选项被取消资格)或软性的(根据用户对规则的信心和选项违反规则的程度对违反行为进行惩罚)。规则要么来自从调查数据中离线挖掘的群体级别规则,要么来自对话中引导的用户规则(详见补充材料D.3节)。

**领域知识输入。** 上述机制假设在对话开始前提供了两样东西:带有加载映射的轴集合\( \mathcal{D} \),以及权重\( \mathbf{w} \)的先验分布。GUIDE从一个特定领域的群体数据集推导出这两者:一个受访者级别的记录表,其列是调查回答和属性。因此,轴是基于对真实决策者的测量数据建立的,并且新用户的先验是基于他们匹配的群体细分来初始化的,从而避免冷启动。这需要一小部分开发者定义的输入:捕捉相关用户特征的行为变量、用于识别和分类用户的人口统计属性、提供行为证据的物品所有权指标,以及从偏好维度到代理这些维度的变量的映射(定义和示例见补充材料D.1节)。这些输入定义了GUIDE如何解释群体数据并将新用户与相关细分进行匹配,具体描述见系统架构部分。

## 系统架构
参考图1:GUIDE工作流
图1 (https://arxiv.org/html/2609.12137#Sx3.F1) 是系统架构概览。GUIDE运行一个自适应循环:它维护一个关于用户效用维度的结构化后验,在每次引导轮次后更新它,并通过一个双向两阶段控制器从问题类型族(我们称之为“变换”)中选择下一个问题。当粒子后验收敛时,它停止并推荐。

### 结构化后验状态
系统对用户的表示包含三个部分:效用权重的数值后验、符号规则集和不可变的交互日志。
1. 1. 权重后验。粒子集合\( \{(\mathbf{w}^{(i)}, \pi^{(i)})\} \)...

相似文章

统一建模与探索的生成式自动竞价

arXiv cs.AI

本文介绍了Guide框架,该框架结合了决策Transformer、Q值引导和逆动力学模块,在数字广告自动出价中平衡探索与安全性,并在公开数据集和模拟拍卖中展示了有效性。

AI推理工程指南(阅读时间约17分钟)

TLDR AI

本指南解释了AI推理工程这一学科,涵盖了预填充和解码阶段的划分、从封闭模型到开放模型的转变,以及针对延迟、吞吐量和成本的优化技术。

UniGD:一种用于工业检索的统一生成-判别框架

arXiv cs.AI

快手研究者提出UniGD,一个用于工业检索的统一生成-判别框架,将检索与相关性评分整合到单一模型中,并采用CAGE与CAM等技术来提升效果并降低延迟。在线A/B测试显示,广告收入提升5.78%,推理延迟降低33.1%。