刚硬规则,柔性偏好:融合推理、学习与优化生成个性化打包清单
摘要
本文提出了一种推理引导的学习框架,用于生成个性化且符合约束条件的旅行打包清单。该框架结合了符号规则、偏好学习与约束优化,在实际部署于iOS生产应用后,实现了高召回率和高约束满足度。
arXiv:2607.15562v1 公告类型:交叉
摘要:航空旅行打包是一项频繁且易出错的任务:清单必须个性化且感知上下文,同时在安全规则、物品依赖关系和行李限制下具有可行性。现有的打包助手要么基于模板且通用,要么基于推荐但缺乏约束,导致用户需手动修补违规项。我们提出了一种推理引导的学习框架,包含三个阶段:(1)符号引擎生成具有显式依赖结构的合规种子清单;(2)两阶段偏好学习器通过用户添加/移除行为估计包含效用和优先级效用,同时减轻幸存者偏差;(3)CP-SAT优化器选择紧凑且合规的子集。该架构实例化了一种泛化的约束个性化模式,适用于硬可行性约束与稀疏偏好信号共存的场景。在604个标记旅行场景(含29K个包含标签和343K对比较)上,符号引擎达到了99.7%的召回率和0.96的规则有效性,而前沿LLM仅为0.78至0.81。梯度提升树和LambdaMART分别达到了0.943的AUC-ROC和0.923的NDCG@5。CP-SAT实现了100%的约束满足度,而贪婪选择和随机选择分别为28%和10%。在iOS旅行应用FlyEnJoy中的实际部署使清单完成度翻倍,并减少了编辑和完成时间。
查看缓存全文
缓存时间: 2026/07/20 09:27
# 硬规则,软偏好:融合推理、学习与优化的个性化打包清单生成 来源:https://arxiv.org/html/2607.15562 Himel Dev¹, Madhusudan Basak², Tanmoy Sen³, Paromita Shome², Bashima Islam² ¹529 Tech LLC, ²马萨诸塞大学阿默斯特分校, ³弗吉尼亚大学 [email protected], [email protected], [email protected], [email protected], [email protected] 美国 (2026) ###### 摘要 航空旅行打包是一项重复且易出错的任务:清单必须个性化且情境感知,同时又要满足安全规则、物品依赖和行李限制。现有的打包助手要么是模板驱动的(通用型),要么是推荐驱动的但无约束条件,导致用户不得不手动修补监管和容量违规问题。我们提出一个推理引导的学习框架,包含三个阶段:(1)一个符号引擎,生成一个符合监管要求且具有显式依赖结构的种子清单;(2)一个两阶段偏好学习器,通过用户的添加和移除行为来估计包含效用和优先级效用,从而减轻幸存者偏差;(3)一个 CP-SAT 优化器,选择紧凑且合规的子集。该架构实现了一种约束个性化的一般模式,适用于硬可行性要求与稀疏偏好信号并存的场景。在 604 个带标签的旅行场景(29K 包含标签,343K 成对比较)上,符号引擎达到了 99.7% 的召回率和 0.96 的评分有效性(相比之下,前沿大语言模型为 0.78 到 0.81);梯度提升树和 LambdaMART 分别达到了 AUC-ROC 0.943 和 NDCG@5 0.923;CP-SAT 达到了 100% 的约束满足率(相比之下,贪心算法为 28%,随机算法为 10%)。在生产级 iOS 旅行应用 FlyEnJoy 中的部署使清单完成量翻倍,并减少了编辑和完成时间。为了支持可重复性,我们公开发布了清单系统的 Python 实现以及示例数据。¹¹11 https://github.com/Official529Tech/rlo-checklist 个性化,约束优化,混合AI ††版权:acmlicensed ††期刊年份:2026 ††DOI:XXXXXXX.XXXXXXX ††会议:请从您的权利确认邮件中输入正确的会议标题;2026年2月1日;美国 ††ISBN:978-1-4503-XXXX-X/2018/06 ## 1. 引言 航空旅行打包是一项重复且易出错的任务,涉及不可协商的监管(美国运输安全管理局,2026b (https://arxiv.org/html/2607.15562#bib.bib51))、安全(美国运输安全管理局,2026a (https://arxiv.org/html/2607.15562#bib.bib52))、容量和依赖约束。对于每次旅行,旅客必须根据旅行背景(目的地、时长、活动、特殊需求)进行调整,同时遵守这些约束以及个人偏好。遗漏必需品、过度打包或违反随身行李规定是常见问题,会导致不便、额外费用以及合规或安全风险。 见图注 图1. 系统架构。第一阶段通过符号规则生成一个高召回率、符合法规的种子清单。第二阶段从用户编辑中学习相关性、优先级和情境感知效用。第三阶段通过约束优化在硬约束下选择并分配物品。一项针对 2000 名美国成年人的 2024 年调查发现,十分之九的受访者在途中意识到自己忘记了某些必需品,最常见的是手机充电器、洗漱用品、防晒霜或药物(Talker Research, 2024 (https://arxiv.org/html/2607.15562#bib.bib1))。42% 的人表示这些遗漏对旅行体验产生了负面影响,这凸显了超越记忆或静态清单的决策支持需求。随身行李的液体限制和与电池相关的限制(美国运输安全管理局,2026b (https://arxiv.org/html/2607.15562#bib.bib51);美国联邦航空管理局,2026 (https://arxiv.org/html/2607.15562#bib.bib54))进一步提高了要求:一个有用的系统必须保证可行性,而不仅仅是建议物品。 对于有特殊需求的旅客,合规失败发生在安检处,而不仅仅是在目的地。携带婴儿旅行的父母可以携带超过标准随身行李液体限制的母乳和配方奶粉,但前提是他们要向 TSA 单独申报进行筛查。胰岛素使用者必须确保随行的冰袋在安检处保持冻结状态,否则将受限于 3-1-1 规则。携带液体药物的孕妇必须援引 TSA 医疗豁免和申报程序。这些不是偏好,而是根据旅客档案不同的监管要求,无法通过一刀切的模板来满足。 尽管有这种需求,现有的打包助手(Lim 等人,2024 (https://arxiv.org/html/2607.15562#bib.bib47);Nikam 等人,2025 (https://arxiv.org/html/2607.15562#bib.bib48);Ravi 和 Negi,2025 (https://arxiv.org/html/2607.15562#bib.bib28);Regin 和 Rajest,2024 (https://arxiv.org/html/2607.15562#bib.bib46))在很大程度上未能对可行性进行建模,并且只能提供有限的个性化。基于模板的清单(Sarkis, Christine, 2024 (https://arxiv.org/html/2607.15562#bib.bib55);Canva, 2026 (https://arxiv.org/html/2607.15562#bib.bib56))易于部署,但忽略了背景(例如,寒冷气候的保暖衣物)、个人偏好和物品间依赖关系(例如,相机意味着需要充电器和存储卡)。基于学习的推荐系统可以实现个性化,但受到稀疏的每用户历史记录、广泛的旅行差异以及主要是隐式反馈的阻碍。关键的是,无约束的推荐系统无法保证在上述硬约束下的可行性,而当约束相互影响时,简单的后过滤会破坏覆盖率或依赖关系。最先进的大型语言模型也好不到哪里去。在我们的评估中(第 4 节 (https://arxiv.org/html/2607.15562#S4)),前沿大型语言模型在涵盖 TSA 合规性、天气适宜性、活动需求和完整性的评分标准上仅达到 78% 到 81% 的有效性,而我们的符号引擎则为 96%。 为了解决这个问题,我们提出了一个推理引导的学习框架,用于生成个性化的打包清单,同时保证在硬约束下的可行性。该系统(图1 (https://arxiv.org/html/2607.15562#S1.F1))将任务分解为三个阶段,每个阶段解决一个模板式和不受约束的推荐方法难以处理的不同问题:(1)**符号推理**——一个对 378 个物品编码了 226 条领域规则的符号引擎,生成与安全和监管要求一致且具有高覆盖率的种子清单,并在冷启动下保持鲁棒性;(2)**偏好学习**——一个两阶段模型,从用户编辑日志中学习特定旅行的效用,将包含与优先级排序分开,以减轻幸存者偏差;(3)**约束优化**——一个 CP-SAT 优化器,在满足容量、安全、监管、环境和依赖约束的前提下,选择并打包物品以最大化学习到的效用。 我们在 FlyEnJoy²²22 https://apps.apple.com/app/6745104853 中部署并评估了该系统,这是一个生产级 iOS 旅行应用,完全在设备上运行,以支持网络连接有限的旅客。设备上的约束排除了部署前沿大型语言模型的可能性,并促使我们在第二阶段使用轻量级、可解释的模型。FlyEnJoy 提供行程生成、打包清单和文档管理;打包模块实现了本文描述的框架。 我们做出以下贡献: - **约束感知的候选生成**。一个符号推理引擎,实现了 99.7% 的候选召回率,并在基于评分的有效性(0.96 vs. 0.78 到 0.81)上优于前沿大型语言模型,规则的来源可追溯性使其能够在冷启动下泛化到稀有物品。 - **幸存者偏差感知的偏好学习**。一个两阶段公式,将物品包含与优先级排序分开,以减轻隐式清单反馈中的幸存者偏差,在包含任务上达到 AUC-ROC 0.943,在排序任务上达到 NDCG@5 0.923。 - **通过约束优化实现固有可行性**。一个用于约束清单选择和行李分配的 CP-SAT 公式,在交互的合规性、容量和依赖约束下保证 100% 的可行性,而贪心基线和随机基线分别为 28% 和 10%。 在 FlyEnJoy 中的部署使清单完成量翻倍,并减少了编辑和完成时间,证实了其实用价值。虽然我们的实例化针对航空旅行打包,但这三阶段架构是一种约束个性化的一般设计模式,适用于硬可行性要求与稀疏偏好信号并存的场景。其他实例包括临床出院计划和移民文件准备。 ## 2. 问题公式化 我们将个性化打包清单生成形式化为一个在背景、偏好和可行性考虑下的约束子集选择问题。 **输入**。每个旅行实例由以下特征描述:(i)旅行背景 \(c\)(出发地、目的地、旅行日期、目的、住宿、行李、活动和特殊需求),以及(ii)一组硬约束 \(\mathcal{R}\),包括物品资格(监管和安全规则)、物理行李容量以及物品间依赖关系。 **输出**。系统从一个物品全集 \(\mathcal{I}\) 中输出一个清单 \(S \subseteq \mathcal{I}\),并可选择性地带有行李分配 \(b: S \rightarrow \mathcal{B}\)。三重对象 \((c, \mathcal{R}, S)\) 实例化了个性化的约束子集选择任务。 **目标**。目标是生成一个最大化预测旅客效用的清单: \[ \max_{S} \; U(S \mid c) \quad \text{s.t.} \quad S \text{ is feasible under } \mathcal{R}. \] 这里,\(U(S \mid c)\) 聚合了在第 3.2 节 (https://arxiv.org/html/2607.15562#S3.SS2) 中学习的物品级效用。 **期望特征**。一个实用的打包系统必须满足: - **合规性**:所有监管(例如,TSA)和安全(例如,医疗)要求必须无一例外地得到满足。 - **召回率**:即使在用户信息稀疏的情况下,也必须包含必需品(例如,手机充电器)。 - **个性化**:推荐应适应旅行特定因素,如目的地、天气和活动。 - **精确性**:清单应避免不必要或多余的物品(例如,热带目的地的厚重外套)。 - **可行性**:必须遵守物理容量、行李资格和物品间依赖约束。 - **效用**:打包决策应平衡预期的保留效用与行李丢失的风险。 ## 3. 系统概述 该系统由三个阶段组成,每个阶段解决一个不同的问题并为下一阶段提供输入。 **第一阶段:符号推理(合规性与召回率)**。给定一个旅行背景,一个符号推理引擎应用一组优先级化的声明性规则,这些规则编码了监管要求、安全约束、情境触发器和物品依赖。输出是一个高召回率、符合法规的种子清单,即使在冷启动情况下也能保持全面性。 **第二阶段:偏好学习(个性化与精确性)**。给定种子清单,一个两阶段学习流程估计(i)每个物品的包含概率和(ii)保留物品之间的相对优先级,将两个信号分开以减轻幸存者偏差。特征结合了旅行背景和符号来源(即,提出每个物品的规则和触发器),从而在稀疏交互数据下实现鲁棒的偏好学习。 **第三阶段:约束优化(可行性与效用)**。最后阶段将物品选择和行李分配表述为一个约束优化问题。一个 CP-SAT 求解器在满足监管、容量和依赖约束的前提下选择一个效用最大化的物品子集并将其分配到行李中,行李丢失的风险反映在目标函数中。 ### 3.1. 符号推理 第一阶段采用符号推理引擎生成一个高召回率、符合法规的种子清单。我们在这一阶段优先考虑合规性、召回率和可解释性而非个性化,因为纯粹数据驱动的推荐在冷启动下不可靠,此时不频繁的旅行和有限的用户历史记录会产生稀疏且有偏的信号。该引擎编码了 226 条声明性规则,涵盖监管、安全、背景和特定旅客知识,操作涉及 378 个原子物品和 103 个旅行前任务。监管规则来源于权威的 TSA 和 FAA 指南(美国运输安全管理局,2026b (https://arxiv.org/html/2607.15562#bib.bib51);美国联邦航空管理局,2026 (https://arxiv.org/html/2607.15562#bib.bib54))。 **知识表示**。领域知识被编码为一组声明性的、人类可读的规则,由内部专家编写。每条规则指定一个 *when* 子句(基于丰富的旅行背景和推断事实)和一个 *then* 子句(发出推荐的物品、旅行前任务或额外事实)。规则分为七类,涵盖监管问题、健康福祉、必需品、情境触发器、活动、特定旅客因素以及物品间依赖(表1 (https://arxiv.org/html/2607.15562#S3.T1))。每条规则都有一个反映其关键性的优先级:监管和安全规则(例如,旅行证件、液体、电池)在背景和舒适性相关规则之前进行评估。这种优先级结构使推理是确定性和可审计的:安全与法律关键性推理构成了后续规则依赖的事实基础。 表 1. 符号规则的结构和优先级分布。优先级较高的规则在背景和特定旅客推理之前强制执行监管和安全约束。 **背景丰富**。原始用户输入(例如,出发地、目的地、开始日期、持续时间、目的)被归一化并丰富成结构化背景。系统自动从出发地-目的地对推导出更高级的属性,如旅行类型(国内 vs. 国际),并根据目的地和日期特定的天气数据推导出温度类别。多选输入(如活动和特殊需求)被转换为原子事实(例如,`special_need(Infant)`, `has_activity(Hiking)`),从而允许同时激活多个规则类别。在推理过程中,规则也可能发出新的事实(例如,`has_liquids`, `requires_adapter`),从而实现级联推理,即早期规则输出为后续监管或依赖规则建立前提条件。 **前向链式推理**。推理使用基于优先级的前向链式:从丰富背景推导出的事实开始,当规则的条件满足时规则被触发,发出额外的事实、候选物品和旅行前任务,直到达到不动点。在实践中,收敛发生在受规则依赖图限制的少量迭代内。该过程支持级联推理(例如,洗漱用品 → 液体 → TSA 夸脱袋),并且是确定性的:相同的输入产生相同的输出。多条规则可能在不同理由或关键性级别下推荐同一物品。我们通过保守的关键性升级(强制 > 推荐 > 可选)、最不严格的可行放置以及触发理由的联合将这些重复项合并为单个候选。产生的来源记录(触发的规则、优先级、触发条件)提供了结构化的归因信号,在第二阶段用作特征。 ### 3.2. 偏好学习 第二阶段学习*软*偏好——即用户的个性化
相似文章
从可行性到期望性:用于个性化设备端行程生成的计划-学习-适应(PLA)框架
本文提出了用于个性化设备端行程生成的计划-学习-适应(PLA)框架,该框架将保证可行性的组合规划与通过 Bradley-Terry 奖励模型进行的人类偏好学习相结合。在实际部署中,该框架实现了行程完成率提升 91%,且延迟低,在可行性方面超过了前沿大语言模型。
ThoughtFold: 通过内省偏好学习折叠推理链
ThoughtFold 提出了一种利用内省偏好学习的框架,旨在减少大型推理模型在思维链推理中的冗余探索,在 DeepSeek-R1-Distill-Qwen-7B 上实现了约 56% 的令牌减少,且准确率无损。
从正确性到偏好:个性化智能体强化学习框架
本文提出了一个统一的个性化智能体强化学习框架,将通用任务奖励与个性化偏好奖励解耦,引入了PARPO和PSGM用于偏好对齐的策略优化和技能检索。
提示引导的多样化策略优化用于LLM推理
本文介绍了提示引导的多样化策略优化(HDPO),这是一个两阶段强化学习框架,鼓励LLMs首先生成多个候选解决方案大纲(提示),然后选择最可靠的一个进行详细推理,从而提升推理的多样性和可靠性。
通过自我调节的模拟规划实现高效代理推理
介绍了 SR²AM,一种通过自我调节的模拟规划实现高效代理推理的框架,在推理 token 减少 26-95% 的同时,达到了与 20-30 倍参数规模模型相竞争的性能。