自然语言策略到可执行决策:一种可解释的大语言模型框架
摘要
本文介绍了一种生产级框架,利用大语言模型将自然语言定价策略转换为旅游定价的可执行决策,在实际部署中实现了显著的效率提升和可审计性。
arXiv:2608.26124v1 公告类型:新
摘要:大规模旅游中的定价自动化具有挑战性,因为旅游订单高度非结构化,而定价策略复杂、快速演变且本质上开放。传统规则引擎脆弱且维护成本高,而无约束的LLM代理缺乏财务决策所需的可靠性和可审计性。我们提出了一种具有严格决策边界的生产级LLM驱动的定价系统:LLM执行结构化提取和有界的策略/路径选择,而所有数值定价,包括总价计算,都以确定性方式执行。策略被编译为可解释的条件树,无需代码更改即可开放支持新条款和演变规则,同时暴露可审计的人工在环控制制品。对日志轨迹的定期微调进一步改进了树归纳和路径匹配。该系统部署在一个市政国有企业旅游企业,覆盖7个景区和12个业务类别,拥有1500多名运营者和1000多个活跃策略,在六个月内处理了3960份订单,将订单管理团队从15-20人减少到3人,并将每单处理时间从10分钟缩短到<2分钟。
查看缓存全文
缓存时间: 2026/08/28 09:17
# 从自然语言策略到可执行决策:一个可解释的大语言模型框架 来源:https://arxiv.org/html/2608.26124 张子强,马静,王子龙,陈佳源,乔毅,何昱,张伟,程戴,沈晓宇 宁波数字孪生研究所,东方理工大学,宁波 zqzhang@idt\.eitech\.edu\.cn xyshen@eitech\.edu\.cn ###### 摘要 大规模旅游业中的定价自动化极具挑战性,因为旅行订单高度非结构化,而定价策略复杂、快速演变且本质开放。传统规则引擎脆弱且维护成本高昂,而完全自主的大语言模型代理缺乏财务决策所需的可靠性和可审计性。我们提出一个生产级、由大语言模型驱动的定价系统,并设定了严格的决策边界:大语言模型负责结构化提取和有界策略/路径选择,而所有数值定价,包括总价计算,均以确定性方式执行。策略被编译成可解释的条件树,支持对新条款和演变规则的开放式扩展,无需代码变更,同时暴露可审计的产物以实现人机协同控制。基于日志轨迹的周期性微调进一步提升了树归纳和路径匹配能力。该系统已部署于一家市政国有旅游企业,覆盖7个景区和12个业务类别,服务于1,500多名运营商并管理1,000多条活跃策略,在六个月内处理了3,960份订单,将订单管理团队从15-20人缩减至3人,并将每单处理时间从约10分钟缩短至不到2分钟。 从自然语言策略到可执行决策:一个可解释的大语言模型框架 张子强, 马静, 王子龙, 陈佳源, 乔毅, 何昱, 张伟, 程戴, 沈晓宇††感谢:通讯作者。宁波数字孪生研究所, 东方理工大学, 宁波 zqzhang@idt\.eitech\.edu\.cn xyshen@eitech\.edu\.cn ## 1引言 准确及时地处理旅行订单是现代旅游服务运营的核心。一个典型的订单描述了团队的行程,包括景点、旅行日期、代理商名称等,这些必须被转化为结构化事实,并与复杂的定价策略库进行匹配Kaushiket al\.\(2017 (https://arxiv.org/html/2608.26124#bib.bib15)\)。尽管自动化此工作流程对于运营扩展至关重要,但由于旅行请求的非结构化特性以及错综复杂、不断演变的定价策略,这在实践中仍然异常困难Zhouet al\.\(2025 (https://arxiv.org/html/2608.26124#bib.bib9)\); Liuet al\.\(2025 (https://arxiv.org/html/2608.26124#bib.bib16)\)。 在真实的生产环境中,旅行订单表现出极端的异构性。请求从半结构化的数字表单到随意的即时通讯文本甚至手写通知不等。关键信息通常是隐式或模糊的:景点可能以非正式的缩写形式被提及,而旅行日期常常依赖背景上下文而非明确说明。这些因素将简单的数据解析转变为一个高阶的信息理解任务,需要超越表面模式的深度推理\(Xuet al.,2019 (https://arxiv.org/html/2608.26124#bib.bib8); Mathewet al.,2020 (https://arxiv.org/html/2608.26124#bib.bib10)\)。 这种输入的复杂性因定价策略本质上的*开放性*而进一步加剧\(Hendryckset al.,2021 (https://arxiv.org/html/2608.26124#bib.bib12)\)。确定一项策略的适用性需要在大量交互条件上进行推理,例如季节性时间窗口、团队规模阈值以及定制的合同条款,这些条件分散在异构的策略文档中。由于新策略经常引入系统设计时从未预见到的全新条件,依赖于手动将逻辑编码到结构化数据库和规则引擎中的传统软件解决方案\(Desmondet al.,2022 (https://arxiv.org/html/2608.26124#bib.bib17)\)本质上是脆弱的。每次策略更新通常需要同步更改后端模式、规则代码和用户界面,造成高昂的维护成本,并使得城市级部署难以扩展。 大语言模型的最新进展为自然语言推理提供了灵活的替代方案Suet al\.\(2022 (https://arxiv.org/html/2608.26124#bib.bib5)\); Achiamet al\.\(2023 (https://arxiv.org/html/2608.26124#bib.bib4)\); Liuet al\.\(2024 (https://arxiv.org/html/2608.26124#bib.bib3)\); Xuet al\.\(2025 (https://arxiv.org/html/2608.26124#bib.bib6)\); Dinget al\.\(2026 (https://arxiv.org/html/2608.26124#bib.bib7)\)。原则上,大语言模型可以解析非正式订单、解释策略文本,并在无需僵化模式的情况下执行跨文档推理。然而在实践中,完全自主的大语言模型并不适合高风险应用。它们通常缺乏稳定性,可解释性有限,并且没有为非技术用户提供清晰的机制来检查或纠正中间推理步骤,而这是定价和审计的关键要求\(Agarwalet al.,2024 (https://arxiv.org/html/2608.26124#bib.bib11)\)。 在这项工作中,我们提出了一个生产级、由大语言模型驱动的定价系统,它调和了大语言模型的语言灵活性与现实世界金融运营的严格可靠性要求。我们的核心洞察是:大语言模型不应取代定价系统,而应在精心定义和可解释的决策边界内运行。该系统围绕两个核心原则设计:\(1\)开放式条件支持:我们利用大语言模型将订单侧的事实与策略侧的条件树进行匹配,而不是硬编码逻辑。这种设计自然支持演变的规则空间,使系统能够处理任意临时规则和季节性例外,无需代码变更或模型重训练\(Gaoet al.,2022 (https://arxiv.org/html/2608.26124#bib.bib13); Chenet al.,2022 (https://arxiv.org/html/2608.26124#bib.bib14)\)。 \(2\)端到端可解释性:系统自动从策略文档中提取逻辑,并将其组织成显式的*条件树*。这些树保留了自然语言的语义,同时暴露其逻辑结构,使旅游管理人员无需编程知识即可审查和维护规则Xionget al\.\(2024 (https://arxiv.org/html/2608.26124#bib.bib1)\); Wanget al\.\(2025 (https://arxiv.org/html/2608.26124#bib.bib2)\)。至关重要的是,所有数值计算都由确定性引擎处理。大语言模型被限制于结构化提取和离散决策选择。这种分离提供了传统软件系统的可靠性,同时保留了现代语言模型的推理灵活性。 我们将该系统部署在一家市政国有旅游企业,该企业运营一个覆盖七个主要景区和十二个业务类别、拥有1,500多名运营商的全市平台。在部署后的前六个月内,该系统处理了3,960份订单,将订单管理团队从15–20人缩减至3人,并将每单处理时间从约10分钟缩短至不到2分钟。该部署将定价治理外化为可审计的产物——订单事实、策略诱导的条件树以及记录的决策轨迹——使得分歧可通过有界的人工确认和覆盖操作进行处理。这些轨迹实现了系统性的错误诊断和迭代改进,而无需更改数值执行逻辑。一项内部调查报告了沟通/效率的提升(96.92%)以及对可用性和可分析规则的积极反馈(76.92%)。 尽管我们的部署聚焦于旅游业,但开放式策略逻辑、非正式输入、严格正确性要求以及以人为本的治理所面临的挑战,在许多领域(如保险承保、合规检查和合同执行)都是普遍存在的。通过消除僵化的规则工程同时保留人类能动性,我们的系统为在策略驱动的行业中实现可扩展、可信赖的AI提供了可行的路径。 ## 2背景 #### 旅游业中的定价生命周期 现代旅游业中的运营定价遵循一个周期性的三部分生命周期:\(i\)策略接入,\(ii\)订单接收与报价,以及\(iii\)结算与验证。该过程始于业务经理发布定价策略——这些文档(通常是PDF或电子表格)定义了针对不同客户细分群体和旅行季节的规则。发布后,旅游协调员接收旅行订单,并必须将其与活跃的策略库进行匹配以生成报价。最后,计算出的价格必须根据原始策略进行验证,以确保可审计性和财务合规。 #### 定价策略的开放性复杂性 该领域的一个核心挑战是定价条件本质上是开放的。策略定义于*资源*(可单独销售的原子单元,如缆车乘坐)和*产品*(资源的捆绑包)。然而,控制其价格的条件,从特定的年龄范围和团队规模阈值,到复杂的季节性重叠和临时合同条款,几乎是无限的。新策略经常引入在初始系统设计时完全未预料到的全新逻辑。这种不断演变的复杂性意味着“定价逻辑”不是一组静态参数,而是一个不断增长的自然语言规则库,必须结合上下文进行解释。 #### 旅行订单中的非正式性和不匹配 生命周期的接收端同样具有挑战性,因为旅行订单具有极端的非正式性。在我们的部署中,97%的订单(基于2025年下半年生产日志)是以即时通讯截图而非结构化数字表单的形式接收的。这些请求混合了旅行日期、目的地和随意笔记,没有固定模板。此外,“资源不匹配”很常见:初始文本中描述的行程通常偏离最终执行的计划。我们近一半的生产案例需要在最终确定报价前手动编辑项目列表,因此需要一个能够容忍不完整描述和过程中人为修正的系统。 #### 传统规则引擎的不适应性 传统的软件解决方案在这种环境下显得力不从心,因为它们依赖于僵化、预定义的模式。由于定价条件是无限的,添加新策略通常不仅仅需要数据录入;它需要协调更新*数据库结构*(以存储新属性)、*规则逻辑*(以处理新谓词)和*输入界面*(以允许用户选择这些新选项)。这种“硬编码”循环造成了巨大的维护负担,因为软件开发人员必须不断将自然语言的细微差别转化为可执行代码。对于拥有数百个不断演变的策略的大型旅游网站,这些手动系统更新的延迟和成本使得传统规则引擎从根本上无法扩展。 #### 对系统设计的启示 这些约束决定了一个生产系统不能依赖“封闭世界”假设。相反,系统必须:\(i\) 将策略逻辑与底层软件模式解耦,以处理开放的条件空间;以及 \(ii\) 将其推理外化为*可解释的中间产物*,这些产物保留自然语言语义,并将人类干预视为一等操作。 ## 3方法论 我们设计了一个可审计的定价流水线,在严格的治理约束下将非正式旅行订单和自然语言定价策略付诸实施。核心设计原则是*严格的大语言模型决策边界*:大语言模型被限制于结构化信息提取和离散决策选择,而所有数值计算均由确定性引擎执行。这种边界从结构上消除了数值幻觉,使剩余的不确定性显式化,并实现了快速的人工验证。 参见图注图 1:系统概览。策略解析模块从定价文档中归纳出可解释的条件树,价格计算模块将订单路由到候选树,验证适用性,并通过确定性执行和人工覆盖计算最终价格。我们提供了可执行的树模式(表1 (https://arxiv.org/html/2608.26124#S3.T1))、验证器套件(表2 (https://arxiv.org/html/2608.26124#S3.T2))、一个生产级的真实树实例(图.6 (https://arxiv.org/html/2608.26124#S3.F6)),以及外化L1–L3级确认和覆盖的端到端UI轨迹(图.9 (https://arxiv.org/html/2608.26124#S3.F9)–11 (https://arxiv.org/html/2608.26124#S3.F11))。在发布之前,每个归纳出的树必须通过显式的验证器套件(表2 (https://arxiv.org/html/2608.26124#S3.T2)),任何失败都将被阻止进入执行并路由至手动修正;此外,所有树管理都通过专用界面(图.5 (https://arxiv.org/html/2608.26124#S3.F5))呈现给操作员,以实现友好的监督。系统被分解为两个主要组件:*策略接入模块*(阶段*A0–A3*)和*价格计算模块*(阶段*B0–D*)。为确保可靠性,我们引入了一个分级的人机协同覆盖过程(*L1–L3*),允许操作员在推理链的不同层级进行干预。这些标识符对应于图1 (https://arxiv.org/html/2608.26124#S3.F1)中说明的架构组件。 ### 3.1策略接入与树归纳 策略处理模块是“离线”阶段,将策略文档转化为*条件树*。条件树作为为特定产品定价的唯一可执行接口。在此结构中,每个内部节点代表一个自然语言适用条件,而每条从根到叶的路径恰好对应一个*价格规范*。这种*一路径–一价格规范*的不变性保证了一旦选择路径,计算是确定性的。这些树的归纳遵循一个四步骤流水线: 参见图注图 2:目录管理界面,定义可执行资源空间RR(A1)。参见图注图 3:策略解析/编辑界面,用于在发布前归纳和审查条件树(A2–A3)。A0:文本提取。我们首先通过OCR或表格提取将策略文档转换为文本,生成规范化的文本输入。 A1:识别资源。我们维护一个预定义的资源目录RR,作为系统识别的规范资源空间。每个资源代表一个操作员定义的原子能力,可被下游执行组件引用。除了定义单个资源外,目录还指定了可以从这些资源构建的产品(捆绑包)配置。因此,RR约束了后续过滤步骤(B1)中允许使用的资源ID和可行的产品组合。在策略解释过程中,大语言模型执行目录锚定,将自然语言策略描述映射为严格取自RR的资源集合。因为锚定过程基于此预定义目录操作,它防止了目录外实体进入可执行接口。在我们的系统架构中(图.2 (https://arxiv.org/html/2608.26124#S3.F2)),目录RR被视为一等操作员产物,并作为资源的唯一可执行命名空间。为确保目录一致性,在目录维护阶段强制执行唯一性约束。在资源级别,每个资源条目由唯一标识符
相似文章
PolicyAlign: 基于直接策略的大型语言模型安全对齐
PolicyAlign 提出了一种框架,通过合成指令生成和在线策略自蒸馏,直接将大型语言模型与自然语言安全策略对齐,在不依赖昂贵监督数据的情况下提升安全性。
基于大语言模型的运筹学不确定性感知仿真推断
本文提出了一种无需训练、不确定性感知的推断框架,用于在运筹学中应用大语言模型。该方法使用短视前瞻仿真和重要性重采样来提高数学公式表述的一致性,在OR基准测试上优于标准基线。
大型语言模型中风险敏感决策的行为特征
本文研究了大型语言模型在不确定性决策中是否展现出稳定且可解释的风险偏好,通过德州扑克量化其基准风险倾向和上下文依赖的适应性调整。
评估大语言模型作为动力系统的可解释控制器
本文评估了大语言模型是否可以作为动力系统的可解释控制器,特别是针对热环境。研究发现,高复杂度模型如Qwen-3 14B和GPT-4o能够实现精确的控制和连贯的推理,而较小模型则表现不佳,凸显了混合基于模型和语言驱动的控制策略的潜力。
释放大型语言模型的潜力:实现实时、企业级部署的蓝图
这篇arXiv论文提出了一种统一的LLMOps架构,用于实时、企业级LLM部署,集成了数据摄入、持续学习、RAG和反馈循环。它引入了AIPO、STAR+FAR和SAGE等组件,以解决受监管行业中知识过时、幻觉和延迟-成本权衡的问题。