基于应用手册的任务:揭示语言模型长时序程序推理的缺陷

arXiv cs.CL 论文

摘要

本文介绍了任务在应用手册(TAM)基准,用于评估语言模型的长时序程序推理能力,揭示了当前大语言模型在ICD-10-CM编码和量刑指南等任务上的显著差距。

arXiv:2609.13005v1 Announce Type: new 摘要:大型语言模型(LLMs)在广泛的自然语言任务上表现出色,最近的基准测试表明它们在多跳推理方面日益熟练。然而,这些基准测试通常是短时序的,只需少量检索或推理步骤,并且对于涉及遵循数百页包含复杂、相互依赖指南的手册的真实世界任务,提供有限的可靠性证据。在本文中,我们介绍了任务在应用手册(TAM),这是一个用于评估长时序程序推理的基准。我们通过从两个领域策划真实世界任务来构建TAM:ICD-10-CM临床编码(将医疗状况映射到诊断代码)和美国联邦量刑(计算犯罪量刑指南结果,特别是犯罪级别),并附有人工验证的标签。每个任务需要遵循一个包含数万条规则的权威手册,并执行一系列跨越不同部分的相互依赖步骤以产生精确答案。我们评估了通用提示方法,包括检索增强生成、ReAct风格提示和代理框架基线在GPT-5上,并发现最佳精确匹配性能仍然极低:ICD-10-CM编码为1%,量刑任务为15.5%。这些结果表明,当前基准测试可能高估了LLM的推理能力,并遗漏了一个关键挑战:可靠地遵循长而基于规则的程序。完整的TAM数据和代码已公开可用。
查看原文
查看缓存全文

缓存时间: 2026/09/14 08:42

# 基于应用手册的任务:揭示语言模型在长周期程序推理中的不足
来源:https://arxiv.org/html/2609.13005 \\correspondingauthor 会议:第35届ACM国际信息与知识管理会议论文集;2026年11月7日–11日;意大利罗马Proceedings of the 35th ACM International Conference on Information and Knowledge Management \(CIKM ’26\), November 07–11, 2026, Rome, ItalyDOI:10\.1145/3799682\.3841039 (https://doi.org/10.1145/3799682.3841039)ISBN:979\-8\-4007\-2539\-5/2026/11CCS:计算方法 自然语言处理CCS:信息系统 检索结果评估CCS:信息系统 检索任务与目标,Syed Shariyar Murtazahttps://orcid.org/0000-0003-3330-4783email:[syed\_shariyar\_murtaza@manulife\.com](mailto:[email protected])所属机构:宏利保险,加拿大多伦多,Yifan Niehttps://orcid.org/0009-0006-9254-4735email:[yifan\_nie@manulife\.com](mailto:[email protected])所属机构:宏利保险,加拿大多伦多,Sachin Chandrasekharhttps://orcid.org/0009-0009-6081-1431email:[sachin\_chandrasekhar@manulife\.com](mailto:[email protected])所属机构:宏利保险,印度班加罗尔与Eugene Wenhttps://orcid.org/0009-0002-7683-3693email:[eugene\_wen@manulife\.com](mailto:[email protected])所属机构:宏利保险,加拿大多伦多 © cc ###### 摘要大型语言模型在各类自然语言任务中表现出色,近期基准测试表明其在多跳推理方面能力日益增强。然而,这些基准测试通常为短周期任务,仅需少量检索或推理步骤,对于涉及遵循数百页包含复杂相互依赖指南的手册的现实任务,其可靠性证据有限。本文提出*基于应用手册的任务*(Tasks over Application Manuals, TAM),这是一个评估长周期程序推理能力的基准。我们通过整合两个领域的实际任务——ICD-10-CM临床编码(将医疗状况映射至诊断代码)和美国联邦量刑(计算犯罪量刑指南结果,特别是犯罪等级)——并辅以人工验证标签,构建了TAM基准。每个任务都需要遵循包含数万条规则的权威手册,并在不同章节执行一系列相互依赖的步骤以得出精确答案。我们在GPT-5上评估了通用提示方法,包括检索增强生成、ReAct式提示以及基于代理的基线,发现最佳精确匹配性能仍然极低:ICD-10-CM编码任务为1%,量刑任务为15.5%。这些结果表明,当前基准测试可能高估了LLM的推理能力,并忽略了关键挑战:可靠遵循冗长的基于规则的程序。完整的TAM数据和代码已公开发布。111数据:https://huggingface.co/datasets/manulife/tam-benchmarks。代码:https://github.com/manulife-ai/tasks-over-application-manual。 ###### 关键词:大型语言模型,程序推理,手册执行,基准设计,ICD-10-CM,量刑指南 ††cc-license:by## 1.引言大型语言模型在自然语言处理领域取得了显著进步,在问答、摘要和代码生成等任务上表现优异。随着这些进展,评估LLM是否能够进行推理的兴趣日益增长,多项基准测试表明其在多步和多跳问题上表现出色。然而,这些基准测试的范围有限。许多广泛使用的推理任务,如HotpotQA(Yang等人, 2018 (https://arxiv.org/html/2609.13005#bib.bib1))和MuSiQue(Trivedi等人, 2022 (https://arxiv.org/html/2609.13005#bib.bib2)),本质上是短周期的,通常仅需少量检索或推理步骤。虽然这些任务很有用,但并未捕捉现实推理的一个重要方面:遵循外部手册定义的冗长、结构化程序。在许多现实和工业场景中,解决问题意味着遵循大型文档中数万条准则描述的逐步流程。例如,在ICD-10-CM编码中,编码员从临床描述开始,查找候选医疗状况,检查数十个章节的规则,并经常根据已识别的约束返回修改先前的选择。在联邦量刑中,用户从犯罪事实出发,识别相关指南,应用一系列调整,并聚合多项指控的决定以计算最终量刑范围。这些并非一次性决策——通常涉及数十个中间步骤,每个选择都会影响后续过程,使得整体过程对早期错误高度敏感。这种差异改变了问题的性质。系统不再是组合几条证据,而是必须在一系列决策中保持一致性,遵循排序规则,并在整个过程中正确应用约束。早期的小错误可能使后续步骤失效,即使每个中间决策单独看似合理。现有基准测试未直接测试这些挑战,它们专注于较短的推理链。这一差距凸显了测试模型是否能可靠遵循冗长、基于规则的程序的需求。为此,我们提出*基于应用手册的任务*(Tasks over Application Manuals, TAM),这是一个用于长周期程序推理的基准。TAM基于需要遵循权威手册的现实任务构建。与现有需要少量跳转的基准测试不同,TAM涉及在包含数万条规则和交叉引用的手册中执行数十个相互依赖的决策,其正确性取决于无误地执行整个流程。我们整理了两个此类应用手册:ICD-10-CM临床编码和联邦量刑指南计算。ICD基准基于2019年ICD-10-CM指南、1,304页的字母索引和1,942页的表格列表。我们的数据集包含从38,332个合格的真实ICD编码就诊案例中抽样的1,000个案例。另一方面,法律基准包含2021–2025年间的五个年度《美国法典》第18篇档案和五个年度USSG手册,数据由人工审核后的200个批准案例组成。两个领域的主要难点都在于从头到尾遵循手册,通常涉及检索多个相关段落。在此基准测试上,我们评估了单次通过的RAG、代理式RAG、ReAct式工具使用以及GPT-5上的代理基线,这些都是在现有多跳推理基准测试上表现良好的代表性技术。我们将这些实验视为新基准的强力初步参考基线,而非对所有专用或新发布方法的详尽比较。我们发现它们在TAM任务上表现不佳,ICD-10-CM编码的精确匹配率保持在1%或以下,量刑任务最高仅达15.5%。这突显了短周期推理性能与现实程序执行之间的明显差距。我们的贡献如下:- •我们提出*基于应用手册的任务*(Tasks over Application Manuals, TAM),这是一个基于现实领域的长周期程序推理基准——ICD-10-CM临床编码和美国联邦量刑——其中解决问题需要遵循大型结构化手册中定义的复杂、多步骤程序。- •我们形式化了*基于手册的推理*作为一个独立的评估场景,其中正确性取决于在数十个相互依赖的决策中保持一致性,而非检索或组合少量相关事实。- •我们评估了代表性的GPT-5基线——单次通过RAG、代理式RAG、ReAct式工具使用和代理基线——并显示它们在TAM上表现不佳,ICD-10-CM编码的精确匹配率保持在1%或以下,量刑任务最高仅达15.5%。- •我们发现了现有短周期推理基准性能与现实程序任务之间的关键差距,强调了需要能够可靠端到端执行冗长、基于规则流程的新方法。 ## 2.基于应用手册的任务 ### 2.1.任务定义我们将*基于应用手册的任务*(TAM)实例定义为三元组\(x,\mathcal{M},y^{*}\),其中\(x\)是案例描述,\(\mathcal{M}\)是手册,\(y^{*}\)是通过正确应用手册中的准则对案例处理获得的精确输出。核心对象不是单一检索段落,而是*决策轨迹*。从初始状态\(s_{0}=(x,\emptyset,\emptyset)\)开始,系统迭代选择行动\(a_{t}\in\mathcal{A}\)并更新状态\(s_{t+1}=\tau_{\mathcal{M}}(s_{t},a_{t})\),其中\(s_{t}=(x,C_{t},y_{t})\)表示累积上下文和部分输出。这里\(C_{t}\)表示全局状态,包括检索内容、中间承诺、未解决的子问题和活跃约束,而\(y_{t}\)是在步骤\(t\)构建的部分输出。转移算子\(\tau_{\mathcal{M}}\)指定了行动如何与手册交互。行动空间\(\mathcal{A}\)包括检索规则、解析交叉引用、应用约束、细化输出、规划子目标、修改先前决策、回溯和终止。TAM实例仅在系统在某个步骤\(H\)停止且\(y_{H}=y^{*}\)并且在整个执行过程中生成的轨迹在手册下保持可接受时才被解决。关键挑战在于局部合理性不意味着全局有效性。在任何步骤,给定当前证据,可能有多个行动看似合理,但只有一小部分能保持通往有效最终输出的路径。一个遗漏的例外、过早的承诺或无根据的假设可能悄无声息地排除正确解决方案,并在数个步骤后才显现。因此,解决TAM是一个对部分解的受限搜索问题:系统必须规划、跟踪活跃义务、检测当前路径何时不一致,并在终止前修改或回溯。检索有助于暴露相关规则,但本身并不能确保演变中的输出是完整、顺序正确且全局有效的。图1 (https://arxiv.org/html/2609.13005#acmlabel1)在我们的两个领域中具体化了这种程序负担。在ICD-10-CM编码中,每个诊断候选都可能触发自己的查找循环。在联邦量刑中,系统可能需要重复执行计数级别的查找,然后根据分组、交叉引用和后续调整规则聚合这些小计。参见标题(a)ICD-10-CM临床编码。(b)联邦量刑指南计算。图1。两个TAM领域的概念执行模式。在ICD-10-CM编码中,每个诊断候选在最终代码集被聚合、去重和排序之前,都可能通过字母索引、表格列表和指南约束触发自己的查找循环。在联邦量刑中,多个指控或罪行可能需要重复进行指南查找和计数级小计计算,然后系统才能跨指控、分组逻辑、交叉引用和后续调整进行聚合以得到确切的总犯罪等级。两个并排的流程图。左侧流程图显示ICD-10-CM编码为重复的诊断级查找循环:出院小结导致就诊和诊断识别,然后编码员重复选择下一个诊断候选,在字母索引中查找,在表格列表中验证特异性,应用章节规则和排序约束,决定诊断是否受支持,然后添加或拒绝代码,再循环到下一个诊断候选。当没有剩余候选时,编码员聚合、去重并排序最终的ICD代码集。右侧流程图显示联邦量刑为重复的计数级查找和聚合过程:案例事实导致指控和法规识别,然后用户选择下一个指控或罪行,使用附录A将法规映射到犯罪指南,应用具体犯罪特征,计算计数级小计,必要时循环处理额外的指控或罪行,然后跨指控、分组规则和交叉引用聚合,之后应用后续调整和减轻,拒绝无支持的增强,并产生确切的总犯罪等级。 ### 2.2.示例说明:ICD-10-CM临床编码ICD-10-CM111https://www\.cdc\.gov/nchs/icd/icd\-10\-cm/index\.html临床编码提供了TAM设置的具体实例化。此处,输入\(x\)是医院出院小结,通常是混合了入院原因、活动性诊断、并发症、慢性病、用药和复制的既往史的密集叙述。手册\(\mathcal{M}\)包含多个交互资源:术语到代码的查找、结构化代码层次结构以及指定纳入标准、排除标准、排序规则以及任何诊断代码何时需要附加代码的指南。输出\(y^{*}\)是精确的可报告ICD-10-CM代码集及其所需的排序信息。在评估中,我们计算代码集的精确匹配(忽略顺序),并单独报告主要诊断的准确性。因此,解决任务意味着将混乱的叙述转换为完整且符合规则的编码决策——这超出了简单检索几个相关段落作为答案的范畴。考虑一位因转移性癌症接受化疗入院的患者。同一记录也可能提及肝转移、输注过程中的药物反应、住院期间管理的高血压和抑郁,以及从既往史部分复制的其他状况。系统无法独立编码这些事实。它必须确定就诊的主要目的、治疗并发症是否引入另一个所需代码、哪些慢性病足够活跃以纳入、哪些提及是背景上下文而非本次就诊的可计费诊断,以及最终代码必须如何排序。一份记录可能包含许多类似诊断的陈述,但输出必须是精确的而非详尽的。所有这些规则的来源是必须经常咨询的手册以做出最终决定。这造成了特有的失败模式。仅编码癌症的系统会遗漏指南要求作为主要诊断(此首列代码称为主要诊断)排序的化疗就诊代码。编码每个类似诊断短语的系统会产生过于宽泛的列表。检索到正确规则但将其附加到错误主要问题的系统可能产生局部连贯但全局无效的答案。我们在TAM中选择此领域以暴露此类失败模式。 ## 3.相关工作 ### 3.1.检索与短周期推理基准信息检索和问答基准评估系统定位和组合相关证据的能力。数据集如MS MARCO(Nguyen等人, 2016 (https://arxiv.org/html/2609.13005#bib.bib8))、BEIR(Thakur等人, 2021 (https://arxiv.org/html/2609.13005#bib.bib10))和TREC深度学习轨道(Craswell等人, 2020 (https://arxiv.org/html

相似文章

TabularMath:用大语言模型理解表格上的数学推理

arXiv cs.CL

TabularMath 引入了一个基准和 AutoT2T 框架来评估 LLM 对表格数据的数学推理能力,揭示表格复杂性、数据质量和模态对模型性能的重大影响。该研究通过系统地评估模型对真实场景中不完整或不一致表格信息的鲁棒性,填补了 LLM 评估中的空白。