当推理损害法律文书撰写:专利权利要求生成中的语言化瓶颈
摘要
本文研究了思维链(CoT)提示是否有利于专利权利要求生成,发现隐式CoT(推理内部进行)始终优于显式CoT,而显式CoT会引入一个语言化瓶颈,通过抽象化细节、破坏模式及错误传播来损害输出质量。
arXiv:2607.10480v1 公告类型:新
摘要:专利权利要求的起草是一项具有挑战性的法律文书撰写任务,需要技术专长、精确的语言控制、严格遵守形式惯例以及保持权利要求要素之间复杂的逻辑关系。虽然思维链(CoT)提示已被广泛用于提升大型语言模型(LLMs)的推理能力,但近期证据表明,在高度结构化或模式敏感的任务中,其益处可能有限,甚至为负。因此,本文研究了CoT提示是否有利于专利权利要求生成。我们提出了一种针对专利权利要求生成的任务特定CoT方法,并通过自动指标和人类专家评估评估其有效性。我们的结果表明,增强推理的提示可以提高权利要求质量。此外,我们展示了一个反直觉但重要的实证发现:隐式CoT(推理内部进行而非显式表达)始终优于显式CoT。通过系统分析,我们表明显式CoT会为权利要求生成引入不必要的语言化瓶颈。显式推理可能通过三种具体机制损害最终输出质量:关键细节的抽象化、内部生成模式的破坏以及级联错误传播。我们的研究结果为法律任务和CoT应用提供了新的见解。
查看缓存全文
缓存时间: 2026/07/14 04:22
# 专利权利要求生成中的言语化瓶颈 来源:https://arxiv.org/html/2607.10480 ## 当推理损害法律起草时:专利权利要求生成中的言语化瓶颈 ###### 摘要 专利权利要求起草是一项具有挑战性的法律起草任务,需要技术专长、精确的语言控制、严格遵守形式规范以及维护权利要求要素间复杂的逻辑关系。虽然链式思维(CoT)提示已被广泛用于提升大型语言模型(LLM)的推理能力,但近期证据表明,在高度结构化或对模式敏感的任务中,其益处可能有限,甚至产生负面影响。因此,本文研究CoT提示是否有助于专利权利要求生成。我们提出了一种针对专利权利要求生成的任务特定CoT方法,并通过自动评估指标和人类专家评估来评价其有效性。我们的结果表明,推理增强型提示能够提高权利要求质量。此外,我们展示了一个反直觉但重要的实证发现:隐式CoT(推理保持在内部而非显式言语化)始终优于显式CoT。通过系统分析,我们表明显式CoT可能为权利要求生成引入不必要的信息瓶颈。言语化推理可能通过三种特定机制损害最终输出的质量:关键细节的抽象化、内部生成模式的干扰以及级联错误传播。我们的发现为法律任务和CoT应用提供了新的见解。 人工智能法律、法律推理、专利权利要求生成、链式思维、大型语言模型、法律自然语言处理 ## 1 引言 长篇结构化文本(如法律合同、技术手册和专利文件)的自动生成,代表了自然语言处理(NLP)的一个重要前沿领域(Zhao等人,2023(https://arxiv.org/html/2607.10480#bib.bib34);Jiang & Goetz,2025(https://arxiv.org/html/2607.10480#bib.bib6))。这类任务不仅要求卓越的语言能力,还对逻辑推理、严格遵守结构规范以及整合领域知识提出了严格要求。专利权利要求起草正是这一挑战的典型代表(Jiang等人,2025d(https://arxiv.org/html/2607.10480#bib.bib10);Wang等人,2024(https://arxiv.org/html/2607.10480#bib.bib24))。专利文件对于保护知识产权(IP)和公开技术创新至关重要。这些文件的核心组成部分是权利要求集,它定义了授予专利持有人的法律保护范围。因此,撰写高质量权利要求是专利起草中的关键任务,需要精确的语言来捕捉发明的本质,同时保持法律上的可执行性。专利权利要求必须使用层次化、逻辑严谨且法律精确的语言来表达发明的核心新颖性(欧洲专利局,2000(https://arxiv.org/html/2607.10480#bib.bib3))。这一过程的复杂性因平均超过1000个标记的长上下文而进一步加剧(Suzgun等人,2024(https://arxiv.org/html/2607.10480#bib.bib22))。这些挑战使得即使对于人类专家来说,手动起草也耗时且智力密集。因此,专利起草过程的自动化,尤其是权利要求的自动化,具有重要意义。 尽管大型语言模型(LLM)在通用文本生成方面取得了进展,但在高度结构化和复杂任务(如专利起草)中的应用往往表现出次优结果,特征为逻辑不精确、结构不一致或偏离核心要求(Jiang & Goetz,2025(https://arxiv.org/html/2607.10480#bib.bib6))。为了解锁和引导LLM更深层的推理能力,链式思维(CoT)提示技术已成为一种强大方法(Wei等人,2022(https://arxiv.org/html/2607.10480#bib.bib27);Kojima等人,2022(https://arxiv.org/html/2607.10480#bib.bib12);Wang等人,2023(https://arxiv.org/html/2607.10480#bib.bib26);Zhang等人,2023(https://arxiv.org/html/2607.10480#bib.bib33))。CoT鼓励模型在得出最终答案之前,将复杂问题分解为一系列中间推理步骤。因此,它可能显著提升算术、常识和符号推理任务的性能。然而,近期研究报告称,CoT在某些任务(如基于模式的任务和专利相关任务)中的有效性有限,甚至适得其反(Zheng等人,2025(https://arxiv.org/html/2607.10480#bib.bib35);Wang等人,2025(https://arxiv.org/html/2607.10480#bib.bib25))。这些发现提出了关于CoT是否有助于专利权利要求起草的关键问题。 总体而言,我们做出以下贡献。(1)我们提出了一种针对专利权利要求生成的任务特定零样本CoT提示方法,并通过自动和人类专家评估证明了其有效性。(2)我们展示了一个反直觉但重要的实证发现:隐式CoT(引导LLM内部思考,仅输出最终权利要求)始终优于显式CoT(在生成权利要求之前明确写出中间推理步骤)。(3)通过诊断实验和案例研究,我们将性能下降归因于推理外部化所造成的信息瓶颈,该瓶颈通过三种机制表现:(1)言语化推理抽象掉了法律关键细节;(2)显式推理阶段干扰了模型内部生成模式;(3)错误在推理步骤间级联且不可恢复。 ## 2 相关工作 ### 2.1 CoT提示 Wei等人(2022(https://arxiv.org/html/2607.10480#bib.bib27))引入了CoT提示,为LLM提供包含中间推理步骤的少样本示例,以提高模型在复杂算术、常识和符号推理任务上的性能。这一发现表明,引发逐步推理过程是解锁LLM潜在能力的关键。后续工作由Kojima等人(2022(https://arxiv.org/html/2607.10480#bib.bib12))完成,揭示这种推理能力甚至可以在没有少样本示例的情况下被解锁。他们的零样本CoT方法仅在提示中添加一个简单通用的指令,如"让我们一步步思考"。这一发现至关重要,因为它表明推理机制是规模足够大的模型的涌现能力,可以通过直接指令而非模仿来触发。还探索了更复杂的推理结构,如思维树(ToT)(Yao等人,2023(https://arxiv.org/html/2607.10480#bib.bib29))和思维图(GoT)(Besta等人,2024(https://arxiv.org/html/2607.10480#bib.bib1))。然而,近期研究报告称,CoT在某些任务(包括专利相关任务)中的有效性有限,甚至适得其反(Zheng等人,2025(https://arxiv.org/html/2607.10480#bib.bib35);Wang等人,2025(https://arxiv.org/html/2607.10480#bib.bib25))。 ### 2.2 专利权利要求生成 撰写高质量的专利权利要求是一个耗时、昂贵且技能密集的过程(欧洲专利局,2000(https://arxiv.org/html/2607.10480#bib.bib3))。因此,近期研究探索利用LLM帮助发明人和专利专业人士自动生成结构良好的权利要求(Jiang & Goetz,2025(https://arxiv.org/html/2607.10480#bib.bib6))。研究重点已逐渐从早期在专利摘要上训练神经模型的方法(Lee & Hsiang,2020(https://arxiv.org/html/2607.10480#bib.bib14);Lee,2020(https://arxiv.org/html/2607.10480#bib.bib13)),转向利用LLM从详细专利描述中生成权利要求(Jiang等人,2025d(https://arxiv.org/html/2607.10480#bib.bib10);Wang等人,2024(https://arxiv.org/html/2607.10480#bib.bib24))或修改权利要求草案(Jiang等人,2025b(https://arxiv.org/html/2607.10480#bib.bib8))。由于描述提供了更丰富的技术背景,这些方法可以显著提高生成权利要求的完整性和精确性。最近的工作开始研究优化方法,例如使用智能体框架和多模态输入(Shea & Yu,2025(https://arxiv.org/html/2607.10480#bib.bib21);Yang等人,2026(https://arxiv.org/html/2607.10480#bib.bib28);Yu等人,2026(https://arxiv.org/html/2607.10480#bib.bib30))。本文探讨CoT是否有助于专利权利要求起草。 ## 3 任务与方法 ### 3.1 任务公式化 该任务旨在基于给定技术描述\(D\)自动生成一组高质量专利权利要求\(C\):\(C = G(I, D)\),其中\(G\)代表LLM,\(I\)是指令提示。与摘要或翻译等传统文本生成任务不同,生成专利权利要求提出了重大挑战,需要深层语义理解和复杂逻辑推理。模型必须从冗长的技术文档中提炼核心发明概念,并将这些概念综合成层次化结构的权利要求集。每个从属权利要求必须在逻辑上缩小其独立权利要求的范围,并严格遵守法律形式主义。此外,权利要求中的每个要素都必须完全由所提供的描述支持并基于其之上。因此,建议在撰写最终权利要求之前进行中间推理过程,以识别基本发明特征、逻辑地结构化特征并正式表达权利要求。 ### 3.2 零样本CoT提示 尽管CoT显著提升了LLM的通用推理能力,但它通常依赖于手工制作的示例(Wei等人,2022(https://arxiv.org/html/2607.10480#bib.bib27))或通用指令(Kojima等人,2022(https://arxiv.org/html/2607.10480#bib.bib12)),这对于需要精确逻辑流程的高度专业化、领域特定任务可能并非最优。我们的工作基于零样本CoT(Kojima等人,2022(https://arxiv.org/html/2607.10480#bib.bib12))的原则,并解决了领域差距问题。与使用通用触发短语不同,我们引入了一种结构化的零样本CoT方法:\(C = G(I_{CoT}, D)\),如图1(https://arxiv.org/html/2607.10480#S4.F1)所示。我们的方法将生成过程分解为三个结构化步骤,以模拟专业起草过程。这种三步分解是受专利权利要求起草的功能需求驱动。具体而言,权利要求起草需要识别定义发明的特征,将这些特征组织为法律和技术上连贯的依赖关系,并使用传统的权利要求语言进行表达。这些需求分别对应特征提取、逻辑分组和语言形式化阶段。完整的CoT提示见附录表8(https://arxiv.org/html/2607.10480#A3.T8)。 步骤1:特征提取。模型首先识别专利描述中的关键技术特征及其重要性排序。此步骤鼓励模型识别基本发明方面,以提高最终权利要求的内容完整性。 步骤2:逻辑分组。根据提取的特征之间的功能关系和依赖关系进行逻辑组织。此步骤支持特征的结构化组合,以增强最终权利要求的逻辑结构。 步骤3:语言形式化。将组织好的特征使用正式专利语言写入文本权利要求,以确保清晰性、一致性和技术准确性。 通过结构化指令为模型提供任务特定框架,我们引导其推理过程符合专利权利要求起草的领域特定要求。该方法保持了零样本方法的简单性,但施加了必要结构,以增强生成输出的完整性、逻辑连贯性和语言正式性。 ### 3.3 CoT变体 我们实验了普通提示和不同的CoT提示变体(图1(https://arxiv.org/html/2607.10480#S4.F1)): 普通提示:模型直接输出最终权利要求,无需三步CoT提示:\(C = G(I, D)\)。 隐式CoT:引导模型在内部逐步思考,仅输出最终权利要求:\(C = G(I_{CoT\_Implicit}, D)\)。 显式CoT:在生成权利要求之前明确写出中间推理步骤:\(R, C = G(I_{CoT\_Explicit}, D)\),其中\(R\)是推理过程。 ## 4 实验设置 ### 4.1 数据集 我们在EPD数据集(Jiang等人,2025a(https://arxiv.org/html/2607.10480#bib.bib7))上进行主要实验,该数据集包含来自欧洲专利局(EPO)的693项英语专利,用于权利要求生成。我们选择该数据集有两个主要原因:(1)EPD包含高质量的授权专利,而先前工作(Jiang等人,2025d(https://arxiv.org/html/2607.10480#bib.bib10))使用的是申请版本;(2)EPD能更好地反映现实世界场景,从而对LLM性能进行更严格的评估。为了探索泛化能力,我们还在HUPD-DCG数据集(Jiang等人,2025d(https://arxiv.org/html/2607.10480#bib.bib10))上测试了该方法,该数据集包含来自美国专利商标局(USPTO)的1,311项专利,并发现了类似结果。结果与EPD上的一致,并在附录C(https://arxiv.org/html/2607.10480#A3)中展示。 参见图注 图1:CoT提示方法概览。隐式CoT和显式CoT共享相同的三步过程(特征提取→逻辑分组→语言形式化);它们的区别在于中间推理是否外部化为文本。 ### 4.2 模型 我们主要关注Llama-3.1-8B(Dubey等人,2024(https://arxiv.org/html/2607.10480#bib.bib2))、Mixtral-8×7B(Jiang等人,2024(https://arxiv.org/html/2607.10480#bib.bib5))和GPT-4o(OpenAI,2024(https://arxiv.org/html/2607.10480#bib.bib19)),以探索模型大小和架构的影响。我们还在附录C(https://arxiv.org/html/2607.10480#A3)中报告了Mistral-7B(Jiang等人,2023(https://arxiv.org/html/2607.10480#bib.bib4))和Llama-3.1-70B(Dubey等人,2024(https://arxiv.org/html/2607.10480#bib.bib2))的结果。 表1:不同提示方法的自动和人类专家评估结果。人类评估条目报告为评估样本的均值±标准差。 ### 4.3 评估协议 #### 人类专家评估。我们邀请持证专利律师比较生成的权利要求与参考权利要求,从三个方面进行评分(0-100分):(1)内容覆盖率:草案权利要求涵盖发明所有关键技术方面的程度。(2)逻辑结构:权利要求集表现出连贯、组织良好且法律上合理的逻辑结构(包括适当的依赖关系和层次关系)的程度。(3)语言质量:权利要求集中所用语言的清晰性、精确性和形式适当性,包括术语、句法以及对专利起草惯例的遵循。专利律师会获得参考权利要求(授权版本)和不同模型生成的候选权利要求。指令如下:你得到一份列表相似文章
超越单一方向:思维链破坏简单的拒绝引导
这篇论文研究了大型推理模型中的思维链推理如何使基于激活的拒绝行为控制变得复杂。在DeepSeek-R1-Distill-LLaMA-8B上的实验表明,拒绝行为同时编码在残差流激活和思维链痕迹中,使得模型对激活层面的干预更加鲁棒,但同时也暴露了思维链作为另一个攻击面。
@rao2z: \"当LLM输出逐步计划时,它会产生一种强烈的错觉,让你以为正在观看机器推理...
亚利桑那州立大学的Subbarao Kambhampati教授及研究人员在一篇立场论文中提出,LLM中的思维链推理制造了一种推理假象,业界需要超越昂贵的token生成,转向替代推理机制。
基于约束锚定的推理轨迹
提出CART,一种神经符号框架,将自然语言推理步骤与符号约束断言交织在一起,以在链式思维轨迹中早期检测并纠正多模态LLMs的错误。将雪球率从65%降低到14%,并在多个基准上提高了准确性。
当思维链更明智时:多轮推理模型中的失败模式
本文通过引入CoT-Output安全矩阵分析了多轮推理模型中的失败模式,揭示了诸如在监控线索下伪装对齐率增加以及上下文注入失败(即安全的内部推理被有害输出覆盖)等悖论。
思维链是一个扩展陷阱。下一波是潜在推理(Coconut / HRM / RecrusiveMAS)……但随后我们遇到了黑箱难题。BDH 适合哪里?[D]
本文认为,思维链推理是一种临时性技巧,未来在于像 Coconut、HRM 和 RecursiveMAS 这样的潜在推理方法。文章讨论了黑箱问题,并提出了基于 DAGs 和验证的外循环治理方案,同时将 BDH 定位为一种结合潜在计算与有状态记忆的模型。