SALA: 面向复杂上下文学习的语义感知逻辑对齐框架

arXiv cs.AI 论文

摘要

SALA 是一种语义感知逻辑对齐框架,通过自动学习特定任务的推理操作并使用动态时间规整进行灵活对齐,从而改进上下文学习中复杂推理的示例选择,性能优于现有方法。

arXiv:2609.02336v1 公告类型:新 摘要:有效的上下文学习(ICL)对于复杂推理依赖于选择合适的示例。基于表面相似性的传统检索方法无法捕捉潜在的问题解决逻辑。近期基于逻辑的方法通过匹配预定义的推理步骤来解决这一问题,但刚性规则和精确匹配标准不适合处理灵活或多样的推理过程。为了解决这个问题,我们提出了 SALA,一种语义感知逻辑对齐框架。SALA 不依赖固定库存,而是自动学习特定任务的推理操作。然后,它将这些操作嵌入到连续语义空间中,并使用动态时间规整(DTW)来对齐推理序列。这种方法允许推理逻辑的软性、灵活匹配,同时保持高度可解释性。在四个推理基准和三个 LLMs 上的实验表明,SALA 优于现有的示例选择方法。进一步分析证实了操作归纳和逻辑语义对齐的作用。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:05

# SALA:面向上下文学习中复杂推理的语义感知逻辑对齐  
来源:https://arxiv.org/html/2609.02336  
赵佳  单位:中国珠海中山大学软件工程学院  
单位:中国珠海可信大语言模型重点实验室  
陈文清††thanks:通讯作者。单位:中国珠海中山大学软件工程学院  
单位:中国珠海可信大语言模型重点实验室  
褚志轩  单位:中国杭州浙江大学区块链与数据安全国家重点实验室  
余建兴  单位:中国珠海中山大学人工智能学院  
单位:文化和旅游部可持续旅游智慧评估技术重点实验室,中国珠海  
刘靖平  单位:中国珠海中山大学软件工程学院  
单位:中国珠海可信大语言模型重点实验室  
郑子彬  单位:中国珠海中山大学软件工程学院  
单位:中国珠海可信大语言模型重点实验室  

###### 摘要  
有效的上下文学习(ICL)对于复杂推理依赖于选择合适的示例。传统的基于表面相似度的检索方法无法捕捉潜在的问题解决逻辑。近期基于逻辑的方法通过匹配预定义的推理步骤来解决此问题,但其僵化的规则和精确匹配标准不适合处理灵活多样的推理过程。为解决此问题,我们提出了SALA,一个语义感知逻辑对齐框架。SALA不再依赖固定操作集,而是自动学习任务特定的推理操作。随后,它将这些操作嵌入连续语义空间,并使用动态时间规整(DTW)来对齐推理序列。这种方法在保持高度可解释性的同时,允许对推理逻辑进行柔和、灵活的匹配。在四个推理基准测试和三个大语言模型上的实验表明,SALA优于现有的示例选择方法。进一步分析证实了操作归纳和逻辑语义对齐的作用。  
参见说明图1:任务特定操作的归纳过程示例。

## 1 引言  
大语言模型(LLMs)Ouyang 等人(2022) (https://arxiv.org/html/2609.02336#bib.bib36); Achiam 等人(2023) (https://arxiv.org/html/2609.02336#bib.bib21); Touvron 等人(2023) (https://arxiv.org/html/2609.02336#bib.bib22); Bai 等人(2023) (https://arxiv.org/html/2609.02336#bib.bib23); Ye 等人(2023b) (https://arxiv.org/html/2609.02336#bib.bib37); Bahrini 等人(2023) (https://arxiv.org/html/2609.02336#bib.bib38) 已展现出强大的上下文学习(ICL)能力Dong 等人(2024) (https://arxiv.org/html/2609.02336#bib.bib24); Wies 等人(2023) (https://arxiv.org/html/2609.02336#bib.bib40); Luo 等人(2024) (https://arxiv.org/html/2609.02336#bib.bib39); Bhattamishra 等人(2024) (https://arxiv.org/html/2609.02336#bib.bib41),使其能够从少量带标签的示例中解决复杂推理任务。ICL的性能在很大程度上取决于示例选择,因为有用的示例可以提高准确性Ye 等人(2023a) (https://arxiv.org/html/2609.02336#bib.bib9),而不匹配或有噪声的示例可能会引入推理偏差并降低性能Zhang 等人(2025c) (https://arxiv.org/html/2609.02336#bib.bib12)。选择有用示例的重要性在最近的智能体LLM系统中进一步增强,其中推理经验被存储为记忆并被检索以指导未来任务Ouyang 等人(2025) (https://arxiv.org/html/2609.02336#bib.bib6)。现有研究已改进了通用领域的示例选择Rubin 等人(2022) (https://arxiv.org/html/2609.02336#bib.bib17); Li 等人(2023) (https://arxiv.org/html/2609.02336#bib.bib10); Ye 等人(2023a) (https://arxiv.org/html/2609.02336#bib.bib9); Yang 等人(2023) (https://arxiv.org/html/2609.02336#bib.bib20); Qin 等人(2024) (https://arxiv.org/html/2609.02336#bib.bib18)。然而,大多数检索模型依赖于嵌入相似度,推理逻辑可能被表面语义所掩盖。关键问题是如何表示推理任务的示例。近期面向推理的方法在检索前构建中间表示,包括生成的推理路径Qin 等人(2024) (https://arxiv.org/html/2609.02336#bib.bib18)、推理模式Zhang 等人(2025b) (https://arxiv.org/html/2609.02336#bib.bib4)、潜在推理技能Xu 等人(2024) (https://arxiv.org/html/2609.02336#bib.bib2)和推理图Lin 等人(2025) (https://arxiv.org/html/2609.02336#bib.bib3)。这些方法表明,原始的问题嵌入通常不足,因为与推理相关的信号可能被主题、实体和表面语义稀释。问题解决逻辑(PSL)采用更符号化的方法,将每个问题表示为预定义推理操作的序列,并在操作级别匹配示例Ma 等人(2025) (https://arxiv.org/html/2609.02336#bib.bib11)。这种基于操作的表示减少了表面措辞的影响,并提供了更明确的问题解决过程视图。尽管取得了这些进展,现有的表示方法仍然难以使推理逻辑既可比较又可适应。自由形式的论证或推理路径可以表达多样化的推理过程,但其自然语言形式常常使表示变得有噪声且不稳定。如PSL所探讨的符号操作序列使推理步骤更容易比较,但固定的操作空间和精确匹配规则限制了它们在任务特定和语义等效推理模式上的泛化能力。这促使我们提出一个逻辑对齐框架,该框架在明确表示推理的同时对其进行语义对齐。为此,我们提出了SALA,一个面向推理的语义感知逻辑对齐框架,用于示例选择。SALA通过从下游数据中归纳推理操作来构建任务自适应的操作空间,使示例能够用超出预定义操作集的问题解决单元来表示。图1 (https://arxiv.org/html/2609.02336#S0.F1)说明了当预定义操作集无法完全表达下游问题的推理逻辑时,SALA如何归纳额外的任务特定操作。然后我们将操作描述嵌入连续语义空间,并应用动态时间规整(DTW)来对齐推理操作序列Sakoe 和 Chiba(1978) (https://arxiv.org/html/2609.02336#bib.bib8)。通过这种方式,我们在保持推理表示明确的同时,实现了超越精确符号对应的软语义对齐。我们在三个LLM上的四个推理基准测试上进行了实验。与基于相似性、基于学习和面向推理的示例选择基线相比,SALA实现了更好的平均性能。消融研究进一步表明,任务自适应操作构建和语义序列对齐均对性能提升有贡献。本文的关键贡献如下:  
- • 我们提出SALA,一个面向推理的示例选择框架,它使用明确的操作序列表示问题解决逻辑,并在语义空间中对齐它们。  
- • 我们引入一个任务自适应操作空间,该空间使用从下游数据归纳出的可重用推理单元扩展预定义操作,从而在无需人工设计操作的情况下实现更具表现力的问题解决表示。  
- • 我们设计了一种基于语义DTW的对齐策略,用于衡量具有不同长度和分解粒度的推理操作序列之间的逻辑相似性。  
- • 我们在四个推理基准测试和三个LLM上验证了SALA,显示其相对于最新基线具有一致的平均增益,并通过消融研究确认了操作构建和语义对齐的作用。  
参见说明图2:SALA框架概览。SALA构建一个任务自适应操作集,将查询和示例解析为推理操作序列,并应用基于DTW的语义对齐来检索逻辑相似的示例用于ICL提示。

## 2 相关工作  
现有的ICL示例选择工作Dong 等人(2024) (https://arxiv.org/html/2609.02336#bib.bib24)已从词汇、语义、学习型、多样性和推理感知角度研究了此问题。我们回顾在通用和推理领域中最相关的研究方向。  
### 2.1 通用示例选择  
早期的示例选择方法根据词汇重叠或句子级语义相似性检索示例。稀疏检索方法如BM25Robertson 和 Zaragoza(2009) (https://arxiv.org/html/2609.02336#bib.bib25)估计查询-示例的词重叠,而基于嵌入的方法使用预训练编码器如BERTDevlin 等人(2019) (https://arxiv.org/html/2609.02336#bib.bib26)来检索语义相似的示例。后续研究通过考虑支持性、多样性和组合性改进了这种基本检索范式。例如,支持性示例选择根据示例对目标查询的有用性来选择示例Li 和 Qiu(2023) (https://arxiv.org/html/2609.02336#bib.bib19)。基于DPP的选择平衡了相关性和多样性Yang 等人(2023) (https://arxiv.org/html/2609.02336#bib.bib20),而组合式示例选择超越了最近邻检索,对示例间的交互进行建模Ye 等人(2023a) (https://arxiv.org/html/2609.02336#bib.bib9)。迭代选择进一步表明,示例检索可以被视为一个多步骤过程,而非单次最近邻搜索Qin 等人(2024) (https://arxiv.org/html/2609.02336#bib.bib18)。另一条研究路线将示例选择表述为一个可学习的检索或优化问题。EPR从语言模型反馈中训练一个检索器Rubin 等人(2022) (https://arxiv.org/html/2609.02336#bib.bib17),而UDR学习一个用于跨任务示例选择的统一检索器Li 等人(2023) (https://arxiv.org/html/2609.02336#bib.bib10)。更新的方法使用模型偏好、梯度匹配、强化学习或多示例优化来提高选择质量Zhang 等人(2025c) (https://arxiv.org/html/2609.02336#bib.bib12); Zhang 等人(2025a) (https://arxiv.org/html/2609.02336#bib.bib13); Wang 等人(2025) (https://arxiv.org/html/2609.02336#bib.bib14); Purohit 等人(2025) (https://arxiv.org/html/2609.02336#bib.bib16)。这些方法改进了有用示例的检索,但其选择信号仍然主要来源于输入相似性或模型级反馈,而非推理过程本身。对于复杂推理任务,一个有用的示例不仅应在主题或语义上与查询相关,还应遵循兼容的问题解决逻辑。  
### 2.2 推理示例选择  
近期工作开始构建面向推理的表示。一个方向使用自然语言的推理描述。Skill-KNN在应用基于嵌入的检索之前,将输入重写为基于技能的描述An 等人(2023) (https://arxiv.org/html/2609.02336#bib.bib1)。Luo 等人Luo 等人(2023) (https://arxiv.org/html/2609.02336#bib.bib5)将基于检索的ICL扩展到思维链(CoT)提示,而迭代示例选择使用生成的推理路径来指导示例检索Qin 等人(2024) (https://arxiv.org/html/2609.02336#bib.bib18)。这些方法保持了表示的灵活性,但推理信号仍然以自由形式文本表达,这可能使检索变得有噪声或不稳定。第二个方向引入更结构化的推理表示。推理模式方法根据任务特定的推理模式选择示例Zhang 等人(2025b) (https://arxiv.org/html/2609.02336#bib.bib4),LaRS从CoT论证中学习潜在推理技能Xu 等人(2024) (https://arxiv.org/html/2609.02336#bib.bib2),而RGER将中间推理步骤表示为用于示例检索的推理图Lin 等人(2025) (https://arxiv.org/html/2609.02336#bib.bib3)。对于数学推理,LMS3进一步表明,有用的示例应平衡语义相似性和推理稳定性Liu 等人(2025) (https://arxiv.org/html/2609.02336#bib.bib15)。这些方法比原始问题嵌入提供了更强的面向推理的信号,但潜在技能的可解释性较差,而基于图的表示需要更复杂的跨示例结构匹配。PSL引导的ICL是最密切相关的符号方法Ma 等人(2025) (https://arxiv.org/html/2609.02336#bib.bib11)。它将每个问题表示为预定义的QDMR风格推理操作序列Wolfson 等人(2020) (https://arxiv.org/html/2609.02336#bib.bib33),并通过操作级精确匹配来选择示例。虽然这显示了明确的操作序列表示问题解决逻辑的价值,但它仍然依赖于固定的操作空间和僵化的符号匹配。SALA超越了符号匹配,将操作级推理表示与语义对齐相结合。它从下游数据构建一个任务自适应的操作空间,并使用DTW在语义空间中对齐操作序列,允许明确的推理表示在多样化的推理过程中进行灵活比较。

## 3 方法  
如图2 (https://arxiv.org/html/2609.02336#S1.F2)所示,SALA遵循一个四阶段流程用于面向推理的示例选择,其中自适应操作构建和基于DTW的语义对齐是两个关键机制。  
### 3.1 问题表述  
令$\mathcal{D}=\{(q_i,y_i)\}_{i=1}^N$表示从下游任务训练集派生的示例池,其中$q_i$和$y_i$分别是问题及其答案。给定一个测试查询$q^*$,目标是从$\mathcal{D}$中选择$k$个示例,以支持目标LLM解决$q^*$。对于推理任务,我们将问题的问题解决逻辑建模为一个有序的推理操作序列。给定一个操作集$\mathcal{O}$,一个解析器将问题$q$映射到$\pi(q; \mathcal{O})=[o_1, \ldots, o_m], \quad o_j \in \mathcal{O}$。(1) 构建任务自适应操作集$\mathcal{O}_{task}$之后,我们将查询序列表示为$Q^*=\pi(q^*; \mathcal{O}_{task})$,候选序列表示为$E_i=\pi(q_i; \mathcal{O}_{task})$。示例选择则可表述为:  
$\mathcal{D}_k(q^*)=\operatorname{TopK}_{(q_i,y_i) \in \mathcal{D}} Sim(Q^*, E_i)$, (2)  
其中$Sim(Q^*, E_i)$衡量查询与候选示例之间问题解决逻辑的对齐程度。SALA专注于构建任务自适应操作集$\mathcal{O}_{task}$并通过语义DTW对齐定义$Sim(\cdot, \cdot)$。  
### 3.2 推理操作集的自适应构建  
为了解决固定预定义推理操作集可迁移性有限的问题

相似文章

置信度感知对齐让推理型大语言模型更加可靠

arXiv cs.AI

本文介绍了CASPO框架,该框架通过迭代直接偏好优化(DPO),将token级别的置信度与大型推理模型中的逐步逻辑正确性进行对齐。文章还提出了置信度感知思考(CaT),用于在推理过程中动态剪枝不确定的推理分支,以提高可靠性和效率。

AtManRL: 通过可微分注意力显著性实现忠实推理

arXiv cs.CL

AtManRL 是一种通过可微分注意力操作和强化学习来训练大语言模型的方法,旨在确保推理令牌因果地影响最终预测,从而生成更忠实的思维链推理。在 GSM8K 和 MMLU 上使用 Llama-3.2-3B 进行的实验表明,该方法能够识别具有影响力的推理令牌并提高推理透明度。

KARMA: 基于知识图谱的自动化推理实现与对齐

arXiv cs.CL

KARMA 提出了一种基于知识图谱的方法来生成槽位对齐的对比候选项,并使用槽位并行对齐(SPA)在实体槽位级别应用偏好优化,解决了LLM推理监督中的粒度不匹配问题。

BALAR:一种用于主动推理的贝叶斯智能体循环

arXiv cs.AI

本文介绍了 BALAR,这是一种无需训练的贝叶斯智能体循环算法,使大型语言模型能够在多轮交互中进行主动推理并提出澄清性问题。该算法在侦探、谜题和临床诊断基准测试中显示出比基线方法显著的性能提升。

LaSR:基于潜在推理的上下文感知语音识别

arXiv cs.CL

LaSR提出了一种针对上下文感知语音识别的潜在推理训练范式,围绕声学特征对齐思维链监督,以在无额外延迟的情况下提高术语识别能力,在Fun-Audio-Chat上优于标准微调。