SICI:一种语义-语用复杂度指数揭示LLM立场检测中的状态转变
摘要
介绍了SICI,一种七维诊断指标,用于评估LLM立场检测中的语义-语用复杂度,揭示了不同模型和提示策略中错误模式的状态转变。
arXiv:2606.13189v1 公告类型:新
摘要:基于提示的LLM越来越多地用于立场检测,但更难的示例并不总是通过更清晰的指令、推理提示、检索或辩论来修复。我们引入了SICI(立场推断复杂度指数),这是一种七维诊断指标,用于衡量目标-文本对施加的语义-语用负担。在SemEval-2016和VAST上,SICI预测LLM准确率优于表面代理,并显示出显著的跨评分者信度($\alpha=0.771$)。更重要的是,随着SICI增加,LLM错误发生状态转变:低复杂度示例容易过度归因,尤其是反对预测;中等复杂度示例形成不稳定边界;高复杂度示例迅速集中在无立场上。这种类似相变的结构在GPT-3.5、GPT-4o-mini、DeepSeek-V3和GPT-4o中持续存在,尽管更强的模型移动了边界。一项15种方法的干预研究进一步表明,提示、检索和辩论往往使模型沿着归因-弃权轴移动,而不是消除高复杂度瓶颈。
查看缓存全文
缓存时间: 2026/06/12 08:51
# SICI:语义-语用复杂性指数揭示LLM立场检测中的状态转变
来源:https://arxiv.org/html/2606.13189
付强牛¹, 张文博² ¹中国科学技术大学网络空间安全学院,合肥,中国 ²深圳技术大学人工智能学院,深圳,中国
###### 摘要
基于提示的LLM越来越多地用于立场检测,但更难的例子并不总是能通过更清晰的指令、推理提示、检索或辩论得到修复。我们引入SICI(立场推理复杂性指数),这是一种七维诊断指标,用于衡量目标-文本对施加的语义-语用负担。在SemEval-2016和VAST上,SICI预测LLM准确率的效果优于表面代理指标,并显示出显著的跨评分者信度(α=0.771)。更重要的是,随着SICI增加,LLM的错误模式发生状态转变:低复杂性样例容易引起过度归因,尤其是反对预测;中等复杂性样例形成不稳定的边界区域;高复杂性样例则迅速集中在“无立场”。这种类似相变的结构在GPT-3.5、GPT-4o-mini、DeepSeek-V3和GPT-4o中均持续存在,尽管更强模型会移动边界。一项15种方法的干预研究进一步表明,提示、检索和辩论往往沿着归因-弃权轴移动模型,而非消除高复杂性瓶颈。
SICI:语义-语用复杂性指数揭示LLM立场检测中的状态转变
付强牛¹, 张文博² ¹中国科学技术大学网络空间安全学院,合肥,中国 ²深圳技术大学人工智能学院,深圳,中国
## 1 引言
立场检测旨在判断文本是否表达出对某个给定目标的“赞成”、“反对”或“无立场”(Mohammad等,2016;Aldayel和Magdy,2021)。随着大语言模型(LLM)的兴起,近期工作越来越多地将立场检测视为基于提示的推理:模型接收文本、目标、标签定义,有时还包含示例或推理指令,然后输出一个立场标签。这种范式自然催生了更丰富的诱导策略,包括零样本和少样本提示、思维链推理、证据导向提示、检索增强以及多智能体讨论或投票。
这些策略基于一个看似合理的假设:如果LLM已经具备相关的语言和世界知识,那么更清晰的指令、更多的示例、明确的推理或额外的上下文应该能够引出更好的立场判断。但对于困难的立场样例,实证结果并不那么确定。已有工作探索了思维链、反事实和知识增强提示用于立场检测(Weinzierl和Harabagiu,2024;Taranukhin等,2024;Zhang等,2024),近期工作还研究了多路径推理、隐式目标增强和刻板印象敏感的LLM评估(Zhang等,2025;Ji等,2025;Dubreuil等,2025)。这些研究表明,当立场是隐式的或与目标相关的证据薄弱时,额外的推理或外部信息并不会自动带来可靠的提升。这提出了一个基本问题:是什么限制了基于提示的LLM在困难样例上的立场检测?
我们认为,这种局限性不能仅仅理解为模型提示方式的问题。立场样例在推理负担上存在显著差异。有些文本明确提及目标并陈述直接态度。其他文本则讨论相邻议题,依赖语用隐含或背景知识,包含情感但目标含糊,或者缺乏足够证据来支持立场判断。因此,困难样例不仅仅是相同标签选择问题的困难版本:它们可能需要定性和定量上不同的语义-语用推理才能授权一个立场标签。
为了研究这种变异来源,我们引入SICI,即立场推理复杂性指数。SICI结合了七个语义-语用维度:目标可见性、范围对齐、语用隐含性、知识需求、上下文依赖性、标签模糊性和极性-立场差距。其目的并非替代标准指标如准确率、宏F1或SemEval的Favg分数。相反,它提供了一个轴来提出一个不同的问题:随着立场推理变得更加复杂,LLM的错误如何变化?
我们的主要发现是:LLM的错误并非随SICI平滑下降。相反,它们在错误模式之间表现出一种类似相变的转变。在低复杂性下,模型倾向于过度归因立场,并明显偏向“反对”。在中等复杂性下,准确率急剧下降,形成一个不稳定的边界区域。在高复杂性下,预测迅速集中在“无立场”,产生一个弃权主导的模式。分段回归显著优于线性模型,表明这一模式不能很好地解释为简单的单调难度下降。
这种状态结构在模型和数据集上定性一致。更强的模型提高了总体性能并移动了转变边界,但它们并未消除这种转变本身:GPT-4o减少了低复杂性下的“反对”过度预测,而在高复杂性区域变得更倾向于“无立场”预测。跨数据集分析进一步表明,“无立场”在语义上并不统一。在SemEval中,高SICI样例常包含隐式立场,因此“无立场”预测常反映虚假弃权。在VAST中,许多高SICI样例实际上确实是未充分指定的,并被标注为“无立场”,使得弃权通常更为恰当。
最后,我们通过系统的干预研究回到提示瓶颈问题。我们评估了多种基于提示的干预方法,包括思维链、多步推理、SICI感知提示、检索增强、多智能体辩论和投票。这些干预方法并未可靠地打破高复杂性瓶颈。相反,它们常常沿着归因-弃权轴移动模型:鼓励间接推理的提示可以减少一些“无立场”预测,但会增加虚假归因;而强调谨慎或范围澄清的提示可以减少过度归因,但同时推动模型走向过度的“无立场”。
我们的贡献是:
(1) 我们识别出LLM立场检测中的一个提示瓶颈:困难样例不仅未能被更强的诱导方法充分服务,而且由语义-语用推理复杂性所组织。
(2) 我们引入SICI,一个七维的立场推理复杂性诊断指标,并表明它能够解释超出表面特征(如长度、词汇多样性、否定密度)之外的模型行为。
(3) 我们展示LLM立场错误表现出一种类似相变的状态转变:从低复杂性的过度归因,经过不稳定的边界区域,到高复杂性的“无立场”弃权。
(4) 我们证明这种结构在模型和数据集上定性稳健,并且提示、检索、辩论和投票干预通常会在虚假归因和虚假弃权之间进行权衡,而非同时解决两者。
## 2 相关工作
### 立场检测。
立场检测已在共享任务和基准数据集中得到形式化,例如SemEval-2016 Task 6(Mohammad等,2016)、VAST(Allaway和McKeown,2020)、P-Stance(Li等,2021)以及多目标或基于对话的变体(Wei等,2018;Li等,2023b, c)。早期的神经网络方法使用目标特定注意力、记忆网络、图模型和迁移学习来建模文本与目标之间的关系(Du等,2017;Wei和Mao,2019;Liang等,2021;Zhang等,2020)。预训练语言模型和推特特定编码器(如BERT和BERTweet)进一步提升了领域内和跨目标性能(Devlin等,2019;Nguyen等,2020)。近期工作还整合了背景知识、常识或基于提示的推理(Liu等,2021;Li等,2023a;Ding等,2024b)。我们的工作是互补的:我们并非提出另一个立场分类器,而是询问哪些实例属性系统性地决定了LLM分类器何时失败。
### 零样本和基于LLM的立场推理。
零样本立场检测具有挑战性,因为测试目标可能未在训练中出现(Allaway和McKeown,2020;Liang等,2022;Allaway等,2021)。LLM提示提供了自然的零样本接口,思维链或基于解释的变体已被探索用于隐式立场和社交媒体推理(Wei等,2022b;Gatto等,2023;Ding等,2024a)。近期LLM时代的立场工作探索了意识形态或树状视角上的推理、检索增强知识以及针对零样本目标的立场特定提示(zhang2024knowledge;Taranukhin等,2024;Zhang等,2024)。其他近期研究强调用于可解释性的多路径推理(Zhang等,2025)、LLM驱动的隐式目标增强以处理目标稀疏样例(Ji等,2025),以及刻板印象敏感的零样本LLM立场检测评估(Dubreuil等,2025;zhang2025logic)。我们与这些工作的区别在于将困难本身作为测量对象。我们不添加推理路径、目标或公平性探测,SICI询问哪些语义-语用属性预测这些系统何时失败。
### 难度、校准和状态转变。
实例难度通常通过模型不确定性、一致性或表面特征来估计。这些信号是有用的,但当相同模型既定义难度又评估难度时,可能会变得循环。我们改为使用目标-文本对的语义-语用属性来定义SICI,然后验证其跨评分者的一致性及其与独立预测行为的关系。我们对状态转变的概念受到机器学习系统中涌现能力和类似相变行为的研究启发(Wei等,2022a)。与缩放定律研究(分析模型能力作为模型或计算规模的函数)不同,我们研究作为*实例复杂性*函数的行为转变。
## 3 SICI框架
### 七个维度。
SICI为每个目标-文本对分配七个0-4的分数,涵盖目标可见性、范围对齐、语用隐含性、知识需求、上下文依赖性、标签模糊性和极性-立场不匹配(表1)。相应推理阶段的详细信息见附录A。
| 维度 | 测量问题 | 低分示例 | 高分示例 |
|------|----------|----------|----------|
| VV:目标可见性 | 目标是否明确提及? | 目标被直接命名 | 从关于政策的推文中推断对政治家的立场 |
| SS:范围对齐 | 文本主要讨论目标吗? | 文本紧扣目标 | 文本讨论相关但偏离的主题 |
| PP:语用隐含性 | 立场是否间接表达? | 直接支持/反对 | 讽刺、隐喻、修辞性暗示 |
| KK:知识需求 | 是否需要背景知识? | 文本自包含 | 需要了解某项法律、事件或团体关系 |
| CC:上下文依赖性 | 是否需要外部对话上下文? | 独立文本 | 回复或引用,缺乏先前语境 |
| AA:标签模糊性 | 黄金标签在语义上是否有争议? | 明确的标签边界 | 混合或未充分指定的立场 |
| GG:极性-立场差距 | 情感极性与立场是否一致? | 情感与立场匹配 | 积极情感用于通过讽刺表达反对 |
表1:SICI的七个语义-语用维度。每个维度从0(低推理负担)到4(高推理负担)评分。它们共同追踪一个多阶段的立场推理链,从目标识别到极性-立场桥接。
### 指数定义。
给定七个分数 d1,...,d7 ∈ {0,1,2,3,4},我们定义:
SICI(x,t) = 0.65 · (mean(d1,...,d7) / 4) + 0.35 · (max(d1,...,d7) / 4). (1)
指数范围从0到1。均值项捕获累积负担,而最大项捕获瓶颈,即一个严重的模糊性可能主导整个实例。我们使用相等的维度权重,因为与手动加权变体的试点比较产生了几乎相同的分数(Pearson r = 0.9996)。
### 评分协议与信度。
主要的SICI分数由GPT-4o-mini使用维度特定的评分准则和独立的0-4判断生成。为了测试SICI是否是模型特有现象,我们还用Claude Haiku 4.5和DeepSeek-V3对200个分层抽样的实例进行评分。两两Spearman相关性较高:GPT与Claude为0.829,GPT与DeepSeek为0.853,Claude与DeepSeek为0.884。三方有序Krippendorff's α为0.771,高于实质性一致的传统阈值。这并不消除人工验证的必要,但它支持SICI捕获的是目标-文本对的稳定属性而非单一模型的预测偏好这一主张。
评分提示特意与立场预测分离。评分者被要求判断实例的七个属性,而不是预测“赞成”、“反对”或“无立场”。这种分离很重要,因为基于随后进入评估的相同预测置信度的难度度量会有循环风险。在我们的分析中,SICI在任何干预比较之前计算,并在所有下游模型和提示中保持不变。因此,相同的SICI值用于分析GPT-3.5、GPT-4o-mini、DeepSeek-V3、GPT-4o以及所有干预变体。
### 从维度到状态。
SICI支持两种互补用途。首先,作为连续得分,它按预期推理复杂性对实例进行排序。其次,通过经验拟合的边界,它将数据划分为不同状态。我们使用两个转变点,b1=...(原文此处截断,但根据上下文,后续应继续)。相似文章
LLM辅助的科学话语立场检测:以贝叶斯认知科学为案例研究
本文提出了一种利用LLM进行科学话语立场检测的方法,具体用于识别贝叶斯认知科学文章中现实主义与工具主义的对立立场。该方法结合了理论驱动编码、专家标注和提示优化,实现了高可靠性。
同一位患者,不同的表述,不同的诊断?评估临床大语言模型的语义稳定性
本文提出了一种基于自然语言推理(NLI)的语义验证框架,用于评估临床大语言模型对保留语义的提示变化的敏感性,并引入了MVS、ΔC和WCI等度量指标。结果表明,领域专业化并不能持续提高鲁棒性,领域专用模型和通用模型的表现均参差不齐。
面向多模态情感分析的语义对齐结构抽象
本文提出了SentiLLM,一个利用语义对齐结构抽象将非语言模态提炼为类文本标记的框架,用于基于大语言模型的多模态情感分析。它引入了一种双流显著性-上下文校准机制,并在四个数据集上取得了优越的性能。
量化基于LLM的公共话语立场分析中的不稳定来源
本文提出一个诊断框架,用于在基于LLM的公共话语立场分析中分离预处理流程不稳定性和测量方法不稳定性,发现跨方法的不一致性比流程效应更大且更具系统性,并且聚合指标可能会掩盖这些不稳定性。
文档草垛中的语义针:LLM-as-a-Judge 相似度评分的敏感性测试
PNNL 与华盛顿大学的研究人员提出一套系统化框架,测试五种大语言模型在文档中捕捉细微语义变化的能力,揭示位置偏差、上下文连贯效应及模型特有的评分“指纹”。