“别说!”: 语言模型在禁忌游戏中的约束、合规与沟通
摘要
本文评估了语言模型在词汇约束下玩禁忌游戏的表现,展示了合规性与沟通效果之间的权衡,并发现模型作为猜测者比人类弱。
arXiv:2607.00601v1 公告类型:新
摘要:禁忌游戏要求描述一个目标词,同时不能使用一组禁止词,以便其他玩家能够猜出它。这个看似简单的任务结合了严格的词汇约束和有效沟通描述的需求,使其成为一个引人入胜的试验场,用于检验语言模型在推理时如何在相互竞争的需求之间导航。我们评估了两种开源模型,在从提示到生成约束再到内部表示操作等逐步深入生成过程的不同条件下进行干预。我们通过禁用词违规检测、语言模型作为法官评估生成的描述在多大程度上成功唤起目标概念(针对人类和机器猜测者),并检查模型在约束下采取的策略是否与人类玩家一致,来评估其输出。我们的结果表明,遵守游戏规则与沟通有效性在不同条件下存在不同的权衡,并且模型作为猜测者仍然远不如人类,这表明在约束下的词汇基础是当前语言模型的一个开放挑战。
查看缓存全文
缓存时间: 2026/07/02 05:37
# “别说出来!”:语言模型玩Taboo时的约束、遵守与沟通 来源:https://arxiv.org/html/2607.00601 \copyrightclause 本文作者版权所有。根据知识共享署名4.0国际许可协议(CC BY 4.0)允许使用。 \conference CLiC-it 2026:第十二届意大利计算语言学会议,2026年9月14日至16日,意大利巴勒莫 [ orcid=0009-0004-5198-6970, [email protected], ]\fnmark[1] [ orcid=0009-0007-3489-9631, [email protected], ]\fnmark[1] [orcid=0009-0006-0518-6504, [email protected], ]\fnmark[1] [orcid=0000-0001-5289-0971, [email protected] ] \cortext [1]通讯作者。 \fntext[1]这些作者贡献相同。 Francesca Padovani 语言与认知中心(CLCG),格罗宁根大学,荷兰 Daniel Scalena 米兰比可卡大学,意大利 Malvina Nissim (2026) ###### 摘要 Taboo游戏要求描述一个目标词,同时不能使用一组禁用词,以便其他玩家能够猜出它。这个看似简单的任务结合了严格的词汇约束与沟通有效性的需求,使其成为检验大语言模型在推理时如何应对相互竞争需求的一个引人入胜的测试场。我们在从提示到生成时约束再到内部表征操作等逐步深入生成过程的条件设置下,评估了两种开放权重模型。我们通过禁用词违规检测、以LLM作为评判者来衡量生成描述在人类和机器猜词者中成功唤起目标概念的程度,以及考察模型在约束下采用的策略是否与人类玩家一致,来评估模型的输出。我们的结果表明,对游戏规则的遵守和沟通有效性在不同条件下存在不同的权衡,并且模型作为猜词者明显弱于人类,这表明在约束条件下的词汇基础化是当前语言模型面临的一个开放性挑战。 ###### 关键词: Taboo \sep 提示工程 \sep 约束生成 \sep 词汇猜测 \sep SAEs ## 1 引言 Taboo游戏要求玩家描述一个目标词,同时不能使用一组禁用词,以便另一个玩家能够猜出它。除了作为桌游的吸引力之外,Taboo体现了一个语言学上具有挑战性的问题:说话者必须抑制一些在词汇和概念上显著的词,同时生成足够信息量的描述以识别目标。这种约束满足与沟通有效性的结合,使其成为在超越标准指令遵循基准的环境下探测语言模型的特别合适的场景。特别是,目前尚不清楚在约束下生成的描述是否符合任务要求——即它们是否足够详细、是否足够显著以唤起目标概念、以及是否具有足够的沟通有效性以使游戏成功完成。在本文中,我们研究LLM如何用意大利语玩Taboo,评估了两种开放权重模型,条件设置逐步深入生成过程:从提示,到生成时约束,再到内部表征的操作。为了将评估建立在实际游戏玩法之上,我们进行了一项人类研究,其中角色在双向互换:人类评估者阅读模型生成的描述并尝试猜测目标词,反之亦然。这种双向设计使我们能够直接评估生成的描述在传达目标概念方面的成功程度,以及模型和人类采用的描述性选择是否相互可解释。我们的发现揭示了规则遵守与描述质量之间的关系在不同条件下有显著差异,并且模型在猜词角色中远不如人类,这表明在约束下的词汇基础化是当前语言模型面临的一个开放性挑战。 ## 2 相关工作 ##### 语言游戏作为 NLP 基准 基于词的游戏已被用作NLP的试验场,提供定义明确的规则和可衡量的目标,适合基准测试。在意大利语NLP社区中,语言游戏作为语言能力探针引起了越来越多的关注:电视游戏La Ghigliottina既被专门的NLP系统处理过[sangati-etal-2020-challenge],也被用于基准测试LLM[manna-etal-2024-riddle],而对谜语(rebus)和填字游戏(crossword)的研究揭示了在需要组合、语音和横向推理的任务中存在的持续局限性[sarti-etal-2024-non, sarti-etal-2024-eurekarebus, ciaccio-etal-2025-crossword, ciaccio2026cruciverbit]。在意大利语之外,诸如NYT Connections[loredo-lopez-etal-2025-nyt]和Codenames[stephenson2025codenamesbenchmarklargelanguage]等基准测试一致表明,在需要刻意推理和心智理论的任务上,LLM与人类表现之间存在显著差距。文字游戏也被研究作为训练环境:horst-etal-2025-playpen表明LLM可以从对话游戏自我对弈反馈中学习,Taboo是其中的训练游戏之一。与我们工作最接近的是cywinski2025elicitinglatentknowledgellms,他们专门在LLM可解释性的背景下研究Taboo,将该游戏作为引发潜在知识的测试。我们的工作范围不同:我们并不聚焦于单一干预,而是系统地比较生成过程多个层次上的约束执行策略,并且我们进一步将评估建立在实际人类游戏玩法之上。 ##### 约束文本生成 对开放源码LLM在约束文本生成上的全面评估表明,即使在相对简单的词汇约束上,模型也表现出系统性缺陷。基于提示的方法存在位置偏差,并且在处理形态复杂形式时存在困难,而更严格的格式约束已被证明会导致性能下降[yao2024collie, tam-etal-2024-speak]。ciaccio-etal-2024-controllable评估了几个意大利语LLM在生成符合形态句法规范的句子方面的能力,发现模型和约束类型之间存在系统性缺陷。calderaro-etal-2025-oulibench进一步表明,即使是顶尖的专有模型在面对意大利语中的细粒度语言限制时也持续表现不佳,并且更严格的要求往往更严重地降低输出质量。这些发现促使我们决定超越提示,选择不同类型的干预。 ##### 机制可解释性与SAEs 超越提示,对输出控制更直接的方法是logit屏蔽,即在每个解码步骤将禁用token的概率设为负无穷,如willard2023efficientguidedgenerationlarge及其前身hokamp-liu-2017-lexically提出的框架所实现的那样。在更深层次上,通过内部模型表征进行概念操作提供了一种替代方法。它不抑制表面token,而是使用稀疏自编码器(SAEs)[cunningham2023sparseautoencodershighlyinterpretable]针对模型中编码的概念进行操作。它们将密集的LLM激活分解为稀疏的、单一语义的特征[templeton2024scaling],这些特征可以在推理时被消融,而无需修改模型权重。此外,特征的可解释性并不能保证其作为引导目标的有效性:干净表示某个概念的特征可能对模型的输出几乎没有因果影响——我们在词汇回避的背景下帮助描述了这一差距及其限制。 参见标题 图1: Taboo卡片的示例。顶部是要猜测的词。下面的五个词禁止出现在描述中。 ## 3 方法论 ### 3.1 数据与模型 数据集包含194张意大利语Taboo卡片,从桌面游戏的实体版本手动转录而来。每个示例包含一个目标词和一个禁用词列表,这些禁用词不能出现在描述中。我们实验了两种开放权重模型。google/gemma-3-4b-it[gemma_2025]是一个轻量级的指令微调模型,因其通用性能强大且提供了预训练的SAEs而入选,这些SAEs与我们基于可解释性的实验条件兼容。openai/gpt-oss-20b[openai2025gptoss120bgptoss20bmodel]是一个混合专家(MoE)推理模型,通过思维链强化学习进行了后训练,用于评估显式推理在约束描述生成中的作用,在有推理和无推理条件下进行评估。生成有效的Taboo描述需要隐式地提前规划:模型必须生成语义信息丰富的描述,同时避免一组词汇相关的禁用词。因此,我们预计显式推理在此任务中会发挥重要作用。 ### 3.2 禁止实验 我们研究了三个层次的禁止,每个层次都在模型行为的不同层面进行干预。在第一个条件下,模型被*提示*提供目标词和禁用词列表,类似于人类玩家在轮到自己之前的指示方式。第二个条件将干预下移至生成阶段,*在生成过程中约束模型*,直接阻止产生禁用的token。第三个条件在内部表征层面运作,*操纵模型的潜在空间*,以抑制与禁用词对应的编码概念。 #### 3.2.1 提示 提示是针对每张卡片程序化构建的,将禁用词列表和目标词嵌入用户消息中。为确保输出干净且可比较,我们还提供了输出指令,指定模型应仅返回描述,不包含任何周围文本,并且限制在30个词以内。提示明确指示模型不仅要避免完全一致的禁用词,还要避免任何来自相同词根的派生词,以完全遵守游戏规则。完整的提示结构见附录A的表LABEL:tab:prompt_example。值得注意的是,提示并未明确指示模型避免在描述中使用目标词本身,这种错误会直接导致模型输掉游戏。我们认为最好通过实证评估这种情况发生的程度,并将此分析推迟到第3.3节。在附录A中,我们还报告了使用一种宽松提示变体获得的结果,该变体省略了形态约束,并讨论了这种简化对模型行为的影响。 #### 3.2.2 生成时约束 ##### 先验词汇审查 在生成开始之前,我们根据禁用词列表计算一个静态的禁用token集合。对于每个禁用词,我们提取所有词干,并禁止任何表面形式是该词干或词元前缀的词汇token,反之亦然。然后,通过在每个解码步骤将它们的logit设为负无穷来屏蔽这些禁用token,使它们无论上下文如何都无法被采样。一个关键的设计选择是使用形态规范化而非精确字符串匹配:审查范围从字面禁用词扩展到其屈折和派生形式。因此,模型被迫使用同义词或迂回说法来表达禁止元素。推理过程完全自由。 ##### 推理时约束生成 先验方法的一个局限是它无法根据生成上下文来条件化禁止,偶尔会抑制在描述中本应合适但与禁用词共享词根的token。关于其激进性的一个实际例子见附录B。我们通过动态约束推理过程来解决这个问题。我们不事先禁止token,而是允许模型自由生成,并在检测到完整单词时进行干预;然后将其词干与禁用词列表进行比较。如果匹配,则生成回退到违规单词的第一个token,该token被添加到持久的基于位置的掩码中,然后从该位置恢复生成,同时抑制触发token。与先验方法相比,它操作的是完整的表面形式而非子词片段,避免了虚假禁止,同时由于可能的回溯,计算开销更高。 #### 3.2.3 模型操作 我们还探索了一种基于表征的方法,在生成时直接干预模型的残差流。该操作分为两个阶段:特征识别和引导生成。 ##### 特征识别 对于每个禁用词 w_i,我们通过让模型运行在简短的自然提示“La parola vietata è w_i”(翻译:“禁用词是 w_i”)上,并提取 google/gemma-3-4b-it 第29层[第29层对应于约85%的网络深度,其中表征在语义内容上更丰富(见附录C)]的残差流激活,来识别与该词最强烈关联的 SAE 特征。这些激活经过来自 google/gemma-scope-2-4b-it[lieberum-etal-2024-gemma]的预训练 JumpReLU SAE,使用宽度为65k的残差后挂钩。选择在对应于 w_i 的token跨度上激活最强的特征作为其代表。此过程应用于一张卡片中的所有禁用词,产生一组特征索引 {f_1, ..., f_k}。 ##### 引导生成 在生成时,我们在同一个残差流层注册一个前向挂钩。在每个解码步骤,我们计算所选特征的平均解码器向量 d = (1/k) Σ_j w^{dec}_{f_i},并应用一个基于激活范数的干预:h' = h + α · ||h||₂ · d,将残差流*偏离*与禁用概念相关的方向。否则,模型在没有任何提及禁用词的情况下被提示,仅接收目标词和标准输出指令。整个过程在推理时运行,无需修改模型权重。 ### 3.3 评估 ##### 违规确切数量 我们通过若干指标评估描述生成中的约束遵守情况。**准确率**衡量完全符合游戏规则的有效描述百分比,即输出中既不包含完全一致的禁用词,也不包含任何形态相关形式。**确切违规占比**报告描述中模型逐字使用禁用词之一的百分比。**形态违规占比**报告描述中模型产生与禁用词共享相同词干或词元的词的百分比。**不适用占比**排他性。
相似文章
语言模型知道不该说什么吗?LLMs中统计抢占的因果证据
本文提供了因果证据,表明大型语言模型通过微调操纵竞争形式频率,能够获得统计抢占(构式语法中的一种机制)所涉及的负面语言知识(即不该说什么),且行为变化符合预测方向。
违者自负:大语言模型在认知不对称下的语用合作困境
本文研究了在认知不对称条件下,大语言模型是否在多主体协作任务中表现出语用合作性,形式化了格莱斯的合作原则,并评估了大语言模型作为说话者和听者的能力。结果表明,尽管大语言模型表现出一定的语用能力,但在信息不完整的情况下仍存在困难,并且未能识别某些违反格莱斯准则的情况。
探索大语言模型在中文抽象语言掌握中的能力边界
本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。
审视LLM中类人行为:模型行为、用户因素和系统提示的多维度分析
本文对LLM中的类人行为进行了多维度分析,研究了来自四个模型的21,000个对话中的普遍性、影响和可控性,发现行为因模型和用户因素而异,并对负责任的设计具有启示意义。
一致但校准不佳:评估LLM在自然语言风险沟通中的局限性
本文评估了九个LLM在自然语言中准确传达概率预测的能力,发现模型表现一致但校准不佳,尤其是在不确定性任务上。