GUIDE:通过语音和视觉共享ID编码的生成式无监督中文查询纠正
摘要
GUIDE 是一个用于中文查询纠正的生成式无监督框架,利用语音和视觉共享ID编码来约束纠正并适应不断变化的词汇,在实验和在线A/B测试中超越了基线。
arXiv:2608.25343v1 公告类型:新
摘要:中文查询纠正(CQC)对于内容平台上的搜索和查询推荐至关重要,但监督方法依赖于大量的标注纠正对,随着查询词汇的演变,维护成本高昂。使用语言模型的无监督纠正很有吸引力,但在短查询设置中,无约束生成常常将模糊输入过度纠正为高频短语,导致意图漂移。我们提出了 \textsc{GUIDE},一个基于先混淆后澄清范式的CQC生成式无监督框架。\textsc{GUIDE} 使用共享ID编码语音或视觉上易混淆的字符,并通过编码器-解码器架构重构原始查询,这在从无标注查询流中学习的同时,将纠正约束在合理的混淆邻域内。一个时间衰减、查询频率加权的目标函数进一步支持了快速变化查询词汇的适应。在 \textit{QSpell 250K} 和大规模真实数据集(\textit{KwaiSearch})上的实验表明,\textsc{GUIDE} 持续优于强大的基线,而在线A/B测试进一步证实了在纠正质量和下游参与度方面的提升。
查看缓存全文
缓存时间: 2026/08/27 09:18
# 指南:通过音形共享ID编码的生成式无监督中文查询纠错 来源:https://arxiv.org/html/2608.25343 Binbin Huang††通讯作者。隶属:快手科技;复旦大学数据科学学院。通讯邮箱:[[email protected]](mailto:[email protected]) Jiwei Tan 隶属:快手科技 Xuhui Sui 隶属:快手科技 Chang Tu 隶属:快手科技 Yi Wang 隶属:快手科技 Han Li 隶属:快手科技 ###### 摘要 中文查询纠错(CQC)对于内容平台的搜索和查询推荐至关重要,但监督学习方法依赖大规模标注纠错对,而随着查询词表的演变,维护这些标注成本高昂。基于语言模型的无监督纠错虽然具有吸引力,但在短查询场景下,无约束的生成常会将模糊输入过度纠正为高频短语,导致意图偏移。我们提出了GUIDE——一个基于“混淆-澄清”范式的生成式无监督CQC框架。GUIDE通过共享ID编码音近或形近字符,并采用编码器-解码器架构重构原始查询,从而在从未标记的查询流中学习的同时,将纠正范围约束在合理的混淆邻域内。此外,引入时间衰减的查询频率加权目标函数,以更好地适应快速变化的查询词表。在QSpell 250K和大规模真实数据集(KwaiSearch)上的实验表明,GUIDE始终优于强基线模型;在线A/B测试进一步证实其在纠正质量和下游用户参与度上的提升。 ## 1 引言 搜索查询直接表达用户意图,决定着检索和展示的内容。在YouTube、TikTok等大型内容平台上,查询推荐模块(包括搜索建议、自动补全和相关查询推荐)通常基于历史搜索日志和用户交互构建(Bacciu等,2024)。因此,查询流中的拼写错误和非规范变体可能被反复曝光、点击和重复挖掘,导致噪声形式在下游检索、排序和推荐管道中传播(Gao等,2010;Sun等,2012)。这使得*中文查询纠错*成为工业搜索系统中的重要问题。 尽管中文拼写纠错常在句子层面进行研究,但CQC在实际应用中更具挑战性,因其面临若干查询特有的约束(Yang等,2023;Su等,2025):(1)**上下文稀疏**:查询提供的语境有限,难以判断是否需要编辑及用户真实意图;(2)**快速演变**:词表随新梗、网红和新兴实体快速变化;(3)**创造性使用**:同音字可能是有意双关——例如“钱途”(字面意思“金钱之路”,即“赚钱的前景”)谐音其同音词“前途”(qiántú,“未来前景”)——因此“不同”未必是错误;(4)**标注稀缺**:大规模查询标注成本高昂,即使百万级标注对也仅覆盖实际错误的一小部分。这些约束使得CQC本质上是一个可控编辑问题:系统不仅要决定纠正什么,还要判断何时纠正以及允许偏离原始表达的程度。 现有方法仅部分解决了这一挑战。监督式纠正器从标注对中学习纠正策略(Zhang等,2020;Xu等,2021),但在词表快速变化下收集和更新标注成本极高。弱监督方法通常通过合成破坏构建伪对(Liu等,2021;Li,2022),但这引入了人为设计的噪声过程,可能与真实查询错误不匹配。基于语言模型的免训练纠正虽具吸引力(Hong等,2019;Zhou等,2024),但无约束或弱约束解码常过度纠正短模糊查询、引入不必要编辑或无法保持原始查询长度(Li等,2023;Liu等,2024)。 这些局限表明,有效的无监督CQC不应依赖自由形式的重写。纠正应基于真实输入错误所诱导的、受语言书写和输入系统塑造的合理混淆邻域。基于此直觉,我们提出GUIDE——一个基于“混淆-澄清”范式的生成式无监督框架。核心思想是将易混淆字符映射到共享ID,并训练编码器-解码器模型重构原始字符序列。这种共享ID重构目标将字符混淆结构转化为学习信号:编码器被鼓励容忍现实歧义,而解码器则被强制将其澄清为具体查询。因此,GUIDE能从未标记查询流中学习可控纠正,无需人工标注纠错对。 对于中文,这些邻域自然对应两类主要查询错误:**音近替换**,以及程度较轻的**形近替换**(Liu等,2010;Wu等,2013a)。这些错误模式与中文输入法编辑器(如拼音和手写输入)密切相关。据此,我们通过两种互补的聚类策略实现GUIDE:基于拼音混淆度的音近共享ID聚类,和基于图像字符相似度的形近共享ID聚类。在此基础上,我们训练一个编码器-解码器Transformer,采用时间衰减的查询频率加权目标函数,使模型能持续适应演变搜索流量中近期和高频的查询。 我们的贡献如下: - 提出GUIDE,一个基于“混淆-澄清”范式的生成式无监督中文查询纠错框架,其中音形共享ID编码为弱查询上下文下的可控纠错提供了显式归纳偏置。 - 展示了共享ID重构如何实现从未标记查询流中学习,无需错误-纠错对。 - 发布了内部搜索日志数据集KwaiSearch,并在QSpell 250K和KwaiSearch上取得强劲结果,在线A/B测试验证了效果。 ## 2 方法论 ### 2.1 问题定义与概述 设$\mathcal{D} = \{(x_i, t_i)\}_{i=1}^N$表示从日志收集的$N$个中文字符查询训练集,其中$x_i = \{x_{i,1}, x_{i,2}, \dots, x_{i,m_i}\}$是时间$t_i$的观测(可能错误)查询。CQC任务将输入查询$x_i$映射到纠错查询$y_i = \{y_{i,1}, y_{i,2}, \dots, y_{i,m_i}\}$,其中$y_i$与$x_i$长度相同,仅在错误字符位置不同。CQC中的错误常源于音近或形近候选字,典型示例如表1所示。 **表1:中文拼写错误中音近候选字(PSC)和形近候选字(VSC)示例** 拼错字符标红,正确形式标蓝。音近错误为拼音输入导致的同音节混淆(常仅声调不同);形近错误为共享部首/部件的形似字。 为避免弱查询上下文下的非预期重写,GUIDE通过字符聚类和序列重构约束纠正。如图1所示,框架包含两个核心阶段:(1)字符聚类,将输入查询映射为音近或形近共享ID序列;(2)中文查询纠错,使用编码器-解码器Transformer重构原始字符序列。 **图1:GUIDE框架概述** 包含两种基于聚类的纠正模型:左侧为同音模型,右侧为视觉相似模型,分别基于发音和字符形状。 ### 2.2 字符聚类 字符聚类将中文字符按音近或形近分组,并将每个字符映射到共享ID。形式上,设$g(\cdot)$为基于聚类的映射,将查询$x_i$转换为共享ID序列$\tilde{x}_i = g(x_i) = \{\tilde{x}_{i,1}, \dots, \tilde{x}_{i,m_i}\}$,其中多个易混淆字符可能共享同一ID。此映射有意引入信息损失:它在编码器侧去除细粒度字符标识,使输入更容忍典型用户错误,并将编辑限制在合理混淆范围内。 为覆盖实际中的主要错误类型,特别是音近混淆和形近混淆,我们设计两种互补方式构建$g(\cdot)$。 #### 同音聚类 内容平台上的多数查询错误是由拼音输入引起的音近混淆。因此我们构建基于拼音的聚类策略,将每个字符映射到**不带声调**的拼音键,并将拼音相同的字符分配到同一共享ID。对于多音字,我们选择查询日志中最频繁的无声调发音以确定ID,使聚类对齐常见用户输入并捕捉高频音近混淆。 #### 视觉相似聚类 为处理另一主要错误类型——形近混淆,我们使用基于图像的字符表示,通过视觉相似度聚类字符。将每个字符渲染为图像,用Vision Transformer(ViT)编码得到特征向量,再基于这些表示的余弦相似度聚类。我们使用阈值$\tau$判断两个字符是否应归为同一簇,从而控制视觉邻域的粒度。 ### 2.3 中文查询纠错 我们使用编码器-解码器Transformer执行中文查询纠错:编码器处理共享ID输入,解码器预测原始字符ID。编码器阶段,输入查询字符被映射到共享ID,使模型能从大规模(基本无错)文本数据中学习错误变体的鲁棒表示。解码器随后将共享ID序列映射回对应的原始字符ID。推理时,我们使用束搜索解码输出序列。 实际中,我们基于两种聚类策略训练两个独立纠正模型:同音模型和视觉相似模型。两者可独立或组合使用。部署时,我们采用无需显式错误类型分类器的简单动态融合:对同一查询,将音近共享ID序列输入同音模型,视觉共享ID序列输入视觉相似模型,获取两个模型的束候选解码器得分(token logits)。然后比较两个模型的候选结果,保留与原始查询得分差较小的那个(即归一化序列对数似然相对变化较小),这有助于防止过度纠正,同时利用束搜索获取合理替代。 ### 2.4 带时间衰减频率重加权的训练目标 给定第2.2节聚类映射得到的共享ID序列$\tilde{x}_i$,我们使用时间衰减频率重加权负对数似然训练GUIDE重构原始查询$x_i = \{x_{i,1}, \dots, x_{i,m_i}\}$: $L = -\frac{1}{N} \sum_{i=1}^{N} w_i \sum_{j=1}^{m_i} \log p_\theta(x_{i,j} \mid \tilde{x}_i, x_i, ...)$ 其中$w_i$为查询频率权重,通过指数衰减赋予近期查询更高权重。此目标促使模型聚焦近期高频查询的正确形式,同时保持对整体词表的覆盖。 ### 2.5 五样本提示与纠错管道 在实际应用中,GUIDE可与大型语言模型(LLM)结合,用于纠正复杂或罕见错误。我们设计五样本提示模板,指示LLM充当查询纠错专家,对输入查询进行合理文本纠错并仅输出纠正后文本。示例如下: > 你是一个query纠错专家。请针对输入query,进行合理的文本纠错,输出纠错后文本,禁止输出任何思考过程。 > 示例: > Query: ... > Output: ... > (重复10次) > Query: {text} > Output: 该模板通过少量示例引导LLM遵循纠错规范,避免输出冗余推理过程,适用于需要上下文推理的纠错场景。 ## 附录B 补充实验结果 ### B.1 训练目标消融与$\lambda$敏感性 我们在KwaiSearch上对公式(1)中的训练目标两个组件进行消融,以隔离各自贡献。从均匀目标出发,仅添加查询频率重加权使F1提升约11点,进一步添加时间衰减项带来约4.6点额外增益(表5)。这证实频率重加权是主导因素,而时间衰减通过将学习重点转向近期查询提供持续附加效益。重要的是,$\lambda$未在测试集上调整。我们基于简单操作假设设定:假设年查询重叠率约60%,每周更新模型,则需$e^{-\lambda \cdot 52} = 0.6$(覆盖一年52周),解得$\lambda = 0.0098$,此值用于所有实验。为验证稳健性,我们也报告了目标50%重叠率($\lambda=0.0133$)和80%重叠率($\lambda=0.0043$)的更激进与保守变体。如表6所示,两种变体F1均保持在默认$\lambda$的约1.6点内,表明GUIDE对$\lambda$具体值不敏感。 **表5:KwaiSearch训练目标消融(3层模型)** 频率重加权较均匀目标提升~11 F1点,时间衰减进一步提升~4.6点。 **表6:KwaiSearch时间衰减系数$\lambda$敏感性(3层模型)** 目标50%重叠率(0.0133)或80%重叠率(0.0043)均使F1保持在默认$\lambda=0.0098$的~1.6点内。 ### B.2 视觉聚类阈值$\tau$选择 视觉聚类阈值$\tau$在独立留出的开发集上选择,该集仅包含视觉错误,而非KwaiSearch测试集。我们在该开发集上对视觉相似模型扫描$\tau$,通过验证集性能确定最优值,确保聚类粒度能有效区分形近混淆。
相似文章
JSPG:基于语义-拼音-字形联合检索的中文上下文ASR动态字典过滤
本文提出JSPG,一种动态字典过滤框架,联合利用语义、拼音和字形特征提升中文上下文ASR的关键词检索准确率,解决同音错误导致语义检索性能下降的问题。
CNM-BERT:一种基于表意描述序列的汉字即插即用结构嵌入
本文提出CNM,一种轻量级增强方法,通过表意描述序列将汉字的离散组合结构注入BERT,在提升稀有字符和未登录字符性能的同时保持通用自然语言理解准确率。
CSRP: 通过强化学习结合效率感知奖励进行中文文本纠错的思维链推理
CSRP提出了一个三阶段框架,结合持续预训练、思维链监督微调和带有效率感知奖励的强化学习,以解决中文语法纠错中的过度纠正问题,在NACGEC基准上取得了最先进的结果。
基于图的噪声ASR音素错误纠正
提出G-SPIN,一个轻量级框架,结合音素图建模与上下文语言理解来纠正ASR错误。使用GNN生成音素合理的候选词元,MLM进行局部评分,LLM进行最终重新排序,所有操作均在推理时进行。
UniGD:一种用于工业检索的统一生成-判别框架
快手研究者提出UniGD,一个用于工业检索的统一生成-判别框架,将检索与相关性评分整合到单一模型中,并采用CAGE与CAM等技术来提升效果并降低延迟。在线A/B测试显示,广告收入提升5.78%,推理延迟降低33.1%。