通过Logit偏置实现语言模型的出奇简单的黑盒适配

arXiv cs.LG 论文

摘要

本文提出了一种黑盒方法,通过学习一个上下文无关的logit偏置向量,在每个解码步骤中添加该向量,从而在不修改模型权重或需要梯度的情况下提升数学和推理任务的性能。

arXiv:2607.22837v1 公告类型:新 摘要:许多组织旨在将语言模型适配用于内部使用,既是为了提升领域特定任务的性能,也是为了应对敏感数据的隐私问题。然而,这种适配仍然不简单:通常需要对开源模型进行操作上具有挑战性的微调或进行临时的提示优化。我们研究了一种基于简单API级别控制的最小替代方案:允许用户通过用户定义的向量来偏置模型的logit。我们开发了一种黑盒方法,用于学习一个上下文无关的logit偏置向量,在每个解码步骤添加该向量,无需修改模型权重或需要梯度。从KL正则化强化学习(RL)目标出发,我们刻画了这种固定logit偏置向量何时能够近似最优的前缀相关修正,并从轨迹、奖励和令牌概率中推导出封闭形式的逆倾向评分估计量。实验上,这种简单的解码时干预在数学和推理基准上优于基础模型,同时使用的可训练参数远少于传统的微调。我们的结果表明,学习到的logit偏置是在最小访问要求下适配语言模型的轻量级机制。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:22

# 异常简单的语言模型黑盒适配:基于 Logit Bias 方法 来源:https://arxiv.org/html/2607.22837 Lior Shani Google Research liorshani@google\.comAviv Rosenberg Google Research avivros@google\.comAnkur Samanta Columbia University as7416@columbia\.eduTal Wagner Tel Aviv University talwag@tauex\.tau\.ac\.ilYonathan Efroni Tel Aviv University yefroni@tauex\.tau\.ac\.il ###### 摘要 许多组织希望通过适配语言模型以满足内部使用需求,既是为了提升在特定领域任务上的性能,也是为了应对敏感数据相关的隐私问题。然而,这种适配并非易事:它通常需要对开源模型进行操作上具有挑战性的微调,或者进行临时性的提示优化。我们研究了一种基于简单 API 级别控制的最小化替代方案:允许用户使用自定义向量对模型的 logits 进行偏置。我们开发了一种黑盒方法,用于学习一个单一的、与上下文无关的 logit-bias 向量,该向量在每个解码步骤被添加,无需修改模型权重或访问梯度。从一个 KL 正则化的强化学习 (RL) 目标出发,我们刻画了这种固定的 logit-bias 向量何时能近似最优的前缀相关校正,并推导出一个基于 rollout、奖励和 token 概率的闭式逆概率加权估计器。在实证中,这种简单的解码时干预在数学和推理基准上提升了基础模型的性能,同时使用的可训练参数远少于传统的微调方法。我们的结果表明,学习到的 logit bias 是一种在最小访问需求下适配语言模型的轻量级机制。 Input(x,y1:t−1)(x,y_{1:t-1}) Frozen LMLogitsℓt\\ell_t++Biasδ\\deltaSoftmaxSampleyty_tFigure 1: Logit-bias 引导概览。固定的 logit-bias 向量δ\\delta在每次解码步骤采样前被添加到基础模型的 logits 中。仅优化δ\\delta;模型权重保持不变。## 1 引言 部署前沿语言模型通常需要将其适配到特定的操作需求:更短的推理链路、更严格的输出格式,或者在小规模、保密的内部数据分布上提升准确性\[48 (https://arxiv.org/html/2607.22837#bib.bib48),47 (https://arxiv.org/html/2607.22837#bib.bib47),21 (https://arxiv.org/html/2607.22837#bib.bib21),58 (https://arxiv.org/html/2607.22837#bib.bib58),2 (https://arxiv.org/html/2607.22837#bib.bib2)\]。然而,在许多实际场景中,模型只能通过推理 API 使用:部署者无法检查或修改权重,无法通过模型进行反向传播,必须利用解码时暴露的控制接口\[55 (https://arxiv.org/html/2607.22837#bib.bib55),54 (https://arxiv.org/html/2607.22837#bib.bib54),8 (https://arxiv.org/html/2607.22837#bib.bib8),16 (https://arxiv.org/html/2607.22837#bib.bib16)\]。这使得标准的适配方法——微调、PEFT、提示嵌入、RLHF 风格优化\[18 (https://arxiv.org/html/2607.22837#bib.bib18),25 (https://arxiv.org/html/2607.22837#bib.bib25),24 (https://arxiv.org/html/2607.22837#bib.bib24),19 (https://arxiv.org/html/2607.22837#bib.bib19),1 (https://arxiv.org/html/2607.22837#bib.bib1),28 (https://arxiv.org/html/2607.22837#bib.bib28),63 (https://arxiv.org/html/2607.22837#bib.bib63),40 (https://arxiv.org/html/2607.22837#bib.bib40)\]——变得不可用或与场景不匹配。那么,一个单一的学习到的 logit-bias 向量能否提供有用的黑盒适配呢?我们将 logit bias 作为一种最小化的适配原语进行研究。Token 级别的 logit-bias 控制已在主要推理栈和托管 API 中有文档说明\[57 (https://arxiv.org/html/2607.22837#bib.bib57),50 (https://arxiv.org/html/2607.22837#bib.bib50),31 (https://arxiv.org/html/2607.22837#bib.bib31),30 (https://arxiv.org/html/2607.22837#bib.bib30),37 (https://arxiv.org/html/2607.22837#bib.bib37),33 (https://arxiv.org/html/2607.22837#bib.bib33),11 (https://arxiv.org/html/2607.22837#bib.bib11)\]。我们考虑最简单的干预方式:从一个固定的、无学习到的 logit bias 的基础模型开始,在每个解码步骤向模型的 logits 添加一个单一的、与上下文无关的 logit-bias 向量δ\\delta。基础模型的权重从不修改;仅通过黑盒 rollout(而非梯度或访问模型内部结构)学习δ\\delta。这种干预有意保持简单。固定的 logit-bias 向量δ\\delta无法编码任意的提示或前缀相关行为,这一点与能够表达显式条件指令的提示不同\[38 (https://arxiv.org/html/2607.22837#bib.bib38),34 (https://arxiv.org/html/2607.22837#bib.bib34)\]。但这种弱点也正是该原语的吸引力所在:当所需的校正大致是 token 特定且跨上下文稳定时,单个向量可能捕获适配中有用的一小部分,而服务开销却很小。一个特别相关的案例是冗余度控制:尽管δ\\delta无法决定哪些推理步骤在数学上是必要的,但它仍然可以学习到可重用的结束、格式化和停止线索,从而在不改变模型权重的情况下缩短生成内容。与提示引导不同,它不消耗上下文长度,直接作用于输出分布;与权重空间适配不同,它不需要梯度、隐藏状态或提供者侧的训练访问\[36 (https://arxiv.org/html/2607.22837#bib.bib36),29 (https://arxiv.org/html/2607.22837#bib.bib29),18 (https://arxiv.org/html/2607.22837#bib.bib18),19 (https://arxiv.org/html/2607.22837#bib.bib19)\]。我们通过一个 KL 正则化的 RL 目标\[63 (https://arxiv.org/html/2607.22837#bib.bib63),53 (https://arxiv.org/html/2607.22837#bib.bib53),40 (https://arxiv.org/html/2607.22837#bib.bib40),22 (https://arxiv.org/html/2607.22837#bib.bib22),44 (https://arxiv.org/html/2607.22837#bib.bib44),62 (https://arxiv.org/html/2607.22837#bib.bib62)\]对上述过程进行形式化;无约束最优解产生了一个前缀相关的校正,我们使用固定的 logit-bias 向量δ\\delta来近似该校正,从而得到一个奖励间隙界和一个基于 rollout、奖励和 token 概率的闭式 IPS 估计器\[17 (https://arxiv.org/html/2607.22837#bib.bib17)\]。 ##### 贡献。我们做出了三项贡献。111代码可在https://github.com/Ofek-Israeli/logit_bias_lm_adaptation获取。首先,我们引入了*黑盒 logit-bias 适配*,这是一种在无需权重更新和梯度访问的情况下个性化冻结语言模型的设置。其次,我们推导了一个闭式估计器以及连接 logit-bias 引导与 KL 正则化最优解的理论分析。第三,我们在实证中表明,全词表的 logit bias 在数学和推理基准上提升了基础模型的性能,同时使用的可训练参数和计算量远少于传统的微调方法。 ## 2 相关工作 ##### 黑盒或仅 API 适配。现有的黑盒方法通过输入通道进行适配,使用无导数连续提示或奖励学习到的离散提示\[55 (https://arxiv.org/html/2607.22837#bib.bib55),54 (https://arxiv.org/html/2607.22837#bib.bib54),8 (https://arxiv.org/html/2607.22837#bib.bib8)\]; 这种基于提示的控制会消耗上下文,并可能干扰任务内容或学习到的提示行为\[25 (https://arxiv.org/html/2607.22837#bib.bib25),24 (https://arxiv.org/html/2607.22837#bib.bib24),29 (https://arxiv.org/html/2607.22837#bib.bib29),8 (https://arxiv.org/html/2607.22837#bib.bib8)\]。我们则通过输出通道进行适配:一个从 rollout 中学习到的、与上下文无关的 logit-bias 向量,在解码时应用\[16 (https://arxiv.org/html/2607.22837#bib.bib16)\]; 它的表达能力较弱,但易于存储、审计和通过标准解码控制部署,无需梯度或提供者侧的微调\[37 (https://arxiv.org/html/2607.22837#bib.bib37),33 (https://arxiv.org/html/2607.22837#bib.bib33),57 (https://arxiv.org/html/2607.22837#bib.bib57)\]。 ##### 解码时控制与 logit 引导。解码时方法通过扰动隐藏状态、使用辅助模型重新加权下一个 token 概率、强制执行硬约束或应用通用 logits 处理器来引导生成\[7 (https://arxiv.org/html/2607.22837#bib.bib7),61 (https://arxiv.org/html/2607.22837#bib.bib61),23 (https://arxiv.org/html/2607.22837#bib.bib23),27 (https://arxiv.org/html/2607.22837#bib.bib27),32 (https://arxiv.org/html/2607.22837#bib.bib32),13 (https://arxiv.org/html/2607.22837#bib.bib13),59 (https://arxiv.org/html/2607.22837#bib.bib59)\]; 我们的方法是该家族中更简单的一员,不使用隐藏状态梯度、辅助模型、硬语法或每个前缀的优化——仅使用一个在每一步复用的学习到的 logit-bias 向量。 ##### RLHF、KL 正则化目标与 DPO。对齐文献为我们提供了理论背景。Ziegler 等人\[63 (https://arxiv.org/html/2607.22837#bib.bib63)\], Stiennon 等人\[53 (https://arxiv.org/html/2607.22837#bib.bib53)\], Ouyang 等人\[40 (https://arxiv.org/html/2607.22837#bib.bib40)\]建立了偏好数据、奖励模型和带近端惩罚的策略优化的标准流程。Korbak 等人\[22 (https://arxiv.org/html/2607.22837#bib.bib22)\]将语言模型的 KL 正则化 RL 解释为变分/贝叶斯推断,而 DPO 在 KL 约束下给出了偏好到策略的闭式关系\[44 (https://arxiv.org/html/2607.22837#bib.bib44)\]。我们的理论与这种 KL 倾斜视角最为接近:我们从接近基础模型的奖励倾斜目标出发,但不是训练新的策略或奖励模型,而是探究将该目标投影到单一的、与上下文无关的 logit-bias 向量这个极度受限的族上后,能保留多少改进。 ##### 参数高效与基于提示的适配。参数高效适配通过更新一小部分参数或学习到的提示来降低成本。代表性方法包括适配器\[18 (https://arxiv.org/html/2607.22837#bib.bib18)\], 前缀微调\[25 (https://arxiv.org/html/2607.22837#bib.bib25)\], 提示微调\[24 (https://arxiv.org/html/2607.22837#bib.bib24)\], LoRA\[19 (https://arxiv.org/html/2607.22837#bib.bib19)\], BitFit\[1 (https://arxiv.org/html/2607.22837#bib.bib1)\] 和 \(IA\)3\(IA\)^{3}\[28 (https://arxiv.org/html/2607.22837#bib.bib28)\]。它们展示了在有限可训练状态下能走多远,但仍然需要训练时访问权重、梯度、隐藏状态或提示嵌入。我们的设置禁止这种访问:基础模型保持冻结,适配被限制为在解码时应用的固定 logit-bias 向量δ\\delta。 ## 3 预备知识 我们考虑从一个具有有限词表V\\mathbb{V}的语言模型进行自回归生成。令ρ\\rho表示提示空间X\\mathcal{X}上的一个分布,x∼ρx\\sim\rho是从中抽取的一个提示。对于给定的提示xx,生成过程持续固定的步数T∈NT\\in\mathbb{N}个 token。222 在实践中,由于遇到 EOS token 时提前停止,每个序列的步数会变化。我们使用固定的TT来简化理论框架;所有结果都可以通过将 EOS 视为吸收态扩展到变长生成。在每个步骤tt,基础语言模型接收提示和迄今为止生成的 tokens y1:t−1=(y1,…,yt−1)y_{1:t-1}=(y_1,\dots,y_{t-1}),并产生 logits l(x,y1:t−1)∈R|V|\\ell(x,y_{1:t-1})\\in\mathbb{R}^{|\mathbb{V}|}。基础的下一个 token 分布为π0(yt∣x,y1:t−1):=softmax(l(x,y1:t−1))yt\\pi_0(y_t\mid x,y_{1:t-1}):=\operatorname{softmax}(\ell(x,y_{1:t-1}))_{y_t},其中softmax(v)y:=exp(vy)∑y′∈Vexp(vy′)\operatorname{softmax}(v)_y:=\frac{\exp(v_y)}{\sum_{y'\in\mathbb{V}}\exp(v_{y'})},y∈Vy\in\mathbb{V};轨迹分布为p0(y1:T∣x):=∏t=1Tπ0(yt∣x,y1:t−1)p_0(y_{1:T}\mid x):=\prod_{t=1}^T \pi_0(y_t\mid x,y_{1:t-1})。对于 logit-bias 向量δ∈R|V|\\delta\in\mathbb{R}^{|\mathbb{V}|},*固定偏差策略*为πδ(yt∣x,y1:t−1):=softmax(l(x,y1:t−1)+δ)yt\\pi_\delta(y_t\mid x,y_{1:t-1}):=\operatorname{softmax}(\ell(x,y_{1:t-1})+\delta)_{y_t},轨迹分布为pδ(y1:T∣x):=∏t=1Tπδ(yt∣x,y1:t−1)p_\delta(y_{1:T}\mid x):=\prod_{t=1}^T \pi_\delta(y_t\mid x,y_{1:t-1})。我们假设完全支撑:对于每个可达的前缀y1:t−1y_{1:t-1}和每个 token yt∈Vy_t\in\mathbb{V},有π0(yt∣x,y1:t−1)>0\pi_0(y_t\mid x,y_{1:t-1})>0。这对于任何基于 softmax 的模型都自动成立,因为 softmax 输出严格为正。在理论推导中我们使用“trajectory”(轨迹)指代 token 序列y1:Ty_{1:T},在实验和评估上下文中使用“completion”(完成)指代同一对象;两者指的都是生成的同一 token 序列。在期望和方差内部,我们用YY表示从相关分布中抽取的随机轨迹,用y1:Ty_{1:T}表示实现的 token 序列。 ##### 干预记号。我们写Y∼p0(⋅∣x,do(yt=y))Y\sim p_0\bigl(\cdot\mid x,\,\mathrm{do}(y_t=y)\bigr)表示在p0(⋅∣x)p_0(\cdot\mid x)下抽取轨迹,其中第tt个 token 通过*干预*而非条件作用\[41 (https://arxiv.org/html/2607.22837#bib.bib41)\]设置为yy:y1:t−1∼p0(⋅∣x)y_{1:t-1}\sim p_0(\cdot\mid x),yt=yy_t=y固定,yt+1:T∼p0(⋅∣x,y1:t−1,y)y_{t+1:T}\sim p_0(\cdot\mid x,y_{1:t-1},y)。这与条件分布p0(⋅∣x,yt=y)p_0(\cdot\mid x,y_t=y)不同,后者通过π0(y∣x,y1:t−1)\pi_0(y\mid x,y_{1:t-1})对前缀进行贝叶斯重加权。给定一个终端奖励函数r:X×VT→Rr:\mathcal{X}\times\mathbb{V}^T\to\mathbb{R}和一个定义在VT\mathbb{V}^T上的提示条件轨迹分布q(⋅∣x)q(\cdot\mid x),我们定义奖励泛函 J(q):=Ex∼ρ[EY∼q(⋅∣x)[r(x,Y)]],J(q)\;:=\;\mathbb{E}_{x\sim\rho}\!\left[\mathbb{E}_{Y\sim q(\cdot\mid x)}\!\bigl[r(x,Y)\bigr]\right], 在整个过程中,E^\widehat{\mathbb{E}}表示样本的经验平均值。 ##### RLVR 设置与准确率奖励。我们主要考虑带可验证奖励的 RL (RLVR):每个提示xx有一个典型的正确答案m⋆m_{\star},生成的完成y1:Ty_{1:T}可以通过提取并规范化其最终答案来自动检查。具体地,令mx(y1:T)m_x(y_{1:T})表示从提示xx的完成y1:Ty_{1:T}中提取的答案,以规范化形式表示,以便识别符号等价的答案;如果无法提取有效答案,我们设mx(y1:T)=⊥m_x(y_{1:T})=\bot。一个标准的奖励可以是正确性指示器raccuracy:X×VT→{0,1}r_{\mathrm{accuracy}}:\mathcal{X}\times\mathbb{V}^T\to\{0,1\},raccuracy(x,y1:T):=1{mx(y1:T)=m⋆},r_{\mathrm{accuracy}}(x,y_{1:T}):=\mathbf{1}\!\left\{m_x(y_{1:T})=m_{\star}\right\}, ##### KL 正则化最优解。对于正则化强度τ>0\tau>0,考虑问题 maxqEx∼ρ[EY∼q(⋅∣x)[r(x,Y)]−τKL(q(⋅∣x)∥p0(⋅∣x))],\max_{q}\;\mathbb{E}_{x\sim\rho}\!\left[\mathbb{E}_{Y\sim q(\cdot\mid x)}[r(x,Y)]\;-\;\tau\,\operatorname{KL}\!\bigl(q(\cdot\mid x)\,\|\,p_0(\cdot\mid x)\bigr)\right],(1)其中最大值在所有定义在VT\mathbb{V}^T上的提示条件轨迹分布族q(⋅∣x)q(\cdot\mid x)上取得。由于被积函数分解为独立的每个提示项,最优解通过分别求解每个提示达到。

相似文章

有限适应性下的上下文Slate GLM Bandits

arXiv cs.LG

提出了在有限适应性下具有广义线性奖励的上下文Slate Bandit算法,实现了与非线性参数无关的遗憾界。批量式和少切换算法计算高效,且在经验上优于基线,包括在语言模型示例选择任务中。

Correcting Suppressed Log-Probabilities in Language Models with Post-Transformer Adapters

arXiv cs.CL

This paper demonstrates that a small post-transformer adapter (786K parameters) can correct suppressed log-probabilities in alignment-tuned language models, particularly on politically sensitive topics. The adapter shows 31-39% generalization to held-out facts across Qwen3 models while maintaining coherent generation when applied at the final prediction position.

语言模型推理的选择性状态空间适配与检索

arXiv cs.CL

提出了MaLoRA和MaRA两种适配器系列,在冻结的语言模型中引入选择性状态空间递归,实现token级和上下文级适配,在MuSiQue和2WikiMultihopQA等多跳推理基准上取得了显著提升。

The Parser Already Knows: Lightweight Bias Correction in Constrained Decoding

arXiv cs.CL

This paper introduces a lightweight, offline-trained logit correction method for grammar constrained decoding that leverages internal parser and lexer states to restore the LM's true probability distribution without expensive online sampling, improving output quality while maintaining low inference latency.