标签
本文介绍了预测性记忆定位(PML),一种从模型内部信号预测选择性干预结果的方法,能够区分校准的目标移动与语义邻居及能力损伤。在3000条记录和九个数据集上的实验显示,选择性路径预测和风险感知的干预决策均得到改善。
一项针对小型Transformer的预注册压力测试表明,虽然潜在因果结构可以被定位,但将其释放到行为中却失败:门控检测器在分布外反转,线性释放方向低于充分性界限,从而将定位与行为释放分离开来。
本文研究了语言模型中激活引导的副作用是否能在干预前被预测,构建了一个涵盖67种行为的交叉效应矩阵,并发现副作用是系统性的且可从未引导的表示中进行预测。
本文介绍了一种可部署的逐实例多层激活引导技术,用于大型语言模型,表明最优层选择随输入变化,并且可以在推理时仅从提示嵌入中预测,而不需要金标准标签。
介绍PoolBench,一个在仅解码器LLM概念表示中隔离池化策略的基准,跨17个概念和3个模型评估19种策略,为比较池化选择提供标准化协议。
本文介绍了PRISMS,一种利用少量针对特定失败的MLP神经元,通过稀疏读出检测和引导LLM工具使用错误(过度调用、缺失调用、无效参数)的框架,从而提升多个模型系列的工具使用可靠性。
介绍了一种用于社会模拟中角色条件化LLM智能体的激活引导筛选工作流,在OLMo-3-7B-Instruct上对275个角色清单进行了评估,结果显示角色特定方向优于助手轴方向控制。
本文提出了一种基于积分梯度的词元归因方法,用于在词元级别诊断LLM中的谄媚行为,并提出了归因引导的对比激活转向方法,在不重新训练的情况下减少推理过程中的谄媚行为。
本文研究了用于改善思维链忠实性的激活转向在多种提示类型、数据集和转向向量构建方法之间,以及在多个 Gemma 和 Qwen 模型上的泛化能力。作者发现,当转向有效时,其效果可以广泛泛化,并且评估设置比训练设置或向量构建方法更为重要。
介绍了策略梯度引导(PGS),一种将激活引导形式化为强化学习问题的方法,利用策略梯度从行为目标中构建可移除、可组合的引导向量。在网格世界、国际象棋谜题和足球环境中进行了验证。
介绍了Latent-IM,一个从冻结的语音LLM中恢复交互管理的框架,利用基于激活的选择和引导来进行会话动作。相比未引导的主干模型,它将端到端动作准确率提升了12.5个百分点。
本文研究了源激活的选择如何影响语言模型中的激活转向,发现执行边界状态(模型即将产生目标行为的状态)能产生更强的信号,并引入了尾部减法来提高转向稳定性。
本文介绍了IHLC在LT-EDI 2026共享任务中的提交方案,使用LoRA微调进行性别中性重写(排名第3)和激活引导进行对立叙事生成(排名第6),同时展示了其潜力与局限性。
本文提出了一个利用荣格认知功能进行大语言模型激活导向的框架,展示了对八种功能的有效单调控制,并揭示了激活空间中结构化的几何关系。
DecodeShare提出了一种方法,用于识别LLM在解码时隐藏状态中跨任务一致共享的低维子空间,并表明干扰该子空间对决策性能的损害程度超过同等待遇下干扰随机或预填充派生的子空间,这对激活引导具有启示意义。
GrAInS 是一种基于对比梯度的归因方法,利用积分梯度识别影响最大的词元,并构建引导向量,在推理时对大语言模型(LLM)和视觉语言模型(VLM)进行引导,从而提升真实性并减少幻觉,同时不损害流畅性。
本文首次系统研究了在单轮聊天中校准的加法激活引导如何迁移到使用工具的ReAct智能体。研究发现,尽管注入的方向在不同设定下几乎以全强度到达深层,但行为耦合在不同模型和上下文之间变化莫测,放大至2倍或衰减,带来即时安全担忧。
本文审计并缓解大型语言模型中的方言偏见,显示它们系统性地偏好标准美式英语而非非裔美国人英语。作者引入了激活操控,一种无需训练的方法,在保持流畅性的同时显著减少偏见,并发布了迄今为止最大的真实AAE平行语料库。
本文提出一种无依赖的原生运行时,通过量化和激活引导,在嵌入式设备上实现高效的文本到音乐生成。在8位精度下,实现了无测量质量损失,并使1.2B参数模型能够在 Raspberry Pi 5 上以4位精度运行。
介绍了针对LLM激活引导的随机Token引导(STS)和随机块引导(SBS),它们以概率方式按token或按序列控制引导信号。实验表明,仅引导50%的token即可恢复大部分密集引导效果,同时保持流畅性,并且行为结果受累积信号剂量的速率限制。