标签
本文提出了自适应熵蒸馏(AED)方法,该方法利用教师熵动态校准知识蒸馏中的词元级模仿强度,在指令跟随和数学推理基准测试上取得了卓越性能。
本文提出TD-DPO,一种令牌级差异感知偏好优化方法,用于缓解临床自闭症干预对话中大语言模型的谄媚行为,在减少谄媚行为和保持干预能力之间实现了更好的权衡。
提出 Token-Level Off-Policy Labeling (TOPL),一种用于忠实生成的离策略训练范式,将后训练重新定义为词元级正确性预测,在摘要和机器翻译任务上实现了强大的分布外泛化能力。
OriginBlame 是一个记录级与令牌级的数据溯源系统,能够在 AI 训练数据管道中传播作者身份,从而为机器遗忘(machine unlearning)生成精确的遗忘集。它消除了数据集级系统导致的过度删除问题,并提升了遗忘效果。
一篇研究论文,介绍了CANON,一种无标签自蒸馏方法,利用采样解之间的共识为训练大型语言模型在推理任务上提供密集的标记级监督,可将pass@1提升最多12个百分点,并以极少的计算量超越无标签强化学习。
提出尾部感知信用校准(TACO),通过校准统一信用分配以抑制对不可信尾部令牌的更新,解决大语言模型强化学习中的正向信用污染问题,提升训练稳定性和性能。
本文研究了多模态大语言模型在生成过程中的令牌级注意力转移,揭示了其中的一致模式,并提出了一种简单的测试时干预方法,显著提升了任务性能。
TokenScope是一个面向仅解码器大型语言模型的交互式可解释性工具,在代码生成过程中提供词元级指标、注意力模式及反事实分支,支持系统性地研究模型行为。
提出了CORTEX,一种针对RAG的令牌级幻觉检测方法,通过比较有无检索文档时LLM的内部表示来识别无根据的文本片段。它改进了长文本RAG输出中幻觉的细粒度定位。
本文介绍了一种时序多信号融合方法,用于通过融合特征上的序列标注检测语言模型中的词元级幻觉,在不访问模型内部信息的情况下实现了改进的跨模型性能。
本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。
提出独立组合令牌(ICT)框架,利用令牌logit分布之间的Jensen-Shannon散度识别关键分支点,防止RLVR在LLM推理中的熵坍缩和熵爆炸。在Qwen模型上实现了高达14.9%的pass@4改进。
STARE 通过引入惊奇度引导的令牌级优势重加权和目标熵调节,解决了基于GRPO的大语言模型强化学习中的策略熵崩溃问题,在AIME基准上实现了4%-8%的准确率提升。
本文通过词元级不确定性信号,刻画了语言模型在推理中失败的两种不同过程——承诺性失败与持续性不确定性,并展示了其对自一致性及失败检测策略的启示。
本文指出了在使用LoRA进行LLM强化学习时,令牌级信用分配中存在的一种结构性失效模式,即内在信号退化。它提出了适配器残差信用分配(ARCA),该方法从适配器的隐藏状态残差中推导令牌显著性,并与基线方法保持竞争力。
RAGognizer 提出了一种幻觉感知微调方法,该方法将轻量级检测头集成到大语言模型(LLMs)中,以实现语言建模与幻觉检测的联合优化,适用于 RAG 系统。论文介绍了 RAGognize,一个包含自然发生的闭域幻觉及其词元级标注的数据集,并展示了在降低幻觉率的同时,实现了最先进的幻觉检测性能,且不损害语言质量。