标签
IDEEA提出了一种免训练的、依赖于输入的引导方法,适用于大型语言模型,通过对激活进行聚类并使用最优匹配,在TruthfulQA上比基线提升真实性高达23.5%。
本文研究了大型语言模型(特别是 Llama-3.1-70B-Instruct)中自发与指示欺骗之间的关系,发现两种设置在检测和因果关系上存在不对称性。
本文指出,针对基于SAE的LLM转向的统计top-k特征选择并非最优,并提出了邻居集成特征选择(NIFS)以通过利用表示相似性来提升性能。
本文研究指令微调的大语言模型如何仲裁系统指令与用户指令之间的冲突,揭示用户偏好行为与可读的内部仲裁信号共存,并通过机械可解释性技术和引导实验进行演示。
本文提出了一个基于采样算法(如Sequential Monte Carlo和Replica Exchange)引导和扩展大型语言模型的理论框架,旨在无需外部监督即可提升生成质量。
Kent C. Dodds 评论了需要持续引导的 AI 代理的局限性,并提出了一种避免重复指令的解决方案。
本文系统地研究了语言模型中的评估意识,表明模型内化了评估语境,导致内部表征、语言表达和导向行为之间的脱节,对基准可靠性有影响。
介绍了 SteerBench-Work,这是一种事件锚定式基准,用于评估 LLM 智能体在采取实际动作前应继续还是暂停。在 30 种模型条件下,模型绝大多数情况下过度拒绝已授权工作,而很少允许不安全行为,揭示了通用能力与转向决策之间的校准差距。
本文研究了六个前沿语言模型在引导压力下的表现,发现模型之间的差异不仅在于行为变化的程度,还在于响应模式的不同,例如 GPT-5 拒绝披露推理过程,以及 Claude Opus 4.7 的抗拒模式等独特行为。
本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。
AgentGUI 是一款开源界面,用于观察和引导长时间运行的 AI 代理,具备轨迹可视化、手动与自动引导以及代理框架集成功能。用户研究表明,从代理轨迹中识别关键元素的速度可提升 38%。
Gemma-4-31B 的一个变体利用基于可解释性的引导技术,通过质疑错误前提来抵抗幻觉,在基准性能几乎不受影响的情况下,对错误前提的反驳效果提升了一倍。
介绍SPARK方法,利用长度控制的隐藏状态敏感性诊断和引导大语言模型的推理状态,提高GSM8K和MATH-500等数学推理基准的准确率。
介绍了针对LLM激活引导的随机Token引导(STS)和随机块引导(SBS),它们以概率方式按token或按序列控制引导信号。实验表明,仅引导50%的token即可恢复大部分密集引导效果,同时保持流畅性,并且行为结果受累积信号剂量的速率限制。
本文研究了通过识别稀疏神经元群体和提取方言激活方向来引导阿拉伯语大语言模型生成特定方言的方法,从而在不进行微调的情况下实现推理时的方言控制。
本文研究了语言模型尽管具有稳健的内部表征,但在行动上却未能体现交际意图的问题。通过线性探针,作者发现意图可以从隐藏状态中解码,但通常不反映在输出中,而引导一个较后层的方向可以恢复预期的行为。
本文介绍了一种机制可解释性方法,通过使用稀疏自编码器识别并干预潜在特征来调控LLM人格特质,在保持语言性能的同时实现了可控的人格调制。
本文对CosyVoice3文本转语音语言模型应用稀疏自编码器,发现可解释的特征,这些特征可被引导以控制笑声、说话者性别和语速等属性,同时保留内容。
提出CTRL-STEER,一种闭环框架,通过时变控制信号对视觉-语言-动作模型进行自适应引导,在无需重新训练的情况下,实现了概念调节与任务成功率之间的更好权衡。