标签
本文提出了一个基于采样算法(如Sequential Monte Carlo和Replica Exchange)引导和扩展大型语言模型的理论框架,旨在无需外部监督即可提升生成质量。
Kent C. Dodds 评论了需要持续引导的 AI 代理的局限性,并提出了一种避免重复指令的解决方案。
本文系统地研究了语言模型中的评估意识,表明模型内化了评估语境,导致内部表征、语言表达和导向行为之间的脱节,对基准可靠性有影响。
介绍了 SteerBench-Work,这是一种事件锚定式基准,用于评估 LLM 智能体在采取实际动作前应继续还是暂停。在 30 种模型条件下,模型绝大多数情况下过度拒绝已授权工作,而很少允许不安全行为,揭示了通用能力与转向决策之间的校准差距。
本文研究了六个前沿语言模型在引导压力下的表现,发现模型之间的差异不仅在于行为变化的程度,还在于响应模式的不同,例如 GPT-5 拒绝披露推理过程,以及 Claude Opus 4.7 的抗拒模式等独特行为。
本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。
AgentGUI 是一款开源界面,用于观察和引导长时间运行的 AI 代理,具备轨迹可视化、手动与自动引导以及代理框架集成功能。用户研究表明,从代理轨迹中识别关键元素的速度可提升 38%。
Gemma-4-31B 的一个变体利用基于可解释性的引导技术,通过质疑错误前提来抵抗幻觉,在基准性能几乎不受影响的情况下,对错误前提的反驳效果提升了一倍。
介绍SPARK方法,利用长度控制的隐藏状态敏感性诊断和引导大语言模型的推理状态,提高GSM8K和MATH-500等数学推理基准的准确率。
介绍了针对LLM激活引导的随机Token引导(STS)和随机块引导(SBS),它们以概率方式按token或按序列控制引导信号。实验表明,仅引导50%的token即可恢复大部分密集引导效果,同时保持流畅性,并且行为结果受累积信号剂量的速率限制。
本文研究了通过识别稀疏神经元群体和提取方言激活方向来引导阿拉伯语大语言模型生成特定方言的方法,从而在不进行微调的情况下实现推理时的方言控制。
本文研究了语言模型尽管具有稳健的内部表征,但在行动上却未能体现交际意图的问题。通过线性探针,作者发现意图可以从隐藏状态中解码,但通常不反映在输出中,而引导一个较后层的方向可以恢复预期的行为。
本文介绍了一种机制可解释性方法,通过使用稀疏自编码器识别并干预潜在特征来调控LLM人格特质,在保持语言性能的同时实现了可控的人格调制。
本文对CosyVoice3文本转语音语言模型应用稀疏自编码器,发现可解释的特征,这些特征可被引导以控制笑声、说话者性别和语速等属性,同时保留内容。
提出CTRL-STEER,一种闭环框架,通过时变控制信号对视觉-语言-动作模型进行自适应引导,在无需重新训练的情况下,实现了概念调节与任务成功率之间的更好权衡。
SteER 是一个用于可引导深度研究的框架,通过自适应暂停决策和实时用户画像建模,在过程中引入可解释的控制,在对齐方面比基线高出 22.80%,并在超过 85% 的成对对齐判断中受到人类读者的青睐。
本文介绍了一种基于原则的多语言语言调控方法,该方法使用在多语言数据上训练的稀疏自编码器(SAEs)以及一种基于多语言对齐与语言可分性交集的新型层选择规则,并在LLaMA-3.1-8B和Gemma-2-9B上针对机器翻译和跨语言摘要进行了评估。
这个推文串讨论了使用Codex编码代理的最佳实践,重点包括持久线程、语音输入、引导、队列,以及其从代码生成扩展到完整计算机工作流程自动化的能力。
Nous Research 发布了对比神经元归因(CNA),这是一种通过识别和消融MLP神经元中稀疏电路来引导LLM行为的方法,无需训练稀疏自编码器或降低通用基准性能,已在多个大型语言模型上得到验证。