steering

标签

Cards List
#steering

IDEEA:通过激活聚类匹配实现免训练的输入依赖式引导

arXiv cs.CL · 6天前 缓存

IDEEA提出了一种免训练的、依赖于输入的引导方法,适用于大型语言模型,通过对激活进行聚类并使用最优匹配,在TruthfulQA上比基线提升真实性高达23.5%。

0 人收藏 0 人点赞
#steering

自发与指示欺骗中的不对称性

arXiv cs.AI · 2026-09-02 缓存

本文研究了大型语言模型(特别是 Llama-3.1-70B-Instruct)中自发与指示欺骗之间的关系,发现两种设置在检测和因果关系上存在不对称性。

0 人收藏 0 人点赞
#steering

通过邻居集成特征选择增强基于SAE的转向

arXiv cs.AI · 2026-09-01 缓存

本文指出,针对基于SAE的LLM转向的统计top-k特征选择并非最优,并提出了邻居集成特征选择(NIFS)以通过利用表示相似性来提升性能。

0 人收藏 0 人点赞
#steering

语言模型如何选择立场:指令层级的内部表示

arXiv cs.AI · 2026-09-01 缓存

本文研究指令微调的大语言模型如何仲裁系统指令与用户指令之间的冲突,揭示用户偏好行为与可读的内部仲裁信号共存,并通过机械可解释性技术和引导实验进行演示。

0 人收藏 0 人点赞
#steering

通过采样引导与扩展LLMs的方案

arXiv cs.CL · 2026-08-28 缓存

本文提出了一个基于采样算法(如Sequential Monte Carlo和Replica Exchange)引导和扩展大型语言模型的理论框架,旨在无需外部监督即可提升生成质量。

0 人收藏 0 人点赞
#steering

@kentcdodds: 你的智能体无法自行驾驶,因为你必须一遍又一遍地引导它处理同样的事情。有一个古老的解决方案…

X AI KOLs Timeline · 2026-08-25 缓存

Kent C. Dodds 评论了需要持续引导的 AI 代理的局限性,并提出了一种避免重复指令的解决方案。

0 人收藏 0 人点赞
#steering

语言模型中的评估意识:表征、表达与控制

arXiv cs.CL · 2026-08-25 缓存

本文系统地研究了语言模型中的评估意识,表明模型内化了评估语境,导致内部表征、语言表达和导向行为之间的脱节,对基准可靠性有影响。

0 人收藏 0 人点赞
#steering

SteerBench-Work:行动边界处的智能体引导基准

arXiv cs.AI · 2026-08-14 缓存

介绍了 SteerBench-Work,这是一种事件锚定式基准,用于评估 LLM 智能体在采取实际动作前应继续还是暂停。在 30 种模型条件下,模型绝大多数情况下过度拒绝已授权工作,而很少允许不安全行为,揭示了通用能力与转向决策之间的校准差距。

0 人收藏 0 人点赞
#steering

前沿语言模型在引导压力下的发散响应模式

arXiv cs.AI · 2026-08-10 缓存

本文研究了六个前沿语言模型在引导压力下的表现,发现模型之间的差异不仅在于行为变化的程度,还在于响应模式的不同,例如 GPT-5 拒绝披露推理过程,以及 Claude Opus 4.7 的抗拒模式等独特行为。

0 人收藏 0 人点赞
#steering

扩展固有可解释语言模型

Hugging Face Daily Papers · 2026-08-06 缓存

本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。

0 人收藏 0 人点赞
#steering

AgentGUI:一款用于观察和引导长时间运行AI代理的界面

arXiv cs.CL · 2026-07-30 缓存

AgentGUI 是一款开源界面,用于观察和引导长时间运行的 AI 代理,具备轨迹可视化、手动与自动引导以及代理框架集成功能。用户研究表明,从代理轨迹中识别关键元素的速度可提升 38%。

0 人收藏 0 人点赞
#steering

Gemma-4-31B-AntiHal:引导Gemma模型反驳错误前提、避免生成幻觉,且对基准性能无任何影响

Reddit r/LocalLLaMA · 2026-07-14

Gemma-4-31B 的一个变体利用基于可解释性的引导技术,通过质疑错误前提来抵抗幻觉,在基准性能几乎不受影响的情况下,对错误前提的反驳效果提升了一倍。

0 人收藏 0 人点赞
#steering

SPARK:基于敏感性的大语言模型潜在推理状态分析与引导

arXiv cs.AI · 2026-07-14 缓存

介绍SPARK方法,利用长度控制的隐藏状态敏感性诊断和引导大语言模型的推理状态,提高GSM8K和MATH-500等数学推理基准的准确率。

0 人收藏 0 人点赞
#steering

每个Token抛硬币:大型语言模型的伯努利稀疏引导

arXiv cs.LG · 2026-07-08 缓存

介绍了针对LLM激活引导的随机Token引导(STS)和随机块引导(SBS),它们以概率方式按token或按序列控制引导信号。实验表明,仅引导50%的token即可恢复大部分密集引导效果,同时保持流畅性,并且行为结果受累积信号剂量的速率限制。

0 人收藏 0 人点赞
#steering

方言能否像语言一样被引导?阿拉伯语大语言模型中的稀疏神经元与分布式方向

arXiv cs.CL · 2026-07-07 缓存

本文研究了通过识别稀疏神经元群体和提取方言激活方向来引导阿拉伯语大语言模型生成特定方言的方法,从而在不进行微调的情况下实现推理时的方言控制。

0 人收藏 0 人点赞
#steering

它们推断出你的意图:模型对交际意图的表征比实际行动更可靠

arXiv cs.CL · 2026-07-07 缓存

本文研究了语言模型尽管具有稳健的内部表征,但在行动上却未能体现交际意图的问题。通过线性探针,作者发现意图可以从隐藏状态中解码,但通常不反映在输出中,而引导一个较后层的方向可以恢复预期的行为。

0 人收藏 0 人点赞
#steering

LLMs的机制人格分析:通过潜在特征干预调控人格

arXiv cs.AI · 2026-06-30 缓存

本文介绍了一种机制可解释性方法,通过使用稀疏自编码器识别并干预潜在特征来调控LLM人格特质,在保持语言性能的同时实现了可控的人格调制。

0 人收藏 0 人点赞
#steering

让LLM代理真正保持角色一致:无人记录的引导靶心

Reddit r/AI_Agents · 2026-06-28

关于保持LLM代理一致性的技术讨论,强调了一个常被忽视的引导方面。

0 人收藏 0 人点赞
#steering

使用稀疏自编码器解释与引导文本转语音语言模型

Hugging Face Daily Papers · 2026-06-08 缓存

本文对CosyVoice3文本转语音语言模型应用稀疏自编码器,发现可解释的特征,这些特征可被引导以控制笑声、说话者性别和语速等属性,同时保留内容。

0 人收藏 0 人点赞
#steering

视觉-语言-动作模型中的闭环神经激活控制

arXiv cs.AI · 2026-06-02 缓存

提出CTRL-STEER,一种闭环框架,通过时变控制信号对视觉-语言-动作模型进行自适应引导,在无需重新训练的情况下,实现了概念调节与任务成功率之间的更好权衡。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈