llm-steering

标签

Cards List
#llm-steering

拓扑引导

arXiv cs.LG · 5天前 缓存

拓扑引导是一种新框架,利用拓扑数据分析捕获激活空间中的全局结构,以控制大型语言模型行为,实现更稳健的行为控制。

0 人收藏 0 人点赞
#llm-steering

基于属性的激活引导:为LLMs实现针对特定群体的解释生成

arXiv cs.CL · 6天前 缓存

本文提出基于属性的激活引导方法,旨在为特定群体定制LLM解释,与提示和最先进基线相比,实现了更好的具体性和事实性。

0 人收藏 0 人点赞
#llm-steering

检测 ≠ 可靠控制:可解码的共情方向在自动化共情分数中最多导致部分偏移

arXiv cs.CL · 2026-08-27 缓存

本文测试了大型语言模型中的可解码共情方向是否能可靠地改变自动化共情分数,发现情感方面的控制是部分的,而认知引导是不一致的,强调了检测并不意味着控制。

0 人收藏 0 人点赞
#llm-steering

CircuitSteer:通过稀疏自编码器电路实现几何对齐的多层引导

arXiv cs.LG · 2026-08-07 缓存

CircuitSteer 是一种新颖的框架,利用稀疏自编码器来识别和操控大型语言模型中的多层语义电路,与CAA等单层方法相比,能够实现更鲁棒且保持流畅性的行为引导。

0 人收藏 0 人点赞
#llm-steering

UniSteer:文本引导的激活空间流匹配实现多功能大语言模型操控

Hugging Face Daily Papers · 2026-05-28 缓存

UniSteer 提出了一种文本引导的激活流匹配方法,在激活空间中学习通用条件速度场,无需特定任务干预模块即可实现多功能的 LLM 行为控制与分类任务。

0 人收藏 0 人点赞
#llm-steering

基于稀疏查询特征梯度优化的导向生成

arXiv cs.LG · 2026-05-25 缓存

本文介绍了Prototype-Based Sparse Steering方法,该方法将稀疏自编码器应用于大语言模型的注意力查询激活,然后在推理过程中使用梯度优化来引导生成朝向目标行为。该方法在一个逻辑规划任务和一个风格化教育领域中得到了验证,展示了可解释且解耦的控制能力。

0 人收藏 0 人点赞
#llm-steering

@NousResearch:今天我们发布对比神经元归因(CNA),一种通过识别和消融稀疏电路来引导LLM行为的方法…

X AI KOLs Following · 2026-05-19 缓存

NousResearch 发布了对比神经元归因(CNA),该方法通过消融稀疏的 MLP 电路来引导 LLM 行为,无需训练稀疏自编码器或降低基准测试性能,并在多达 70B 参数的模型的拒绝电路上验证了有效性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈