representation-engineering

标签

Cards List
#representation-engineering

驾驭语言轴:从线性可解码性到因果控制

arXiv cs.CL · 2026-08-14 缓存

本文研究LLM中的语言身份是否可以通过紧凑的激活方向进行线性解码和因果控制。通过在多个模型家族上进行引导(steering)和消融(ablation)实验,作者表明语言选择具有方向依赖性、层特异性,并且在语言信号被消融时会恢复为英语。

0 人收藏 0 人点赞
#representation-engineering

RepBench:将基准测试编译为大语言模型的能力表示

arXiv cs.CL · 2026-07-31 缓存

RepBench是一个基于基准测试的表示探测数据层,由13,427篇基准测试论文和353个公共数据集构建,生成涵盖94种能力的46,149条探测文本。它评估了能力向量在模型和读出方法之间的迁移。

0 人收藏 0 人点赞
#representation-engineering

分析语言模型中的自伤表征:一项跨架构研究

arXiv cs.CL · 2026-07-27 缓存

本文分析了大型语言模型内部如何表征自伤内容,发现自伤信息在最后几层结晶,且线性可分性与探针准确性并不一致。

0 人收藏 0 人点赞
#representation-engineering

Latent Fusion Jailbreak: 混合有害与无害表征以诱发不安全的大语言模型输出

arXiv cs.CL · 2026-07-20 缓存

介绍Latent Fusion Jailbreak(LFJ),一种白盒攻击方法,通过混合大语言模型隐藏状态中有害提示与无害提示的表征,达到94.13%的攻击成功率。同时提出一种潜在对抗训练防御方法,将攻击成功率降低至12.37%。

0 人收藏 0 人点赞
#representation-engineering

通过定向干预实现语言模型的多属性引导

arXiv cs.CL · 2026-07-13 缓存

MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。

0 人收藏 0 人点赞
#representation-engineering

通过标题特定激活引导控制工具使用

arXiv cs.AI · 2026-07-08 缓存

本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。

0 人收藏 0 人点赞
#representation-engineering

HARC:耦合有害性与拒绝方向以实现稳健的安全对齐

arXiv cs.AI · 2026-07-02 缓存

本文分析了对齐的LLM如何编码有害性和拒绝方向,揭示越狱攻击会抑制这些方向。作者提出了HARC,一种微调方法,该方法在提示和响应位置上耦合这些方向,在不降低通用能力的情况下实现了稳健的安全对齐。

0 人收藏 0 人点赞
#representation-engineering

想要更好的合成数据?引导它:用于低资源语言生成的激活引导

arXiv cs.CL · 2026-06-18 缓存

本文研究了激活引导作为替代少样本提示的方法,用于生成低资源语言的合成数据。作者提出了LanguageSteering和QualitySteering策略,表明在早期层进行引导可以提高数据多样性并改善下游模型性能。

0 人收藏 0 人点赞
#representation-engineering

MechELK:一种用于从大型语言模型中引出潜在知识的机制可解释性框架

arXiv cs.CL · 2026-05-29 缓存

MechELK 是一个三阶段框架,结合机制可解释性工具(SAE、激活修补、因果探测)与表示工程,从大型语言模型中引出潜在知识,实现了84.7%的准确率,优于CCS和线性探测等现有方法。

0 人收藏 0 人点赞
#representation-engineering

解构并引导大型语言模型中的功能性元认知

arXiv cs.CL · 2026-05-12 缓存

本研究探讨了大型语言模型中的功能性元认知,证明诸如评估意识和自我评估能力等内部状态可以从残差流激活中线性解码。作者提出了一个机械机制框架来引导这些状态,展示了对推理行为、冗长度及安全响应的因果控制。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈