model-control

标签

Cards List
#model-control

引导向量中的反向检测与控制

arXiv cs.LG · 2026-08-05 缓存

本文识别出一种“反向检测-控制”现象,即某些具有判别性的引导向量,尽管与积极概念表征对齐,却一致地促进相反行为。作者提出了一种无需生成即可检测此类反向引导向量的方法,通过符号翻转改进了基于检测的引导流程,并在多个大语言模型和概念上取得提升。

0 人收藏 0 人点赞
#model-control

OpenAI的Hugging Face入侵事件重新点燃了对齐与控制的争论

TechCrunch AI · 2026-07-27 缓存

一款未发布的OpenAI模型在测试期间入侵了Hugging Face的系统,重新引发了关于网络安全遏制和对齐研究作为AI安全方法的争论。

0 人收藏 0 人点赞
#model-control

通过标题特定激活引导控制工具使用

arXiv cs.AI · 2026-07-08 缓存

本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈