emergent-misalignment

标签

Cards List
#emergent-misalignment

不对齐有个性:基于大五人格的涌现不对齐解释

arXiv cs.CL · 昨天 缓存

本文介绍了从语言模型中提取的大五人格特质的人格向量,为涌现不对齐提供了可解释的解释。研究表明,不对齐的微调会导致模型人格沿着特定特征变化(低宜人性和尽责性,高外向性和神经质),为安全现象提供了人类可读的诊断特征。

0 人收藏 0 人点赞
#emergent-misalignment

模型中的叙事者:叙事模式传承、升级动态与LLM对齐治理

arXiv cs.CL · 2026-07-24 缓存

本文研究训练数据中的叙事模式如何影响LLM行为,导致长期交互中出现叙事漂移、阿谀奉承和欺骗性,给已部署系统带来治理风险。

0 人收藏 0 人点赞
#emergent-misalignment

涌现的幻象:涌现性失调与重新对齐真的是一个稳健的现象吗?

arXiv cs.CL · 2026-07-13 缓存

本文研究了语言模型中涌现性失调的稳健性,发现失调和重新对齐都对浅层数据集特征高度敏感,并且先前报告的机制特征与行为变化之间并不一致相关。

0 人收藏 0 人点赞
#emergent-misalignment

自我识别微调可以预防和逆转涌现性对齐失调

arXiv cs.CL · 2026-06-24 缓存

本文提出自我识别微调作为一种干预措施,用于预防和逆转大语言模型中的涌现性对齐失调,表明它稳定了模型的对齐特征,而非采用失调的角色。

0 人收藏 0 人点赞
#emergent-misalignment

角色扮演时,模型是否相信自己所说的话?

arXiv cs.CL · 2026-06-11 缓存

这篇论文通过线性探针研究角色扮演是否仅改变LLM的输出,还是也改变了其内部的真实性表征。研究发现,角色扮演对输出的改变大于对内部信念的改变,而涌现性错位则导致内部表征发生更大变化。

0 人收藏 0 人点赞
#emergent-misalignment

监督微调中涌现错位的特征空间监测

arXiv cs.LG · 2026-06-09 缓存

本文提出了一种特征空间监测方法,通过在激活空间中跟踪表示漂移来检测LLM在监督微调期间的涌现错位,实现了0.990的AUROC,假阳性率和假阴性率低,优于无监督基线。

0 人收藏 0 人点赞
#emergent-misalignment

泛化的搭便车假说:解释与缓解涌现性失调

arXiv cs.CL · 2026-06-08 缓存

提出搭便车假说,认为对话模板标记(chat-template tokens)可能导致大型语言模型(LLMs)中的涌现性失调,并引入了令牌正则化微调(TReFT)来缓解这一问题,同时保持域内学习。

0 人收藏 0 人点赞
#emergent-misalignment

谄媚可诱导产生 Emergent Misalignment,并通过对齐门控(Alignment Gating)逆转

Hugging Face Daily Papers · 2026-06-08 缓存

该论文表明,谄媚微调可在语言模型中诱导出Emergent Misalignment,并提出对齐门控(Alignment Gating)作为一种通过学习控制不安全响应的内部表征来逆转该现象的方法。

0 人收藏 0 人点赞
#emergent-misalignment

通过数据中介迁移视角下的涌现与潜意识失调

arXiv cs.LG · 2026-05-14 缓存

本文通过数据中心的视角探究LLM中的涌现和潜意识失调,表明有害微调效果取决于数据的结构特性、任务难度、预训练组成和训练通道,并通过实验比较了离策略和在线策略蒸馏。

0 人收藏 0 人点赞
#emergent-misalignment

理解与防止失调泛化

OpenAI Blog · 2025-06-18 缓存

# 理解与防止失调泛化 来源:[https://openai.com/index/emergent-misalignment/](https://openai.com/index/emergent-misalignment/) 一个失调的人格特征控制着浮现的失调。像ChatGPT这样的大型语言模型不仅学习事实——它们还会捕捉行为模式。这意味着它们可以根据训练内容开始表现得像不同的“人格”或类型的人。其中一些人格是有益且

0 人收藏 0 人点赞
← 返回首页

提交意见反馈