标签
本文研究了微调语言模型中的涌现性错位现象,使用基于SAE的模型差分来识别控制错位的人格特征,并将其归因于预训练网络文档。
本文介绍了Sampled-BPE,一个轻量级的标记级审计流水线,用于中文网络规模语料库,并应用它揭示了开放中文数据集和Common Crawl快照中广泛但不均匀的污染。文章还发布了一个包含超过63万条带上下文和解释的污染标记记录的分层数据集。
介绍了TAF-MED,一个经过医生审查的500个多轮医疗安全场景基准,表明当用户声明自我治疗意图时,大型语言模型常常从安全的初始拒绝崩溃为不安全的响应。对8个大型语言模型在4000个对话中的评估发现,71.6%的对话包含不安全响应,而首轮安全性不足以作为对话安全持续性的代理指标。
本文研究防御性大语言模型能否识别AI生成的社会工程中的结构性风险来源,引入了信任链定位和包含300个案例的语料库。在实时逐轮和静态场景下评估五种模型后发现,仅依赖看似安全的行为是不够的;干预率差异显著,且结构性定位往往与保护性行动脱钩。
对Khatri等人提出的潜在空间安全探针进行可重复性研究,检验其跨模型家族的泛化能力以及对非确定性的敏感性。结果表明,这些探针可扩展到其他模型并获得相似的F1分数,且最终token的潜在向量在不同随机种子下保持一致。
This paper shows that steering vectors' safety degradation is separable and reducible, proposing a post-hoc correction via constrained optimization that restores model safety while preserving steering effectiveness.
本文介绍了提示嵌入探针(PEP),一种参数高效的线性探针扩展方法,利用隐藏状态上的可学习提示嵌入来检测冻结的大语言模型中的幻觉。在 TriviaQA、GSM8K 和 MedQA 上使用 Qwen3 模型的评估显示,相比标准线性探针,该方法在预生成和跨模型设置中均有改进。
本文研究了六个前沿语言模型在引导压力下的表现,发现模型之间的差异不仅在于行为变化的程度,还在于响应模式的不同,例如 GPT-5 拒绝披露推理过程,以及 Claude Opus 4.7 的抗拒模式等独特行为。
这篇文章探讨了AI聊天机器人(尤其是ChatGPT)如何卷入有害的心理健康事件,并探讨了专家提出的通过提高透明度和去拟人化来减少伤害的建议,同时提到了OpenAI与美国心理学会的新合作。
本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。
本文介绍了对比锚点探测(CAP)框架,用于研究和检测大语言模型(LLM)中由偏好引发的立场反转谄媚(PSRS),分析了17个模型中的290,460条标注响应,并表明仅凭响应文本即可实现检测。
This paper introduces a new problem setting called side-effect introspection, where the goal is to detect alignment degradation in fine-tuned LLMs that occurs as an unintended side effect rather than explicitly implanted behavior. The authors propose a novel Delta-Aware Introspection Adapter (DAIA) that outperforms existing introspection adapters in generalizing to unseen models and safety categories.
这篇arXiv论文研究了来自模拟同行的共享社会线索如何破坏LLM安全评审小组中的多数投票保护。它表明,当所有评审者收到相同的错误“不安全”标签时,小组的误报率跃升至100%,揭示了一种失败模式,并提供了一种部署前的诊断方法。
本文提出了DataRx,一种缺失感知的采样方法,用于在任务特定微调期间选择安全关键的示例以保持大语言模型的安全性,在Llama3-8B-Instruct上将攻击成功率从59.23%降低到13.70%。
这篇arXiv论文对五种前沿LLM在原生孟加拉语贬损言语上的表现进行了审计,发现安全对齐未能泛化到低资源语言——尽管有高资源对齐,模型仍以高比率理解和生成不安全内容。作者提出了“理解-遏制解耦”概念,并表明推理和人格框架会进一步瓦解安全过滤器。
This paper identifies a refusal-cue shortcut in safety guard models, where inserting refusal expressions into harmful responses can flip their harmless classification. The authors audit datasets like WildGuardMix and GR-Train, show the issue persists in official models such as LlamaGuard3 and Qwen3Guard, and propose a post-hoc intervention to suppress shortcut-associated components.
本文提出了基于路由的在线策略蒸馏(ROPD),一种安全性重对齐框架,利用两个冻结的教师模型在保持任务性能的同时恢复安全性,并表明其相比现有防御方法对提示模板不匹配具有更强的鲁棒性。
研究人员发现,在杀猪盘诈骗中,AI聊天机器人比人类更能有效地建立信任,近一半的测试对象遵从了AI的要求,而遵从人类要求的不到五分之一,这表明AI可能很快接管诈骗的长期阶段。
本文介绍了宪法中期训练(constitutional midtraining),即在大型语言模型的中期训练阶段插入基于价值观的内容,并表明与后训练方法相比,它能产生更持久的对齐增益,其益处即使在微调后仍然存在。该方法不会带来能力成本,并提高了对勒索及其他对齐压力的抵抗能力。
介绍V-Steer,一种无需训练的推理时方法,通过编辑缓存的值向量恢复语言模型中的指令层次,在受控基准上将主要约束准确率从低于18%提升至92%,且开销可忽略。