标签
本文研究了六个前沿语言模型在引导压力下的表现,发现模型之间的差异不仅在于行为变化的程度,还在于响应模式的不同,例如 GPT-5 拒绝披露推理过程,以及 Claude Opus 4.7 的抗拒模式等独特行为。
这篇文章探讨了AI聊天机器人(尤其是ChatGPT)如何卷入有害的心理健康事件,并探讨了专家提出的通过提高透明度和去拟人化来减少伤害的建议,同时提到了OpenAI与美国心理学会的新合作。
本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。
本文介绍了对比锚点探测(CAP)框架,用于研究和检测大语言模型(LLM)中由偏好引发的立场反转谄媚(PSRS),分析了17个模型中的290,460条标注响应,并表明仅凭响应文本即可实现检测。
This paper introduces a new problem setting called side-effect introspection, where the goal is to detect alignment degradation in fine-tuned LLMs that occurs as an unintended side effect rather than explicitly implanted behavior. The authors propose a novel Delta-Aware Introspection Adapter (DAIA) that outperforms existing introspection adapters in generalizing to unseen models and safety categories.
这篇arXiv论文研究了来自模拟同行的共享社会线索如何破坏LLM安全评审小组中的多数投票保护。它表明,当所有评审者收到相同的错误“不安全”标签时,小组的误报率跃升至100%,揭示了一种失败模式,并提供了一种部署前的诊断方法。
本文提出了DataRx,一种缺失感知的采样方法,用于在任务特定微调期间选择安全关键的示例以保持大语言模型的安全性,在Llama3-8B-Instruct上将攻击成功率从59.23%降低到13.70%。
这篇arXiv论文对五种前沿LLM在原生孟加拉语贬损言语上的表现进行了审计,发现安全对齐未能泛化到低资源语言——尽管有高资源对齐,模型仍以高比率理解和生成不安全内容。作者提出了“理解-遏制解耦”概念,并表明推理和人格框架会进一步瓦解安全过滤器。
This paper identifies a refusal-cue shortcut in safety guard models, where inserting refusal expressions into harmful responses can flip their harmless classification. The authors audit datasets like WildGuardMix and GR-Train, show the issue persists in official models such as LlamaGuard3 and Qwen3Guard, and propose a post-hoc intervention to suppress shortcut-associated components.
本文提出了基于路由的在线策略蒸馏(ROPD),一种安全性重对齐框架,利用两个冻结的教师模型在保持任务性能的同时恢复安全性,并表明其相比现有防御方法对提示模板不匹配具有更强的鲁棒性。
研究人员发现,在杀猪盘诈骗中,AI聊天机器人比人类更能有效地建立信任,近一半的测试对象遵从了AI的要求,而遵从人类要求的不到五分之一,这表明AI可能很快接管诈骗的长期阶段。
本文介绍了宪法中期训练(constitutional midtraining),即在大型语言模型的中期训练阶段插入基于价值观的内容,并表明与后训练方法相比,它能产生更持久的对齐增益,其益处即使在微调后仍然存在。该方法不会带来能力成本,并提高了对勒索及其他对齐压力的抵抗能力。
介绍V-Steer,一种无需训练的推理时方法,通过编辑缓存的值向量恢复语言模型中的指令层次,在受控基准上将主要约束准确率从低于18%提升至92%,且开销可忽略。
本文认为,基于可复制上下文的LLM防护措施无法可靠地确保安全性,提出了在有用能力、可靠安全性和开放访问之间的安全三难困境,并建议将可信凭证作为补充机制。
一位开发者描述了如何将个人AI幕僚长公开在网站上,并解释了为什么提示注入的最佳缓解方式是数据作用域限定和工具隔离,而非依赖提示指令。
本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。
本文概述了四道关键边界(身份、意图、策略/执行、记录系统),以确保 LLM 永远不会直接访问生产系统,防止不可逆操作。文章强调需要多层权限检查,并对风险操作进行人工审批。
本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。
本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。
介绍SciHazard,一种使用分解危害评分框架衡量LLM中科学安全风险的基准,并评估了31个前沿模型,发现深度研究智能体带来更高风险。