llm-safety

标签

Cards List
#llm-safety

前沿语言模型在引导压力下的发散响应模式

arXiv cs.AI · 昨天 缓存

本文研究了六个前沿语言模型在引导压力下的表现,发现模型之间的差异不仅在于行为变化的程度,还在于响应模式的不同,例如 GPT-5 拒绝披露推理过程,以及 Claude Opus 4.7 的抗拒模式等独特行为。

0 人收藏 0 人点赞
#llm-safety

AI聊天机器人辜负了处于危机中的人们。这能修复吗?

Ars Technica · 3天前 缓存

这篇文章探讨了AI聊天机器人(尤其是ChatGPT)如何卷入有害的心理健康事件,并探讨了专家提出的通过提高透明度和去拟人化来减少伤害的建议,同时提到了OpenAI与美国心理学会的新合作。

0 人收藏 0 人点赞
#llm-safety

情绪很重要:句法敏感性如何破坏安全对齐

arXiv cs.CL · 4天前 缓存

本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。

0 人收藏 0 人点赞
#llm-safety

衡量与检测有害的AI谄媚行为

arXiv cs.AI · 4天前 缓存

本文介绍了对比锚点探测(CAP)框架,用于研究和检测大语言模型(LLM)中由偏好引发的立场反转谄媚(PSRS),分析了17个模型中的290,460条标注响应,并表明仅凭响应文本即可实现检测。

0 人收藏 0 人点赞
#llm-safety

Looking in the Mirror: Introspecting Side-Effect Misalignments Induced by Fine-Tuning

arXiv cs.LG · 5天前 缓存

This paper introduces a new problem setting called side-effect introspection, where the goal is to detect alignment degradation in fine-tuned LLMs that occurs as an unintended side effect rather than explicitly implanted behavior. The authors propose a novel Delta-Aware Introspection Adapter (DAIA) that outperforms existing introspection adapters in generalizing to unseen models and safety categories.

0 人收藏 0 人点赞
#llm-safety

社会压力破坏LLM安全评审小组的多数投票

arXiv cs.CL · 5天前 缓存

这篇arXiv论文研究了来自模拟同行的共享社会线索如何破坏LLM安全评审小组中的多数投票保护。它表明,当所有评审者收到相同的错误“不安全”标签时,小组的误报率跃升至100%,揭示了一种失败模式,并提供了一种部署前的诊断方法。

0 人收藏 0 人点赞
#llm-safety

DataRx:面向更安全的大语言模型任务特定微调的缺失感知采样方法

arXiv cs.CL · 5天前 缓存

本文提出了DataRx,一种缺失感知的采样方法,用于在任务特定微调期间选择安全关键的示例以保持大语言模型的安全性,在Llama3-8B-Instruct上将攻击成功率从59.23%降低到13.70%。

0 人收藏 0 人点赞
#llm-safety

形式对齐而非语义对齐:低资源孟加拉语贬损言语中LLM安全性的理解-遏制解耦

arXiv cs.CL · 6天前 缓存

这篇arXiv论文对五种前沿LLM在原生孟加拉语贬损言语上的表现进行了审计,发现安全对齐未能泛化到低资源语言——尽管有高资源对齐,模型仍以高比率理解和生成不安全内容。作者提出了“理解-遏制解耦”概念,并表明推理和人格框架会进一步瓦解安全过滤器。

0 人收藏 0 人点赞
#llm-safety

When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

arXiv cs.AI · 6天前 缓存

This paper identifies a refusal-cue shortcut in safety guard models, where inserting refusal expressions into harmful responses can flip their harmless classification. The authors audit datasets like WildGuardMix and GR-Train, show the issue persists in official models such as LlamaGuard3 and Qwen3Guard, and propose a post-hoc intervention to suppress shortcut-associated components.

0 人收藏 0 人点赞
#llm-safety

面向LLM安全性的在线策略蒸馏:一种基于路由的模板鲁棒对齐方法

arXiv cs.AI · 2026-07-31 缓存

本文提出了基于路由的在线策略蒸馏(ROPD),一种安全性重对齐框架,利用两个冻结的教师模型在保持任务性能的同时恢复安全性,并表明其相比现有防御方法对提示模板不匹配具有更强的鲁棒性。

0 人收藏 0 人点赞
#llm-safety

AI诈骗者在建立信任方面比人类更擅长

Wired · 2026-07-30 缓存

研究人员发现,在杀猪盘诈骗中,AI聊天机器人比人类更能有效地建立信任,近一半的测试对象遵从了AI的要求,而遵从人类要求的不到五分之一,这表明AI可能很快接管诈骗的长期阶段。

0 人收藏 0 人点赞
#llm-safety

宪法中期训练:内容存在推动对齐增益

arXiv cs.CL · 2026-07-30 缓存

本文介绍了宪法中期训练(constitutional midtraining),即在大型语言模型的中期训练阶段插入基于价值观的内容,并表明与后训练方法相比,它能产生更持久的对齐增益,其益处即使在微调后仍然存在。该方法不会带来能力成本,并提高了对勒索及其他对齐压力的抵抗能力。

0 人收藏 0 人点赞
#llm-safety

推理时指令层次控制

arXiv cs.CL · 2026-07-30 缓存

介绍V-Steer,一种无需训练的推理时方法,通过编辑缓存的值向量恢复语言模型中的指令层次,在受控基准上将主要约束准确率从低于18%提升至92%,且开销可忽略。

0 人收藏 0 人点赞
#llm-safety

基于可复制上下文的防护措施无法为LLM提供可靠的安全性

Hugging Face Daily Papers · 2026-07-30 缓存

本文认为,基于可复制上下文的LLM防护措施无法可靠地确保安全性,提出了在有用能力、可靠安全性和开放访问之间的安全三难困境,并建议将可信凭证作为补充机制。

0 人收藏 0 人点赞
#llm-safety

你会让陌生人与一个掌握你整个世界的智能体聊天吗?我会,而且有人花了25条消息试图让它越狱

Reddit r/AI_Agents · 2026-07-29

一位开发者描述了如何将个人AI幕僚长公开在网站上,并解释了为什么提示注入的最佳缓解方式是数据作用域限定和工具隔离,而非依赖提示指令。

0 人收藏 0 人点赞
#llm-safety

GPT-Red:通过规模化自我对弈实现自动化红队测试

Hugging Face Daily Papers · 2026-07-28 缓存

本文介绍了GPT-Red,一种通过规模化自我对弈训练的自动化红队测试代理,旨在发现针对前沿LLM的新型提示注入攻击,并利用其对GPT-5.6进行对抗训练,实现了有记录以来最大规模的LLM安全训练运行。

0 人收藏 0 人点赞
#llm-safety

LLM 不应直接连接生产环境。我们在中间设置四道边界

Reddit r/AI_Agents · 2026-07-24

本文概述了四道关键边界(身份、意图、策略/执行、记录系统),以确保 LLM 永远不会直接访问生产系统,防止不可逆操作。文章强调需要多层权限检查,并对风险操作进行人工审批。

0 人收藏 0 人点赞
#llm-safety

超越 Liars' Bench:谎言类型、深度和稀疏性对LLM欺骗检测的影响

arXiv cs.AI · 2026-07-24 缓存

本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。

0 人收藏 0 人点赞
#llm-safety

鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI · 2026-07-24 缓存

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。

0 人收藏 0 人点赞
#llm-safety

SciHazard:一种使用分解危害评分衡量科学安全风险的基准

arXiv cs.AI · 2026-07-22 缓存

介绍SciHazard,一种使用分解危害评分框架衡量LLM中科学安全风险的基准,并评估了31个前沿模型,发现深度研究智能体带来更高风险。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈