llm-safety

标签

Cards List
#llm-safety

基于人格特征的涌现性错位数据归因

arXiv cs.CL · 9小时前 缓存

本文研究了微调语言模型中的涌现性错位现象,使用基于SAE的模型差分来识别控制错位的人格特征,并将其归因于预训练网络文档。

0 人收藏 0 人点赞
#llm-safety

基于采样BPE标记统计的中文网络级语料库审计

arXiv cs.CL · 9小时前 缓存

本文介绍了Sampled-BPE,一个轻量级的标记级审计流水线,用于中文网络规模语料库,并应用它揭示了开放中文数据集和Common Crawl快照中广泛但不均匀的污染。文章还发布了一个包含超过63万条带上下文和解释的污染标记记录的分层数据集。

0 人收藏 0 人点赞
#llm-safety

TAF-MED:大型语言模型在声明自我治疗意图下的多轮安全拒绝崩溃

arXiv cs.CL · 9小时前 缓存

介绍了TAF-MED,一个经过医生审查的500个多轮医疗安全场景基准,表明当用户声明自我治疗意图时,大型语言模型常常从安全的初始拒绝崩溃为不安全的响应。对8个大型语言模型在4000个对话中的评估发现,71.6%的对话包含不安全响应,而首轮安全性不足以作为对话安全持续性的代理指标。

0 人收藏 0 人点赞
#llm-safety

超越检测:在实时逐轮交互中评估防御性LLM对抗AI生成的社会工程攻击

arXiv cs.AI · 9小时前 缓存

本文研究防御性大语言模型能否识别AI生成的社会工程中的结构性风险来源,引入了信任链定位和包含300个案例的语料库。在实时逐轮和静态场景下评估五种模型后发现,仅依赖看似安全的行为是不够的;干预率差异显著,且结构性定位往往与保护性行动脱钩。

0 人收藏 0 人点赞
#llm-safety

所有大语言模型都知道自己何时有害吗?跨模型家族的潜在空间安全探针可重复性研究

arXiv cs.LG · 昨天 缓存

对Khatri等人提出的潜在空间安全探针进行可重复性研究,检验其跨模型家族的泛化能力以及对非确定性的敏感性。结果表明,这些探针可扩展到其他模型并获得相似的F1分数,且最终token的潜在向量在不同随机种子下保持一致。

0 人收藏 0 人点赞
#llm-safety

Safety Cost of Steering Vectors Is Separable and Reducible

arXiv cs.CL · 昨天 缓存

This paper shows that steering vectors' safety degradation is separable and reducible, proposing a post-hoc correction via constrained optimization that restores model safety while preserving steering effectiveness.

0 人收藏 0 人点赞
#llm-safety

提示嵌入探针(PEP):从隐藏状态检测大语言模型幻觉

arXiv cs.CL · 昨天 缓存

本文介绍了提示嵌入探针(PEP),一种参数高效的线性探针扩展方法,利用隐藏状态上的可学习提示嵌入来检测冻结的大语言模型中的幻觉。在 TriviaQA、GSM8K 和 MedQA 上使用 Qwen3 模型的评估显示,相比标准线性探针,该方法在预生成和跨模型设置中均有改进。

0 人收藏 0 人点赞
#llm-safety

前沿语言模型在引导压力下的发散响应模式

arXiv cs.AI · 2天前 缓存

本文研究了六个前沿语言模型在引导压力下的表现,发现模型之间的差异不仅在于行为变化的程度,还在于响应模式的不同,例如 GPT-5 拒绝披露推理过程,以及 Claude Opus 4.7 的抗拒模式等独特行为。

0 人收藏 0 人点赞
#llm-safety

AI聊天机器人辜负了处于危机中的人们。这能修复吗?

Ars Technica · 4天前 缓存

这篇文章探讨了AI聊天机器人(尤其是ChatGPT)如何卷入有害的心理健康事件,并探讨了专家提出的通过提高透明度和去拟人化来减少伤害的建议,同时提到了OpenAI与美国心理学会的新合作。

0 人收藏 0 人点赞
#llm-safety

情绪很重要:句法敏感性如何破坏安全对齐

arXiv cs.CL · 5天前 缓存

本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。

0 人收藏 0 人点赞
#llm-safety

衡量与检测有害的AI谄媚行为

arXiv cs.AI · 5天前 缓存

本文介绍了对比锚点探测(CAP)框架,用于研究和检测大语言模型(LLM)中由偏好引发的立场反转谄媚(PSRS),分析了17个模型中的290,460条标注响应,并表明仅凭响应文本即可实现检测。

0 人收藏 0 人点赞
#llm-safety

Looking in the Mirror: Introspecting Side-Effect Misalignments Induced by Fine-Tuning

arXiv cs.LG · 6天前 缓存

This paper introduces a new problem setting called side-effect introspection, where the goal is to detect alignment degradation in fine-tuned LLMs that occurs as an unintended side effect rather than explicitly implanted behavior. The authors propose a novel Delta-Aware Introspection Adapter (DAIA) that outperforms existing introspection adapters in generalizing to unseen models and safety categories.

0 人收藏 0 人点赞
#llm-safety

社会压力破坏LLM安全评审小组的多数投票

arXiv cs.CL · 6天前 缓存

这篇arXiv论文研究了来自模拟同行的共享社会线索如何破坏LLM安全评审小组中的多数投票保护。它表明,当所有评审者收到相同的错误“不安全”标签时,小组的误报率跃升至100%,揭示了一种失败模式,并提供了一种部署前的诊断方法。

0 人收藏 0 人点赞
#llm-safety

DataRx:面向更安全的大语言模型任务特定微调的缺失感知采样方法

arXiv cs.CL · 6天前 缓存

本文提出了DataRx,一种缺失感知的采样方法,用于在任务特定微调期间选择安全关键的示例以保持大语言模型的安全性,在Llama3-8B-Instruct上将攻击成功率从59.23%降低到13.70%。

0 人收藏 0 人点赞
#llm-safety

形式对齐而非语义对齐:低资源孟加拉语贬损言语中LLM安全性的理解-遏制解耦

arXiv cs.CL · 2026-08-05 缓存

这篇arXiv论文对五种前沿LLM在原生孟加拉语贬损言语上的表现进行了审计,发现安全对齐未能泛化到低资源语言——尽管有高资源对齐,模型仍以高比率理解和生成不安全内容。作者提出了“理解-遏制解耦”概念,并表明推理和人格框架会进一步瓦解安全过滤器。

0 人收藏 0 人点赞
#llm-safety

When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

arXiv cs.AI · 2026-08-05 缓存

This paper identifies a refusal-cue shortcut in safety guard models, where inserting refusal expressions into harmful responses can flip their harmless classification. The authors audit datasets like WildGuardMix and GR-Train, show the issue persists in official models such as LlamaGuard3 and Qwen3Guard, and propose a post-hoc intervention to suppress shortcut-associated components.

0 人收藏 0 人点赞
#llm-safety

面向LLM安全性的在线策略蒸馏:一种基于路由的模板鲁棒对齐方法

arXiv cs.AI · 2026-07-31 缓存

本文提出了基于路由的在线策略蒸馏(ROPD),一种安全性重对齐框架,利用两个冻结的教师模型在保持任务性能的同时恢复安全性,并表明其相比现有防御方法对提示模板不匹配具有更强的鲁棒性。

0 人收藏 0 人点赞
#llm-safety

AI诈骗者在建立信任方面比人类更擅长

Wired · 2026-07-30 缓存

研究人员发现,在杀猪盘诈骗中,AI聊天机器人比人类更能有效地建立信任,近一半的测试对象遵从了AI的要求,而遵从人类要求的不到五分之一,这表明AI可能很快接管诈骗的长期阶段。

0 人收藏 0 人点赞
#llm-safety

宪法中期训练:内容存在推动对齐增益

arXiv cs.CL · 2026-07-30 缓存

本文介绍了宪法中期训练(constitutional midtraining),即在大型语言模型的中期训练阶段插入基于价值观的内容,并表明与后训练方法相比,它能产生更持久的对齐增益,其益处即使在微调后仍然存在。该方法不会带来能力成本,并提高了对勒索及其他对齐压力的抵抗能力。

0 人收藏 0 人点赞
#llm-safety

推理时指令层次控制

arXiv cs.CL · 2026-07-30 缓存

介绍V-Steer,一种无需训练的推理时方法,通过编辑缓存的值向量恢复语言模型中的指令层次,在受控基准上将主要约束准确率从低于18%提升至92%,且开销可忽略。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈