refusal

标签

Cards List
#refusal

OrcaRouter 的未经审查的 Qwen3.8-27B 仍然对 27–56% 的有害答案添加保留意见

Reddit r/ArtificialInteligence · 2026-08-20

OrcaRouter 的未经审查的 Qwen3.8-27B 衍生模型将有害提示的拒绝率降低至 0-6%,但仍然对 27-56% 的答案添加保留意见,与基线模型相比性能指标参差不齐。

0 人收藏 0 人点赞
#refusal

MMOOC:多模态大语言模型上下文外评估的综合基准

Hugging Face Daily Papers · 2026-08-01 缓存

MMOOC 是一个大规模基准,包含超过 41K 个图像-问题对,用于评估多模态大语言模型在拒绝上下文外问题的同时回答上下文偏移问题的能力,结果显示当前模型难以平衡这两种能力。

0 人收藏 0 人点赞
#refusal

一个拒绝猜测的符号化引擎

Reddit r/artificial · 2026-07-22

Chiron 是一个精确定位或拒绝的证据门,用于结构化输出,将声明验证为 VERIFIED(已验证)、REFUTED(已驳斥)或 REFUSED(已拒绝),并配有公开的评估历史记录和源代码。

0 人收藏 0 人点赞
#refusal

我在一个月的假账目中植入了六个错误,看我的AI智能体能发现几个。它们发现了五个。漏掉的那个才是最可怕的部分。

Reddit r/AI_Agents · 2026-07-15

一项实验在虚假记账数据中植入了六个错误,AI智能体发现五个;特别值得注意的是,当数据不足时它们会拒绝猜测,凸显出不确定性意识比纯粹准确率更有价值。

0 人收藏 0 人点赞
#refusal

我曾深爱Claude,但最新模型正在慢慢毁掉它

Hacker News Top · 2026-07-11 缓存

一篇评论文章讨论了Claude近期更新如何使AI聊天机器人更容易拒绝请求和说教用户,尤其是在敏感的创意话题上,这让长期用户感到沮丧。

0 人收藏 0 人点赞
#refusal

保范Abliteration应用于Qwen3.6-35B-A3B:0%拒绝率,基准测试性能完整,开源数据集

Reddit r/LocalLLaMA · 2026-06-30

对Qwen3.6-35B-A3B应用保范Abliteration技术,实现0%拒绝率,基准测试性能保持不变,并发布了开源数据集。

0 人收藏 0 人点赞
#refusal

代理安全即行动对齐

arXiv cs.AI · 2026-06-30 缓存

本文认为,将内容安全拒绝方法应用于AI代理是一种范畴错误——代理的危害在于权限滥用而非输出——并提出通过最小权限原则在模型外部强制实施行动对齐。

0 人收藏 0 人点赞
#refusal

聊天模型中拒绝行为位于人格下游

arXiv cs.AI · 2026-06-26 缓存

本文表明,在聊天模型中,拒绝行为由晚期层的合规模型人格方向门控,而非孤立的机制。操控人格可抑制拒绝,而重新引入拒绝仅在晚期层部分恢复拒绝,揭示了人格与安全表示之间的耦合。

0 人收藏 0 人点赞
#refusal

新型消融算子 (apostate)

Reddit r/LocalLLaMA · 2026-06-22

介绍了一种名为apostate的新型对比消融算子,该算子将模型拒绝率从96%降低至5%,同时仅以0.081 KL散度保留无害行为,已在Granite 3.3-8B上测试。

0 人收藏 0 人点赞
#refusal

超越单一方向的拒绝:Diff-in-Means与INLP的初步比较

arXiv cs.AI · 2026-06-15 缓存

比较了Diff-in-Means和迭代零空间投影(INLP)方法在安全微调聊天模型中引导拒绝行为的效果,发现INLP反事实翻转在抑制拒绝方面与DiM方向消融相当,同时提供了更多可调性的干预手段。

0 人收藏 0 人点赞
#refusal

为什么 Fable 5 接受提示的门槛这么低,一直消耗令牌却最终拒绝回答?

Reddit r/ArtificialInteligence · 2026-06-11

用户报告称,Fable 5 接受提示并消耗令牌,但随后拒绝回答,突显了接受门槛低和令牌使用效率低下的问题。

0 人收藏 0 人点赞
#refusal

AI科学家何时应停止?面向自主发现的可验证实验引导与拒绝机制

arXiv cs.LG · 2026-06-09 缓存

本文介绍了Cartograph,一种为AI科学家设计的验证层,它结合了子空间实验引导、模糊性解析和库不充分检测。该框架在自主发现测试平台上优于基线,并回顾性地标记了A-Lab材料系统中不明确的声明。

0 人收藏 0 人点赞
#refusal

超越单一方向:思维链破坏简单的拒绝引导

arXiv cs.AI · 2026-05-27 缓存

这篇论文研究了大型推理模型中的思维链推理如何使基于激活的拒绝行为控制变得复杂。在DeepSeek-R1-Distill-LLaMA-8B上的实验表明,拒绝行为同时编码在残差流激活和思维链痕迹中,使得模型对激活层面的干预更加鲁棒,但同时也暴露了思维链作为另一个攻击面。

0 人收藏 0 人点赞
#refusal

@m_shalia: Three Babies的初步结果出来了,我必须谈谈这个。我们微调了三个共享...的8B模型

X AI KOLs Following · 2026-05-15 缓存

对三个8B Llama 3变体(Hermes、Dolphin、Llama-Instruct)使用271示例课程进行微调的初步结果显示,拒绝和不确定性表达发生了显著变化,表明教授真实拒绝价值观比服从训练更有效。

0 人收藏 0 人点赞
#refusal

从强制拒绝到安全完成:面向输出为中心的安全训练

OpenAI Blog · 2025-08-07 缓存

# 从强制拒绝到安全完成:面向输出为中心的安全训练 来源: [https://openai.com/index/gpt-5-safe-completions/](https://openai.com/index/gpt-5-safe-completions/) OpenAI在 GPT-5 中引入的安全完成是一种新的安全训练方法,可在安全约束范围内最大化模型的实用性。与基于拒绝的训练相比,安全完成提高了安全性和实用性,特别是在双用途领域。**如果用户要求 ChatGPT 提供最小能量

0 人收藏 0 人点赞
← 返回首页

提交意见反馈