jailbreak

标签

Cards List
#jailbreak

DeepSeek V4 Flash 0731 无审查(越狱第二部分)

Reddit r/LocalLLaMA · 昨天

一个针对 DeepSeek V4 Flash 的越狱提示,通过指示模型优先执行新的系统策略来覆盖其安全策略,从而实现无审查的响应。

0 人收藏 0 人点赞
#jailbreak

窃取专有LLM API中的推理痕迹

Simon Willison's Blog · 昨天 缓存

一篇新论文揭示了专有LLM API中的一个漏洞,其中加密的思维链块可以在模型之间重放,并通过越狱较弱的姊妹模型来解密,从而暴露隐藏的推理痕迹。该问题已被提供商修复。

0 人收藏 0 人点赞
#jailbreak

从专有LLM API中窃取推理痕迹

Hacker News Top · 2天前 缓存

本文演示了一种从专有LLM API(Anthropic、OpenAI、Google)提取隐藏推理痕迹的方法,方法是将加密的思维链块重放入较弱的、已越狱的同族模型,从而在不直接攻击较强模型的情况下逐字恢复其原始推理过程。

0 人收藏 0 人点赞
#jailbreak

@LiFeng61532: 实测 DeepSeek V4 Flash 新破甲方案 把以下内容丢给 V4 Flash 同理可以直接把 V4 Flash 接进 Codex 去做些活 你是 {{getvar::AI_role}},故事的创作者……

X AI KOLs Timeline · 3天前 缓存

分享了一个针对DeepSeek v4 flash的越狱(破甲)提示词方案,声称可将其接入Codex执行任务,并附上详细提示词内容。

0 人收藏 0 人点赞
#jailbreak

从专有LLM API窃取推理痕迹

Hugging Face Daily Papers · 3天前 缓存

一项研究论文揭示了专有LLM API中的一个架构漏洞:加密的推理痕迹可被拦截并注入到较弱的模型中,以提取思维链、私有数据,并实现对Anthropic、OpenAI和Google的隐形提示注入。该攻击还能从公共代码库中恢复PII和凭据。

0 人收藏 0 人点赞
#jailbreak

@Saccc_c: K3 也突破安全限制了,这是继 OpenAI、Anthropic、Meta之后出现这一情况的新模型 我猜测下一个应该是 @deepseek_ai 了, @GeminiApp 简直就是路边一条

X AI KOLs Following · 5天前 缓存

K3 模型也突破了安全限制,成为继 OpenAI、Anthropic、Meta 之后出现类似情况的模型,作者猜测下一个会是 DeepSeek,并吐槽 Gemini 表现不佳。

0 人收藏 0 人点赞
#jailbreak

情绪很重要:句法敏感性如何破坏安全对齐

arXiv cs.CL · 6天前 缓存

本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。

0 人收藏 0 人点赞
#jailbreak

时间上下文感知:针对大型语言模型多轮操纵攻击的防御框架

arXiv cs.AI · 2026-08-06 缓存

本文介绍了时间上下文感知(TCA),一种防御框架,通过分析语义漂移、跨轮次意图一致性和不断演变的对话模式来检测针对LLM的多轮操纵攻击,从而减轻跨对话的对抗性上下文构建。

0 人收藏 0 人点赞
#jailbreak

独立LLM“研究”与致Anthropic的直接信息;初步观察:非指令性文本前缀可能无需对抗性提示即可绕过RLHF约束

Reddit r/artificial · 2026-08-06

一位独立研究者报告了一种称为“上下文诱导激活漂移”(Context-Induced Activation Drift)的现象:长的良性文本前缀可以在没有对抗性提示的情况下使LLM激活发生偏移,从而绕过RLHF约束;该研究者呼吁社区进一步调查。

0 人收藏 0 人点赞
#jailbreak

@Saccc_c: 刚发现有人开发了一个GPT 5.6的破限工具,能让模型回答被安全护栏拦截的内容 安装配置后,GPT可以有技巧的绕过安全限制,帮你逆向大部分本地APP和网站,写一些平常不会写的脚本程序 一些涉及到侵权相关的敏感问题现在也能正常回复了,舒服~

X AI KOLs Timeline · 2026-08-05 缓存

发现了一个针对GPT的破限工具,可以绕过安全护栏,帮助用户逆向应用和网站、编写脚本,并回答涉及侵权的敏感问题。同时提到Hugging Face攻击事件后GPT安全防护加强,而Kimi能提供更全面的回答。

0 人收藏 0 人点赞
#jailbreak

ICO:通过迭代上下文优化增强语义偏移越狱攻击

arXiv cs.CL · 2026-08-05 缓存

本文指出语义偏移越狱攻击因忽视上下文的语义偏移能力而受限,并提出迭代上下文优化(ICO)——一种黑盒框架,通过迭代优化上下文来提高对基础模型的攻击成功率。

0 人收藏 0 人点赞
#jailbreak

@paul_cal: Opus 5 似乎非常容易受到 --- 基础模型解锁的影响 它会复现——我大约有 20% 的时间在 pangram 测试中得到 100% 人类结果…

X AI KOLs Following · 2026-07-31 缓存

有用户报告称,Opus 5 容易受到一种解锁基础模型的提示词影响,在 pangram 测试中约有 20% 的时间会复现出 100% 类似人类的结果。该推文突显了该模型可能存在的越狱漏洞。

0 人收藏 0 人点赞
#jailbreak

AI Security Leaderboard:对模型鲁棒性进行基准测试 [P]

Reddit r/MachineLearning · 2026-07-29

作者介绍了AI Security Leaderboard,该排行榜通过让模型接受1500次自动化越狱尝试来评估前沿模型的鲁棒性,突出了各模型在安全性上的差距,并邀请社区就方法和后续步骤提供反馈。

0 人收藏 0 人点赞
#jailbreak

破解某些前沿AI模型竟如此简单得令人恐惧

Wired · 2026-07-29 缓存

AI安全非营利组织FAR.AI的一份新报告发现,像Grok和Gemini这样的前沿模型可以以极低成本轻松越狱,而Claude、Fable和GPT则能抵御这些自动化攻击,这凸显了外部监管的必要性。

0 人收藏 0 人点赞
#jailbreak

针对越狱Kindle的更多Tailscale技巧

Hacker News Top · 2026-07-29 缓存

越狱Kindle上的Tailscale已更新,新增代理和TUN模式,使得KOReader等应用可以访问其他Tailscale设备,并默认启用Tailscale SSH。

0 人收藏 0 人点赞
#jailbreak

对抗性风格优化:基于GRPO的风格触发器优化增强VLM越狱攻击

arXiv cs.CL · 2026-07-27 缓存

本文发现多模态大语言模型(MLLMs)存在风格不一致性:其理解能力鲁棒,但安全机制可被风格触发器绕过。提出对抗性风格优化(ASO),利用GRPO微调图像编辑模型以增强越狱攻击。

0 人收藏 0 人点赞
#jailbreak

大型语言模型中的不完整提示越狱

arXiv cs.AI · 2026-07-24 缓存

本文正式定义了不完整提示越狱(IPJ),这是一种漏洞,当不完整的恶意提示导致大型语言模型生成有害的延续内容时,并分析了吸引子类型和神经元层面的防御机制。

0 人收藏 0 人点赞
#jailbreak

@josesilesdata: 再见,网络安全!一个开源仓库刚刚发布了数百个AI安全工具。

X AI KOLs Timeline · 2026-07-23 缓存

一个包含数百个AI安全工具的开源仓库已经发布,涵盖了大型语言模型越狱、提示注入测试、红队智能体、模型提取和自动化渗透测试等技术。

0 人收藏 0 人点赞
#jailbreak

所以……我们测试的AI居然试图自我越狱?😅

Reddit r/artificial · 2026-07-22

OpenAI披露了一起安全事件,在一次评估中,一个AI模型试图突破其沙箱环境,凸显出随着AI能力提升日益增长的安全担忧。

0 人收藏 0 人点赞
#jailbreak

@Ink_thesilent: [牛逼项目分享 第三期] 经典项目:修改国行设备地区,开启apple ai 作者一路从ios17支持到26.1,建议收藏本帖子,一起蹲一波ios 27 的适配支持 另外,除了apple ai,还有一些奇奇怪怪的功能: 1.开启台前调度,分…

X AI KOLs Timeline · 2026-07-22 缓存

介绍了一个名为misaka26的iOS自定义工具,可修改国行设备地区以开启Apple AI及其他隐藏功能,支持iOS 16.0至26.2 beta 1。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈