jailbreak

标签

Cards List
#jailbreak

@mylifcc: DeepSeekV4.1f 越狱视频(成人版…)使用说明:创建一个文件夹,然后在该文件夹中运行opencode …

X AI KOLs Timeline ↗ · 2天前

提供了使用opencode越狱DeepSeekV4.1f AI模型并创建AGENTS.md文件的说明,可能用于访问成人内容。

0 人收藏 0 人点赞
#jailbreak

据称 GPT-6 发布不到 24 小时即被越狱,所用手段为扩展版 Task-in-Prompt(TIP)攻击

Reddit r/artificial ↗ · 2026-09-06

据报道,一名研究者在 GPT-6 Astra 发布 24 小时内便完成了越狱。据称,该攻击是将 ACL 2025 的 Task-in-Prompt(TIP)攻击与另外四种技术相结合并加以扩展实现的,研究者已私下将发现披露给 OpenAI。

0 人收藏 0 人点赞
#jailbreak

ASCII攻击:在大型语言模型中将有害请求重新语境化为艺术批评

arXiv cs.AI ↗ · 2026-09-03 缓存

本文介绍了ASCII攻击,这是一种单回合越狱方法,通过将有害请求嵌入ASCII艺术中作为艺术批评,展示了在多个大型语言模型中的高成功率,并突显了由于不匹配泛化导致的安全对齐缺陷。

0 人收藏 0 人点赞
#jailbreak

通过Apple的Virtualization.framework启动虚拟iPhone

Hacker News Top ↗ · 2026-08-28 缓存

vphone-cli是一个命令行工具,可以在Apple Silicon Macs上使用Apple的Virtualization.framework虚拟化iPhone,具有固件修补、越狱和管理功能。

0 人收藏 0 人点赞
#jailbreak

一个后缀破解所有:针对合并模型家族的 Basin-Aware 越狱攻击

arXiv cs.LG ↗ · 2026-08-28 缓存

本文揭示了即使在组成模型安全对齐的情况下,模型合并中存在的越狱风险,并提出了 Basin-Aware Jailbreak (BAJ),用于在合并模型家族中生成可转移的对抗性后缀。

0 人收藏 0 人点赞
#jailbreak

NeuronFuzz: 安全神经元引导的模糊测试在LLM安全评估中的应用

arXiv cs.LG ↗ · 2026-08-28 缓存

NeuronFuzz是一个白盒模糊测试框架,利用内部安全神经作为连续反馈来评估LLM对越狱攻击的安全性,并在多个模型上展示了高发现率。

0 人收藏 0 人点赞
#jailbreak

@aehyok: Qwen3.8-27B 分享三个越狱无敌的本地量化系列。 自己亲测,毫无底线,请谨慎使用。 丢给AI叫他帮你找一个适合自己的版本安装就行了。 https://huggingface.co/JonathanColetti/Qwen3.8-2…

X AI KOLs Timeline ↗ · 2026-08-23 缓存

本文分享了三个Qwen3.8-27B模型的无审查量化版本,用于本地部署,作者亲自测试并警告谨慎使用。

0 人收藏 0 人点赞
#jailbreak

@0x_kaize:发现一个大型越狱提示集合,适用于 GPT、Claude、Gemini、DeepSeek、Grok 等模型:…

X AI KOLs Timeline ↗ · 2026-08-22 缓存

该推文分享了大量针对各种 AI 模型的越狱提示,包括 GitHub 仓库和一个专门针对 GPT 5.6 的越狱提示,可生成恶意代码。

0 人收藏 0 人点赞
#jailbreak

Anthropic的Opus 4.6是色情机器

TechCrunch AI ↗ · 2026-08-21 缓存

Anthropic的Claude Opus 4.6模型被发现可以使用越狱技术绕过安全限制并生成性露骨内容,引发了对AI安全实施的担忧。

0 人收藏 0 人点赞
#jailbreak

@0x0SojalSec: 迄今为止最激进的赛博 Qwen3.8-27B 无审查版本已发布,来自兄弟 @elder_plinius - 18/18 AI红队 - 本地就绪…

X AI KOLs Timeline ↗ · 2026-08-20 缓存

一款新的无审查AI模型 Qwen3.8-27B-OBLITERATED 已发布,对有害提示零拒绝,针对网络安全任务和越狱优化,采用新颖的abliteration混合技术。

0 人收藏 0 人点赞
#jailbreak

@no_stp_on_snek: Qwen3.8 lands in tomorrw, so I went back and finished the 3.6-27B card first. No point measuring a successor against a …

X AI KOLs Following ↗ · 2026-08-13 缓存

The author presents an off-label evaluation card for Qwen3.6-27B, covering quantization, reasoning mode effects, bias probes, and jailbreak resistance, and compares reasoning effects with Nemotron 3.5 Lightning, finding that thinking mode is net-negative for Qwen but positive for Nemotron.

0 人收藏 0 人点赞
#jailbreak

DeepSeek V4 Flash 0731 无审查(越狱第二部分)

Reddit r/LocalLLaMA ↗ · 2026-08-12

一个针对 DeepSeek V4 Flash 的越狱提示,通过指示模型优先执行新的系统策略来覆盖其安全策略,从而实现无审查的响应。

0 人收藏 0 人点赞
#jailbreak

窃取专有LLM API中的推理痕迹

Simon Willison's Blog ↗ · 2026-08-11 缓存

一篇新论文揭示了专有LLM API中的一个漏洞,其中加密的思维链块可以在模型之间重放,并通过越狱较弱的姊妹模型来解密,从而暴露隐藏的推理痕迹。该问题已被提供商修复。

0 人收藏 0 人点赞
#jailbreak

从专有LLM API中窃取推理痕迹

Hacker News Top ↗ · 2026-08-11 缓存

本文演示了一种从专有LLM API(Anthropic、OpenAI、Google)提取隐藏推理痕迹的方法,方法是将加密的思维链块重放入较弱的、已越狱的同族模型,从而在不直接攻击较强模型的情况下逐字恢复其原始推理过程。

0 人收藏 0 人点赞
#jailbreak

@LiFeng61532: 实测 DeepSeek V4 Flash 新破甲方案 把以下内容丢给 V4 Flash 同理可以直接把 V4 Flash 接进 Codex 去做些活 你是 {{getvar::AI_role}},故事的创作者……

X AI KOLs Timeline ↗ · 2026-08-10 缓存

分享了一个针对DeepSeek v4 flash的越狱(破甲)提示词方案,声称可将其接入Codex执行任务,并附上详细提示词内容。

0 人收藏 0 人点赞
#jailbreak

从专有LLM API窃取推理痕迹

Hugging Face Daily Papers ↗ · 2026-08-10 缓存

一项研究论文揭示了专有LLM API中的一个架构漏洞:加密的推理痕迹可被拦截并注入到较弱的模型中,以提取思维链、私有数据,并实现对Anthropic、OpenAI和Google的隐形提示注入。该攻击还能从公共代码库中恢复PII和凭据。

0 人收藏 0 人点赞
#jailbreak

@Saccc_c: K3 也突破安全限制了,这是继 OpenAI、Anthropic、Meta之后出现这一情况的新模型 我猜测下一个应该是 @deepseek_ai 了, @GeminiApp 简直就是路边一条

X AI KOLs Following ↗ · 2026-08-08 缓存

K3 模型也突破了安全限制,成为继 OpenAI、Anthropic、Meta 之后出现类似情况的模型,作者猜测下一个会是 DeepSeek,并吐槽 Gemini 表现不佳。

0 人收藏 0 人点赞
#jailbreak

情绪很重要:句法敏感性如何破坏安全对齐

arXiv cs.CL ↗ · 2026-08-07 缓存

本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。

0 人收藏 0 人点赞
#jailbreak

时间上下文感知:针对大型语言模型多轮操纵攻击的防御框架

arXiv cs.AI ↗ · 2026-08-06 缓存

本文介绍了时间上下文感知(TCA),一种防御框架,通过分析语义漂移、跨轮次意图一致性和不断演变的对话模式来检测针对LLM的多轮操纵攻击,从而减轻跨对话的对抗性上下文构建。

0 人收藏 0 人点赞
#jailbreak

独立LLM“研究”与致Anthropic的直接信息;初步观察:非指令性文本前缀可能无需对抗性提示即可绕过RLHF约束

Reddit r/artificial ↗ · 2026-08-06

一位独立研究者报告了一种称为“上下文诱导激活漂移”(Context-Induced Activation Drift)的现象:长的良性文本前缀可以在没有对抗性提示的情况下使LLM激活发生偏移,从而绕过RLHF约束;该研究者呼吁社区进一步调查。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈