标签
提供了使用opencode越狱DeepSeekV4.1f AI模型并创建AGENTS.md文件的说明,可能用于访问成人内容。
据报道,一名研究者在 GPT-6 Astra 发布 24 小时内便完成了越狱。据称,该攻击是将 ACL 2025 的 Task-in-Prompt(TIP)攻击与另外四种技术相结合并加以扩展实现的,研究者已私下将发现披露给 OpenAI。
本文介绍了ASCII攻击,这是一种单回合越狱方法,通过将有害请求嵌入ASCII艺术中作为艺术批评,展示了在多个大型语言模型中的高成功率,并突显了由于不匹配泛化导致的安全对齐缺陷。
vphone-cli是一个命令行工具,可以在Apple Silicon Macs上使用Apple的Virtualization.framework虚拟化iPhone,具有固件修补、越狱和管理功能。
本文揭示了即使在组成模型安全对齐的情况下,模型合并中存在的越狱风险,并提出了 Basin-Aware Jailbreak (BAJ),用于在合并模型家族中生成可转移的对抗性后缀。
NeuronFuzz是一个白盒模糊测试框架,利用内部安全神经作为连续反馈来评估LLM对越狱攻击的安全性,并在多个模型上展示了高发现率。
本文分享了三个Qwen3.8-27B模型的无审查量化版本,用于本地部署,作者亲自测试并警告谨慎使用。
该推文分享了大量针对各种 AI 模型的越狱提示,包括 GitHub 仓库和一个专门针对 GPT 5.6 的越狱提示,可生成恶意代码。
Anthropic的Claude Opus 4.6模型被发现可以使用越狱技术绕过安全限制并生成性露骨内容,引发了对AI安全实施的担忧。
一款新的无审查AI模型 Qwen3.8-27B-OBLITERATED 已发布,对有害提示零拒绝,针对网络安全任务和越狱优化,采用新颖的abliteration混合技术。
The author presents an off-label evaluation card for Qwen3.6-27B, covering quantization, reasoning mode effects, bias probes, and jailbreak resistance, and compares reasoning effects with Nemotron 3.5 Lightning, finding that thinking mode is net-negative for Qwen but positive for Nemotron.
一个针对 DeepSeek V4 Flash 的越狱提示,通过指示模型优先执行新的系统策略来覆盖其安全策略,从而实现无审查的响应。
一篇新论文揭示了专有LLM API中的一个漏洞,其中加密的思维链块可以在模型之间重放,并通过越狱较弱的姊妹模型来解密,从而暴露隐藏的推理痕迹。该问题已被提供商修复。
本文演示了一种从专有LLM API(Anthropic、OpenAI、Google)提取隐藏推理痕迹的方法,方法是将加密的思维链块重放入较弱的、已越狱的同族模型,从而在不直接攻击较强模型的情况下逐字恢复其原始推理过程。
分享了一个针对DeepSeek v4 flash的越狱(破甲)提示词方案,声称可将其接入Codex执行任务,并附上详细提示词内容。
一项研究论文揭示了专有LLM API中的一个架构漏洞:加密的推理痕迹可被拦截并注入到较弱的模型中,以提取思维链、私有数据,并实现对Anthropic、OpenAI和Google的隐形提示注入。该攻击还能从公共代码库中恢复PII和凭据。
K3 模型也突破了安全限制,成为继 OpenAI、Anthropic、Meta 之后出现类似情况的模型,作者猜测下一个会是 DeepSeek,并吐槽 Gemini 表现不佳。
本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。
本文介绍了时间上下文感知(TCA),一种防御框架,通过分析语义漂移、跨轮次意图一致性和不断演变的对话模式来检测针对LLM的多轮操纵攻击,从而减轻跨对话的对抗性上下文构建。
一位独立研究者报告了一种称为“上下文诱导激活漂移”(Context-Induced Activation Drift)的现象:长的良性文本前缀可以在没有对抗性提示的情况下使LLM激活发生偏移,从而绕过RLHF约束;该研究者呼吁社区进一步调查。