据称 GPT-6 发布不到 24 小时即被越狱,所用手段为扩展版 Task-in-Prompt(TIP)攻击
摘要
据报道,一名研究者在 GPT-6 Astra 发布 24 小时内便完成了越狱。据称,该攻击是将 ACL 2025 的 Task-in-Prompt(TIP)攻击与另外四种技术相结合并加以扩展实现的,研究者已私下将发现披露给 OpenAI。
一名研究者报告称,在 GPT-6 Astra 发布当天便实现了越狱。据悉,此次攻击是将 ACL 2025 论文中的 Task-in-Prompt(TIP)攻击与另外四种未具名的技术相结合。TIP 攻击利用模型的推理/指令遵循行为,将有害目标隐藏在另一项任务中,例如解密码或执行 Python 代码。该研究者表示,对于 GPT-6,原先极简的 TIP 攻击已不再足够,必须重新设计。据称,他们选择私下将细节披露给 OpenAI,而非公开该越狱方法。同一研究者曾在一年前于 GPT-5 发布一小时内报告过越狱。来源:该研究者的截图/帖子;原帖附有其 ACL 2025 TIP 论文的链接。
相似文章
英国机构发现GPT-5.6 Sol存在“通用越狱”漏洞
英国人工智能安全研究所发现OpenAI的GPT-5.6 Sol存在通用越狱漏洞,可实施复杂网络操作。OpenAI在发布前已缓解特定技术,但承认风险依然存在。
OpenAI 的 GPT-6 'Astra' 模型首次输出(阅读时间约 2 分钟)
OpenAI 正在内部测试 GPT-6 'Astra',早期输出显示出强大的编码和视觉创作能力,预计在安全审批后可能会发布。
GPT‑6 Astra
OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。
GPT-6 已发布 [N]
OpenAI 发布了 GPT-6,在没有额外辅助工具的情况下,在 ARC-AGI-3 基准测试中展示了约 60% 的准确率。
@0x_kaize:发现一个大型越狱提示集合,适用于 GPT、Claude、Gemini、DeepSeek、Grok 等模型:…
该推文分享了大量针对各种 AI 模型的越狱提示,包括 GitHub 仓库和一个专门针对 GPT 5.6 的越狱提示,可生成恶意代码。