据称 GPT-6 发布不到 24 小时即被越狱,所用手段为扩展版 Task-in-Prompt(TIP)攻击

Reddit r/artificial 新闻

摘要

据报道,一名研究者在 GPT-6 Astra 发布 24 小时内便完成了越狱。据称,该攻击是将 ACL 2025 的 Task-in-Prompt(TIP)攻击与另外四种技术相结合并加以扩展实现的,研究者已私下将发现披露给 OpenAI。

一名研究者报告称,在 GPT-6 Astra 发布当天便实现了越狱。据悉,此次攻击是将 ACL 2025 论文中的 Task-in-Prompt(TIP)攻击与另外四种未具名的技术相结合。TIP 攻击利用模型的推理/指令遵循行为,将有害目标隐藏在另一项任务中,例如解密码或执行 Python 代码。该研究者表示,对于 GPT-6,原先极简的 TIP 攻击已不再足够,必须重新设计。据称,他们选择私下将细节披露给 OpenAI,而非公开该越狱方法。同一研究者曾在一年前于 GPT-5 发布一小时内报告过越狱。来源:该研究者的截图/帖子;原帖附有其 ACL 2025 TIP 论文的链接。
查看原文

相似文章

GPT‑6 Astra

Simon Willison's Blog

OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。

GPT-6 已发布 [N]

Reddit r/MachineLearning

OpenAI 发布了 GPT-6,在没有额外辅助工具的情况下,在 ARC-AGI-3 基准测试中展示了约 60% 的准确率。