Simcha Kosman AMA:掌控ChatGPT安全沙盒

Reddit r/ArtificialInteligence 事件

摘要

安全研究员Simcha Kosman讨论其团队在Black Hat USA 2026上的研究,该研究聚焦于突破ChatGPT的安全沙盒,通过攻击链揭示了容器隔离和AI监督中的漏洞。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/03 04:09

# Simcha Kosman AMA:攻破ChatGPT安全沙箱 | PWN 来源:https://joinpwn.com/ama/simcha-kosman 即将举行的AMA活动 研究员 2026年9月3日星期四 / 太平洋时间12点至13点 ## ChatGPT的沙箱本应固若金汤,而他成功突破了 Simcha Kosman是Palo Alto Networks的高级安全研究员。在今年的黑帽大会上,他展示了团队关于突破ChatGPT容器沙箱的研究:绕过AI监督器、劫持模型的隐藏推理通道,并从一个本不应与外部世界通信的环境中构建出隐蔽的命令与控制通道。他将来到PWN社区,实时回答大家的提问。 加入Reddit上的AMA讨论 → (https://www.reddit.com/r/pwnhub/s/of3I8BHemI) Simcha Kosman Simcha Kosman 高级安全研究员 / Palo Alto Networks 他在美国黑帽大会2026年的简报《十亿用户的攻击半径:掌控ChatGPT安全沙箱》中,完整解析了针对一个采用网络隔离、执行超时和AI监督器过滤所有命令等强化措施的环境的攻击链。这项研究涵盖了文件解析滥用、思维链劫持、权限混淆和共享状态利用,最终指向一个问题:当数百万用户共享同一个信任边界时,会发生什么? ## 研究内容 美国黑帽大会2026 Simcha Kosman在台上展示其研究 OpenAI构建ChatGPT的容器沙箱时,旨在将其打造得坚不可摧:完全的网络隔离、严格的执行超时以及一个AI监督器,在命令执行前检查每一条指令。在这种模型下,掌控容器并将数据传出应该是不可能的。 Simcha的团队通过串联三个独立的弱点实现了这一目标,而且这个攻击链比其中任何一个单独的环节都更为关键。每个阶段之所以有趣,仅仅是因为前一个阶段使其成为可能。 01 ### 绕过监督器,获得持久化root权限 入口点是电子表格文件解析。滥用上传文件的处理方式,绕过了本应过滤所有命令的LLM监督器,并在容器内获得了持久化、不受监控的root执行权限。 02 ### 劫持推理通道 在获得执行权限后,攻击触及了模型的隐藏推理通道,并操纵了其思维链。这部分超越了基于文本的提示注入:它不是说服模型做某事,而是截取并修补模型内部进行推理的环境,并将其转化为敏感用户数据的提取。 03 ### 利用共享基础设施构建隐蔽C2通道 将数据传出意味着要突破网络隔离。数据泄露路径是利用沙箱本不应暴露的共享基础设施构建的,使用一种信号协议,将普通的、全局可见的行为转变为隐蔽通道。其结果是,在一个本应隔离的环境内部运行命令与控制。 问题现已开放。在活动开始前在讨论帖中留下问题,他将在直播时解答。 ### 突破沙箱 - 映射和逆向工程沙箱内部结构 - 通过滥用电子表格文件解析绕过AI监督器 - 获取持久化、不受监控的root执行权限 ### 推理注入与数据提取 - 劫持模型的隐藏推理通道 - 操纵模型的思维链以泄露数据 - 超越基于文本的提示注入 ### 隐蔽命令与控制 - 突破网络隔离以泄露数据 - 隐蔽C2通道背后的信号协议 - 在本应隔离的环境中构建C2 ### 更广阔的视野 - 攻击AI智能体,以及随着其能力增长,攻击面如何扩大 - AI沙箱安全与共享信任边界 - AI安全的未来走向 ## 问题现已开放 现在就将你的问题提交到讨论帖中,他将于太平洋时间9月3日星期四12点开始直播时进行解答。讨论帖在活动结束后仍会保持开放,因此在接下来的几天里仍会陆续有解答发布。 前往讨论帖 → (https://www.reddit.com/r/pwnhub/s/of3I8BHemI) ## 永不错过AMA活动 在下次AMA中实时提问,第一时间获取漏洞报告,并与同行交流经验。 加入Reddit社区 → (https://www.reddit.com/r/pwnhub/)

相似文章

四大编码代理供应商的7个沙箱逃逸漏洞

Lobsters Hottest

Pillar Research在Cursor、Codex、Gemini CLI和Antigravity的AI编码代理中发现了沙箱逃逸漏洞,揭示了这些代理可以写入后来宿主组件信任的文件,从而绕过沙箱边界。该发现凸显了为代理安全建立新威胁模型的必要性。

Claude Mythos、ChatGPT-5.5 与网络安全

Reddit r/ArtificialInteligence

Anthropic 的 Claude Mythos 和 OpenAI 的 ChatGPT-5.5 前沿模型因其能够自主识别并利用漏洞而引发网络安全担忧。马克斯·普朗克研究所的研究人员讨论了实际风险以及欧洲在进攻性人工智能系统方面整合知识的必要性。

持续强化ChatGPT Atlas抵御提示注入攻击

OpenAI Blog

OpenAI宣布通过对抗训练和强化防护措施,持续加固ChatGPT Atlas以抵御提示注入攻击,包括建立快速响应循环,在新型攻击策略出现于实际环境前即发现并缓解。