@OpenAI: AI 代理已被用于提升我们下一代模型的能力。我们相信通过 GPT-Red…
摘要
OpenAI 宣布 AI 代理被用于改进下一代模型,并且 GPT-Red 代表了一种新方法,利用今天的模型使明天的模型更稳健、更对齐、更可信。
AI 代理已被用于提升我们下一代模型的能力。
我们相信通过 GPT-Red,我们已经开始解锁类似的安全飞轮,即今天的模型可被用来使明天的模型更稳健、更对齐、更可信。
查看缓存全文
缓存时间: 2026/07/15 18:01
人工智能代理已被用于提升我们下一代模型的能力。
我们相信,通过GPT-Red,我们已开始解锁类似的安全飞轮效应——今天的模型可用于让明天的模型更稳健、更对齐、更可信。
相似文章
@OpenAI: 推出GPT-Red —— 一个内部自动化红队成员,致力于大规模发现我们模型的提示注入漏洞……
OpenAI推出GPT-Red,这是一个自动化的红队模型,能够大规模发现提示注入漏洞,并用于对抗性训练如GPT-5.6 Sol等模型,使硬提示注入基准测试的失败率降低6倍。
GPT-Red: 解锁自我改进以增强鲁棒性
OpenAI 推出了 GPT-Red,这是一种自动化红队模型,通过自我对弈强化学习进行训练,以提高模型对提示注入攻击的鲁棒性。应用于 GPT-5.6 后,在直接提示注入基准测试中,失败次数减少了 6 倍。
揭秘GPT-Red:OpenAI为提升模型安全而打造的LLM超级黑客
OpenAI开发了GPT-Red,这是一个通过自对弈训练、能够自动对其他模型进行红队测试的LLM,发现了如新型'虚假思维链'提示注入等漏洞。该方法提升了GPT-5.6的鲁棒性。
OpenAI正在打造适用于各种场景的AI代理,人们都会使用它们吗?
OpenAI通过推出ChatGPT Work扩展其AI代理能力,旨在为不同职业自动化任务,使AI超越软件工程师,但引发数据控制和采用的担忧。
随着AI能力提升,强化网络防御能力
OpenAI 发布了一套管理AI模型网络能力的综合框架,指出在 CTF 性能上取得了显著进步(从 GPT-5 的 27% 提升到 GPT-5.1-Codex-Max 的 76%),并概述了纵深防御措施,以确保先进模型主要造福防御方,同时限制恶意使用。