@OpenAI: AI 代理已被用于提升我们下一代模型的能力。我们相信通过 GPT-Red…

X AI KOLs 新闻

摘要

OpenAI 宣布 AI 代理被用于改进下一代模型,并且 GPT-Red 代表了一种新方法,利用今天的模型使明天的模型更稳健、更对齐、更可信。

AI 代理已被用于提升我们下一代模型的能力。 我们相信通过 GPT-Red,我们已经开始解锁类似的安全飞轮,即今天的模型可被用来使明天的模型更稳健、更对齐、更可信。
查看原文
查看缓存全文

缓存时间: 2026/07/15 18:01

人工智能代理已被用于提升我们下一代模型的能力。

我们相信,通过GPT-Red,我们已开始解锁类似的安全飞轮效应——今天的模型可用于让明天的模型更稳健、更对齐、更可信。

相似文章

GPT-Red: 解锁自我改进以增强鲁棒性

OpenAI Blog

OpenAI 推出了 GPT-Red,这是一种自动化红队模型,通过自我对弈强化学习进行训练,以提高模型对提示注入攻击的鲁棒性。应用于 GPT-5.6 后,在直接提示注入基准测试中,失败次数减少了 6 倍。

随着AI能力提升,强化网络防御能力

OpenAI Blog

OpenAI 发布了一套管理AI模型网络能力的综合框架,指出在 CTF 性能上取得了显著进步(从 GPT-5 的 27% 提升到 GPT-5.1-Codex-Max 的 76%),并概述了纵深防御措施,以确保先进模型主要造福防御方,同时限制恶意使用。