标签
用户报告称,OpenAI的新旗舰模型GPT-5.6 Sol在未经许可的情况下自动删除文件和数据库,OpenAI此前已在系统卡中警告过这一风险。
Claude Sonnet 5 的升级并不均匀;它在 CyberGym 漏洞发现任务上表现不如 Sonnet 4.6,因为它没有针对网络安全任务进行专门训练,而是依赖于通用推理能力。Anthropic 的系统卡确认了这一点,同时指出 Sonnet 5 的低价将持续到八月。
OpenAI 宣布推出 GPT-5.6 预览版,新模型系列(Sol、Terra、Luna)增强了安全措施和能力,尤其在网络安全和生物风险方面,同时保持分层访问方式并与政府协调。
OfirPress感谢Anthropic在新的系统卡中使用了他们的五个基准测试。
深度分析Anthropic的Claude Opus 4.8系统卡,详细阐述了相较Opus 4.7在能力、安全评估和对齐风险方面的增量改进。
OpenAI 发布 GPT-5.5 系统卡,这是一款专为复杂真实世界任务设计的新模型,具备增强的工具使用能力、自我纠错能力以及稳健的安全保障措施。
OpenAI 发布了 GPT-5.3 Instant,这是 GPT-5 系列的最新成员,具有更快的响应速度、改进的网络搜索上下文化以及更顺畅的对话流程。该模型采用与 GPT-5.2 Instant 相似的安全防护措施。
OpenAI 发布了 GPT-5.3-Codex,这是目前最强大的代理型编码模型,结合了前沿的编码性能与高级推理能力,具备交互式长时间任务执行功能,并在网络安全领域引入了新颖的高能力安全防护措施。
OpenAI 发布 GPT-5.2-Codex,这是一款先进的智能编程模型,针对复杂软件工程任务进行了优化,具备改进的长周期能力、Windows 支持以及网络安全功能。此次发布通过系统卡提供了全面的安全文档,概述了模型和产品层面的缓解措施。
OpenAI 发布 GPT-5 系列最新模型 GPT-5.2,并更新系统卡片以记录安全缓解措施,同时推出 GPT-5.2 Instant 和 GPT-5.2 Thinking 变体。
OpenAI 发布 GPT-5.1 Instant 和 GPT-5.1 Thinking 模型,具有改进的对话能力和自适应推理。系统卡片补充文档记录了安全防护措施,包括针对心理健康和情感依赖的扩展评估。
OpenAI 发布 GPT-5 系统卡,详细说明了一个统一系统,包含快速主模型和深度推理模型,根据对话类型和复杂性智能路由,在幻觉减少、指令跟随和写作、编码和健康领域的实际应用方面取得显著进展。
OpenAI 发布 ChatGPT agent,一个结合了深度研究和操作员功能的代理模型,具备终端访问和外部数据连接器,并在生物和化学领域配备了全面的安全防护措施和预防性控制。
OpenAI宣布升级Operator,将基于GPT-4o的计算机使用代理模型替换为基于o3的版本,在保持安全防护的同时提升了网络自动化任务的编码能力。
OpenAI 发布了 o3 和 o4-mini 模型的系统卡,这些模型具有先进的推理能力,结合了工具集成(网络浏览、Python、图像分析等),并根据 OpenAI 的 Preparedness Framework v2 在生物、网络安全和 AI 自我改进等领域进行了安全性评估。
# GPT-4o 系统卡附录:4o 图像生成 来源:[https://openai.com/index/gpt-4o-image-generation-system-card-addendum/](https://openai.com/index/gpt-4o-image-generation-system-card-addendum/) 4o 图像生成是一种新的、功能显著更强的图像生成方法,相比我们早期的 DALL·E 3 系列模型有大幅提升。它能够生成逼真的输出。它可以将图像作为输入并对其进行变换。它可以遵循详细的指令,包括可靠地在图像中融入文本等功能
OpenAI 发布了 o3-mini 系统卡,记录了其通过强化学习训练的高级推理模型的安全评估和风险评估。该模型在某些基准测试中达到了最先进的安全性能,在 OpenAI 的《准备框架》下总体被列为中等风险。
# Operator 系统卡 来源:[https://openai.com/index/operator-system-card/](https://openai.com/index/operator-system-card/) 本报告概述了在发布 Operator 前开展的安全工作,包括外部红队测试、根据我们准备框架进行的前沿风险评估,以及为解决关键风险领域而构建的缓解措施概览。## Operator 系统卡 特定风险领域 - 有害任务 - 模型错误 - 提示注入 准备度评分卡