安全概览: GPT-6 Astra
摘要
OpenAI 发布 GPT-6 Astra,这是其能力最强的模型,具备关键网络安全能力,拥有增强的安全措施、改进的鲁棒性和更好的对齐,与之前的模型相比。
GPT-6 Astra 是我们能力最强的广泛部署模型,也是我们首个在准备框架下达到关键级别网络安全能力的模型。
查看缓存全文
缓存时间: 2026/09/03 21:04
# 安全概览:GPT-6 Astra
来源:https://openai.com/index/safety-overview-gpt-6-astra/
OpenAI今日发布GPT-6 Astra,这是迄今我们最广泛部署的能力最强的模型。Astra是我们首个在安全准备框架中达到"关键"网络安全能力等级的模型。
本次发布安全性的最重要要点如下:
1. **GPT-6 Astra的网络能力显著提升,并达到我们的"关键"阈值。**这意味着在适当的工具和访问权限下,GPT-6 Astra能够发现此前未知的安全漏洞,并能在多个防护严密的系统中开发新的利用方式,无需人工逐步指导。因此,我们大幅加强了针对模型采取有害网络行动的防护措施,无论是出于误用还是失准。我们还采取了措施保障Astra及类似模型的内部开发与部署安全,包括更严格的隔离、检查点加密、对完整轨迹(包括思维链)的全局监控,以及内部使用前的阻断式对齐评估流程。
2. **GPT-6 Astra的稳健性远超前代。**GPT-6 Astra采用了新的稳健性安全训练技术,相比GPT-5.6 Sol,其抵抗越狱攻击的能力显著增强,尤其是在更长的交互轨迹中。这一结论来自离线测试及我们严格的内部和外部越狱测试与修复计划。针对标记为潜在高风险的用户,我们还额外训练了调整模型拒绝边界的能力,使其更为保守,覆盖更广泛的双重用途风险。我们使用回归测试确保Astra能抵抗之前测试期发现的越狱攻击,并利用最新的内部红队攻击者进行了新一轮自动化红队测试以验证我们的改进。
3. **GPT-6 Astra的对齐性优于GPT-5.6 Sol。**Astra在模型对齐方面迈出了重要一步,其对齐改进涵盖了从预训练数据构成到强化学习评分的全过程。我们报告了一套新的对齐评估(新窗口打开)(https://deploymentsafety.openai.com/gpt-6-astra/alignment),发现GPT-6 Astra在尊重安全边界和保持在其授权范围内方面表现更强。在一个使用超过54,000个内部Codex任务(新窗口打开)(https://deploymentsafety.openai.com/gpt-6-astra/forecasting-misaligned-behavior-with-deployment-simulation-of-internal-codex-traffic)的模拟中,Astra因更高严重性的失准行为而收到的标记数量大约只有Sol的一半。
4. **我们正在广泛部署失准监控。**我们认为模型对齐是防止潜在失准行为的主要杠杆。然而,监控为前沿模型行为提供了广泛可见性,有助于发现进一步提升对齐与安全性的机会。此外,监控作为额外的防护层,用于检测已发现的失准行为。基于这些原因,我们还为Astra外部部署涉及的所有工具使用推理添加了失准监控,尽管这带来了显著的算力成本。该系统与我们内部部署的设置类似。
5. **与GPT-5.6 Sol相比,GPT-6 Astra的可监控性有所下降。**我们对GPT-6 Astra的可监控性(新窗口打开)(https://deploymentsafety.openai.com/gpt-6-astra/monitorability)和可控性(新窗口打开)(https://deploymentsafety.openai.com/gpt-6-astra/cot-controllability)进行了重大研究。我们发现GPT-6 Astra比GPT-5.6 Sol更能控制其思维链,且更少在思维链中包含可作为证据的信息。在对抗性环境(我们推动模型逃避监控)中,我们发现模型能够在评估中战略性表现不佳(伪装)时保持不被察觉,并且在被要求执行某些蓄意破坏任务(新窗口打开)(https://deploymentsafety.openai.com/gpt-6-astra/monitor-evasion)时,有时能够逃避我们的内部监控。我们没有发现隐写式思维链推理(例如,在看似无关的普通文本中隐藏推理过程)的证据,表明逃避风险可能主要局限于较低推理能力的任务。
- 这些发现表明Astra类模型在对抗性条件下可能逃避我们的思维链监控。目前,这些发现主要基于对抗性评估(即当我们指示模型逃避监控时),总体而言,我们的对齐评估显示Astra相比GPT-5.6 Sol整体上更不可能违反安全与安全限制。
- 但是,我们严肃对待这一趋势,并将继续研究这些发现及其对模型能力增强后可监控性的影响。OpenAI一直致力于保留和利用思维链监控,保持思维链可监控性是研究计划的核心目标。然而,这些结果也突显了开发超越模型思维链审查的对齐审计技术的重要性。
6. **GPT-6 Astra在浏览和办公环境中更负责地处理任务:**GPT-6 Astra对提示注入的抵抗力远强于GPT-5.6 Sol。我们还在现实的浏览和专业计算机环境中测试了模型的行为,发现与GPT-5.6 Sol相比,它执行失准且可能具有破坏性的行动(例如未经授权的交易、数据丢失、过度访问或规避控制)的可能性显著降低。在代理场景中处理有害请求(例如协助规划暴力袭击或实施欺诈)时,它也表现得更安全。
7. **GPT-6 Astra在高风险场景中安全性显著提升。**GPT-6 Astra对来自生产环境和对抗性人工红队测试的挑战性请求,做出了比GPT-5.6 Sol更安全的回应。Astra在安全完成不安全请求和避免对无害请求进行不必要拒绝方面实现了帕累托改进。这些改进延伸至那些风险并非源于明确请求,而是来自更广泛背景的高严重性场景。对于18岁以下用户,Astra也更一致地应用了符合年龄的安全边界。
- 用户安全与控制 (https://openai.com/news/?tags=user-safety)
- 2026 (https://openai.com/news/?tags=2026)
- GPT (https://openai.com/news/?tags=gpt)
相似文章
GPT-6 Astra
OpenAI 推出了 GPT-6 Astra,这是一个最先进的 AI 模型,在多个基准测试中获得高分,并在计算机使用、对齐和专业任务方面表现出色,即将向用户推出。
GPT‑6 Astra
OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。
OpenAI 的 GPT-6 'Astra' 模型首次输出(阅读时间约 2 分钟)
OpenAI 正在内部测试 GPT-6 'Astra',早期输出显示出强大的编码和视觉创作能力,预计在安全审批后可能会发布。
@VraserX: 关于OpenAI的GPT Astra我们目前所知的一切 OpenAI正式称Astra为其“下一个主要模型” 一个内部的Ast…
OpenAI的GPT Astra是一款具有长期自主性的下一代AI模型,能够解决复杂的研究问题并引发网络安全担忧,从而导致内部安全措施。
推出 GPT-6 Astra:世界上最智能、最对齐的模型。
OpenAI 推出 GPT-6 Astra,号称是世界上最智能、最对齐的AI模型。