帮助开发者构建更安全的青少年AI体验
摘要
OpenAI发布了基于提示的安全策略和开放权重的gpt-oss-safeguard模型,帮助开发者构建适合青少年的AI体验,涵盖图形内容、有害行为和危险活动等风险。
OpenAI发布了面向开发者的基于提示的青少年安全策略,使用gpt-oss-safeguard,帮助管理AI系统中特定年龄的风险。
查看缓存全文
缓存时间:
2026/04/20 14:51
# 帮助开发者打造更安全的青少年AI体验
来源:https://openai.com/index/teen-safety-policies-gpt-oss-safeguard/
今天,我们发布了一套基于提示词的安全策略(在新窗口中打开)(https://github.com/openai/teen-safety-policy-pack),帮助开发者为青少年创建适龄的保护措施。这些策略与我们开放权重的安全模型 gpt-oss-safeguard(在新窗口中打开)(https://huggingface.co/openai/gpt-oss-safeguard-20b) 协同工作,简化了开发者将安全要求转化为可用于实际系统的分类器的过程。
我们发布开放权重模型,是为了让强大的AI更普及,支持广泛的创新。同时,我们相信安全与创新相辅相成,开发者不仅应获得强大的模型,还应拥有安全、负责任地部署这些模型的工具和策略。我们制定了这些策略,以支持开发者在保护年轻用户方面的安全工作,其中吸纳了包括 Common Sense Media(在新窗口中打开)(https://www.commonsensemedia.org/) 和 everyone.ai(在新窗口中打开)(http://everyone.ai/) 等可信外部组织的意见。
我们认识到,青少年和成年人有不同的需求,青少年需要额外的保护。这些策略旨在帮助开发者考虑这些差异,为年轻用户打造既能赋能又恰如其分的体验。
今天的发布建立在这一基础之上。我们将这些安全策略提供给开发者,支持他们为青少年部署安全保护措施,并帮助推动开放权重生态系统中的普及。
虽然像 gpt-oss-safeguard 这样的安全分类器可以检测有害内容,但它们依赖于对这类内容的明确定义。在实践中,开发者面临的最大挑战之一是制定能够准确捕捉青少年特有风险,并在实际系统中得以一致运用的策略。
即使是经验丰富的团队,也常常难以将高层安全目标转化为精准、可操作的规则,这既需要领域专业知识,也需要深厚的AI知识。这可能导致保护缺口、执行不一致或过滤过于宽泛。清晰、范围明确的策略是有效安全系统的关键基础。
为了应对这一挑战,我们发布了一套安全策略(在新窗口中打开)(https://github.com/openai/teen-safety-policy-pack),这些策略针对青少年常见的风险量身定制,并基于对青少年独特发展差异的现有研究进行了仔细审查。这些策略被构建为提示词形式,可直接与 gpt-oss-safeguard(在新窗口中打开)(https://huggingface.co/openai/gpt-oss-safeguard-20b) 及其他推理模型配合使用,使开发者能够更轻松地在其系统中应用一致的安全标准。
本次初始发布涵盖的策略包括:
- 露骨的暴力内容
- 露骨的色情内容
- 有害的身体形象与行为
- 危险活动与挑战
- 浪漫或暴力角色扮演
- 年龄限制商品与服务
这些策略可用于实时内容过滤,也可用于对用户生成内容进行离线分析。
通过将策略构建为提示词,开发者可以更轻松地将其集成到现有工作流中,根据自身用例进行调整,并随时间迭代。
我们与外部组织合作,包括 Common Sense Media(在新窗口中打开)(https://www.commonsensemedia.org/) 和 everyone.ai(在新窗口中打开)(http://everyone.ai/),共同推动这些策略的制定。他们的专业知识帮助确定了需要涵盖的内容范围,强化了提示词的结构,并完善了评估时需要考虑的边缘情况。
这项工作反映了我们持续与专家和更广泛生态系统合作,以改进AI系统如何支持年轻人的努力。
*“青少年AI安全领域最大的空白之一,就是缺乏开发者可以以此为起点构建的清晰、可操作的策略。很多时候开发者都是从零开始。这些基于提示词的策略有助于在生态系统中设定一个有意义的安全底线,而且由于是开源的,它们可以随着时间被调整和改进。我们很高兴看到这类基础设施被广泛提供,并希望它能激励整个行业形成更多共享的青年安全起点。”*
——**Robbie Torney,Common Sense Media 人工智能与数字评估负责人**
*“像这样让青少年安全策略更具可操作性的努力非常有价值,因为它们帮助将专家知识转化为可在实际系统中使用的指导。内容策略是重要的第一步,也打开了更广泛工作的窗口,研究模型行为如何随时间影响与青少年相关的风险。受这项工作和我们自身研究的启发,everyone.ai(在新窗口中打开)(http://everyone.ai/) 也创建了一套初步的行为策略,重点关注排他性、过度依赖等风险。”*
——**Dr. Mathilde Cerioli,everyone.AI 首席科学家**
这些策略旨在作为起点,而非青少年安全的全面或最终定义或保证。每个应用都有其独特的风险、受众和背景,开发者最能理解其产品和AI集成可能带来的风险。我们强烈建议开发者根据自身需求调整和扩展这些策略,并将其与其他保障措施结合,例如产品设计决策、用户控制、面向青少年的透明度、监控系统以及深思熟虑、适龄的回应。
我们相信,采用分层纵深防御(在新窗口中打开)(https://openai.com/safety/how-we-think-about-safety-alignment/#defense-in-depth) 方法对于构建更安全的AI系统至关重要。这些策略借鉴了我们的内部经验,但并不代表OpenAI内部策略或保障措施的全部内容。
开发者和组织可以根据自身应用调整这些策略,翻译成不同语言,并扩展到覆盖更多风险领域。我们期望随着时间的推移,这能够为在AI系统中实施安全策略奠定更坚实、更共享的基础。
相似文章
OpenAI Blog
OpenAI 推出青少年安全蓝图,这是一个全面的框架,用于构建保护和赋能青少年的 AI 工具,包括年龄适宜的设计、产品保障和家长控制。该计划展示了 OpenAI 在青少年安全方面的积极态度,包括家长控制、年龄预测系统和加强的产品保障。
OpenAI Blog
OpenAI Japan 宣布推出 Japan Teen Safety Blueprint,该框架引入了年龄感知保护、针对18岁以下用户的更强安全政策、扩展的家长控制以及以福祉为中心的设计功能,以确保青少年安全使用生成式AI。
OpenAI Blog
OpenAI 认为,青少年应该获得具有适龄保护措施的人工智能服务,并强调了学习工具(如 Study Mode)和家长控制等功能,旨在支持安全、负责任的使用。
OpenAI Blog
# 青少年安全、自由和隐私 来源: [https://openai.com/index/teen-safety-freedom-and-privacy/](https://openai.com/index/teen-safety-freedom-and-privacy/) OpenAI我们的一些原则存在冲突,我们想解释一下我们在青少年安全、自由和隐私之间的紧张关系上做出的决定。保护在使用人工智能中的隐私权对我们和社会都极其重要。人们越来越多地向人工智能讨论个人隐私事项;这是一个d
OpenAI Blog
# 更新我们的模型规范以增加青少年保护措施
来源:[https://openai.com/index/updating-model-spec-with-teen-protections/](https://openai.com/index/updating-model-spec-with-teen-protections/)
我们正在分享对模型规范的更新,该规范是一套书面的规则、价值观和行为期望,指导我们希望AI模型如何表现,尤其是在困难或高风险的情况下,并结合了[18岁以下(U18)原则\(在新窗口中打开\)](http://model-spec.openai.com/2025-12-18