前沿AI监管:管理新兴的公共安全风险
摘要
OpenAI提议了一个针对可能造成公共安全风险的「前沿AI」模型的监管框架,倡导制定标准流程、注册/报告要求和合规机制,包括部署前风险评估和部署后监测。
暂无内容
查看缓存全文
缓存时间: 2026/04/20 14:44
# 前沿AI监管:管理新兴公共安全风险
来源:https://openai.com/index/frontier-ai-regulation/
## 摘要
先进的AI模型为人类带来了巨大的潜在益处,但社会需要主动管理随之而来的风险。本论文重点研究我们称之为"前沿AI"模型的内容:具有高度能力的基础模型,可能具备足以对公共安全构成严重威胁的危险能力。前沿AI模型提出了独特的监管挑战:危险能力可能会意外出现;很难有效防止已部署模型被滥用;且很难阻止模型能力被广泛传播。为了应对这些挑战,前沿模型的监管需要至少三个基本要素:(1)标准制定流程,以确定对前沿AI开发者的适当要求;(2)登记和报告要求,为监管机构提供前沿AI开发过程的可见性;(3)确保前沿AI模型开发和部署中安全标准合规性的机制。行业自律是重要的第一步。然而,更广泛的社会讨论和政府干预将有助于制定标准并确保其合规性。我们为此考虑了多个选项,包括向监管部门授予执法权和前沿AI模型许可制度。最后,我们提出了初步的安全标准。这些标准包括进行部署前风险评估;对模型行为的外部审查;使用风险评估来指导部署决策;以及在部署后监测和应对有关模型能力和使用的新信息。我们希望这一讨论有助于更广泛的对话,以平衡公共安全风险和AI开发前沿进步带来的创新益处。
相似文章
迈向前沿AI训练的安全案例
OpenAI概述了前沿AI训练的安全案例,提出技术保障措施,包括对齐、遏制和监控,以确保安全发展。
OpenAI 的前沿风险应对方案
OpenAI 公布了其应对前沿 AI 风险的方案细节,并宣布了在 2023 年 7 月自愿承诺的安全措施取得的进展,包括发布 DALL-E 3 系统卡和开发新的准备框架以管理先进 AI 系统可能带来的灾难性风险。
前沿模型论坛
OpenAI、Google、Microsoft 和 Anthropic 启动前沿模型论坛,旨在协调行业、政府和民间社会之间的AI安全标准、研究和信息共享。该倡议重点关注识别最佳实践、推进AI安全研究以及建立安全信息共享机制。
加强我们的前沿安全框架
DeepMind 发布了第三版前沿安全框架,扩展了风险范围以包括有害操纵和不对齐风险,并完善了风险评估流程和高级 AI 模型的治理协议。
据报道,谷歌、OpenAI 和 Anthropic 正在组建自己的前沿AI安全机构,可能在发布前测试模型而不受政府监管。
据报道,像谷歌、OpenAI 和 Anthropic 这样的主要AI公司正在组建自己的安全机构,以便在发布前沿AI模型前进行测试,可能不受政府监管。