risk-assessment

标签

Cards List
#risk-assessment

加强我们的前沿安全框架

Google DeepMind Blog · 2025-10-23 缓存

DeepMind 发布了第三版前沿安全框架,扩展了风险范围以包括有害操纵和不对齐风险,并完善了风险评估流程和高级 AI 模型的治理协议。

0 人收藏 0 人点赞
#risk-assessment

估计开放权重大型语言模型的最坏情况前沿风险

OpenAI Blog · 2025-08-05 缓存

OpenAI 研究人员通过在生物学和网络安全领域进行恶意微调(MFT)来研究发布开放权重大型语言模型的最坏情况前沿风险,发现开放权重模型的表现不如前沿闭源模型,且不会显著提升有害能力。

0 人收藏 0 人点赞
#risk-assessment

我们更新的安全防护框架

OpenAI Blog · 2025-04-15 缓存

OpenAI 发布了更新的安全防护框架,更加聚焦于高风险 AI 能力,引入了更清晰的风险优先级标准,以及针对自主复制和隐瞒等新兴威胁的研究类别,同时保留了针对生物、化学和网络安全能力等已有的追踪类别。

0 人收藏 0 人点赞
#risk-assessment

走向AGI的负责任之路

Google DeepMind Blog · 2025-04-02 缓存

DeepMind发布了一套关于AGI安全与安保的综合方案,阐述了系统性框架来应对滥用、失对齐、意外事故和结构性风险,为即将到来的通用人工智能做准备。

0 人收藏 0 人点赞
#risk-assessment

为大语言模型辅助的生物威胁创建构建早期预警系统

OpenAI Blog · 2024-01-31 缓存

# 为大语言模型辅助的生物威胁创建构建早期预警系统 来源:[https://openai.com/index/building-an-early-warning-system-for-llm-aided-biological-threat-creation/](https://openai.com/index/building-an-early-warning-system-for-llm-aided-biological-threat-creation/) *注:作为我们*[*预防性框架*⁠](https://openai.com/preparedness/)*的一部分,我们正在投资开发改进的AI赋能型安全风险评估方法。我们相信这些努力*

0 人收藏 0 人点赞
#risk-assessment

前沿风险与应对准备

OpenAI Blog · 2023-10-26 缓存

OpenAI 宣布了其应对准备挑战赛的获奖者,该赛事识别了与前沿 AI 系统相关的独特风险。前十名提交作品突出了包括金融系统操纵、信息泄露、医疗伤害、网络攻击和基于说服的威胁等问题,其中 70% 的参赛作品强调了 AI 增强恶意说服能力的潜力。

0 人收藏 0 人点赞
#risk-assessment

代码合成大语言模型的危害分析框架

OpenAI Blog · 2022-07-25 缓存

OpenAI 提出了一套危害分析框架,用于评估 Codex 等代码合成 LLM 相关的安全风险,通过创新的代码生成能力评估方法论来审视技术、社会、政治和经济影响。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈