risk-mitigation

标签

Cards List
#risk-mitigation

你实际上是如何为AI代理构建审批门的?我确信大多数都只是形同虚设

Reddit r/AI_Agents · 2026-06-23

作者认为,许多针对AI代理的人工审批门效果不佳,如同虚设;并提出了一个框架,用于设计能够真正捕捉错误的有意义的审查机制。

0 人收藏 0 人点赞
#risk-mitigation

@levie:能够为特定任务路由到最佳AI模型的层,其价值将大幅提升。这…

X AI KOLs Following · 2026-06-14 缓存

一条推文指出,由于成本优化、能力差异和风险缓解,在AI模型之间进行路由的层将变得越来越有价值,同时引用了OpenRouter的Fusion API公告。

0 人收藏 0 人点赞
#risk-mitigation

我建了一个插件,让OpenClaw在做任何有风险的事之前先问我手机

Reddit r/openclaw · 2026-06-11

OKed 是一个 OpenClaw 插件,拦截风险性工具调用并在执行前需要用户批准,防止代理执行删除数据或发送付款等破坏性操作。

0 人收藏 0 人点赞
#risk-mitigation

我们对社区安全的承诺

OpenAI Blog · 2026-04-28 缓存

OpenAI 阐述了其对社区安全的承诺,详细介绍了 ChatGPT 如何通过完善的安全防护措施和专家意见来检测和降低暴力与伤害风险。

0 人收藏 0 人点赞
#risk-mitigation

为生物学领域的未来AI风险做准备

OpenAI Blog · 2025-06-18 缓存

OpenAI发布了一套管理高级AI模型在生物领域的两用风险的综合方案,通过专家协作、模型训练、检测系统和安全控制等策略,既能推动有益的科学发现,又能防止其被滥用于生物武器开发。

0 人收藏 0 人点赞
#risk-mitigation

更新前沿安全框架

Google DeepMind Blog · 2025-02-04 缓存

DeepMind 发布了更新的前沿安全框架(v2.0),为前沿 AI 模型配备了更强的安全协议,包括新的关键能力等级(CCL)安全建议和加强的欺骗性对齐风险防护方法。该框架旨在防止模型权重的未授权泄露,并管理 AI 系统变得更加强大时带来的风险。

0 人收藏 0 人点赞
#risk-mitigation

OpenAI 的前沿风险应对方案

OpenAI Blog · 2023-10-26 缓存

OpenAI 公布了其应对前沿 AI 风险的方案细节,并宣布了在 2023 年 7 月自愿承诺的安全措施取得的进展,包括发布 DALL-E 3 系统卡和开发新的准备框架以管理先进 AI 系统可能带来的灾难性风险。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈