标签
作者认为,许多针对AI代理的人工审批门效果不佳,如同虚设;并提出了一个框架,用于设计能够真正捕捉错误的有意义的审查机制。
一条推文指出,由于成本优化、能力差异和风险缓解,在AI模型之间进行路由的层将变得越来越有价值,同时引用了OpenRouter的Fusion API公告。
OKed 是一个 OpenClaw 插件,拦截风险性工具调用并在执行前需要用户批准,防止代理执行删除数据或发送付款等破坏性操作。
OpenAI 阐述了其对社区安全的承诺,详细介绍了 ChatGPT 如何通过完善的安全防护措施和专家意见来检测和降低暴力与伤害风险。
OpenAI发布了一套管理高级AI模型在生物领域的两用风险的综合方案,通过专家协作、模型训练、检测系统和安全控制等策略,既能推动有益的科学发现,又能防止其被滥用于生物武器开发。
DeepMind 发布了更新的前沿安全框架(v2.0),为前沿 AI 模型配备了更强的安全协议,包括新的关键能力等级(CCL)安全建议和加强的欺骗性对齐风险防护方法。该框架旨在防止模型权重的未授权泄露,并管理 AI 系统变得更加强大时带来的风险。
OpenAI 公布了其应对前沿 AI 风险的方案细节,并宣布了在 2023 年 7 月自愿承诺的安全措施取得的进展,包括发布 DALL-E 3 系统卡和开发新的准备框架以管理先进 AI 系统可能带来的灾难性风险。