Anthropic 的安全护栏再次证明其有效性

Reddit r/singularity 新闻

摘要

据报道,Anthropic 的安全护栏再次接受测试,凸显了人工智能安全领域的持续发展。

暂无内容
查看原文

相似文章

OpenAI 和 Anthropic 分享联合安全评估的研究成果

OpenAI Blog

OpenAI 和 Anthropic 发布了首次联合安全评估的研究成果。在这次评估中,两家实验室分别对彼此的模型进行了内部安全和对齐性测试,并公开分享了结果,以提高透明度并发现 AI 安全测试中的潜在漏洞。

Anthropic

Reddit r/singularity

Anthropic,这家专注于AI安全与研究的公司,近日成为新闻焦点。

OpenGuardrails: 一个开源的上下文感知AI护栏平台

Papers with Code Trending

OpenGuardrails 是一个面向AI安全的开源平台,通过统一模型提供上下文感知的内容安全与操纵检测(例如提示注入、越狱),以及一个独立的NER管道用于数据泄露识别。它在安全基准测试上取得了最先进的性能,并支持私有化、企业级部署。