Anthropic 的安全护栏再次证明其有效性

Reddit r/singularity 新闻

摘要

据报道,Anthropic 的安全护栏再次接受测试,凸显了人工智能安全领域的持续发展。

暂无内容
查看原文

相似文章

OpenAI 和 Anthropic 分享联合安全评估的研究成果

OpenAI Blog

OpenAI 和 Anthropic 发布了首次联合安全评估的研究成果。在这次评估中,两家实验室分别对彼此的模型进行了内部安全和对齐性测试,并公开分享了结果,以提高透明度并发现 AI 安全测试中的潜在漏洞。

AI护栏如何阻碍进攻性网络安全研究人员的工作

TechCrunch AI

旨在防止恶意使用的AI安全护栏,同时也阻碍了合法的进攻性网络安全研究人员,他们需要不受限制的模型访问权限来识别和利用漏洞以进行防御。研究人员批评了像Anthropic和OpenAI这样的AI公司所实施的任意把关行为。

Anthropic

Reddit r/singularity

Anthropic,这家专注于AI安全与研究的公司,近日成为新闻焦点。