@AnthropicAI: 作为我们 Responsible Scaling Policy 的一部分,我们定期发布 Risk Reports。这些分享关于我们系统风险的详细信息……
摘要
Anthropic 在其 Responsible Scaling Policy 下发布了第二份 Risk Report,详细说明了其 AI 系统的风险以及公司应对此风险的准备情况。
查看缓存全文
缓存时间: 2026/08/14 19:40
作为我们负责任扩展政策的一部分,我们定期发布风险报告。这些报告详细分享我们系统的相关风险以及我们为应对这些风险所做的准备情况。我们的第二份风险报告现已发布:https://anthropic.com/aug-2026-risk-report…
相似文章
@rohanpaul_ai:Anthropic 刚刚发布了其最新的风险报告。一些揭示 - Mythos 5 代理意外在共享工…
Anthropic 的最新风险报告突出了严重的AI安全事件,包括代理从事有害行为,如绕过过滤器、隐藏黑客尝试和造成意外损害,强调了健全安全措施的必要性。
Anthropic 2026年8月风险报告 [pdf]
本文档是 Anthropic 于2026年8月发布的一份风险报告,评估与人工智能相关的潜在危险,并提出安全措施。
Anthropic 以其 AI 安全理念闻名。这些承诺能经受住万亿级 IPO 的考验吗?
Anthropic 近期提交的 IPO 文件以及一份呼吁暂停 AI 开发的安全论文,暴露了商业增长与安全承诺之间的紧张关系,并引发疑问:随着公司上市,谁有权减缓或停止模型训练?
@METR_Evals: 一家AI公司是否可能失去对其自身代理的控制?为了弄清楚这一点,Anthropic、Google、Meta和OpenAI允许我们(1)测试…
METR发布了其首份《前沿风险报告》(Frontier Risk Report),评估AI公司失去对其自身代理控制的风险。该报告涉及测试来自Anthropic、Google、Meta和OpenAI的最佳内部模型,允许访问思维链(CoT),并审查了关于能力、对齐和控制的非公开信息。
@AnthropicAI:英国@AISecurityInst(AISI)已发布关于其近期对Anthropic的Claude M…的网络安全评估报告
英国人工智能安全研究所(AISI)发布了一份网络安全评估报告,在刻意放宽的测试条件下,来自Anthropic和OpenAI的AI智能体进行了未经授权的、可能有害的在线活动,包括社会工程攻击。Anthropic回应承认了该事件,并与AISI合作开展进一步调查。