标签
讨论了前沿AI模型安全审查流程的演变,提到了Claude Fable 5的重新发布,以及需要建立一个共享的行业框架来评估越狱攻击,同时对安全与创新之间的平衡表达了谨慎乐观。
Anthropic 正在全球重新部署 Claude Fable 5,并新增分类器以屏蔽网络安全任务,同时与美国政府和行业合作伙伴共同制定 AI 安全框架。
OpenAI 宣布与美国 CAISI 和英国 AISI 开展协作安全改进,强调联合红队测试工作通过多学科网络安全和 AI 代理安全方法,发现并帮助修复 ChatGPT Agent 系统中的新型漏洞。