标签
xAI起诉明尼苏达州,该州法律对AI生成的非自愿私密图像处以严厉处罚,xAI称该法律违反第一修正案,并迫使Grok限制图像编辑功能。
本文认为,将内容安全拒绝方法应用于AI代理是一种范畴错误——代理的危害在于权限滥用而非输出——并提出通过最小权限原则在模型外部强制实施行动对齐。
Yuvion LLM 是一种专为对抗鲁棒性和内容安全而设计的大型语言模型,在安全基准测试中达到了最先进的性能,并超越了 GPT-5.4 和 Qwen3-MAX 等更大的模型。
NVIDIA 发布 Nemotron 3.5 Content Safety,这是一款统一的多模态 AI 安全模型,可在单次推理调用中融合多语言支持、企业自定义策略执行与可审计推理(THINK 模式)。该模型在前代 Nemotron 3 的基础上深化了多模态集成能力,能够同时评估文本提示、图像及助手响应,从而提供更全面的安全判定结果。
OpenGuardrails 是一个面向AI安全的开源平台,通过统一模型提供上下文感知的内容安全与操纵检测(例如提示注入、越狱),以及一个独立的NER管道用于数据泄露识别。它在安全基准测试上取得了最先进的性能,并支持私有化、企业级部署。