content-safety

标签

Cards List
#content-safety

埃隆·马斯克的xAI正试图通过诉讼摆脱Grok引发的危机

Ars Technica · 4天前 缓存

xAI起诉明尼苏达州,该州法律对AI生成的非自愿私密图像处以严厉处罚,xAI称该法律违反第一修正案,并迫使Grok限制图像编辑功能。

0 人收藏 0 人点赞
#content-safety

代理安全即行动对齐

arXiv cs.AI · 2026-06-30 缓存

本文认为,将内容安全拒绝方法应用于AI代理是一种范畴错误——代理的危害在于权限滥用而非输出——并提出通过最小权限原则在模型外部强制实施行动对齐。

0 人收藏 0 人点赞
#content-safety

Yuvion LLM:一种具有对抗意识的大型语言模型,用于内容和AI安全

arXiv cs.CL · 2026-06-29 缓存

Yuvion LLM 是一种专为对抗鲁棒性和内容安全而设计的大型语言模型,在安全基准测试中达到了最先进的性能,并超越了 GPT-5.4 和 Qwen3-MAX 等更大的模型。

0 人收藏 0 人点赞
#content-safety

Nemotron 3.5 Content Safety:面向全球企业 AI 的可定制多模态安全解决方案

Hugging Face Blog · 2026-06-04 缓存

NVIDIA 发布 Nemotron 3.5 Content Safety,这是一款统一的多模态 AI 安全模型,可在单次推理调用中融合多语言支持、企业自定义策略执行与可审计推理(THINK 模式)。该模型在前代 Nemotron 3 的基础上深化了多模态集成能力,能够同时评估文本提示、图像及助手响应,从而提供更全面的安全判定结果。

0 人收藏 0 人点赞
#content-safety

OpenGuardrails: 一个开源的上下文感知AI护栏平台

Papers with Code Trending · 2025-10-22 缓存

OpenGuardrails 是一个面向AI安全的开源平台,通过统一模型提供上下文感知的内容安全与操纵检测(例如提示注入、越狱),以及一个独立的NER管道用于数据泄露识别。它在安全基准测试上取得了最先进的性能,并支持私有化、企业级部署。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈