标签
本文提出了BRACE,一种通过编码有序推理链来检测不断变化的恶意聊天对话的方法,在编码器和解码器骨干网络上均取得了较高的危害类型F1分数。
这篇arXiv论文提出了一种“流式逐项”内容判断绕过方法,用于在高损失领域中治理AI输出,旨在减少错误或不安全的AI生成内容造成的危害。
这篇文章探讨了为什么Apple会因CSAM内容而临时将Telegram从App Store下架,而X却仍在App Store上,并指出这种差异更多是出于政治而非技术原因,因为移除Elon Musk的平台可能引发强烈反弹。
TikTok将一段显示博主佩雷斯·希尔顿自残的直播延迟移除归咎于“审核员失误”,并表示已通知执法部门并封禁其账号。这一事件引发了对TikTok内容审核的担忧,尤其是在该公司裁减审核人员之际。
Ars Technica 报道了基于 AI 的内容审核的局限性,强调了对边缘群体的偏见以及人工监督的必要性,同时提到 Reddit 扩展 Rules Hub 以赋予人工版主更多控制权。
TikTok将Perez Hilton直播在呈现自残迹象的情况下持续约15分钟归咎于“审核员失误”,这引发了对平台审核失败的再次担忧。
研究人员发现,Meta在其平台上投放了数十条包含AI生成的儿童性虐待图像的付费广告,其中一些推广“脱衣”应用;Meta仅在广告被标记后才将其移除。
WIRED报道称,像Mugshawtys这样的病毒式传播的嫌犯照片账号在女性被捕多年后仍对其进行羞辱,促使Meta和TikTok关闭这些账号,同时也引发了对隐私和社交媒体审核的担忧。
Fenng 批评 Telegram 多年来存在非法内容,并引用 Pavel Durov 关于 Apple 因用户发布的色情帖子而短暂将 Telegram 从 App Store 下架的解释。
苹果因CSAM违规短暂将Telegram从App Store下架,在Telegram删除相关内容并封禁涉事用户后恢复了该应用。Telegram批评了这一下架行为,称其已尽到审核义务,并指出苹果的执法标准不一致。
谷歌地球短暂推出了一项用于创建虚假卫星图像的AI功能,随后迅速撤回,原因是担心该功能可能削弱人们对真实卫星图像的信任,并助长错误信息传播。专家质疑谷歌的SynthID水印技术是否足以防止滥用。
Snapchat 宣布将不再奖励 Spotlight 上完全由 AI 生成的视频,优先考虑人类创作的内容,同时仍允许使用 AI 创意工具进行增强。
LinkedIn 正在推出一款按钮,让用户可以将帖子标记为“看起来像 AI 垃圾”,作为减少平台上 AI 生成内容的更广泛努力的一部分,同时还推出了新的分类器和审核功能。
本文评估了对话式AI审核中的端到端权衡,比较了过滤器放置(输入、响应、两者)和操作(阻止与重写),使用客户结果指标如有用性和有害暴露,而不是组件准确性。
Instagram正在打击利用Meta Ray-Ban智能眼镜秘密拍摄的视频,这类眼镜在网上被称为‘变态眼镜’,此前被用于未经同意拍摄女性。此举凸显了Meta在扩大其AI眼镜产品线时面临的隐私挑战。
Pangram筹集900万美元用于检测AI生成内容,推出新的文本和图像检测模型,识别AI辅助写作的准确率超过99%。
AI Forensics 的一份报告揭示,Hugging Face 托管的模型可被轻易用于制作女性与儿童的未经同意的裸体深度伪造,且几乎没有防护措施。研究人员发现,多数图像编辑模型会响应简单的脱衣指令,而蜜罐空间收到了数千条色情请求。
AI Forensics 的一份新报告显示,Hugging Face 的 Spaces 被广泛用于生成未经同意的深度伪造裸照,其中 73% 的提示涉及色情内容,6.7% 针对明显是儿童的对象,突显了内容审核危机。
Shieldstral 是一个 3B 参数的多模态安全分类器,通过将内容审核表述为二值问答任务,在安全基准测试中实现了最先进的性能,匹配或超越近 7 倍于其规模的模型。
Meta的智能眼镜引发了隐私担忧和骚扰问题,导致Instagram禁止用该眼镜拍摄的某些内容,但该政策引发了执行方面的疑问。