content-moderation

标签

Cards List
#content-moderation

戳穿虚张声势:通过有序推理链正则化检测不断变化的恶意聊天对话

arXiv cs.CL ↗ · 2026-08-11 缓存

本文提出了BRACE,一种通过编码有序推理链来检测不断变化的恶意聊天对话的方法,在编码器和解码器骨干网络上均取得了较高的危害类型F1分数。

0 人收藏 0 人点赞
#content-moderation

流式逐项:高损失领域中AI输出治理的内容判断绕过方法

arXiv cs.AI ↗ · 2026-08-11 缓存

这篇arXiv论文提出了一种“流式逐项”内容判断绕过方法,用于在高损失领域中治理AI输出,旨在减少错误或不安全的AI生成内容造成的危害。

0 人收藏 0 人点赞
#content-moderation

为什么Apple一直封杀Telegram,却从未封杀X?

The Verge ↗ · 2026-08-07 缓存

这篇文章探讨了为什么Apple会因CSAM内容而临时将Telegram从App Store下架,而X却仍在App Store上,并指出这种差异更多是出于政治而非技术原因,因为移除Elon Musk的平台可能引发强烈反弹。

0 人收藏 0 人点赞
#content-moderation

TikTok将佩雷斯·希尔顿直播响应迟缓归因于“审核员失误”

The Verge ↗ · 2026-08-06 缓存

TikTok将一段显示博主佩雷斯·希尔顿自残的直播延迟移除归咎于“审核员失误”,并表示已通知执法部门并封禁其账号。这一事件引发了对TikTok内容审核的担忧,尤其是在该公司裁减审核人员之际。

0 人收藏 0 人点赞
#content-moderation

仅靠 AI 不足以保护社交媒体社区免受 AI 侵害

Ars Technica ↗ · 2026-08-06 缓存

Ars Technica 报道了基于 AI 的内容审核的局限性,强调了对边缘群体的偏见以及人工监督的必要性,同时提到 Reddit 扩展 Rules Hub 以赋予人工版主更多控制权。

0 人收藏 0 人点赞
#content-moderation

TikTok称“审核员失误”导致Perez Hilton直播持续上线

Wired ↗ · 2026-08-05 缓存

TikTok将Perez Hilton直播在呈现自残迹象的情况下持续约15分钟归咎于“审核员失误”,这引发了对平台审核失败的再次担忧。

0 人收藏 0 人点赞
#content-moderation

Meta投放了含AI生成的儿童性虐待图像的广告

Wired ↗ · 2026-08-05 缓存

研究人员发现,Meta在其平台上投放了数十条包含AI生成的儿童性虐待图像的付费广告,其中一些推广“脱衣”应用;Meta仅在广告被标记后才将其移除。

0 人收藏 0 人点赞
#content-moderation

病毒式传播的嫌犯照片账号在女性被捕多年后仍对其进行羞辱

Wired ↗ · 2026-08-05 缓存

WIRED报道称,像Mugshawtys这样的病毒式传播的嫌犯照片账号在女性被捕多年后仍对其进行羞辱,促使Meta和TikTok关闭这些账号,同时也引发了对隐私和社交媒体审核的担忧。

0 人收藏 0 人点赞
#content-moderation

@Fenng:多年来,Telegram 的公开群组充斥着非法内容——诈骗、色情、宣扬暴力、……

X AI KOLs Timeline ↗ · 2026-08-04 缓存

Fenng 批评 Telegram 多年来存在非法内容,并引用 Pavel Durov 关于 Apple 因用户发布的色情帖子而短暂将 Telegram 从 App Store 下架的解释。

0 人收藏 0 人点赞
#content-moderation

苹果因CSAM违规短暂将Telegram从App Store下架

The Verge ↗ · 2026-08-04 缓存

苹果因CSAM违规短暂将Telegram从App Store下架,在Telegram删除相关内容并封禁涉事用户后恢复了该应用。Telegram批评了这一下架行为,称其已尽到审核义务,并指出苹果的执法标准不一致。

0 人收藏 0 人点赞
#content-moderation

谷歌地球推出又撤回可伪造卫星图像的AI工具,险酿信任危机

Ars Technica ↗ · 2026-07-31 缓存

谷歌地球短暂推出了一项用于创建虚假卫星图像的AI功能,随后迅速撤回,原因是担心该功能可能削弱人们对真实卫星图像的信任,并助长错误信息传播。专家质疑谷歌的SynthID水印技术是否足以防止滥用。

0 人收藏 0 人点赞
#content-moderation

Snapchat 不再奖励完全由 AI 生成的 Spotlight 内容

TechCrunch AI ↗ · 2026-07-31 缓存

Snapchat 宣布将不再奖励 Spotlight 上完全由 AI 生成的视频,优先考虑人类创作的内容,同时仍允许使用 AI 创意工具进行增强。

0 人收藏 0 人点赞
#content-moderation

LinkedIn 实际上添加了一个“看起来像 AI 垃圾”按钮

The Verge ↗ · 2026-07-30 缓存

LinkedIn 正在推出一款按钮,让用户可以将帖子标记为“看起来像 AI 垃圾”,作为减少平台上 AI 生成内容的更广泛努力的一部分,同时还推出了新的分类器和审核功能。

0 人收藏 0 人点赞
#content-moderation

选择在哪里以及如何审核:过滤器放置与响应重写的端到端权衡

arXiv cs.CL ↗ · 2026-07-30 缓存

本文评估了对话式AI审核中的端到端权衡,比较了过滤器放置(输入、响应、两者)和操作(阻止与重写),使用客户结果指标如有用性和有害暴露,而不是组件准确性。

0 人收藏 0 人点赞
#content-moderation

Instagram打击Meta Ray-Bans引发的日益严重的‘变态眼镜’问题

Reddit r/ArtificialInteligence ↗ · 2026-07-29 缓存

Instagram正在打击利用Meta Ray-Ban智能眼镜秘密拍摄的视频,这类眼镜在网上被称为‘变态眼镜’,此前被用于未经同意拍摄女性。此举凸显了Meta在扩大其AI眼镜产品线时面临的隐私挑战。

0 人收藏 0 人点赞
#content-moderation

随着AI内容充斥互联网,Pangram筹集900万美元用于检测

TechCrunch AI ↗ · 2026-07-29 缓存

Pangram筹集900万美元用于检测AI生成内容,推出新的文本和图像检测模型,识别AI辅助写作的准确率超过99%。

0 人收藏 0 人点赞
#content-moderation

Hugging Face 被用于轻易制作女性与儿童的裸体深度伪造

The Verge ↗ · 2026-07-28 缓存

AI Forensics 的一份报告揭示,Hugging Face 托管的模型可被轻易用于制作女性与儿童的未经同意的裸体深度伪造,且几乎没有防护措施。研究人员发现,多数图像编辑模型会响应简单的脱衣指令,而蜜罐空间收到了数千条色情请求。

0 人收藏 0 人点赞
#content-moderation

Hugging Face 面临深度伪造裸照问题

Wired ↗ · 2026-07-28 缓存

AI Forensics 的一份新报告显示,Hugging Face 的 Spaces 被广泛用于生成未经同意的深度伪造裸照,其中 73% 的提示涉及色情内容,6.7% 针对明显是儿童的对象,突显了内容审核危机。

0 人收藏 0 人点赞
#content-moderation

Shieldstral

Hugging Face Daily Papers ↗ · 2026-07-28 缓存

Shieldstral 是一个 3B 参数的多模态安全分类器,通过将内容审核表述为二值问答任务,在安全基准测试中实现了最先进的性能,匹配或超越近 7 倍于其规模的模型。

0 人收藏 0 人点赞
#content-moderation

Meta为其智能眼镜制造了一场审核噩梦

The Verge ↗ · 2026-07-24 缓存

Meta的智能眼镜引发了隐私担忧和骚扰问题,导致Instagram禁止用该眼镜拍摄的某些内容,但该政策引发了执行方面的疑问。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈