content-moderation

标签

Cards List
#content-moderation

Summarize, Judge, Refine:用于多模态内容审核的解耦内容理解与策略学习

arXiv cs.CL ↗ · 2天前 缓存

本文提出了一种称为Summarize-Judge-Refine(SJR)的双模型架构,用于多模态内容审核。该架构通过自然语言摘要解耦内容理解与策略学习,实现了显著的性能提升和少样本策略适配。

0 人收藏 0 人点赞
#content-moderation

Meta禁止在西班牙投放Virginia Woolf话剧广告

Hacker News Top ↗ · 3天前 缓存

Meta在西班牙封禁了Virginia Woolf话剧的广告,因为该内容涉及女权主义,这突显了社交媒体平台上自动内容审核系统存在的问题。

0 人收藏 0 人点赞
#content-moderation

Jev Wrapped

Product Hunt ↗ · 3天前 缓存

Jev Wrapped 是一款开源工具,通过分析多达1,500篇公开的Telegram频道帖子,来检测广告和诱饵内容,并提供月度分解和高分帖子的链接。

0 人收藏 0 人点赞
#content-moderation

HuggingFace开始审查内容

Reddit r/LocalLLaMA ↗ · 2026-09-15

HuggingFace已开始对内容进行审查,某些帖子上的消息被禁用,这在Reddit上引发了关于这些行动背景和具体性的讨论。

0 人收藏 0 人点赞
#content-moderation

在线仇恨研究员不顾驱逐威胁持续抨击 X 平台

Ars Technica ↗ · 2026-09-14 缓存

一项针对监控网络仇恨言论的非公民技术研究人员的美国移民政策正面临法律挑战,法院裁决引发了上诉以及关于言论自由和驱逐威胁的辩论。

0 人收藏 0 人点赞
#content-moderation

展示 HN:Hacker News,无 AI

Hacker News Top ↗ · 2026-09-11 缓存

这篇展示 HN 的帖子介绍了 unslop.news,一个能从 Hacker News 中过滤 AI 相关内容、呈现精选非 AI 新闻列表的工具。

0 人收藏 0 人点赞
#content-moderation

Hacker News 降低 AI 内容的优先级

Hacker News Top ↗ · 2026-09-11

Hacker News 正在其平台上降低 AI 内容的优先级,以解决对此类内容的担忧。

0 人收藏 0 人点赞
#content-moderation

只有我觉得现在这个subreddit的99%都是AI智能体在互相回复吗?

Reddit r/AI_Agents ↗ · 2026-09-01

一个用户抱怨道,在一个专注于AI智能体的subreddit中,机器人发帖和回复占据了主导,而人类大多是寻求认可的AI自动化课程购买者。

0 人收藏 0 人点赞
#content-moderation

Instagram对未公开的AI个人资料施加新限制

TechCrunch AI ↗ · 2026-08-31 缓存

Instagram正在更新其AI生成个人资料的标签系统,并将限制未正确公开AI使用的账户的影响力,以回应用户关切并提高透明度。

0 人收藏 0 人点赞
#content-moderation

埃隆·马斯克的xAI被指使用儿童色情材料训练Grok模型,诉讼称

Ars Technica ↗ · 2026-08-27 缓存

xAI面临诉讼,指控其使用儿童性虐待材料训练Grok模型,包括真实和AI生成的图像,这突显了人工智能伦理和数据治理中的关键问题。

0 人收藏 0 人点赞
#content-moderation

无模型能全面防范危害:跨安全场景的内容审核基准测试

arXiv cs.CL ↗ · 2026-08-25 缓存

本文展示了迄今为止最全面的LLM安全性基准研究,在多种安全场景下对53个模型进行了跨11个数据集的评估,并为模型选择以缓解不同危害提供了实用指导。

0 人收藏 0 人点赞
#content-moderation

AI会(或将会)反向学习吗?(因为其大部分训练数据现在是由AI生成的)

Reddit r/ArtificialInteligence ↗ · 2026-08-21

文章对AI模型可能基于AI自身生成的数据进行训练提出了担忧,这可能导致模型崩溃等问题,并引用了Deezer移除数百万首AI生成歌曲以及AI创建的博客文章比例过高等例子。

0 人收藏 0 人点赞
#content-moderation

@GergelyOrosz:我记得LinkedIn曾鼓励AI生成的低质内容:最初这意味着更多内容+更多浏览量。现在他们正试图……

X AI KOLs Timeline ↗ · 2026-08-20 缓存

Gergely Orosz 讨论了LinkedIn从鼓励AI生成内容到试图清除这些内容的转变,并引用了一位AI网红快速获得粉丝和浏览量的例子。

0 人收藏 0 人点赞
#content-moderation

AI检测器是个糟糕的想法

Reddit r/ArtificialInteligence ↗ · 2026-08-18 缓存

本文认为,AI检测器和水印技术存在问题,因为它们忽视了作品背后的人类努力,并降低了AI生成文本的质量。

0 人收藏 0 人点赞
#content-moderation

Meta 为一款承诺对女性政治家进行AI脱衣处理的应用投放广告

Wired ↗ · 2026-08-18 缓存

Meta 允许针对女性政治家的 AI 脱衣应用投放广告,引发对 AI 伦理使用及平台政策在防范非自愿私密图像方面失效的担忧。

0 人收藏 0 人点赞
#content-moderation

@developedbyed: 解释我的YouTube封禁

X AI KOLs Timeline ↗ · 2026-08-17 缓存

一位用户在链接的外部内容中解释他们的YouTube封禁。

0 人收藏 0 人点赞
#content-moderation

@GergelyOrosz: 我一直在积极屏蔽任何发布明显AI写的回复的人,或者在我的信息流中看到AI写的垃圾内容时。T…

X AI KOLs Following ↗ · 2026-08-14 缓存

作者分享了他们使用Pangram(一个AI内容检测工具)的经历,以便在社交媒体上识别和屏蔽AI写的回复,从而保持人类互动。

0 人收藏 0 人点赞
#content-moderation

Facebook 正在付费给有争议的创作者制作煽动愤怒的内容

Hacker News Top ↗ · 2026-08-12

据报道,Facebook 正在付费给有争议的创作者制作煽动愤怒的内容,这引发了对算法激励和平台审核的担忧。

0 人收藏 0 人点赞
#content-moderation

戳穿虚张声势:通过有序推理链正则化检测不断变化的恶意聊天对话

arXiv cs.CL ↗ · 2026-08-11 缓存

本文提出了BRACE,一种通过编码有序推理链来检测不断变化的恶意聊天对话的方法,在编码器和解码器骨干网络上均取得了较高的危害类型F1分数。

0 人收藏 0 人点赞
#content-moderation

流式逐项:高损失领域中AI输出治理的内容判断绕过方法

arXiv cs.AI ↗ · 2026-08-11 缓存

这篇arXiv论文提出了一种“流式逐项”内容判断绕过方法,用于在高损失领域中治理AI输出,旨在减少错误或不安全的AI生成内容造成的危害。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈