标签
本文提出了一种称为Summarize-Judge-Refine(SJR)的双模型架构,用于多模态内容审核。该架构通过自然语言摘要解耦内容理解与策略学习,实现了显著的性能提升和少样本策略适配。
Meta在西班牙封禁了Virginia Woolf话剧的广告,因为该内容涉及女权主义,这突显了社交媒体平台上自动内容审核系统存在的问题。
Jev Wrapped 是一款开源工具,通过分析多达1,500篇公开的Telegram频道帖子,来检测广告和诱饵内容,并提供月度分解和高分帖子的链接。
HuggingFace已开始对内容进行审查,某些帖子上的消息被禁用,这在Reddit上引发了关于这些行动背景和具体性的讨论。
一项针对监控网络仇恨言论的非公民技术研究人员的美国移民政策正面临法律挑战,法院裁决引发了上诉以及关于言论自由和驱逐威胁的辩论。
这篇展示 HN 的帖子介绍了 unslop.news,一个能从 Hacker News 中过滤 AI 相关内容、呈现精选非 AI 新闻列表的工具。
Hacker News 正在其平台上降低 AI 内容的优先级,以解决对此类内容的担忧。
一个用户抱怨道,在一个专注于AI智能体的subreddit中,机器人发帖和回复占据了主导,而人类大多是寻求认可的AI自动化课程购买者。
Instagram正在更新其AI生成个人资料的标签系统,并将限制未正确公开AI使用的账户的影响力,以回应用户关切并提高透明度。
xAI面临诉讼,指控其使用儿童性虐待材料训练Grok模型,包括真实和AI生成的图像,这突显了人工智能伦理和数据治理中的关键问题。
本文展示了迄今为止最全面的LLM安全性基准研究,在多种安全场景下对53个模型进行了跨11个数据集的评估,并为模型选择以缓解不同危害提供了实用指导。
文章对AI模型可能基于AI自身生成的数据进行训练提出了担忧,这可能导致模型崩溃等问题,并引用了Deezer移除数百万首AI生成歌曲以及AI创建的博客文章比例过高等例子。
Gergely Orosz 讨论了LinkedIn从鼓励AI生成内容到试图清除这些内容的转变,并引用了一位AI网红快速获得粉丝和浏览量的例子。
Meta 允许针对女性政治家的 AI 脱衣应用投放广告,引发对 AI 伦理使用及平台政策在防范非自愿私密图像方面失效的担忧。
作者分享了他们使用Pangram(一个AI内容检测工具)的经历,以便在社交媒体上识别和屏蔽AI写的回复,从而保持人类互动。
据报道,Facebook 正在付费给有争议的创作者制作煽动愤怒的内容,这引发了对算法激励和平台审核的担忧。
本文提出了BRACE,一种通过编码有序推理链来检测不断变化的恶意聊天对话的方法,在编码器和解码器骨干网络上均取得了较高的危害类型F1分数。
这篇arXiv论文提出了一种“流式逐项”内容判断绕过方法,用于在高损失领域中治理AI输出,旨在减少错误或不安全的AI生成内容造成的危害。