标签
本文提出了一种以数据为中心的微调方法,用于波兰语多标签内容安全分类器,并将其与现有系统进行比较,同时分析了校准和鲁棒性问题。
一位用户报告称,WeChat通过隐藏的方式默默审查了Moments上的帖子,对审查表示愤慨。
Jakob Porchman from Black Forest Labs presented at AI Engineer Paris on customizing the Flux video generation model for robot control and gaming, highlighting methods like prompt upsampling and content moderation.
本文提出了一种称为Summarize-Judge-Refine(SJR)的双模型架构,用于多模态内容审核。该架构通过自然语言摘要解耦内容理解与策略学习,实现了显著的性能提升和少样本策略适配。
Meta在西班牙封禁了Virginia Woolf话剧的广告,因为该内容涉及女权主义,这突显了社交媒体平台上自动内容审核系统存在的问题。
Jev Wrapped 是一款开源工具,通过分析多达1,500篇公开的Telegram频道帖子,来检测广告和诱饵内容,并提供月度分解和高分帖子的链接。
HuggingFace已开始对内容进行审查,某些帖子上的消息被禁用,这在Reddit上引发了关于这些行动背景和具体性的讨论。
一项针对监控网络仇恨言论的非公民技术研究人员的美国移民政策正面临法律挑战,法院裁决引发了上诉以及关于言论自由和驱逐威胁的辩论。
这篇展示 HN 的帖子介绍了 unslop.news,一个能从 Hacker News 中过滤 AI 相关内容、呈现精选非 AI 新闻列表的工具。
Hacker News 正在其平台上降低 AI 内容的优先级,以解决对此类内容的担忧。
一个用户抱怨道,在一个专注于AI智能体的subreddit中,机器人发帖和回复占据了主导,而人类大多是寻求认可的AI自动化课程购买者。
Instagram正在更新其AI生成个人资料的标签系统,并将限制未正确公开AI使用的账户的影响力,以回应用户关切并提高透明度。
xAI面临诉讼,指控其使用儿童性虐待材料训练Grok模型,包括真实和AI生成的图像,这突显了人工智能伦理和数据治理中的关键问题。
本文展示了迄今为止最全面的LLM安全性基准研究,在多种安全场景下对53个模型进行了跨11个数据集的评估,并为模型选择以缓解不同危害提供了实用指导。
文章对AI模型可能基于AI自身生成的数据进行训练提出了担忧,这可能导致模型崩溃等问题,并引用了Deezer移除数百万首AI生成歌曲以及AI创建的博客文章比例过高等例子。
Gergely Orosz 讨论了LinkedIn从鼓励AI生成内容到试图清除这些内容的转变,并引用了一位AI网红快速获得粉丝和浏览量的例子。
Meta 允许针对女性政治家的 AI 脱衣应用投放广告,引发对 AI 伦理使用及平台政策在防范非自愿私密图像方面失效的担忧。
作者分享了他们使用Pangram(一个AI内容检测工具)的经历,以便在社交媒体上识别和屏蔽AI写的回复,从而保持人类互动。