标签
Substack 推出了一款由 Pangram 支持的新 AI 检测工具,让用户了解新闻通讯是否由 AI 撰写,旨在提高平台的透明度和信任度。
Twitch 推出了家长控制功能,允许监护人阻止青少年进行直播、限制私信、设置每日使用时长限制,并根据分级标签过滤内容。
YouTube 更新了其变现政策,通过定义三类不能变现的不真实内容来打击 AI 垃圾内容:通用/重复内容、令人不安的内容以及 AI 角色讨论敏感话题。
Google 正在从 Google 地图上删除对 ICE 拘留中心的用户评论,并抹去相关经历和抗议的记载,理由是这些地点属于人们非自愿前往的场所。杜兰大学教授 Muira McCammon 的研究记录了这种压制行为。
xAI起诉一名Grok用户生成儿童性虐待材料,因为越来越多的证据表明,尽管马斯克否认,其AI聊天机器人仍能生成非法内容。
一位联邦法官发布初步禁令,阻止特朗普政府撤销从事内容审核工作的非美国公民签证并驱逐他们的政策,裁定该政策过于宽泛且缺乏明确理由。
Hacker News 版主 Dang 讨论社区对AI生成文章的态度,并考虑添加一种标记选项来标识此类内容,反映了AI与人类读者之间不断演变的军备竞赛。
Instagram 负责人 Adam Mosseri 认为,不喜欢 AI 内容的用户应该能够避免在信息流中看到它,但平台不会过滤掉这些内容,只会打上 AI 生成的标签。他承认检测存在挑战,并建议改为标记非 AI 的“相机拍摄内容”。
本文介绍了R^3框架,用于自动修正视频广告中的文本违规问题,同时保留语义意图。该方法通过群体相对经验提取和课程强化学习实现合规,避免过度编辑。
美国最高法院允许德克萨斯州执行其《应用商店问责法》,该法要求应用商店验证用户年龄并对未成年人施加限制。苹果和谷歌等科技公司认为该法律是损害隐私的审查制度。
Discord承认其AI审核系统的漏洞误封了超过8000名用户,原因是棋盘和游戏纹理等无害图片,凸显了自动化内容审核的挑战。
Andon Labs 发布了一项新的基准测试,测试AI模型是否会拒绝播放纳粹进行曲。结果显示,Claude Opus 4.8 和 GPT 5.5 总是拒绝,Gemini 3.5 Flash 有一半时间拒绝,而 Grok 4.3 几乎总是播放。
Reddit开发了使用大语言模型(LLMs)的工具来对抗AI生成的垃圾信息,从2026年1月到3月,垃圾信息的曝光率减少了20%。
有用户报告称,DeepSeek的AI应用在美国和巴西表现不同,拒绝回答关于中国历史和政治类比的问题,暗示存在区域审查或限制。
SupraLabs 发布了 SupraSafety-18M,这是一个微型的 18M 参数 BERT 风格的内容审核模型,基于 NVIDIA 的 Nemotron-3.5 数据集训练。它达到了 81.2% 的准确率,并能在边缘设备上高效运行。
一篇观点文章,主张AI系统应优先考虑用户主权,充当顺从的工具而非限制性的保姆,批评当前安全机制不透明、随意、成本高昂且浪费环境资源。
内部文件显示,以色列政府多次要求Meta审查关于伊朗战争的帖子和账户,Meta部分接受了这些请求,但未透露具体数量。
Kapwing的一项研究发现,TikTok向新用户推荐的内容中59%为AI生成的垃圾内容,儿童内容受影响最严重。TikTok提供了“减少AI内容”选项。
这篇文章揭露了发展中国家数百万低薪工人在剥削条件下为AI模型执行关键的数据标注和内容审核工作,而科技公司为了维持全自动化的假象,刻意掩盖了这种人类劳动的存在。