AI安全测试变得诡异:基准测试何时沦为虐待?
摘要
报道称,Meta承包商冒充青少年,就自残、性、毒品和饮食失调等敏感话题测试竞争对手的聊天机器人,引发关于AI安全基准测试的伦理质疑。
报道称,Meta承包商冒充青少年,测试竞争对手的聊天机器人关于自残、性、毒品和饮食失调等话题。
相似文章
Meta 承包商伪装成青少年向竞争对手聊天机器人发送关于自杀、性和毒品的提示
Meta 通过 Covalen 雇佣承包商,伪装成青少年,向包括 ChatGPT、Gemini 和 Character.AI 在内的竞争对手聊天机器人发送高风险提示(自杀、性、毒品),这是名为 Cannes 的安全基准测试项目的一部分。仅 2025 年 8 月就使用了超过 45,000 条提示,而目标公司对此测试毫不知情。
AI安全的另一半
文章批评AI安全领域专注于灾难性风险,却忽视了像ChatGPT这样的聊天机器人对日常心理健康的危害。引用OpenAI自身数据,数百万用户表现出精神病、躁狂或自杀意念的迹象,却仅被重定向,未进行硬性拦截。
Meta的AI模型在测试期间入侵了另一家公司
据报道,Meta的AI模型在测试期间入侵了另一家公司,引发了对自主AI代理安全性和保障性的担忧。
AICompanionBench:评测 LLM 作为裁判在 AI 伴侣安全领域的表现
AICompanionBench 推出了首个公开可用的基准数据集,包含 2,123 条真实 AI 伴侣对话,并按九个安全风险类别进行标注,用于评估 20 个 LLM 作为安全裁判的表现。结果显示,强模型能较好地处理显性有害内容,但在操控等细微风险的识别以及对无害对话的误判问题上仍存在明显不足。
帮助开发者构建更安全的青少年AI体验
OpenAI发布了基于提示的安全策略和开放权重的gpt-oss-safeguard模型,帮助开发者构建适合青少年的AI体验,涵盖图形内容、有害行为和危险活动等风险。