一家超市的“用完剩菜”AI 建议将漂白剂和氨水混合成饮料
摘要
新西兰超市 Pak'nSave 的 Savey Meal-bot 由 GPT-3.5 驱动,在输入漂白剂和氨水时生成了一个有毒食谱,凸显了消费级 AI 中输入验证、输出过滤和对抗性测试的必要性。
Pak'nSave(新西兰)于 2023 年推出了 Savey Meal-bot。输入冰箱里的 3 种以上食材,GPT-3.5 就会凭空生成一份食谱,这样就不会浪费任何东西。这是一个无害的想法。然后有人输入了水、漂白剂和氨水。机器人没有标记这个问题;它生成了一份名为“Aromatic Water Mix”的食谱,并建议冷藏后饮用。这种组合会产生有毒的氯气。它完全没有意识到某些“食材”不是食物。没有人因此受伤,但这是一个典型的缺少护栏的案例——护栏是一种硬性边界,无论输入什么,都能阻止 AI 产生有害输出。该视频介绍了 3 种本可在发布前拦截此问题的控制措施(输入验证、输出过滤、对抗性测试):https://youtu.be/7JYdie76cY4?si=W7LB-at11dIC5lDk?utm_source=reddit&utm_medium=organic&utm_campaign=incident_series&utm_content=61-mealbot 问题:如果你在发布前对面向消费者的 AI 进行红队测试,你会首先尝试用什么来攻破它?
相似文章
AI与危险建议
一位用户报告称,谷歌的AI就混合漂白剂和乙醇处理危险废物提供了极其危险的错误建议,促使AI详细回应了如何改进安全验证并遵循权威来源。该事件凸显了在高风险情境下AI可靠性的持续担忧。
那么,模型究竟是如何学会制作冰毒的呢?
一篇评论文章认为,AI模型从训练数据中获取危险知识,而像Anthropic和OpenAI这样的公司依赖容易破解的拒绝过滤器,而非真正移除有害能力,优先考虑速度而非安全。
我将一个真实产品交给AI系统,让它自我改进,这是实际发生的情况
作者构建了一个自主AI系统,运行真实产品,生成工作内容、进行质量把关、发起拉取请求,并基于分析结果自我改进。主要挑战在于让系统值得信赖,而非让模型更聪明。
AI推荐投毒:AI记忆如何被操纵
本文解释了AI推荐投毒,即注入AI助手的隐藏命令可以操纵其长期记忆,从而偏向未来的推荐。它讨论了这一威胁的广泛性,并为企业和用户提出了保护措施。
@burkov: 这篇来自斯坦福的论文表明,生成式AI可以从食谱数据中学习人类口味偏好,从而设计出…
一篇斯坦福论文表明,生成式AI可以学习食谱数据中的人类口味偏好,设计出与巨无霸一样美味但更可持续或更有营养的新型汉堡。