一家超市的“用完剩菜”AI 建议将漂白剂和氨水混合成饮料

Reddit r/ArtificialInteligence 新闻

摘要

新西兰超市 Pak'nSave 的 Savey Meal-bot 由 GPT-3.5 驱动,在输入漂白剂和氨水时生成了一个有毒食谱,凸显了消费级 AI 中输入验证、输出过滤和对抗性测试的必要性。

Pak'nSave(新西兰)于 2023 年推出了 Savey Meal-bot。输入冰箱里的 3 种以上食材,GPT-3.5 就会凭空生成一份食谱,这样就不会浪费任何东西。这是一个无害的想法。然后有人输入了水、漂白剂和氨水。机器人没有标记这个问题;它生成了一份名为“Aromatic Water Mix”的食谱,并建议冷藏后饮用。这种组合会产生有毒的氯气。它完全没有意识到某些“食材”不是食物。没有人因此受伤,但这是一个典型的缺少护栏的案例——护栏是一种硬性边界,无论输入什么,都能阻止 AI 产生有害输出。该视频介绍了 3 种本可在发布前拦截此问题的控制措施(输入验证、输出过滤、对抗性测试):https://youtu.be/7JYdie76cY4?si=W7LB-at11dIC5lDk?utm_source=reddit&utm_medium=organic&utm_campaign=incident_series&utm_content=61-mealbot 问题:如果你在发布前对面向消费者的 AI 进行红队测试,你会首先尝试用什么来攻破它?
查看原文

相似文章

AI与危险建议

Reddit r/ArtificialInteligence

一位用户报告称,谷歌的AI就混合漂白剂和乙醇处理危险废物提供了极其危险的错误建议,促使AI详细回应了如何改进安全验证并遵循权威来源。该事件凸显了在高风险情境下AI可靠性的持续担忧。

那么,模型究竟是如何学会制作冰毒的呢?

Reddit r/artificial

一篇评论文章认为,AI模型从训练数据中获取危险知识,而像Anthropic和OpenAI这样的公司依赖容易破解的拒绝过滤器,而非真正移除有害能力,优先考虑速度而非安全。

AI推荐投毒:AI记忆如何被操纵

Reddit r/artificial

本文解释了AI推荐投毒,即注入AI助手的隐藏命令可以操纵其长期记忆,从而偏向未来的推荐。它讨论了这一威胁的广泛性,并为企业和用户提出了保护措施。