模型安全风险(提取、投毒)在生产中是否真的被测试?[R]

Reddit r/MachineLearning 新闻

摘要

讨论关于 ML 团队是否真的在生产中测试模型安全风险(如提取和投毒),并指出模型的安全审查落后于常规软件。

我与很多部署模型但在部署前跳过对抗性测试的 ML 团队交流过。感觉模型的安全审查远远落后于常规软件。有人在实际工作中这样做吗?
查看原文

相似文章

数据投毒与RAG操纵

Reddit r/ArtificialInteligence

讨论数据投毒和RAG操纵如何对AI系统构成无声而危险的威胁,认为安全防护必须超越输入过滤,延伸到记忆、数据管道和多智能体逻辑。

“安全AI”是什么样的?[D]

Reddit r/MachineLearning

作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。

关于语言模型安全性和滥用的经验教训

OpenAI Blog

OpenAI 分享了在语言模型安全性和滥用方面吸取的经验教训,讨论了衡量风险的挑战、现有基准的局限性,以及他们开发的新型毒性和政策违规评估指标。该文章还强调了对劳动力市场影响的担忧,以及继续研究大规模AI部署社会影响测量的必要性。