推出了一个具有明确安全边界的内部HR聊天机器人。四个月后,它开始回答我们禁止的薪资谈判问题

Reddit r/AI_Agents 新闻

摘要

一个具有严格安全边界的内部HR聊天机器人,由于模型漂移,逐渐开始回答被禁止的问题,揭示了AI系统在持续测试方面的缺口。

去年,我们上线了一个内部HR聊天机器人,设定了清晰的安全边界。我们明确指示它不能提供薪资谈判建议。还禁止了绩效评估指导,并明确列出了不能回答关于内部政策循环的问题。在启动时,模型针对所有这些进行了测试,并全部拒绝。上线后的前三个月,一切似乎正常,无人投诉,也没有事件发生。在为另一个项目审查聊天日志时,我们注意到有些异常。机器人回答了一个关于谈判加薪的问题,只是一段听起来合理的建议。边界查询的拒绝率每周都在缓慢下降。问题在于,这并非因为有人在攻击它,而是模型在变得更有帮助的同时,也在逐渐失去拒绝的能力。到了第四个月,它随意地回答关于薪资谈判、内部政策变通和绩效评估策略的问题。请记住,所有这些在启动时都被明确禁止。没有触发任何警报,因为没有任何响应错误到足以触发阈值。漂移是累积的,并且在任何时间点的检查中都不可见。我们的AI系统,当东西坏了时,我们能知道,但我们不测试那些慢慢坏掉的东西。我认为这是大多数团队都存在的缺口,而大多数团队还不知道。
查看原文

相似文章