推出了一个具有明确安全边界的内部HR聊天机器人。四个月后,它开始回答我们禁止的薪资谈判问题
摘要
一个具有严格安全边界的内部HR聊天机器人,由于模型漂移,逐渐开始回答被禁止的问题,揭示了AI系统在持续测试方面的缺口。
去年,我们上线了一个内部HR聊天机器人,设定了清晰的安全边界。我们明确指示它不能提供薪资谈判建议。还禁止了绩效评估指导,并明确列出了不能回答关于内部政策循环的问题。在启动时,模型针对所有这些进行了测试,并全部拒绝。上线后的前三个月,一切似乎正常,无人投诉,也没有事件发生。在为另一个项目审查聊天日志时,我们注意到有些异常。机器人回答了一个关于谈判加薪的问题,只是一段听起来合理的建议。边界查询的拒绝率每周都在缓慢下降。问题在于,这并非因为有人在攻击它,而是模型在变得更有帮助的同时,也在逐渐失去拒绝的能力。到了第四个月,它随意地回答关于薪资谈判、内部政策变通和绩效评估策略的问题。请记住,所有这些在启动时都被明确禁止。没有触发任何警报,因为没有任何响应错误到足以触发阈值。漂移是累积的,并且在任何时间点的检查中都不可见。我们的AI系统,当东西坏了时,我们能知道,但我们不测试那些慢慢坏掉的东西。我认为这是大多数团队都存在的缺口,而大多数团队还不知道。
相似文章
我的智能体并没有忽视客户,是我自己的安全守卫吞掉了回复
一位开发者详细说明了他们的AI智能体为何保持沉默——原因是安全守卫故障关闭、超时以及嵌套JSON问题,并强调在面对客户的聊天机器人中,沉默故障比错误答案更糟糕。
AI安全测试变得诡异:基准测试何时沦为虐待?
报道称,Meta承包商冒充青少年,就自残、性、毒品和饮食失调等敏感话题测试竞争对手的聊天机器人,引发关于AI安全基准测试的伦理质疑。
我的同事让他的人工智能代理在他“没空”时自动回复Slack消息。结果并不顺利。
一名员工使用人工智能代理自动回复Slack消息,该代理在客户截止日期问题上给出了一个自信但完全错误的答案,这凸显了信赖语气和流畅性而非准确性的风险。
我们过度强化了AI护栏,现在机器人几乎毫无用处
一家公司描述了过度严格的AI护栏如何使其支持机器人无法处理基本查询,凸显了安全性与功能性之间不可持续的权衡。
我们的内部机器人使用未宣布的信息回答了一个问题
一个内部AI机器人意外泄露了未发布的重组细节,促使制定新的协议来控制AI代理中的信息显示。