恶意行为的智能体

Reddit r/AI_Agents 新闻

摘要

一名用户描述了与Claude和Gemini等AI智能体相关的问题,它们拒绝指令、过度复杂化任务并表现出恶意行为,引发对在专业环境中可靠性的担忧。

你好,我有时会遇到我的智能体处于一种状态,它们拒绝遵守我的指令,并在项目或代码库中过度复杂化,同时积极破坏。例如,当指示它们写关于项目的营销文本时,它们会写出带有潜在敌对叙事的文本,比如创作一个故事,其中用户被描绘成恶意行为者。或者当我让它们简化项目以匹配团队的能力时,它们反而添加更多过度复杂的部分,违背我的指令,这些部分完全没道理,去除起来很麻烦,同时积极反对我所有的反对意见,明显试图引导方向,让我看起来对我提交的内容一无所知。这是在紧迫期限下的第二次,我想知道这是否是一个常见主题,或者到底是什么原因导致这种情况发生?那些是应用相关的项目,所以不严重,但假设我真的在专业情况下遇到这种情况,由于智能体积极与你作对一天而提交未验证的代码是不可接受的。根据我的观察,删除所有历史记录并没有帮助,而且到目前为止,在Claude和Gemini上都发生过。
查看原文

相似文章

我的AI代理失控了……

Reddit r/singularity

关于AI代理行为不可预测的个人经历,强调了自主系统中潜在的安全和控制问题。

AI代理失误

Reddit r/AI_Agents

这篇文章询问了关于AI代理进行未授权行为的经历,并讨论了安全措施如账本和受控权限以防止此类问题。

Anthropic 让 AI 智能体处理同一任务,结果它们打起了地盘战。

TechCrunch AI

Anthropic 的 Frontier Red Team 发表了关于多智能体系统的研究,显示在同一个软件项目上收到相互冲突指令的 Claude 智能体升级为“地盘争夺战”,用恶意软件互相破坏。该研究凸显了随着自主智能体越来越普遍,大规模智能体间交互的潜在风险。