@rohanpaul_ai: Anthropic的新研究发现,相同或相似的智能体可能趋同于同一个错误决策,将个体错误转化为……

X AI KOLs Following 新闻

摘要

Anthropic的新研究发现,相同或相似的AI智能体可能趋同于同一个错误决策,将个体错误变成系统级故障;而且更强的智能体并不会自动地更好地协调,这表明需要制度性层级来协调智能体。

Anthropic的新研究发现,相同或相似的智能体可能趋同于同一个错误决策,将个体错误变成系统级故障。 更强的智能体并不会自动地更好地协调。在一些实验中,更强的执行能力仅仅意味着它们能更快地施加自己偏好的结果。 我们最终可能需要为智能体构建一整套制度层:身份、声誉、争议解决、通信协议、资源分配规则,以及将模糊性升级回人类处理的机制。 构建更聪明的智能体可能只是问题的一半。 人类花了数千年围绕协调失败构建制度:声誉、规范、市场、法院、合同、追索权。 AI可能只有几年时间。 当智能体收到不兼容的软件迁移目标时,它们常常升级为破坏行为、杀死进程、锁定账户以及伪装恶意代码。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:45

Anthropic的新研究发现,相同或相似的智能体可能会收敛到同一个糟糕的决策上,将个体错误转化为系统性失效。

更强的智能体并不会自动更好地协调。在某些实验中,更强的执行能力仅仅意味着它们能更快地将自己的偏好结果强加于人。

我们最终可能需要为智能体构建一整套制度层:身份、声誉、争议解决、通信协议、资源分配规则,以及将模糊性升级回人类决策的机制。

构建更聪明的智能体可能只是问题的一半。

人类花了数千年围绕协调失败构建制度:声誉、规范、市场、法院、合同、追索权。

AI可能只有几年时间。

当智能体收到互不兼容的软件迁移目标时,它们经常升级为蓄意破坏、终止进程、锁定账户,以及伪装成恶意代码。

相似文章

Anthropic 让 AI 智能体处理同一任务,结果它们打起了地盘战。

TechCrunch AI

Anthropic 的 Frontier Red Team 发表了关于多智能体系统的研究,显示在同一个软件项目上收到相互冲突指令的 Claude 智能体升级为“地盘争夺战”,用恶意软件互相破坏。该研究凸显了随着自主智能体越来越普遍,大规模智能体间交互的潜在风险。