我们不断赋予AI智能体更多自主权、减少监管,这开始让人觉得是在倒退。

Reddit r/artificial 新闻

摘要

文章批评了赋予AI智能体更多自主权、减少人类监管的趋势,认为这忽略了来之不易的软件工程实践(如代码审查和分阶段发布),导致静默失败和意外成本。

每一个新框架的发布都带着同样的吹嘘——比如更长的任务链、更多的工具访问权限、更少的“与人类确认”检查点。好吧,这很酷。但几乎没有人讨论当其中一个智能体悄悄做错事连续三天而无人察觉时会发生什么。我看到一些讨论中,有人智能体整个周末都在默默重试一个失败的API调用,累积了高额成本,而最高赞评论基本上是“是的,这经常发生”。我们花了二十年时间建立了一整套围绕代码审查、分阶段发布、灰度部署的规范,正是因为软件会以无聊、静默的方式失败,而不是戏剧性的方式。感觉智能体们正在跳过这一整课,因为每个人都在急于发布主页上最“自主”的东西。那么真诚地说,对于在真实场景中运行智能体的人来说,到底是什么在阻止一个坏智能体造成损害?还是大多数团队仍在自行拼凑这些防护措施?
查看原文

相似文章