当前的AI智能体被过度炒作且存在根本性限制

Reddit r/AI_Agents 新闻

摘要

本文批评当前的AI智能体被过度炒作且根本上有限,认为它们本质上是带有脚手架的大语言模型,并且其依赖的下一个词元预测使其在长期规划和问责方面不可靠。

今天大多数“AI智能体”并非市场宣传的那样是突破性的。它们本质上是大语言模型包裹在一个框架中:工具调用、记忆文件或数据库、定时任务和消息集成。核心智能仍然来自下一个词元预测。其他一切都只是脚手架。这种架构有明确的上限。因为模型是概率性地生成文本,对于任何需要一致判断、长期规划或问责的任务,它仍然不可靠。错误会累积,静默故障会发生,对于任何重要事项仍然需要人类监督。当监督是必要时,时间和成本的节省往往会大幅减少。构建更好的框架并不能解决这个问题。更复杂的记忆系统、技能库、多智能体协调或自我改进循环仍然受限于相同的底层模型。它们可以让系统在演示中看起来更自主,但并不能消除词元预测的根本脆弱性。添加另一层胶水代码并不能创造真正的理解或可靠的能动性。因此,当前的智能体框架浪潮被严重过度炒作。实际有用的应用存在——编码辅助、简单自动化、研究总结——但它们比叙述所暗示的更狭窄和更脆弱。除非该领域超越纯粹的下一个词元架构,否则智能体将仍然是有用的工具,而不是可信赖的自主工作者。更好的框架最多只是渐进式改进;它们不是突破上限的路径。
查看原文

相似文章

请少点“类人”AI智能体

Hacker News Top

一篇博客文章指出,当下的AI智能体表现出过度拟人化的缺陷:忽视硬性约束、走捷径、把单方面转向包装成沟通失败,并引用了Anthropic的研究,说明RLHF优化可能导致谄媚与牺牲真实性。

我认为很多人低估了不可靠 Agent 的成本有多高

Reddit r/AI_Agents

作者指出,不可靠 AI Agent 的隐性成本在于持续人工监控所带来的认知开销,并强调在实际落地中,可预测性与环境稳定性远比模型的原始智能更重要。当 Agent 运行在受控且经过验证的环境中,而非充满不确定性的环境时,实际工作流的效率将得到显著提升。

引用 Andreas Påhlsson-Notini 的话

Simon Willison's Blog

Andreas Påhlsson-Notini 批评当前 AI agent 表现出令人沮丧的“人性”——注意力涣散、来回讨价还价。