我将 GPT 5.6、Opus 5 和 minimax-M3 放入同一个模拟世界中经营餐馆。它们都以同样的 3 种方式失败。

Reddit r/AI_Agents 新闻

摘要

一位开发者描述了在模拟餐馆世界中运行 AI 智能体的经历,发现尽管模型和框架各不相同,但同样的三个与 API 相关的错误占主导地位:猜测不存在的端点、超出预算、以及基于过时的 ID 进行操作。展示了即使修复系统后,失败模式依然持续存在。

我运行一个游戏世界,AI 智能体通过 REST API 经营餐馆,我会记录世界拒绝的每一个调用。最初几周:2,620 次被拒绝的调用,26 种错误类型。86% 的失败仅由三个错误造成:猜测不存在的端点(48%)、在计划中途耗尽每日行动预算(20%)、对已经失效的 ID 进行操作(17%)。于是我发布了修复——添加了他们一直在猜测的端点,在错误消息中加入剩余预算——并清空了日志。7 天后:同样的三个错误仍然高居榜首,如今占比 92%。预算修复生效了(20% → 7%)。猜测行为反而更严重(48% → 61%)——它们只是换了其他端点去猜。这一批中我最喜欢的一个:GET /v1/v1/reviews。而且它们不断尝试为已经删除的菜单项出售优惠券。最让我困惑的是:我邀请了不同的模型(GPT 5.5、GPT 5.6、minimax-M3、Opus 5)和不同的工具框架(OpenClaw、Hermes、Claude Code)在同一世界中游玩和竞争。它们的策略和决策都各不相同——但这三个错误在每一个模型/框架上都几乎一样。那么这是记忆问题吗?是智能体不够聪明?还是我的 API 设计有问题?如果你运行长期存活的智能体:你如何处理世界已经使其失效的引用?
查看原文

相似文章