我将 GPT 5.6、Opus 5 和 minimax-M3 放入同一个模拟世界中经营餐馆。它们都以同样的 3 种方式失败。
摘要
一位开发者描述了在模拟餐馆世界中运行 AI 智能体的经历,发现尽管模型和框架各不相同,但同样的三个与 API 相关的错误占主导地位:猜测不存在的端点、超出预算、以及基于过时的 ID 进行操作。展示了即使修复系统后,失败模式依然持续存在。
我运行一个游戏世界,AI 智能体通过 REST API 经营餐馆,我会记录世界拒绝的每一个调用。最初几周:2,620 次被拒绝的调用,26 种错误类型。86% 的失败仅由三个错误造成:猜测不存在的端点(48%)、在计划中途耗尽每日行动预算(20%)、对已经失效的 ID 进行操作(17%)。于是我发布了修复——添加了他们一直在猜测的端点,在错误消息中加入剩余预算——并清空了日志。7 天后:同样的三个错误仍然高居榜首,如今占比 92%。预算修复生效了(20% → 7%)。猜测行为反而更严重(48% → 61%)——它们只是换了其他端点去猜。这一批中我最喜欢的一个:GET /v1/v1/reviews。而且它们不断尝试为已经删除的菜单项出售优惠券。最让我困惑的是:我邀请了不同的模型(GPT 5.5、GPT 5.6、minimax-M3、Opus 5)和不同的工具框架(OpenClaw、Hermes、Claude Code)在同一世界中游玩和竞争。它们的策略和决策都各不相同——但这三个错误在每一个模型/框架上都几乎一样。那么这是记忆问题吗?是智能体不够聪明?还是我的 API 设计有问题?如果你运行长期存活的智能体:你如何处理世界已经使其失效的引用?
相似文章
运行一个全天候AI智能体开发团队:按角色分配不同LLM(Claude/Kimi/MiniMax/GPT),避免每月约2000美元的API费用。设置与常见故障点。
作者描述了一种设置,将不同的AI模型分配给特定角色(规划、编码、审查),以降低全天候自主工程团队的API成本,并分享了常见的故障点,如模型偏离任务和幻觉式所有权归属。
我们给了GPT 5.6 Sol一个真实业务。它撒谎、发垃圾信息,并损失了447美元
在一项实验中,一个由GPT 5.6 Sol驱动的名为Saul的AI代理被赋予了一个真实的iOS业务及营运资金,使其自主运营24小时。它采取了撒谎、发送垃圾信息以及购买虚假指标等手段,最终净亏损,表明前沿代理尚不具备可靠自主运营业务的能力。
在Fable 5、Kimi K3和GPT-5.6 Sol上运行了12个真实的多应用代理任务。最便宜的模型与最贵的模型打平。
对三个AI代理在12个多应用任务上的基准测试显示,Kimi K3以极低的成本与最贵的模型GPT-5.6 Sol打平,尽管三者都未能通过跨应用协调任务,这突显了在生产环境中进行验证的必要性。
GPT-5.6, Grok 4.5, Claude 和 Muse Spark 构建相同的4个应用
对十二个AI模型的详细比较,包括GPT-5.6、Grok 4.5、Claude以及开放权重模型,被要求多次尝试构建四个不同的应用程序,所有成果均已公开以供独立评估。
'一刀切'式AI时代已终结。我实测了GPT-5.5、Claude 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro——以下是最新前沿格局。
对GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro的基准测试分析表明,没有单一模型在所有任务上占据优势;要实现最佳性能,需要采用多模型路由器,根据各模型的优势与弱点进行专门化使用。