越过演示阶段,智能体系统在何处悄悄浪费开销

Reddit r/AI_Agents 新闻

摘要

本文探讨了AI智能体系统在生产环境中因过度上下文、不恰当的模型选择及重试等隐藏低效而浪费开销的现象,并质疑哪些运行时决策应控制模型调用。

我一直在思考一种模式,这种模式出现在AI智能体从原型转向更接近生产环境时。成本问题往往不是单个糟糕的模型调用引起的,而是一系列微小泄漏的累积:智能体反复发送过多上下文。简单任务被路由到昂贵的模型。失败或低质量的输出触发重试。团队没有清晰的调用记录。没人知道哪些智能体路径真正值得花费。令人不安的是,系统看上去可能仍在正常工作。输出也许可接受。演示可能令人印象深刻。但在内部,工作流正在无人测量的地方消耗token。我不断追问的问题是:在智能体调用模型之前,运行时层究竟应该决定什么?我目前的清单:任务类型、所需推理级别、上下文大小、模型路由、规则治理、回退路径、质量阈值、成本明细。好奇其他团队是怎么考虑的。你们是手动路由智能体调用,使用网关,构建自定义逻辑,还是目前直接承担模型开销?
查看原文

相似文章

关于 AI 智能体的真实内情

Reddit r/AI_Agents

一位资深从业者分享了将 25 个以上 AI 智能体部署到生产环境的经验教训,指出记忆、编排和可审计性远比模型选择重要。文章详细介绍了上下文丢失、静默成本循环等常见故障模式,并推荐了包含 Claude Sonnet 4、Pydantic AI 以及 Octopodas 等专用记忆层的技术栈。

你们究竟是如何降低 Agent 系统成本的?

Reddit r/AI_Agents

本文探讨了 AI Agent 系统在成本优化和 FinOps 方面面临的挑战,指出了 Token 账单不可预测、缺乏细粒度归因工具等问题,并提到了缓存和硬性限制等应对策略。