AI代理在生产环境中目前能做什么?分享三个月来有效和失效的经验

Reddit r/ArtificialInteligence 新闻

摘要

在3个SaaS产品中运行AI代理3个月后,作者分享了哪些有效(GitHub MCP、Postgres MCP、Playwright MCP)以及哪些失效(长任务、认证壁垒、成本飙升、多工具编排错误),月成本约430美元。

我尝试了大约6个功能,它们运行良好,足以保留在生产环境中;另外4个则出现了故障或遇到了我无法解决的硬性限制。我已在3个SaaS产品中运行AI代理(主要是Claude Opus 4.7,上个月迁移到4.8,也用了部分GPT-5.5作对比)持续3个月。宏观来看:Gartner预测到2026年底,40%的企业应用将嵌入AI代理,而去年这一比例不到5%;MCP SDK月下载量已达9700万次——采用率确实在上升,但生产环境比演示版要混乱得多。 有效部分: - GitHub MCP用于PR分类和代码审查,每周节省约8-10小时:代理读取差异、标记问题、草拟审查评论,由我批准。 - Postgres MCP用于只读数据库查询,每周处理约30个支持工单,无需我亲自处理:Claude写SQL,我批准后自动回复。 - Playwright MCP用于关键流程的QA测试,上个月发现了4个本可能发布的回归问题。 - Context7提供实时文档,阻止了Claude对库API的幻觉,这本身就已值回成本。 - 通过MCP进行社交媒体排程也已上线:PostFast从Claude跨平台发布,支持11个平台(包括Google Business Profile),每月10欧元,MCP与Claude和ChatGPT兼容;Metricool(每月22美元)处理分析(因为PostFast的分析功能较弱)。两者合计每周节省约5小时手动排程时间。缺点:PostFast社区小,边缘情况文档不足;Metricool没有n8n节点,只能从Claude直接驱动。 失效部分: - 超过15分钟的长期运行代理任务始终不可靠——它们会丢失上下文或在运行中达到速率限制。 - 任何涉及认证墙后浏览器会话的任务(如LinkedIn抓取、某些SaaS登录)都会频繁崩溃:Playwright无法良好保持会话状态。 - Claude Opus的成本飙升是真实的:第一个月API账单在某一周因让代理无监督执行研究任务而达到340美元。解决方法:积极使用提示缓存(将缓存输入减少90%),并将研究工作默认切换为Sonnet 4.6(每百万tokens 3/15美元),而非Opus 4.8(每百万tokens 5/25美元)。 - 同时编排5个以上MCP的多工具协作时,代理大约有20%的概率选错工具。 - 通过任何MCP排程工具发布TikTok仍然半失效——因为TikTok的API限制,PostFast、Blotato和Postiz都遇到同样的障碍。 安全性是大家谈论不够的部分。提示注入是OWASP 2026年LLM漏洞排名第一的问题。近期审计发现,41%的公共MCP服务器根本没有认证,只有8.5%使用OAuth;今年早些时候,仅60天内就出现了30多个MCP相关的CVE。建议坚持使用供应商维护的服务器(GitHub、Anthropic参考实现、官方Metricool、官方PostFast),不要随意安装Glama 22K+目录中的随机服务器。 优化后的月成本:Claude Max 5x计划200美元 + Sonnet超量API约150美元 + PostFast 10欧元 + Metricool 22美元 + 托管50美元 ≈ 每月430美元。比兼职员工便宜,但仍需监督——所以它是辅助而非替代。Anthropic自己的Claude Code数据表明,典型开发者月费150-250美元,重度用户500-2000美元,我的支出符合这个区间。 你有哪些成功部署的生产案例是我可能错过的?尤其对多工具代理编排的成功经验感兴趣,因为我在这方面一直碰壁。
查看原文

相似文章