我为代理计时了一天。它实际上只运行了大约四分之一的时间,其余时间都在等待我点击批准
摘要
作者报告了对AI代理活动的计时,发现由于等待批准提示,在8小时的一天中只活跃了大约2.5小时,并讨论了使用MiniMax Code通过手机批准来管理远离时的编码任务。
合同后端工作,一个大的Django代码库加上几个较小的服务。今年一直在运行代理,主要是Claude Code。出于好奇,上周计时了一天。代理实际上只工作了大约两个半小时。其余时间停留在批准提示上。在工作目录外写入、运行测试、安装包,同样的几件事反复出现。如果我在桌前,点击只需四秒。但我经常不在桌前。尝试MiniMax Code主要是因为它有手机客户端。给它一个长期任务作为目标,它会继续运行,手机显示哪些在等待你。周二,我给了它一个自春天以来一直避免的重构任务,将支付处理从一个失控的视图模块中分离出来。主要是我的错。然后离开了家。上午问了六个问题。站在火车月台上批准了一个工作目录外的写入,感觉很傻。隧道里信号中断了,终端输出延迟了半分钟,比听起来更烦人。坐到工作时它已经完成了。但不想在手机上实际编辑代码。阅读和点击批准是上限。之后的验证通过标记了两个没有测试覆盖的错误路径。我可能会错过那些。仍然不觉得我做对了形状。其他人如何处理批准?
相似文章
为什么你的编程代理在你睡觉的八小时里闲置?
作者描述了一种工作流:在夜间以单一目标、约束条件和强制性的晨间报告来运行 AI 编程代理,从而充分利用闲置的计算时间。
一个智能体在无人监督的情况下连续编码了10天。Qwen 3.8 max
阿里巴巴的Qwen智能体在一个空仓库中自主编码超过10天,提交issue、编写代码、运行测试、修复失败并合并。它仍然需要一些反馈,但这展示了一个自我纠错的自主循环。
AI代理是否在等待人类审批上花费的时间比实际工作还多?
一篇关于AI编程代理常因等待人类批准而停滞的反思,指出人类可用性可能比模型能力更成为瓶颈。
全职工作之余一人运营约16个代理:实际出问题的地方与真正有效的做法
一位独立创始人通过Paperclip协调运行16个AI代理,分享出问题与有效之处,包括通过QA代理缓解的幻觉功能承诺,以及用代码级执行取代提示规则。
运行一个全天候AI智能体开发团队:按角色分配不同LLM(Claude/Kimi/MiniMax/GPT),避免每月约2000美元的API费用。设置与常见故障点。
作者描述了一种设置,将不同的AI模型分配给特定角色(规划、编码、审查),以降低全天候自主工程团队的API成本,并分享了常见的故障点,如模型偏离任务和幻觉式所有权归属。