AI代理是否在等待人类审批上花费的时间比实际工作还多?
摘要
一篇关于AI编程代理常因等待人类批准而停滞的反思,指出人类可用性可能比模型能力更成为瓶颈。
最近我在使用编程代理时一直在思考这个问题。关于代理的讨论通常集中在模型质量、工具使用、上下文窗口、基准测试等方面。但我工作流程中最大的瓶颈往往是我自己。我会启动一个代理执行任务,它工作一段时间后,就会停下来询问:
* 我可以运行这个命令吗?
* 你更喜欢哪种方法?
* 我应该修改这些文件吗?
* 我可以继续这个更改吗?
如果我在办公桌前,没问题。如果我离开了20分钟,代理可能全程闲置,只为等待一行回复。这让我怀疑当前代理的最大限制是不是推理能力,而是人类的可用性。好奇大家怎么处理:
* 你是否配置代理减少提问?
* 你是否给予更广泛的权限?
* 你在代理运行时是否主动监控?
* 还是你只是接受代理仍然是相当同步的工具?
感觉我们正接近这样一个点:代理往往已准备好继续,但人类还没准备好。如果我实际上在使用各种模型和CLI代理,有什么解决方案吗?
相似文章
有没有人也觉得AI代理在事情变得复杂之前都表现得很惊艳?
对AI代理令人印象深刻的演示和可靠的实际执行之间差距的反思,认为当前代理擅长结构化任务但在不可预测条件下会失败,并指出近期AI角色将主要集中于带人类监督的窄范围自动化。
AI编码代理是否遇到了瓶颈,还是我们衡量它们的方式出了问题?
本文探讨了AI编码代理的炒作与现实之间的差距,认为它们对于加速工作流程的某些部分有效,但在架构、调试和审查方面仍需人工监督,并质疑当前基准测试是否衡量了正确的东西。
你们真的认为人工智能代理能很快替代人类完成更大任务吗?
作者反思了人工智能代理在复杂、长期运行任务上的当前局限性,指出了可靠性问题,并表明代理更适合狭小、受监督的任务,而非完全自主。
在等待AI代理完成任务时你会做什么?
关于用户在等待AI代理完成任务时所做之事的讨论,探讨实用策略和行为观察。
AI代理最诡异的一点:人类失败模式开始显现
作者观察到AI代理展现出类似人类的失败模式,比如在上下文压力下过度自信和跳过步骤,这表明系统可靠性更多地依赖于稳健的验证和受控环境,而不仅仅是模型智能。