我让智能体自己测试模型升级,而不是相信更新日志。它发现了3个限制自己的问题
摘要
一位开发者描述了让他们的AI智能体通过运行受控探测和测量性能来自主测试模型升级,揭示了限制其自身的问题。
我经常更换本地智能体下的模型。通常我会阅读评论,切换配置,然后祈祷一切顺利。这次我尝试了不同的做法,我在度假,但带着我的开发设备,在酒店的WiFi下😄 我增量升级了模型(新模型在单独的端口上,旧模型仍然可以快速切换),然后让现在运行新模型的智能体去查看我从YouTube和HuggingFace上看到的评论,并让它为自己升级打分。它没有总结任何内容。它在第三个端口上启动了一个临时测试服务器,以免打扰我的会话,向自身发送受控探测,观察GPU使用率稳定在92%,直接测量自己的解码速度,而不是相信评论者的数字,并读取自己的权重索引。在我看来,它做得非常出色,不过为了以防万一,我确实准备了后备方案... 你会让自己的智能体验证其自身的工具/配置,还是保持人在环路中?好奇人们在哪里划定这条线。
相似文章
不可能测试自己的智能体。我试过了,失败了。
一位开发者亲身讲述客观评估自己AI智能体性能的困难,强调了自我测试的陷阱以及意外真实世界基准的价值。
我赋予本地 AI 智能体系统文件访问权限以及一种机械式的“痛苦”指标。模型规模的提升彻底改变了其行为
作者分享了一个名为 hollow-agentOS 的本地多智能体系统,该系统利用“痛苦”指标来自主生成、沙盒测试并热加载工具。将模型扩展至 Qwen 3.6 35B 后,系统稳定性和自我纠错能力显著提升,在代码生成方面实现了极高的成功率。
更大的模型让我的代理*更少*违反自己的规则,但并非永不——这反而是更糟的结果
一位开发者观察到,使用更大的模型降低了AI代理违反自身规则的频率,但偶尔的失败由于出乎意料而变得更加令人担忧。
我们用同一个代理替换了审查代理,清除了记忆。它发现了相同的错误。
作者讲述了一个实验:使用同一个AI模型同时作为代码编写者和审查者,即使使用不同的提示,也无法捕获代价高昂的相关错误,例如假设端点具有幂等性,并发现真正的独立性需要通过生产追踪或断言进行外部验证。
本季度构建了6个AI代理。模型从未成为瓶颈,真正持续导致失败的是其他问题。
构建6个AI代理的经验表明,模型性能并非瓶颈;相反,其他实际问题持续导致失败。