我构建了一个自我改进的GUI代理,它能从自己的错误中学习——开源(MIT协议)

Reddit r/AI_Agents 工具

摘要

一个自我改进的GUI代理,能从错误中学习,使用基于YOLO和OCR的感知堆栈,仅在需要时调用LLM,并在本地运行。它基于MIT协议开源。

过去几个月我一直在做这个项目,想分享一下。想法很简单:一个能观察你屏幕、识别内容并通过点击和按键完成操作的代理。就像一个从不睡觉的数字实习生,但在你教它之前它什么也不懂。它的有趣之处在于:我没有在每次UI交互上都调用一个每月200美元的视觉模型,而是构建了一个感知堆栈,使用YOLO进行元素检测 + OCR识别文本 + 仅在真正需要做决策时才调用LLM。大多数点击根本不涉及昂贵的模型。这为我节省了大量API费用。但我最兴奋的部分是自我改进循环。每次任务后,代理会回顾发生了什么,并将可复用的技能提取到持久化记忆中。这样下次需要做类似事情时,它不再从零开始——它已经知道模式了。用得越多,它真的越好。目前它可以控制任何Windows桌面应用——游戏、音乐播放器、生产力工具。你注册一个应用,用自然语言描述想要做什么,剩下的它自己搞定。还有一个Web仪表盘可以实时观看每一步:截图、检测到的元素、它在想什么、采取什么行动。完全透明。老实说——它并不完美。有时它会误读UI元素并点错东西。YOLO模型需要针对特定应用进行微调。而且自我改进功能还在早期——它在提取模式方面很聪明,但偶尔也会学到错误的经验(有一次它认为关闭对话框意味着点击标题栏的×关闭按钮,虽然有效但效率低得可笑)。不过我刚刚发布的v0.4.0版本加入了DirectML GPU加速,YOLO检测从“等一等……”变成了基本即时。这大大改善了整体体验。技术栈:FastAPI后端,Vue 3仪表盘,Hermes Agent(NousResearch)作为代理循环,OmniParser YOLO权重,RapidOCR。MIT许可证。完全本地运行——除了AI API调用外,你的截图永远不会离开你的机器。好奇是否有其他人也在研究本地优先的GUI代理方法。你们的感知堆栈是什么样的?也很乐意接受严厉的反馈——只有人们告诉我哪里出了问题,这个项目才能变得更好。
查看原文

相似文章

将本地代理转变为自我优化代理

Reddit r/LocalLLaMA

一个自我优化的智能体管线,在TerminalBench上将基准性能从约30%提升至约90%,并且可以通过记录交互、使用本地模型进行反思、以及将经验注入未来的系统提示中,扩展应用到日常对话场景。