一种构建自动化的新型智能体方法
摘要
一种新工具允许用户屏幕录制自己执行任务;智能体学习该任务并构建确定性脚本以自动化执行,并在脚本出错时进行回退处理。
对于很多个人自动化任务,展示比提示更简单,因为我们已经在自己的浏览器/电脑上执行这些任务了。例如,进行屏幕录制并说:
* 在仪表盘上点击此按钮下载数据,
* 如果数据正常,像这样更新 Google 表格,
* 如果数据缺失,向 WhatsApp 上的这个群组发送消息。
这就是我所构建的。你可以屏幕录制自己执行任务的过程。智能体会观看,确认任务的输入、输出和方法,学会执行任务,并构建一个确定性脚本来完成。这简化了为编码智能体提供正确上下文的过程。这也确保了我们能够提前提供自动化的所有细节,而无需反复提示。智能体会迭代学习如何执行任务。脚本出问题时怎么办?它会回退到智能体。智能体会传递最初学习的上下文和脚本错误日志,以完成任务并在需要时修复脚本。很想知道你的想法。GitHub 链接附在评论中,以及一些我尝试过的示例链接。
相似文章
一直在录制重复性任务,将它们转化为智能体技能。分享这个工具。
一个通过屏幕录制记录重复性任务,并将其编译为符合 agentskills.io 标准的可复用智能体技能的工具,以 MCP 服务器形式发布,支持跨平台使用。
@dabit3: 现在智能体可以行动了,我们需要问:它们何时运行,可以接触什么,工作如何被检查,以及它们获得什么上下文……
作者提出将自动化工程作为一门学科,用于设计触发器、护栏和成功检查,使AI智能体能够安全可靠地运行,无需持续的人类监督。
自动化的未来将是:截图->思考->响应->截图
作者分享了利用 harness engineering 和免费的 NVIDIA NIM 端点构建 AI 代理的个人经验,这些代理能够自动化复杂的多步骤工作流,例如创建 AI 视频系列和酒店预订系统,并建议网络爬虫服务可以被免费的前沿模型取代。
我构建了一个代理,用于记录你的智能体实际执行的所有操作
我构建了Trovis,一个能够记录并解释生产环境中智能体操作的工具,展示与预期行为的偏差。
打造了一个真正操作你电脑的智能体:哪些好用,哪些不行。
作者介绍了 Clark Agent,这是一个能在用户电脑上执行操作(浏览器、邮件、日历、文件)的 AI 智能体,分享了哪些功能好用,以及常见的痛点如验证码和脆弱的长时间工作流。