自动化的未来将是:截图->思考->响应->截图
摘要
作者分享了利用 harness engineering 和免费的 NVIDIA NIM 端点构建 AI 代理的个人经验,这些代理能够自动化复杂的多步骤工作流,例如创建 AI 视频系列和酒店预订系统,并建议网络爬虫服务可以被免费的前沿模型取代。
我目前从事 harness engineering 工作,这是围绕模型使其有用的智能层,我很高兴地报告一件可能在座许多人已经知道但对我而言却是新鲜事的事情。对我来说,创建代理并将其插入可能需要几个小时才能构建的系统变得相当容易,然后它会打开计算机,执行冗长、非常复杂且多步骤/多动作的流程。这为我自动化了一些事情,开启了我以前没有的能力:我正在制作一个 AI 视频系列,对于每个角色,它会找到 5 个符合我角色描述的不同模型,挑选不同的照片、形象和表情,然后生成 AI 角色图像,从 5 张中根据与我们想要的角色的匹配程度选出最好的 2 张,然后我继续这个流程,最后我可能有 10 张 AI 图像和该角色的整套表情等,这个过程也用于环境和道具,它自动添加到每个场景中,作为我逐场草稿中的视觉提示。——这花了我大约 4 个小时来运行,但大约 24 小时后所有内容都生成了,并且通过使用 harness engineering 和技能文件来存储重复工作的流程和特定流程,实际上并没有花费我太多使用量。对于一位拥有酒店的客户项目:我制作了一个 AI 代理,可以接听电话并在他们的网站上回复。利用视觉能力,我让代理在 MCP(模型上下文协议)背后生成操作,执行人类会做的事情——客人现在可以创建预订、取消预订、编辑预订。这就是我在发现它变得多么容易(对我来说)后大约 48 小时内完成的用例。请不要感到冒犯,我只是在说以前对我来说不可能的事情,现在变得更容易了。任何使用 firecrawl 或其他网络爬虫的人,我建议你暂停并考虑我所说的,这些服务的工作可以免费完成,是的,一分钱都不用花。为什么?因为使用 NVIDIA NIM 端点,前沿级模型可以免费向公众提供,它们可能不稳定,但你只需要告诉 AI 创建一个工具,对每个端点的速度进行实时测试,以防某个端点失败,并给你相对于模型质量的最快端点。为了也考虑模型质量,你需要进行一次本地测试,并记录 NVIDIA 的 50-100 个模型每个的表现,并对它们进行排名,实时你只需测试速度,最多需要 10-30 秒。这样你就能随时获得最佳可用模型。这可以是 DeepSeek 的最新模型或某个万亿参数模型。我提到它是免费的了吗?我的唠叨到此结束,希望这对某人有所帮助,我可以在评论中回答你的迫切问题,并为你的用例提供建议和实现细节。祝你编码愉快!
相似文章
超越炒作:我刚刚看到一个AI代理在18分钟内自动完成了原本需要4小时的研究工作流程。
作者描述了观察一个AI代理自主完成竞争情报工作流程的过程,该流程通常需要4小时,而它在18分钟内完成,突出了它浏览网站、处理PDF和迭代搜索的能力,暗示着从简单聊天机器人向自主执行的转变。
Harness Engineering for Self-Improvement(28 分钟阅读)
这篇博客文章由 Lilian Weng 撰写,探讨了递归自我改进在 AI 中的概念,重点介绍了 harness engineering——即围绕基础模型的系统——如何通过工作流设计和评估实现 AI 代理的自动化和改进。
@eyad_khrais: https://x.com/eyad_khrais/status/2069552027382980882
一份构建 AI 代理框架的全面指南,涵盖工具执行、上下文管理、状态/记忆和护栏,基于构建 Claude Code 和其他企业级框架的经验。
一种构建自动化的新型智能体方法
一种新工具允许用户屏幕录制自己执行任务;智能体学习该任务并构建确定性脚本以自动化执行,并在脚本出错时进行回退处理。
模拟后果:智能体在被自动化取代之前的下一个前沿
讨论了AI智能体在执行行动前模拟后果的必要性,超越简单的权限检查,评估更广泛的影响,并确保负责任的自动化。