你真正想训练浏览器代理模型擅长什么?
摘要
本文探讨了训练浏览器代理模型进行顺序决策时的挑战,如错误恢复和记忆问题,并寻求优化训练目标的建议。作者提到了在tinyfish开发的'mako'模型,并邀请社区反馈。
我一直在思考,浏览器代理不完全是“能点击东西的LLMs”,而更像是一个相当奇怪的顺序决策问题。正确完成前几个操作通常已经不那么令人印象深刻了。更困难的部分似乎是:
- 注意到操作静默失败
- 在不重复相同操作8次的情况下恢复
- 记住20步之前的重要信息
- 处理意外的页面状态
- 知道何时回退还是继续前进
- 决定任务何时真正完成
所以,如果你有一个庞大的浏览器代理轨迹数据集,你会优化什么行为?原始的任务成功率似乎很明显,但感觉这忽略了太多东西。两个代理都可能任务失败,但一个在2步后意识到卡住,而另一个先浪费了50个操作。我们一直在tinyfish开发mako(一个专门针对网络代理的模型)时思考这个问题,我很好奇这里的人们真正希望在训练目标/评估中反映出什么。你最希望模型学习的浏览器代理行为是什么,而当前模型在这方面一直表现很差?
相似文章
@sydneyrunkle: 学习如何构建能与浏览器互动的智能体!
学习如何构建能与浏览器互动的AI智能体。
“浏览器代理成本高昂且仍在成熟”这种表述可能忽略了架构方面的问题
讨论了当前使用无头Chrome加AI层的浏览器代理的架构问题,并介绍了Opera Neon的命令行界面作为替代方案,将AI集成到浏览器中,从而降低令牌开销并提高理解能力。
@svpino: 我还没见过在浏览器中运行的智能体不让人觉得是取巧之作。我试过无头浏览器,但无法…
Santiago (@svpino) 讨论了在浏览器中运行AI智能体的挑战,而 @ego_agent 宣布了 'ego lite',一个内核级重建,旨在让AI智能体更快、更可靠。
@qinzytech: https://x.com/qinzytech/status/2066585405479371092
对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。
构建护城河:自我学习型智能体(12分钟阅读)
本文讨论了一种构建自我学习型智能体的方法,通过结合智能体追踪与浏览器内用户活动,利用AG-UI协议捕获并应用学习成果,使产品在使用中不断改进,从而构建商业护城河。