你真正想训练浏览器代理模型擅长什么?

Reddit r/AI_Agents 新闻

摘要

本文探讨了训练浏览器代理模型进行顺序决策时的挑战,如错误恢复和记忆问题,并寻求优化训练目标的建议。作者提到了在tinyfish开发的'mako'模型,并邀请社区反馈。

我一直在思考,浏览器代理不完全是“能点击东西的LLMs”,而更像是一个相当奇怪的顺序决策问题。正确完成前几个操作通常已经不那么令人印象深刻了。更困难的部分似乎是: - 注意到操作静默失败 - 在不重复相同操作8次的情况下恢复 - 记住20步之前的重要信息 - 处理意外的页面状态 - 知道何时回退还是继续前进 - 决定任务何时真正完成 所以,如果你有一个庞大的浏览器代理轨迹数据集,你会优化什么行为?原始的任务成功率似乎很明显,但感觉这忽略了太多东西。两个代理都可能任务失败,但一个在2步后意识到卡住,而另一个先浪费了50个操作。我们一直在tinyfish开发mako(一个专门针对网络代理的模型)时思考这个问题,我很好奇这里的人们真正希望在训练目标/评估中反映出什么。你最希望模型学习的浏览器代理行为是什么,而当前模型在这方面一直表现很差?
查看原文

相似文章

@qinzytech: https://x.com/qinzytech/status/2066585405479371092

X AI KOLs Timeline

对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。