不使用智能体循环,将浏览器智能体成本降低50倍。先规划后执行 + 数据。

Reddit r/AI_Agents 新闻

摘要

描述了一种通过单次规划调用后确定性执行来降低浏览器智能体任务中LLM成本的技术,与标准智能体循环相比,实现了50倍的成本降低。

我一直在为AI智能体构建一个浏览器自动化层(例如:注册SaaS、填写表单、获取OTP、点击验证链接)。默认方案是 browser-use / Stagehand 模式:将页面交给LLM,让它选择下一步操作,重复执行。标准的智能体循环。我观察到的数据: - 每个任务20到50次LLM调用 - 按Claude Sonnet 4.6价格每任务0.50到3.00美元 - 一半的运行中途偏离任务 没有人明说的一点是:大多数智能体浏览器目标是线性的。"去 notion.so,用这个邮箱注册,粘贴OTP。" LLM 很擅长一次性规划出这个方案。但它极不擅长在每一步重新推导。 所以我反转了做法: 1. 一次Anthropic Messages调用:将目标转为JSON步骤列表 2. 执行器针对Steel Chromium确定性运行每一步 3. 执行期间零LLM调用 步骤词汇表包含10个动词:navigate, click, fill, wait_seconds, wait_for_text, extract_text, wait_for_email, use_otp_from_inbox, open_link_from_inbox, done 最后三个很有意思。它们在同一个运行时中从绑定的收件箱读取,因此拥有邮件的智能体与驱动浏览器的智能体是同一个。无需中间粘合代码。 切换后的数据: - 每个任务1次LLM调用 - 每个任务0.01到0.05美元 - 偏离失败大大减少(执行器在元素缺失时会抛出异常,而不是胡编乱造) 权衡:如果页面在流程中发生变化,运行会终止,而不是重新规划。对于脆弱的长周期目标,你仍然需要步骤级循环。但对于大多数智能体工作(注册、验证、填写表单、导航),廉价版本胜出一个数量级。 如果有人在从事类似工作,我很乐意讲解规划器提示和步骤JSON模式。你们用过哪些有效的模式?
查看原文

相似文章

Agent Execution Tax:浏览器代理基准测试的新衡量指标

Reddit r/LocalLLaMA

Fireworks AI 和 Notte 在运行了四个 LLM 的 720 个浏览器代理任务后,引入了 'Agent Execution Tax' 指标,发现执行可靠性——而非智能——是智能体 AI 的主要瓶颈,其中一个模型在格式错误的 JSON 上浪费了 22.9% 的推理调用。

@SunNeverSetsX: 分享我珍藏的 4 个让 Agent Loop 跑得更快、更好的基础设施,一定要让你的 Agent 用上! 1. http://agent-browser.dev 让 Agent 在真实浏览器里点击、验证 UI 变更,实现真正的自闭环测试 …

X AI KOLs Timeline

agent-browser is a CLI tool for browser automation designed for AI agents, using compact text output and ref-based element selection to minimize token usage. The post also highlights three other tools—portless, emulate, and ai-cli—for improving agent loop efficiency.