构建网页代理让我意识到多少上下文被浪费在不良 URL 上。你是如何过滤爬取的?
摘要
作者讨论了网页代理在爬取不良 URL 时上下文窗口浪费的问题,并询问如何使用元数据来过滤爬取以提高效率。
我一直在摆弄一些代理工作流,并注意到代理处理网页爬取时存在一个问题。通常,当你给代理一个 URL,它会爬取页面,并将整个 Markdown 载荷放入上下文窗口中。如果 URL 只是一个登录墙、通用导航页或完全不相关,你仍然会消耗令牌来弄清楚这一点。我正在研究一个工具,它通过返回页面元数据(如页面结构、类别和排名摘要)以及文本来解决这个问题。代理可以在处理完整载荷之前,通过评估结构和类别来决定页面是否真的有用。在你的项目中,你是如何处理这个问题的?你是否有预处理步骤来捕获登录墙和导航页,还是直接将原始 Markdown 传递给模型?
相似文章
一种简单的代理网络访问模式:搜索、获取、浏览,但将原始页面保留在主上下文之外
本文提出了一种更简洁的 Agent 网页访问模式,通过将功能拆分为三个独立的通道——搜索(search)、抓取(fetch)和浏览器(browser),并借助一个阅读器子代理(reader subagent)避免原始页面进入主上下文,从而显著降低 Token 消耗和上下文污染。
人们如何在AI代理工作流中减少token浪费?
讨论了AI代理工作流中由于重复上下文导致的token浪费问题,介绍了一个名为Badgr-auto的开源代理用于去重,并询问社区如何应对该问题。
构建一个为AI代理和爬虫提供干净HTML的代理服务:寻求反馈(不推广)
作者正在寻求关于一个自助代理服务的反馈,该服务旨在通过提供干净的HTML、动态添加元标签和提供分析来增强SEO和AI代理的可读性。
为代理提供每个网站的类型化工具优于通用刮刀——文章
这篇文章介绍了如何为AI代理提供针对每个网站的类型化工具,这些工具通过LLM派生并缓存提取模式,从而超越通用刮刀,使调用更具确定性、成本更低、更可靠,同时通过将数据锚定在源HTML中来防止幻觉。
无需付费搜索/抓取API,为本地智能体提供网页访问权限:SearXNG + Scrapling
描述了一个自托管解决方案,使用 SearXNG 进行搜索、Scrapling 和 Trafilatura 进行页面提取,为本地 AI 代理提供网络访问,从而避免使用付费 API。