构建网页代理让我意识到多少上下文被浪费在不良 URL 上。你是如何过滤爬取的?

Reddit r/AI_Agents 新闻

摘要

作者讨论了网页代理在爬取不良 URL 时上下文窗口浪费的问题,并询问如何使用元数据来过滤爬取以提高效率。

我一直在摆弄一些代理工作流,并注意到代理处理网页爬取时存在一个问题。通常,当你给代理一个 URL,它会爬取页面,并将整个 Markdown 载荷放入上下文窗口中。如果 URL 只是一个登录墙、通用导航页或完全不相关,你仍然会消耗令牌来弄清楚这一点。我正在研究一个工具,它通过返回页面元数据(如页面结构、类别和排名摘要)以及文本来解决这个问题。代理可以在处理完整载荷之前,通过评估结构和类别来决定页面是否真的有用。在你的项目中,你是如何处理这个问题的?你是否有预处理步骤来捕获登录墙和导航页,还是直接将原始 Markdown 传递给模型?
查看原文

相似文章