web-crawling

标签

Cards List
#web-crawling

利用网络数据和大型语言模型量化组织环境行动

arXiv cs.CL ↗ · 2026-09-16 缓存

提出了一种使用网络数据和大型语言模型的可扩展计算框架,以量化组织环境行动,并以美国犹太教堂为例进行了演示,比较了关键词检索、语义检索和直接分类方法。

0 人收藏 0 人点赞
#web-crawling

Data Scout: 用于领域特定预训练语料库的定向网络爬取

arXiv cs.LG ↗ · 2026-09-10 缓存

Data Scout 是一种定向网络爬取方法,它使用 LLM 将主题扩展为查询并筛选内容,与过滤大型存档相比,显著提高了创建领域特定预训练语料库的效率。

0 人收藏 0 人点赞
#web-crawling

关于 Unix 负载平均的一些(大多是历史性的)问题

Lobsters Hottest ↗ · 2026-09-10 缓存

本文详细介绍了博客作者为阻止旧浏览器以减少来自恶意爬虫的负载(可能用于 LLM 训练)所采取的措施,并讨论了 Inoreader 和 Feedly 等阅读器以及 Vivaldi 浏览器和存档服务的特定问题。

0 人收藏 0 人点赞
#web-crawling

LinkedIn对GPTBot和ClaudeBot返回HTTP 999,但对OAI-SearchBot返回HTTP 200。我测量了200响应里的内容。

Reddit r/artificial ↗ · 2026-09-01

LinkedIn屏蔽了GPTBot和ClaudeBot等AI爬虫,但允许OAI-SearchBot等搜索索引机器人访问,提供的有限个人资料数据省略了职位和工作经历日期等关键信息。

0 人收藏 0 人点赞
#web-crawling

@TheAhmadOsman: 专业提示:RSS 源又回来了顺便说一下,现在用代理将任何 API 或 Web 应用转换为 RSS 源非常容易。给 GLM 5.3 Flash…

X AI KOLs Timeline ↗ · 2026-08-30 缓存

一条专业提示:利用如 GLM 5.3 Flash 这样的 AI 代理,通过爬取、映射端点和构建自定义仪表板,轻松将任何 API 或 Web 应用转换为 RSS 源。

0 人收藏 0 人点赞
#web-crawling

@tom_doerr: 爬取网站以将提取的网页内容转换为适用于大语言模型(LLM)的数据结构。 https://github.com/watercrawl/WaterC…

X AI KOLs Timeline ↗ · 2026-08-27 缓存

WaterCrawl是一个开源Web应用,它爬取网站以将提取的内容转换为适用于大语言模型(LLM)的数据结构,使用Python、Django、Scrapy和Celery构建。

0 人收藏 0 人点赞
#web-crawling

@binghe: 爬虫界的赛博菩萨:Crawl4ai 免费,给 AI 用的爬虫工具。78.9k 免费:无需注册、无需密钥、不按页计费,可替代每月 16 美元的付费爬虫。 专为 AI 打造:可将任意复杂网页一键提纯为 Markdown 格式,直接喂给大模型,…

X AI KOLs Timeline ↗ · 2026-08-21 缓存

Crawl4ai 是一个免费的、为 AI 设计的爬虫工具,可将网页内容转换为 Markdown 格式,适合 RAG 和 Agent 开发。

0 人收藏 0 人点赞
#web-crawling

@WilliamBryk:Exa 现已成为全球最大的索引之一。我们服务 800 亿页面,跟踪 1.4 万亿 URL,并有望达到 Google 规模…

X AI KOLs Following ↗ · 2026-08-03 缓存

Exa 宣布其服务 800 亿个页面并跟踪 1.4 万亿个 URL,将自己定位为最大的网络索引之一,并计划在 2027 年初达到 Google 规模。

0 人收藏 0 人点赞
#web-crawling

大多数Googlebot都是假的

Lobsters Hottest ↗ · 2026-07-27 缓存

文章指出,很多声称自己是Googlebot的机器人实际上是假的,它们冒充其用户代理以绕过机器人控制,并提供了如何验证合法Googlebot流量的指导。

0 人收藏 0 人点赞
#web-crawling

假设你正在构建一个基于整个网站训练的RAG聊天机器人。你将如何爬取整个网站

Reddit r/AI_Agents ↗ · 2026-06-28

关于如何爬取整个网站以训练RAG聊天机器人的讨论,涵盖策略与挑战。

0 人收藏 0 人点赞
#web-crawling

每个 AI 智能体抓取网站的方式截然不同。以下是 3 个月、1100 万事件日志显示的真实情况。

Reddit r/AI_Agents ↗ · 2026-06-10

对 34 个网站上 1100 万爬虫日志的分析揭示了不同行为:GPTBot 无视 robots.txt 持续抓取;Google 的爬虫频繁检查规则;ClaudeBot 的抓取速度正在快速提升;Bytespider 是最重的爬虫。这些发现表明,SEO 正从以 Google 为中心转向针对 AI 智能体的页面选择进行优化。

0 人收藏 0 人点赞
#web-crawling

Kuri – 基于 Zig 的 agent-browser 替代方案

Hacker News Top ↗ · 2026-04-22 缓存

Kuri 是一款面向 AI 智能体的 Zig 浏览器自动化工具包,仅 464 KB 二进制,冷启动约 3 ms,每个工作流循环的 token 使用量比 agent-browser 低 16%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈