web-scraping

标签

Cards List
#web-scraping

智能体护照?

Reddit r/AI_Agents ↗ · 8小时前

本文讨论了互联网需要允许良好机器人访问的演变需求,以一个AI代理被网站阻止为例,并询问该领域的当前发展情况。

0 人收藏 0 人点赞
#web-scraping

@JenovaAIAgent: Newsletter Generator 是一款 AI 代理,帮助您通过一次性规划标题、来源、风格和章节,来发布专业的新闻通讯,并能随时按指令生成精美版本 ✉️

X AI KOLs Following ↗ · 2天前 缓存

Newsletter Generator 是一款 AI 代理,它能通过规划标题、来源和章节,实现专业新闻通讯的自动化创建,随后可按指令生成风格统一、准时交付的精美版本。

0 人收藏 0 人点赞
#web-scraping

我构建了一个潜在客户研究管道,并刻意未使用AI代理。

Reddit r/AI_Agents ↗ · 2天前

作者使用n8n和AI工具构建了一个潜在客户研究管道,为确保可预测性而刻意避免使用AI代理,并邀请对设计的反馈。

0 人收藏 0 人点赞
#web-scraping

当您将网页抓取作为服务销售时,您实际交付给客户的是什么?

Reddit r/AI_Agents ↗ · 4天前

作者讨论了提供房地产网页抓取服务的挑战,分享了客户会议中关于数据交接和准确性的见解,并寻求社区的建议。

0 人收藏 0 人点赞
#web-scraping

@vista8: VPS抓取信息无法绕过Cloudflare,GPT5.6 sol拒绝帮助。切换到Zhipu GLM 5.3 Flash。发现th…

X AI KOLs Timeline ↗ · 4天前 缓存

一位用户使用Zhipu GLM 5.3 Flash和curl_cffi绕过Cloudflare封锁,以在JoMu RSS阅读器中启用YouTube视频摘要。

0 人收藏 0 人点赞
#web-scraping

@svpino: 每个人都在阻止代理访问内容。浏览器指纹、付费墙、验证码——名单不胜枚举。B…

X AI KOLs Timeline ↗ · 2026-09-17 缓存

这条推文讨论了绕过内容封锁器的方法,如浏览器指纹、付费墙和验证码,并提供了一个便捷访问指南的链接。

0 人收藏 0 人点赞
#web-scraping

shot-scraper 1.12

Simon Willison's Blog ↗ · 2026-09-13 缓存

shot-scraper 1.12 版本新增 WebP 格式的截图支持,大幅减小文件大小,并提供质量设置选项。

0 人收藏 0 人点赞
#web-scraping

@gregpr07: https://x.com/gregpr07/status/2099188090913120278

X AI KOLs Timeline ↗ · 2026-09-13 缓存

本文解释了无头浏览器、其在自动化方面的优势,以及AI浏览器代理对它们日益增长的采用,并与有头浏览器进行了比较。

0 人收藏 0 人点赞
#web-scraping

@realfxw: 做 Agent 最头疼的往往不是模型逻辑,而是让它联网“拿数据”——反爬、登录鉴权、频率限制,折腾半天全卡在接口上。 推荐关注开源项目 Agent-Reach,相当于直接给 AI Agent 装上了一副全网“采集外骨骼”: 整合成熟生态:…

X AI KOLs Timeline ↗ · 2026-09-13 缓存

Agent-Reach 是一个开源项目,为 AI Agent 提供一键式网络数据采集能力,整合多种工具以解决反爬和认证等问题。

0 人收藏 0 人点赞
#web-scraping

@RoundtableSpace: Maigret 仅用一个用户名就能为任何人建立完整档案——无需 API 密钥即可跨数百个网站交叉引用账户…

X AI KOLs Timeline ↗ · 2026-09-13 缓存

Maigret 是一个开源工具,能够在无需 API 密钥的情况下,通过跨数百个网站交叉引用用户名,为个人建立详尽的档案。它已大受欢迎,下载量超过 100 万次,并广泛应用于开源情报(OSINT)领域。

0 人收藏 0 人点赞
#web-scraping

让smolagents在无需浏览器堆栈的情况下处理受保护和JS渲染页面

Reddit r/ArtificialInteligence ↗ · 2026-09-10

作者描述了使用如ZenRows等服务的自定义抓取工具替换smolagents内置的VisitWebpageTool,以处理受保护和JS渲染的网页,从而在无需浏览器堆栈的情况下改善AI代理的网络数据访问。

0 人收藏 0 人点赞
#web-scraping

从TikTok抓取的45亿帖子

Hacker News Top ↗ · 2026-09-03 缓存

本文提供了抓取TikTok私人移动API的技术指南,产生了一个包含45亿视频的庞大数据集,该数据集已上传至Hugging Face供公众访问。

0 人收藏 0 人点赞
#web-scraping

诡异爬虫

Lobsters Hottest ↗ · 2026-08-29 缓存

AI爬虫通过低效抓取git提交以获取训练数据,导致kernel.org的CPU负载显著增加,其消耗的资源超过了所有合法访问的总和。

0 人收藏 0 人点赞
#web-scraping

@RoundtableSpace:Firecrawl 刚刚推出了一个免费无密钥版本,让AI代理能够在不到3秒内搜索并抓取任何页面为干净的Markdown格式

X AI KOLs Timeline ↗ · 2026-08-28 缓存

Firecrawl 推出了一个免费无密钥版本,允许AI代理快速将网页抓取为干净的Markdown格式,搜索准确率达94.7%,无需注册。

0 人收藏 0 人点赞
#web-scraping

@tom_doerr:使用四种独立的提取方法,包括JSON-LD、网站特定爬取……监控任何网站的产品价格。

X AI KOLs Timeline ↗ · 2026-08-27 缓存

PriceGhost 是一个自托管的价格追踪应用,使用四种独立的提取方法,包括JSON-LD、网站特定爬取、CSS选择器和AI分析,监控任何网站的产品价格,并提供用户控制的价格选择功能。

0 人收藏 0 人点赞
#web-scraping

@RoundtableSpace: 七位Claude代理在MacBook上扫描Google Maps、构建登陆页面模型、渲染视频并发送冷消息前…

X AI KOLs Timeline ↗ · 2026-08-27 缓存

七位Claude AI代理在MacBook上自动化任务,如扫描Google Maps、构建登陆页面模型、渲染视频和发送冷消息,每月生成$18,800的收入,API成本仅$480,无需团队或办公室。

0 人收藏 0 人点赞
#web-scraping

收到Waffle House的停止和终止函(2025)

Lobsters Hottest ↗ · 2026-08-26 缓存

一位开发者讲述了通过抓取Waffle House网站数据构建Waffle House指数网站,最终收到该公司停止和终止函的经历,这交织了技术创新与灾害应对传说。

0 人收藏 0 人点赞
#web-scraping

使用TypeScript获取最稀有的车牌之一(2025年)

Lobsters Hottest ↗ · 2026-08-26 缓存

一名工程师使用TypeScript自动化检查佛罗里达州DMV网站上的稀有车牌可用性,绕过付费服务。

0 人收藏 0 人点赞
#web-scraping

追踪Costco汽油价格

Hacker News Top ↗ · 2026-08-24 缓存

作者开发了一个仪表板,通过抓取API数据并映射趋势,在全球燃油危机期间追踪和可视化美国各地的Costco汽油价格。

0 人收藏 0 人点赞
#web-scraping

构建网页代理让我意识到多少上下文被浪费在不良 URL 上。你是如何过滤爬取的?

Reddit r/AI_Agents ↗ · 2026-08-24

作者讨论了网页代理在爬取不良 URL 时上下文窗口浪费的问题,并询问如何使用元数据来过滤爬取以提高效率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈