scraping

标签

Cards List
#scraping

所以Reddit认为纯HTML不安全

Lobsters Hottest · 昨天 缓存

Reddit现在要求登录才能使用其旧版设计(old.reddit.com),理由是对滥用爬虫和自动化流量的安全担忧,这让喜欢更简洁界面的用户感到失望。

0 人收藏 0 人点赞
#scraping

Patreon 停止请求 AI 机器人不要抓取——并开始阻止它们

TechCrunch AI · 6天前 缓存

Patreon 已与 Cloudflare 合作,主动阻止 AI 机器人抓取创作者内容用于训练,超越了自愿的 robots.txt 方式。此举旨在让创作者更好地控制其作品被 AI 公司使用的方式。

0 人收藏 0 人点赞
#scraping

Suno从YouTube、Genius和Deezer抓取了数百万首歌曲

The Verge · 2026-07-15 缓存

一次黑客事件揭露,AI音乐生成器Suno通过从YouTube、Genius和Deezer抓取数百万首歌曲来训练其模型,证实了版权侵权的指控,并暴露了客户数据。

0 人收藏 0 人点赞
#scraping

黑客事件表明AI音乐生成器Suno从YouTube抓取训练数据

TechCrunch AI · 2026-07-15 缓存

对AI音乐生成器Suno的黑客攻击显示,它涉嫌从YouTube、Deezer等来源抓取了数十年的音频作为训练数据,在各大唱片公司起诉期间引发了版权和DMCA方面的担忧。

0 人收藏 0 人点赞
#scraping

@Pluvio9yte: 太牛逼了,这个除了小红书的接口经常挂,要更新接口,其他的基本能够满足你的一切抓取的需求。 我用了快一个月了,消耗情况,见评论区

X AI KOLs Timeline · 2026-07-13 缓存

用户称赞一款数据抓取工具,除了小红书接口偶尔需要更新外,基本能满足各种抓取需求。

0 人收藏 0 人点赞
#scraping

shot-scraper 1.11

Simon Willison's Blog · 2026-07-12 缓存

shot-scraper 1.11 发布,带来了一些小改进,例如服务器进程更长的等待时间,以及新增了 --js-file 和 --timeout 命令选项以保持一致性。

0 人收藏 0 人点赞
#scraping

@gengdaJ: 爽了,现在可以直接用Codex自动批量抓取公众号文章。 原创、一次性多篇都可以精确抓取; 正文、点赞、分享、评论、阅读量也都可以抓取。 之前还要手动去网站操作,现在直接让Codex操作,舒服了~ 正文,只需要扫个码,登录状态保持4天。 其…

X AI KOLs Timeline · 2026-07-09 缓存

介绍了一个新的 yichen-skills 工具 wechat-mp-batch-exporter,允许使用 Codex 自动批量抓取微信公众号文章,包括正文、点赞、分享、评论、阅读量等数据,并保持登录状态4天。

0 人收藏 0 人点赞
#scraping

Show HN: Fortress – 一款隐身Chromium引擎,让你的代理不再被屏蔽

Hacker News Top · 2026-07-08 缓存

Fortress 是一款隐身Chromium引擎,它在C++层面修改浏览器指纹,帮助爬虫和浏览器代理避免被诸如Cloudflare Turnstile、CreepJS和Sannysoft等机器人检测器检测。它可作为Playwright和Puppeteer的即插即用CDP替代方案。

0 人收藏 0 人点赞
#scraping

@gkxspace: 好多人问这到底是什么网站,展开讲讲: TikHub,简单说就是一个社交平台数据的 API 集合站 16 个平台全打通了:抖音、小红书、TikTok、Instagram、YouTube、B站、微博、快手、知乎、LinkedIn、微信公众号、…

X AI KOLs Timeline · 2026-07-04 缓存

TikHub 是一个社交平台数据 API 集合站,支持 16 个平台(如抖音、小红书、TikTok 等),提供超过 1000 个接口用于获取视频、评论、用户画像、电商数据等。

0 人收藏 0 人点赞
#scraping

每个AI可见性工具都在欺骗你

Hacker News Top · 2026-07-03 缓存

本文批判性地审视了声称能衡量品牌在生成式AI回复中曝光度的AI可见性工具,指出由于非确定性、个性化和抓取偏差,这些工具提供了虚假精度。文章呼吁方法透明,并警告不要将不透明的仪表盘视为稳定真相。

0 人收藏 0 人点赞
#scraping

@yhslgg: 为什么14个爬虫工具我只标了这个"最特别"?老杨现在说清楚 兄弟们,这个爬虫逻辑完全不一样的工具——ScrapeGraphAI,GitHub 27900 星。 一句话:你说"帮我把这个页面上的所有产品名和价格抓出来",LLM 自动生成抓取…

X AI KOLs Timeline · 2026-07-01 缓存

介绍ScrapeGraphAI,一个基于LLM的爬虫工具,能用自然语言描述需求并自动生成抓取流程,无需编写选择器或关心HTML结构,支持本地模型和多种集成平台。

0 人收藏 0 人点赞
#scraping

Reddit将要求用户登录才能使用old.reddit.com

Ars Technica · 2026-06-30 缓存

Reddit将要求用户登录以访问old.reddit.com,称这是为了打击滥用抓取和自动化流量,这可能会让喜欢旧版界面简洁和隐私的用户感到不满。

0 人收藏 0 人点赞
#scraping

住宅代理的威胁

Lobsters Hottest · 2026-06-30 缓存

住宅代理用于爬取和隐藏恶意活动,随着机器人现在生成比人类更多的互联网流量,住宅代理的使用正在上升。本文探讨了技术和伦理挑战,包括Cloudflare和Coinbase的x402标准等支付协议。

0 人收藏 0 人点赞
#scraping

@geekbb: Go 编写的 CLI 工具,集成了 Web 搜索(Brave/DDG/SearXNG/Exa)、代码搜索(Grep/Sourcegraph/GitHub)和库文档查询(Context7)三种搜索能力,同时支持网页抓取和站点爬取。 为 AI…

X AI KOLs Timeline · 2026-06-30 缓存

一个用 Go 编写的极速、无状态的 CLI 工具,集成 Web 搜索、代码搜索和库文档查询功能,支持网页抓取和站点爬取,专为 AI Agent 和终端使用设计。

0 人收藏 0 人点赞
#scraping

超过20家出版商起诉OpenAI和微软,指控其使用其内容训练ChatGPT

Reddit r/artificial · 2026-06-29 缓存

美国35家报纸出版商已对OpenAI和微软提起诉讼,指控这两家公司未经许可抓取其受版权保护且需付费的内容用于训练ChatGPT,损害了本地新闻业。

0 人收藏 0 人点赞
#scraping

@sairahul1: https://x.com/sairahul1/status/2066809666592718879

X AI KOLs Timeline · 2026-06-16 缓存

一份关于构建AI驱动内容机器的详细指南,该机器从TikTok和Instagram等平台抓取热门内容,使用AI生成平台原生帖子,并利用ScrapeCreators、Kie.ai和Postiz等工具自动安排发布计划。

0 人收藏 0 人点赞
#scraping

浏览器会话在大约20个并发时开始失败。没有人提醒过你这一点

Reddit r/AI_Agents · 2026-06-12

在生产环境中使用 Node.js 运行 Playwright 爬虫时,大约20个并发浏览器会话开始失败,导致内存飙升和崩溃。开发者指出文档中没有关于此限制的警告。

0 人收藏 0 人点赞
#scraping

我自动化了客户拓展。难点并不在于自动化本身。

Reddit r/AI_Agents · 2026-06-11

一位开发者分享了他使用 n8n 和 OpenAI API 自动化客户拓展的经历,指出理解要自动化什么比实现自动化更难。

0 人收藏 0 人点赞
#scraping

@tavilyai: 智能体已经存在于终端中。当它们需要网络数据时,应该能够运行命令,这正是Tavily CLI的功能。

X AI KOLs Following · 2026-06-10 缓存

Tavily CLI 是一个命令行工具,为AI智能体提供网络搜索、提取、爬取和研究功能,返回结构化的JSON输出,便于直接解析。

0 人收藏 0 人点赞
#scraping

Launch HN: Intuned (YC S22) – 以代码形式构建并运行可靠的浏览器自动化

Hacker News Top · 2026-06-08 缓存

Intuned 是一个由 YC 支持的工具,它利用 AI 智能体构建、部署和维护基于 Playwright 的浏览器自动化,处理数据抓取、RPA 和爬虫任务,并内置反检测和身份验证功能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈