标签
Reddit现在要求登录才能使用其旧版设计(old.reddit.com),理由是对滥用爬虫和自动化流量的安全担忧,这让喜欢更简洁界面的用户感到失望。
Patreon 已与 Cloudflare 合作,主动阻止 AI 机器人抓取创作者内容用于训练,超越了自愿的 robots.txt 方式。此举旨在让创作者更好地控制其作品被 AI 公司使用的方式。
一次黑客事件揭露,AI音乐生成器Suno通过从YouTube、Genius和Deezer抓取数百万首歌曲来训练其模型,证实了版权侵权的指控,并暴露了客户数据。
对AI音乐生成器Suno的黑客攻击显示,它涉嫌从YouTube、Deezer等来源抓取了数十年的音频作为训练数据,在各大唱片公司起诉期间引发了版权和DMCA方面的担忧。
用户称赞一款数据抓取工具,除了小红书接口偶尔需要更新外,基本能满足各种抓取需求。
shot-scraper 1.11 发布,带来了一些小改进,例如服务器进程更长的等待时间,以及新增了 --js-file 和 --timeout 命令选项以保持一致性。
介绍了一个新的 yichen-skills 工具 wechat-mp-batch-exporter,允许使用 Codex 自动批量抓取微信公众号文章,包括正文、点赞、分享、评论、阅读量等数据,并保持登录状态4天。
Fortress 是一款隐身Chromium引擎,它在C++层面修改浏览器指纹,帮助爬虫和浏览器代理避免被诸如Cloudflare Turnstile、CreepJS和Sannysoft等机器人检测器检测。它可作为Playwright和Puppeteer的即插即用CDP替代方案。
TikHub 是一个社交平台数据 API 集合站,支持 16 个平台(如抖音、小红书、TikTok 等),提供超过 1000 个接口用于获取视频、评论、用户画像、电商数据等。
本文批判性地审视了声称能衡量品牌在生成式AI回复中曝光度的AI可见性工具,指出由于非确定性、个性化和抓取偏差,这些工具提供了虚假精度。文章呼吁方法透明,并警告不要将不透明的仪表盘视为稳定真相。
介绍ScrapeGraphAI,一个基于LLM的爬虫工具,能用自然语言描述需求并自动生成抓取流程,无需编写选择器或关心HTML结构,支持本地模型和多种集成平台。
Reddit将要求用户登录以访问old.reddit.com,称这是为了打击滥用抓取和自动化流量,这可能会让喜欢旧版界面简洁和隐私的用户感到不满。
住宅代理用于爬取和隐藏恶意活动,随着机器人现在生成比人类更多的互联网流量,住宅代理的使用正在上升。本文探讨了技术和伦理挑战,包括Cloudflare和Coinbase的x402标准等支付协议。
一个用 Go 编写的极速、无状态的 CLI 工具,集成 Web 搜索、代码搜索和库文档查询功能,支持网页抓取和站点爬取,专为 AI Agent 和终端使用设计。
美国35家报纸出版商已对OpenAI和微软提起诉讼,指控这两家公司未经许可抓取其受版权保护且需付费的内容用于训练ChatGPT,损害了本地新闻业。
一份关于构建AI驱动内容机器的详细指南,该机器从TikTok和Instagram等平台抓取热门内容,使用AI生成平台原生帖子,并利用ScrapeCreators、Kie.ai和Postiz等工具自动安排发布计划。
在生产环境中使用 Node.js 运行 Playwright 爬虫时,大约20个并发浏览器会话开始失败,导致内存飙升和崩溃。开发者指出文档中没有关于此限制的警告。
一位开发者分享了他使用 n8n 和 OpenAI API 自动化客户拓展的经历,指出理解要自动化什么比实现自动化更难。
Tavily CLI 是一个命令行工具,为AI智能体提供网络搜索、提取、爬取和研究功能,返回结构化的JSON输出,便于直接解析。
Intuned 是一个由 YC 支持的工具,它利用 AI 智能体构建、部署和维护基于 Playwright 的浏览器自动化,处理数据抓取、RPA 和爬虫任务,并内置反检测和身份验证功能。