CatchAll by NewsCatcher
摘要
CatchAll by NewsCatcher 是一款基于用户自定义条件从网络构建定制化数据集的产品。
<p>
从网络构建任意数据集。根据你的条件过滤。
</p>
<p>
<a href="https://www.producthunt.com/products/catchall?utm_campaign=producthunt-atom-posts-feed&utm_medium=rss-feed&utm_source=producthunt-atom-posts-feed">讨论</a>
|
<a href="https://www.producthunt.com/r/p/1146304?app_id=339">链接</a>
</p>
相似文章
NanmiCoder/MediaCrawler
MediaCrawler是一个开源的多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎等主流平台的公开信息抓取,基于Playwright浏览器自动化实现,无需JS逆向。
使用Cloudflare Workers、Vectorize和Nostr的自托管AI新闻聚合器
一个自托管的AI新闻聚合器,使用Cloudflare Workers、Vectorize、D1和Nostr抓取Hacker News、Lobsters和Reddit等来源,生成AI嵌入向量,并根据点赞历史提供个性化信息流。
@NFTCPS: X推特上那些搬运博主的内容源终于知道从哪来的! 就这个工具MediaCrawler,一个工具通吃小红书、抖音、快手、B站、微博、贴吧、知乎,公开的内容、评论、点赞、转发都能扒下来。 最骚的是它不用搞JS逆向那套,靠浏览器登录态直接拿签名,…
MediaCrawler是一个多平台自媒体数据采集工具,支持小红书、抖音、快手、B站、微博、贴吧、知乎的公开内容抓取,利用浏览器登录态绕过JS逆向,降低技术门槛。
@grgerwcwetwet: 推荐一个开源项目 Horizon,一个专门盯海外科技圈的 AI 信息雷达。 它会自动聚合 Hacker News、Twitter、Reddit、GitHub 等平台内容,再用 AI 做筛选、去重和总结,把真正有价值的信息整理成日报。 比较…
推荐开源项目 Horizon,这是一个AI驱动的海外科技新闻雷达,自动聚合Hacker News、Twitter、Reddit、GitHub等平台内容,进行筛选、去重和总结,生成中英双语日报,并支持推送到飞书、邮箱、微信等渠道。
@Jolyne_AI: 又在 GitHub 挖到一款高性能爬虫/抓取利器:AnyCrawl,把数据采集这件事做得更省心、更高效。 它把 Cheerio、Playwright、Puppeteer 三种引擎打包到一起:静态页面秒解析,复杂 JavaScript 渲染…
AnyCrawl 是一款高性能开源爬虫/抓取工具,集成了 Cheerio、Playwright、Puppeteer 三种引擎,支持静态解析与 JS 渲染、SERP 批量抓取、站点级爬虫、多线程/多进程并发、代理支持,并针对 LLM 数据采集优化输出格式。