data-scraping

标签

Cards List
#data-scraping

Codeberg:服务条款扩展以禁止LLM数据提取

Hacker News Top · 3天前

Codeberg正在更新其服务条款,明确禁止为训练大型语言模型而提取数据(LLM-extrusions),旨在保护平台上的存储库免受未经授权的使用。

0 人收藏 0 人点赞
#data-scraping

FOSS NotebookLM 连接到 Reddit、YT、Google、IG、Tiktok 等平台

Reddit r/LocalLLaMA · 2026-07-14 缓存

SurfSense 是一个面向 AI 智能体的开源竞争情报平台,提供实时抓取连接器,支持 Reddit、YouTube、Instagram、TikTok、Google Maps、Google 搜索等,并配有 REST API 和 MCP 服务器。

0 人收藏 0 人点赞
#data-scraping

@gengdaJ: 惊呆了,TikHub这网站真炸裂啊。。。海内外全平台社媒的API都有,twitter api一条一分钱不到,一直以来最难搞的小红书也只有7分钱。。。 TikTok、Reddit、公众号、抖音更是不在话下。 这个已经进入我的核心工具列表了,…

X AI KOLs Timeline · 2026-07-04 缓存

推荐一个名为TikHub的网站,提供海内外全平台社交媒体API,价格极低,覆盖Twitter、小红书、TikTok、抖音、Reddit等,可用于数据爬取、监控、选题搜集等。

0 人收藏 0 人点赞
#data-scraping

@1YES_yes1: 兄弟们,今天真挖到一个宝。 我感觉很多人还没意识到。 **Agent 最大的问题,从来不是模型不够强。** 而是: **它根本拿不到数据。** 你让 Agent 去网上找资料。 结果现实是: 推特/X API 要付费。 网页抓取要订阅。 …

X AI KOLs Timeline · 2026-06-29 缓存

开源项目 Agent Reach 让 AI Agent 无需复杂配置即可接入 14 个互联网平台,解决了 Agent 获取数据的痛点。

0 人收藏 0 人点赞
#data-scraping

如今未经许可抓取数据用于AI训练突然变得不可取了?

Reddit r/artificial · 2026-06-27

一篇关于对AI训练中网络爬取态度转变的评论,质疑为何突然谴责未经许可的数据收集。

0 人收藏 0 人点赞
#data-scraping

@MagiccatMila: 终于找到可以稳定抓X推特、小红书数据的工具了! AgentKey -- 小白友好,更稳定更好用的升级版[Agent Reach] http://agentkey.app/@cirila 一直想要抓外部数据但是不会自己配置cookie和管理…

X AI KOLs Timeline · 2026-06-25 缓存

AgentKey 是一个对小白友好的工具,让 AI 代理可以稳定抓取 X(推特)和小红书等平台的数据,无需手动配置 cookie 或管理 API,只需一个 key 即可使用。

0 人收藏 0 人点赞
#data-scraping

Pokémon Go 扫描数据训练军用无人机导航技术

Hacker News Top · 2026-06-11

据报道,从 Pokémon Go 扫描中收集的数据被用于训练军用无人机的导航技术,引发了关于消费者数据被意外用于军事目的的担忧。

0 人收藏 0 人点赞
#data-scraping

@DivyanshT91162: 我认为GitHub仓库正在悄然取代一半的SaaS行业。这个仓库能将提示词转化为实时数据集。输入:"…

X AI KOLs Timeline · 2026-06-03 缓存

推广一个GitHub仓库,用户可以用自然语言描述数据集,由AI智能体研究网络,构建结构化表格,可导出为CSV,并支持自动刷新。

0 人收藏 0 人点赞
#data-scraping

@gkxspace: 发现一个很疯狂的开源工具,你输一句话描述你要什么数据,它派出一群 AI Agent 并行跑到各个网站上调研,几分钟后汇总成一张结构化表格给你 其实数据都摆在网上,但想变成一张能用的表格,历来都是苦力活,过去这是一个工程项目: 拼搜索、写爬…

X AI KOLs Timeline · 2026-06-03 缓存

BigSet 是一个开源工具,输入一句话描述所需数据,它会派出多个 AI Agent 并行在网络上调研,自动推断 schema、去重、验证并生成结构化表格,支持定时刷新。

0 人收藏 0 人点赞
#data-scraping

@tylerjrichards: 每次David Senra与创始人共进晚餐,他都会通过@FoundersPodcast向全世界讲述一切,包括……

X AI KOLs Timeline · 2026-05-31 缓存

一位数据爱好者抓取了《创始人播客》的所有节目,以图表形式呈现了主持人大卫·塞拉(David Senra)如何记录他与创始人的晚餐会面,结果显示其社交日程日益密集,晚餐时长中位数为3小时。

0 人收藏 0 人点赞
#data-scraping

@0xBenniee: 币安 @binancezh 开发的聪明钱看板非常好用,国产野庄经常用这个数据来拉盘,通过观察聪明钱的平均持仓成本可以更容易找到二段进场点位。 开源了一个smart-money数据,npm install之后直用,可以拿到所有的聪明钱数据,…

X AI KOLs Timeline · 2026-05-25 缓存

作者开源了一个用于获取币安聪明钱数据的工具,可通过npm安装使用,提供包括鲸鱼平均持仓成本等在内的专业数据。

0 人收藏 0 人点赞
#data-scraping

@wsl8297: https://x.com/wsl8297/status/2054798253955375388

X AI KOLs Timeline · 2026-05-14 缓存

介绍如何利用 XCrawl 和 Hermes Agent 搭建无需编码的自动化情报收集工作流,涵盖竞品监控、Twitter 互动雷达、亚马逊商品监控等场景。

0 人收藏 0 人点赞
#data-scraping

发布了我的第一个 OpenClaw 技能:zillow-full。之所以构建它,是因为手动房产调研占用了我的周末时间。

Reddit r/openclaw · 2026-05-12

一位房地产批发商构建了一个名为 zillow-full 的 OpenClaw 技能,用于自动化房产调研,通过使用 AI 根据个人标准对房源进行评分,将交易量从每月 2 笔增加到 11 笔。

0 人收藏 0 人点赞
#data-scraping

@kfk_ai: 手把手教你用工具获取 X 平台数据|零基础也能学会 看推荐流、获取大V推文、下载长文 Markdown,全程不用 API Key,用 CodeX AI 助手一键搞定。 00:00 开场 00:53 工具介绍:免 API、免付费、自动读取登…

X AI KOLs Timeline · 2026-05-12

本文是一个视频教程,演示如何使用 CodeX AI 助手和 Twitter CLI 工具,在无需 API Key 的情况下从 X 平台抓取数据并转换为 Markdown 格式。

0 人收藏 0 人点赞
#data-scraping

OpenAI违反了加拿大隐私法,联邦和省级监管机构指出

Reddit r/ArtificialInteligence · 2026-05-07 缓存

加拿大联邦和省级隐私监管机构认定,OpenAI在未经适当同意的情况下抓取大量个人数据以训练ChatGPT,违反了隐私法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈