标签
本文提供了抓取TikTok私人移动API的技术指南,产生了一个包含45亿视频的庞大数据集,该数据集已上传至Hugging Face供公众访问。
作者使用逆向工程方法抓取了59.4亿个TikTok视频和32.3亿个用户资料,并将完整数据集上传至Hugging Face,提供教程和代码但需付费。
Crawl4ai 是一个免费的、为 AI 设计的爬虫工具,可将网页内容转换为 Markdown 格式,适合 RAG 和 Agent 开发。
一位历史研究者批评为了获取AI模型训练数据而切割古书书脊的做法,认为这导致了珍贵历史信息和数据的不可逆损失,且无法复原。
据报道,人工智能公司正在批量购买稀有书籍,通过切割书脊并粉碎原本来进行扫描,这项操作由名为ISBNdb的服务提供便利,引发了道德担忧。
AI公司大量购买稀有书籍,通过切掉书脊扫描并销毁原书,ISBNdb为其提供便利,一位联邦法官裁定此为合理使用。这种对文化瑰宝的不可逆毁灭引发了众怒。
AI公司购买并销毁稀有实体书籍,以获取不含AI生成内容的训练数据,利用合理使用和首次销售原则等法律原则,同时引发伦理和保存方面的担忧。
Codeberg正在更新其服务条款,明确禁止为训练大型语言模型而提取数据(LLM-extrusions),旨在保护平台上的存储库免受未经授权的使用。
SurfSense 是一个面向 AI 智能体的开源竞争情报平台,提供实时抓取连接器,支持 Reddit、YouTube、Instagram、TikTok、Google Maps、Google 搜索等,并配有 REST API 和 MCP 服务器。
推荐一个名为TikHub的网站,提供海内外全平台社交媒体API,价格极低,覆盖Twitter、小红书、TikTok、抖音、Reddit等,可用于数据爬取、监控、选题搜集等。
开源项目 Agent Reach 让 AI Agent 无需复杂配置即可接入 14 个互联网平台,解决了 Agent 获取数据的痛点。
AgentKey 是一个对小白友好的工具,让 AI 代理可以稳定抓取 X(推特)和小红书等平台的数据,无需手动配置 cookie 或管理 API,只需一个 key 即可使用。
据报道,从 Pokémon Go 扫描中收集的数据被用于训练军用无人机的导航技术,引发了关于消费者数据被意外用于军事目的的担忧。
推广一个GitHub仓库,用户可以用自然语言描述数据集,由AI智能体研究网络,构建结构化表格,可导出为CSV,并支持自动刷新。
BigSet 是一个开源工具,输入一句话描述所需数据,它会派出多个 AI Agent 并行在网络上调研,自动推断 schema、去重、验证并生成结构化表格,支持定时刷新。
一位数据爱好者抓取了《创始人播客》的所有节目,以图表形式呈现了主持人大卫·塞拉(David Senra)如何记录他与创始人的晚餐会面,结果显示其社交日程日益密集,晚餐时长中位数为3小时。
作者开源了一个用于获取币安聪明钱数据的工具,可通过npm安装使用,提供包括鲸鱼平均持仓成本等在内的专业数据。
介绍如何利用 XCrawl 和 Hermes Agent 搭建无需编码的自动化情报收集工作流,涵盖竞品监控、Twitter 互动雷达、亚马逊商品监控等场景。
一位房地产批发商构建了一个名为 zillow-full 的 OpenClaw 技能,用于自动化房产调研,通过使用 AI 根据个人标准对房源进行评分,将交易量从每月 2 笔增加到 11 笔。