@seclink: 分享 数据集 的 收录站点 ,免费的研究数据集 和 收费的都有!
摘要
一个GitHub仓库整理了国内外用于大模型与生成式AI训练的数据集下载站点,涵盖文生文、文生图、文生视频,按地区和类型分类,免费与付费资源均有收录。
查看缓存全文
缓存时间: 2026/08/06 14:39
分享 数据集 的 收录站点 ,免费的研究数据集 和 收费的都有!
https://t.co/IycmdYASJs
XiaomingX/awesome-datasets
Source: https://github.com/XiaomingX/awesome-datasets
Awesome Datasets
收集国内外可用于大模型(LLM)与生成式 AI 训练的数据集下载站点,对标 ModelScope 数据集。覆盖文生文(文本预训练与后训练)、文生图、文生视频三类需求,按数据类型与地区分类整理。
所有链接均经过整理核对,少数站点因网络环境限制未能在本机直接验证,已在条目后用 (核对) 标注,发布前建议在浏览器中确认。
目录
综合类枢纽
这些平台同时涵盖文本、图像、视频等多模态数据,是首选的入口。
| 站点 | 地区 | 链接 | 说明 |
|---|---|---|---|
| Hugging Face Datasets | 国际 | https://huggingface.co/datasets | 最大的机器学习数据集托管与版本管理平台,绝大多数数据集可免费下载(部分需申请授权) |
| ModelScope 魔搭 | 中国 | https://modelscope.cn/datasets | 阿里推出的开源模型与数据集社区,国内最接近 Hugging Face 的平台,多数数据集免费下载 |
| OpenDataLab 开放数据平台 | 中国 | https://opendatalab.com/ | 上海人工智能实验室推出的开放数据集平台,覆盖文本/图像/视频,注册后可免费下载 |
| Kaggle Datasets | 国际 | https://www.kaggle.com/datasets | 社区化数据集仓库,含内置 Notebook 环境,登录后可免费下载 |
| OpenXLab 浦源 | 中国 | https://openxlab.org.cn/datasets | 面向具身智能与基础模型的开放数据集/模型平台,免费下载 |
| GitHub | 国际 | https://github.com/ | 大量研究数据集以代码仓库形式发布(常通过 Git LFS 或下载脚本分发),免费 |
| Google Dataset Search | 国际 | https://datasetsearch.research.google.com/ | 跨站数据集搜索引擎,索引全网数据集并跳转至原始来源 |
文生文:文本预训练与后训练数据
国际站点(文本)
-
Hugging Face Datasets
- 链接:https://huggingface.co/datasets
- 类型:文本 / 多模态
- 说明:各类 ML 数据集的最大枢纽,免费浏览,多数可免费下载(部分需授权)。
- 代表数据集:
RedPajama-Data-1T、C4、FineWeb、OpenAssistant、Dolly-15k、SlimPajama。
-
Kaggle Datasets
- 链接:https://www.kaggle.com/datasets
- 类型:文本 / 图像 / 视频 / 表格 / 多模态
- 说明:社区数据集仓库,含内置 Notebook 环境,登录后免费下载。
- 代表数据集:
Common Crawl、Wikipedia转储、各类 NLP 与指令数据。
-
GitHub
- 链接:https://github.com/
- 类型:文本 / 图像 / 视频 / 代码 / 多模态
- 说明:研究数据集的主要发布源(常通过 Git LFS、Hugging Face 链接或下载脚本分发),免费。
- 代表数据集:
RedPajama-Data(togethercomputer)、The Pile(EleutherAI)、Alpaca、Vicuna训练数据。
-
Papers with Code — Datasets
- 链接:https://paperswithcode.com/datasets
- 类型:文本 / 图像 / 视频 / 多模态
- 说明:与论文和榜单关联的数据集索引,跳转至下载源,免费。
- 代表数据集:覆盖 NLP、CV、ML 各领域的基准数据集。
-
Common Crawl
- 链接:https://commoncrawl.org/
- 类型:文本(网页语料)
- 说明:免费开放的原始与处理后网页爬取数据(WARC/WAT/WET、CC-MAIN),PB 级,可通过 S3/HTTPS 下载。
- 代表数据集:每月
CC-MAIN爬取、CCNet处理文本。
-
The Pile(EleutherAI)
- 链接:https://pile.eleuther.ai/
- 类型:文本
- 说明:EleutherAI 构建的 800GB+ 多样化英文文本语料,用于 LLM 预训练,免费下载。
- 代表数据集:
Pile-CC、Pile-arXiv、Pile-Github、Pile-StackExchange、Pile-Books3。
-
Academic Torrents
- 链接:https://academictorrents.com/
- 类型:文本 / 图像 / 视频 / 多模态
- 说明:基于 BitTorrent 的分布式研究数据集与论文仓库,社区维护,免费。
- 代表数据集:
The Pile、RedPajama、ImageNet、LAION子集。
-
RedPajama
- 链接:数据集 https://huggingface.co/datasets/togethercomputer/RedPajama-Data-1T ;项目 https://www.redpajama.ai/
(核对) - 类型:文本
- 说明:LLaMA 1.2T token 训练集的开放复现(Together AI 等),免费下载。
- 代表数据集:
RedPajama-Data-1T、RedPajama-Data-v2(30+ 万亿 token)。
- 链接:数据集 https://huggingface.co/datasets/togethercomputer/RedPajama-Data-1T ;项目 https://www.redpajama.ai/
-
Zenodo
- 链接:https://zenodo.org/
(核对) - 类型:文本 / 图像 / 视频 / 多模态
- 说明:CERN 支持的通用途科研数据仓库,提供 DOI,免费上传/下载。
- 代表数据集:大量学术语料、OSCAR、ML 补充数据集。
- 链接:https://zenodo.org/
-
Figshare
- 链接:https://figshare.com/
- 类型:文本 / 图像 / 视频 / 多模态
- 说明:提供 DOI 的学术图表/数据集仓库,免费下载。
- 代表数据集:众多科研补充数据集。
-
Google Dataset Search
- 链接:https://datasetsearch.research.google.com/
- 类型:文本 / 图像 / 视频 / 多模态
- 说明:跨网数据集搜索引擎,索引并跳转至原始来源,免费使用。
- 代表数据集:索引 Kaggle、Zenodo、data.gov、高校仓库等。
-
Data.gov(美国)/ data.gov.uk(英国)
- 链接:https://www.data.gov/ 、https://data.gov.uk/
- 类型:文本 / 表格 / 多模态
- 说明:官方开放政府数据门户,免费下载,可用于公版文本/语料。
- 代表数据集:法律法规、专利、公共记录、人口普查文本。
-
CEUR Workshop Proceedings
- 链接:https://www.ceur-ws.org/
- 类型:文本
- 说明:计算机 workshop 论文的开放获取论文集,是论文附属数据集与语料的来源。
- 代表数据集:各 workshop 发布的 NLP/ML 数据集。
国内站点(文本)
-
ModelScope 魔搭 — 数据集
- 链接:https://modelscope.cn/datasets
- 类型:文本 / 图像 / 视频 / 音频 / 多模态
- 说明:阿里开源模型与数据集社区,国内最接近 Hugging Face 的平台,多数免费下载(部分需授权)。
- 代表数据集:
BelleSFT 数据、COIG中文指令数据、ZeroList系列。
-
OpenDataLab 开放数据平台
- 链接:https://opendatalab.com/
- 类型:文本 / 图像 / 视频 / 多模态
- 说明:上海人工智能实验室推出的大型开放数据集平台,注册后免费下载。
- 代表数据集:
Wukong中文图文、MSCOCO-CN等大量学术数据集。
-
阿里天池 Tianchi
- 链接:https://tianchi.aliyun.com/
- 类型:文本 / 图像 / 视频 / 表格 / 多模态
- 说明:阿里数据科学竞赛与数据集平台,多数数据集免费下载。
- 代表数据集:天池中文语料、竞赛数据集、
NLPCC评测数据。
-
百度 AI Studio / 千帆
- 链接:https://aistudio.baidu.com/
- 类型:文本 / 图像 / 视频 / 多模态
- 说明:百度的 AI 开发平台,含数据集市场与免费数据集,提供免费额度。
- 代表数据集:
DuReader(机器阅读理解)、中文诗歌/语料集。
-
BAAI 智源研究院 开放数据
- 链接:https://data.baai.ac.cn/ 、https://www.baai.ac.cn/
- 类型:文本 / 图像 / 视频 / 多模态
- 说明:北京智源人工智能研究院开放数据门户,免费科研数据集。
- 代表数据集:
WuDaoCorpora(200GB 中文文本)、COIG、Flickr30k-CN。
-
OpenXLab 浦源
- 链接:https://openxlab.org.cn/datasets
- 类型:文本 / 图像 / 视频 / 多模态
- 说明:面向具身智能与基础模型的开放数据集/模型平台,免费下载。
- 代表数据集:
OpenX-Embodiment、InternVideo数据。
-
OMEGA 开放多模态数据计划
- 链接:https://opendatalab.com/ (搜索 “OMEGA”)
(核对具体落地页) - 类型:多模态 / 文本 / 图像
- 说明:OpenDataLab 生态下的超大规模开放多模态数据计划,免费。
- 代表数据集:
OMEGA多模态语料、中文网页文本集。
- 链接:https://opendatalab.com/ (搜索 “OMEGA”)
-
DataBall 数据球
- 链接:https://databall.cn/
(核对) - 类型:文本 / 图像 / 多模态
- 说明:中文开放数据集聚合/搜索门户,免费浏览与下载。
- 代表数据集:精选中文 NLP 与 CV 数据集。
- 链接:https://databall.cn/
-
TianGong 天工
- 链接:https://www.tiangong.org.cn/
(核对) - 类型:文本 / 多模态
- 说明:天工智能发起的开放 AI 数据计划,免费科研数据集。
- 代表数据集:
TianGong中文文本与多模态语料。
- 链接:https://www.tiangong.org.cn/
-
CNGBdb 国家基因库
- 链接:https://db.cngb.org/
- 类型:文本 / 生物信息
- 说明:国家基因库数据库,免费生物与基因组序列数据,仅适用于科研/生物医学 LLM 预训练。
- 代表数据集:基因组/多组学序列仓库(如
GSA)。
文生图:图像生成训练数据
国际站点(图像)
-
LAION
- 链接:https://laion.ai/
- 类型:图像 / 多模态(图文)
- 说明:支撑 Stable Diffusion 的开放大规模图文数据集,免费(部分子集因安全原因下线/重链)。
- 代表数据集:
LAION-5B、LAION-400M、LAION-Aesthetics、COYO-700M。
-
ImageNet
- 链接:https://www.image-net.org/
- 类型:图像(分类)
- 说明:经典 1400 万图像标注数据集,非商业研究可免费使用(需注册)。
- 代表数据集:
ImageNet-1k、ImageNet-21k。
-
COCO(Common Objects in Context)
- 链接:https://cocodataset.org/
- 类型:图像(检测 / 描述)
- 说明:大规模目标检测、分割与图像描述数据集,研究免费。
- 代表数据集:
COCO 2017(captions、instances、keypoints)。
-
Google Conceptual Captions
- 链接:https://ai.google.com/research/ConceptualCaptions/
- 类型:图文
- 说明:网页规模的图文对数据,用于视觉-语言训练,免费下载。
- 代表数据集:
CC3M、CC12M。
-
Pexels
- 链接:https://www.pexels.com/
(核对直接下载权限 — 受 API/许可限制) - 类型:图像 / 视频
- 说明:CC0 免费图库与视频,按 Pexels 许可下载(用于模型训练再分发需谨慎)。
- 代表数据集:精选图库/视频库。
- 链接:https://www.pexels.com/
-
Pixabay
- 链接:https://pixabay.com/
(核对直接下载权限 — 受 API/许可限制) - 类型:图像 / 视频
- 说明:CC0 免费图像、插画与视频,按 Pixabay 许可下载。
- 代表数据集:大型 CC0 媒体库。
- 链接:https://pixabay.com/
-
Hugging Face Datasets(交叉引用)
- 链接:https://huggingface.co/datasets
- 代表图文数据集:
laion/laion-400-open、diffusiondb、textcaps、coyo-700m。
-
Kaggle Datasets(交叉引用)
- 链接:https://www.kaggle.com/datasets
- 代表:ImageNet、COCO、各类描述数据集。
国内站点(图像)
-
Wukong 悟空(通过 OpenDataLab / BAAI)
- 链接:https://opendatalab.com/ 、https://data.baai.ac.cn/
- 类型:图文
- 说明:1 亿中文图文对,用于中文文生图模型训练,免费。
- 代表数据集:
Wukong-100M。
-
ModelScope / 天池 / AI Studio(见上文交叉引用)— 托管中文图文与绘画风格数据集(如
Taiyi扩散数据、Guofeng风格集)。
文生视频:视频生成训练数据
国际站(视频)
-
WebVid(WebVid-10M)
- 链接:https://github.com/m-bain/webvid
- 类型:视频-文本
- 说明:1000 万+ 库存视频片段与描述对,广泛用于训练文生视频模型,研究免费(需注册授权)。
- 代表数据集:
WebVid-10M、WebVid-2M。
-
Panda-70M
- 链接:https://github.com/snap-research/Panda-70M (项目页 https://snap-research.github.io/Panda-70M/ )
- 类型:视频-文本
- 说明:7000 万高质量视频-描述对,自动标注自 YouTube,免费(研究用途,受 YouTube 条款约束)。
- 代表数据集:
Panda-70M。
-
InternVid
- 链接:https://github.com/OpenGVLab/InternVideo (数据 https://huggingface.co/datasets/OpenGVLab/InternVid-Full )
- 类型:视频-文本
- 说明:约 2.3 亿视频-文本对,用于视频理解与生成,免费。
- 代表数据集:
InternVid-Full、InternVid-10M。
-
Hugging Face Datasets(交叉引用)
- 链接:https://huggingface.co/datasets
- 代表视频-文本数据集:
InternVid-Full、Panda-70M索引、WebVid镜像、SkyTimelapse。
-
Academic Torrents(交叉引用)
- 链接:https://academictorrents.com/
- 代表:
WebVid及各类视频基准种子。
-
SkyTimelapse
- 链接:https://github.com/weixiong-ur/VideoSummarization (搜索 “SkyTimelapse”)
(核对具体仓库) - 类型:视频(延时)
- 说明:天空延时视频数据集,用于视频预测/生成,研究免费。
- 代表数据集:
SkyTimelapse-320k。
- 链接:https://github.com/weixiong-ur/VideoSummarization (搜索 “SkyTimelapse”)
国内站(视频)
-
OpenDataLab / OpenXLab / BAAI(交叉引用)
- 链接:https://opendatalab.com/ 、https://openxlab.org.cn/datasets 、https://data.baai.ac.cn/
- 代表视频数据集:
InternVid-Full(托管)、VideoChat指令数据、具身视频集。
-
ModelScope 魔搭(交叉引用)
- 链接:https://modelscope.cn/datasets
- 代表:中文视频-文本、数字人说话视频数据集。
使用建议
- 预训练语料优先:Common Crawl、The Pile、RedPajama、WuDaoCorpora、Belle/COIG。
- 后训练/SFT/RLHF 数据:Hugging Face、ModelScope、OpenAssistant、Dolly、ShareGPT 类指令集。
- 文生图:LAION、COCO、Conceptual Captions、Wukong。
- 文生视频:WebVid、Panda-70M、InternVid。
下载前请务必确认各数据集的许可证(License)与适用条款,区分研究用途与商业用途,避免侵权。
商业化可采购的预训练数据集站点(付费 / 授权)
以下站点提供可付费采购或商业授权的预训练数据(文本 / 图像 / 视频 / 多模态),区别于上文的免费公开枢纽。多数企业级数据服务商不公开挂牌单价,采用“企业询价 / 项目制 / 授权“模式;少数公开计价的已单独标注。
价格交叉验证说明(重要)
为防止单一媒体渠道误导或被虚假报价欺骗,本节的报价均按以下口径标注可信度:
- 【官方挂牌价】:来自厂商官网定价页,已核实。
- 【中标/采购公示价】:来自政府或央企公开采购公示(如财政部政府采购网、中国移动采购公示),多源一致,可信度最高。
- 【企业询价】:官网不公开报价,需联系商务,无公开数字。
- 【单一来源·未核实】:仅单一渠道(多为媒体/第三方评测)给出数字,且未能从第二来源印证,仅供参考,请务必自行向官方复核。
凡属【单一来源·未核实】的数字均已在条目标注,请勿直接采信。
国际商业化站点
| 站点 | 链接 | 数据类型 | 报价与计价单位 | 可信度 |
|---|---|---|---|---|
| Bright Data | https://brightdata.com | 网页文本 / 爬虫数据 | Web Scraper API 按成功记录计费:约 $1.5 / 1000 条(按需),Scale 套餐约 $1.3 / 1000 条;成品数据集约 $2.5 / 1000 条 | 【官方挂牌价】官网定价页核实 |
| Zyte | https://www.zyte.com | 网页爬取数据 | Zyte API 约 0.06–1.27 / 1000 次成功响应(按承诺档位);浏览器渲染 1.01–16.08 / 1000 次 | 【官方挂牌价】官网定价页核实 |
| Roboflow | https://roboflow.com | 图像 / 视频标注与训练 | 公开档:免费(15 credits/月);Core 79/月(年付),99/月(月付);企业版定制 | 【官方挂牌价】官网定价页核实 |
| Bloomberg Terminal | https://www.bloomberg.com/professional | 金融文本 / 行情 | 终端约 25,000–32,000 / 席位 / 年(通常两年租约) | 【中标/多源】Wall Street Prep、雪球等多源一致 |
| Scale AI | https://scale.com | 文本 / 图像 / 视频 / 多模态 | 企业询价;真实锚点:Meta 2025 以约 $14.3–14.8B 获其 49% 非投票权股份(Bloomberg/Reuters/NYT/The Information 四源一致);2024 营收约 $870M(Reuters);2022 年美国国防部合同 $250M(公开公示) | 【权威媒体原文核实】+$250M 合同【公示核实】 |
| Surge AI | https://surge.ai | 文本 / LLM 训练数据 | 企业询价;真实锚点:2024 营收约 $1.2B、估值 $15–25B(Bloomberg 2025-07-30 原文);单条/每小时标注单价无可核实公开费率卡 | 【权威媒体原文核实】 |
| Appen | https://appen.com | 语音 / 文本 / 图像 / 视频 | 企业询价;真实锚点:原最大客户(Google)退出前年花费约 $70–75M(由 FY2024 Q2 披露的前置 Google 收入 $18.3M 年化得出,ASX 年报);注意 CNBC 报道的 $15/小时为承包商劳务价,非买家价 | 【财报核实】 |
| TELUS International | https://www.telusinternational.com | 多语言文本 / 语音 / 图像 | 企业询价;真实锚点:其收购 Lionbridge AI 作价 US935M(C1.2B,2020),TELUS 新闻稿 / Reuters / Nasdaq 三源一致 | 【财报/公示核实】 |
| Defined.ai | https://defined.ai | 语音 / 文本 / 图像(市场) | 企业询价;规模锚点:累计融资约 $62.3M(A 轮 $11.8M 见 Fortune 2018、B 轮 $50.5M 见 Privco 2020,两源互证),独立运营、未被收购;数据集市场为 custom pricing(Datarade/Spotsaas 共同确认未公开) | 【权威媒体+第三方核实】融资可核实;单价无法核实 |
| Webz.io | https://webz.io | 新闻 / 网页文本 | 企业询价;免费层锚点明确:News API Lite 为 1000 次/月(每次最多 10 篇,开源文档仓库可查);付费单价仍 quote-only | 【单一来源·未核实(免费层)】付费单价无法核实 |
| LexisNexis | https://www.lexisnexis.com | 法律 / 新闻 / 商业文本 | 企业/学术询价;官方定价页明确 “prices vary by client, customized solutions”,无公开机构价;个别高校旧数据(如 2011 年印度高校 Rs.48 万/年)不可外推 | 【权威媒体原文核实(官方定制声明)】单价无法核实 |
| FactSet / LSEG / Refinitiv | https://www.factset.com | 金融文本 / 时序 | 真实锚点:FactSet 公开标价约 $12,000 / 席位 / 年(厂商公开价,FY2024 ASV $2.28B 印证);LSEG Eikon/Workspace 约 $22,000 / 席位 / 年(精简版 $3,600) | 【权威媒体+公示核实】 |
| Innodata | https://innodata.com | 文本 / GenAI 数据 | 企业询价(上市公司);真实锚点:FY2024 营收 $170.5M,最大客户占 48% 约 $82M,近期扩约约 $24M(NASDAQ:INOD 10-K) | 【财报核实】 |
| Encord | https://encord.com | 图像 / 视频标注 | 企业询价;独立未退出公司,无公开价、无第三方中位数、无收购价,规模锚点仅为“2021 年 A 轮约 $20M 级“ | 【无法核实】 |
| V7 | https://www.v7labs.com | 图像 / 视频标注 | 企业询价;规模锚点:2022 年估值约 $2 亿、累计融资约 $3,600 万(量子位 2022-11-29,单一来源);官网 V7 Go 明确 “custom, usage-based pricing” | 【单一来源·未核实(融资)】单价无法核实 |
| Labelbox | https://labelbox.com | 多模态标注 | 公开档 Free–$3,500/月;真实锚点:企业版客户年费中位数约 $40,000/年(Vendr 交易流),标注单元 LBU $0.10 | 【第三方成本平台核实】 |
| Toloka | https://toloka.ai | 众包标注 / RLHF | 企业询价;规模锚点:2025 年融资 72M(Bezos Expeditions 领投,Reuters 转载 + Tadviser 双源一致),源自 Yandex、现属 Nebius Group;买家最低消费与单任务费率未公开(0.01–$5/任务为工人侧报酬) | 【权威媒体原文核实(融资)】单价无法核实 |
| Datarade(聚合) | https://datarade.ai | 聚合 2600+ 供应商 | 买家免费浏览;单数据集由供应商定价(多数询价) | 【官方挂牌价】平台模式核实 |
| AWS Data Exchange | https://aws.amazon.com/data-exchange | 数据集市场 | 免费 + 付费订阅 + API 按量;单价见各商品页 | 【官方挂牌价】平台模式核实 |
| Snowflake Marketplace | https://marketplace.snowflake.com | 数据市场 | 多为免费实时共享; monetized 列表由供应商定价 | 【官方挂牌价】平台模式核实 |
注意:Bright Data、Zyte 提供的网页爬取文本用于大模型预训练存在服务条款与版权风险,采购前请确认授权范围。Bloomberg / LexisNexis / FactSet 等金融与法律文本授权清晰但昂贵且受限,不适合作为大规模预训练语料堆。
国内商业化站点
| 站点 | 链接 | 数据类型 | 报价与计价单位 | 可信度 |
|---|---|---|---|---|
| 海天瑞声 | https://haitianruisheng.com/ | 语音 / 文本 / 图像 / 视频 / 多模态 | 企业询价;可核实中标价:财政部 2025-05-19 人工智能数据集服务中标 229.3 万元;中移动 2025 大模型数据集包4(语音识别)含税 615.14 万元(不含税 580.32 万元,增值税 6%,与公示完全一致);中移动 2026–2027 框架海天瑞声标包(视频+音频)约 6237 万元 | 【公示核实】财政部 + 千里马/寻标宝公示一致 |
| 数据堂 | https://www.datatang.com/ | 文本 / 语音 / 图像 / 多模态 | 企业询价;可核实中标价:财政部 2025-05-07 互联网数据采购中标 485 万元(北京政府采购合同互证);中移动 2025 包5(文本知识库)含税 383.72 万元;年报营收 3.62 亿元、毛利率 49.84%(新三板 831428) | 【公示/财报核实】财政部 + 中移动公示 + 年报 |
| 标贝科技 | https://www.data-baker.com/ | 语音 / 文本 / 图像 / 视频 | 企业询价;官方平台证据:阿里云市场店铺“图像语音点云数据标注采集定制服务“近 180 天成交 0 笔、无标价,为引流/询价入口 | 【官方平台核实】无公开单价 |
| 视觉中国 | https://www.vcg.com/ | 多模态(图 / 视频 / 3D) | 企业询价;真实锚点:港股招股书披露 2025 内容授权服务收入 5.24 亿元、内容定制服务收入 2.09 亿元(每日经济新闻/新浪/澎湃等多家引用招股书,互证);注意该数字为内容业务整体收入,招股书未单列“AI 训练数据“营收线;头部大模型客户付费金额无可核实披露。微图 Veer 单图 36 元为【单一来源·未核实】,非官方价目表 | 【权威媒体原文核实(招股书)】 |
| BasicFinder 数据工场(倍赛) | https://www.basicfinder.com/ | 采集 / 标注 / 训练数据 | 企业询价;规模锚点:2019 年 A 轮数千万元(36氪),自营 12 家数据中心、2000+ 全职标注师;无公开单价(worker/buyer 均未披露) | 【单一来源·未核实(融资)】单价无法核实 |
| 曼孚科技 / Testin 云测 等标注商 | https://www.mindflow.tech/ 、https://www.testin.cn/ | 标注为主,少量成品数据集 | 企业询价 / 项目制;无公开单价。曼孚规模锚点:多轮融资(2022 Pre-B 5000 万、2025 B+++ 近亿、2026 Pre-C 数亿元,投资界/多家媒体);Testin 2011 年成立、百万级客户,无公开财务数据 | 【单一来源·未核实(曼孚融资)】单价无法核实 |
| 上海数据交易所 | https://www.chinadep.com/ | 多模态高质量数据集 | 挂牌授权 / 按调用;无公开单品价(大盘:2024 年挂牌产品超 4500 种、交易额超 40 亿元,政府/媒体披露) | 【权威媒体核实(大盘)】单品仍询价 |
| 贵阳大数据交易所 | https://www.gzdex.com.cn/ | 高质量数据集(文字/音频/图/视频,含预训练/指令微调集) | 挂牌但无公开单品价;规模可核实:2025-05 发布 939 个高质量数据集(贵阳市大数据局官网 + 人民网 + 省政府三方互证),数据集交易额超 9000 万元(无单品明细) | 【官方核实】规模可核实;单品仍询价 |
| 深圳数据交易所 | https://www.szdex.com/ | AI / 高质量数据集 | 挂牌授权;无公开单价 | 【企业询价】 |
| 北京国际大数据交易所 | https://www.bjbdp.com.cn/ | 数据交易板块 | 挂牌授权;无公开单价 | 【企业询价】 |
| 阿里云市场(数据交换) | https://market.aliyun.com/dataexchange | 标准 / 定制数据集 | 数据集购买 / 订阅 + 请求者付费;单数据集单价进商品页查 | 【官方挂牌价】平台机制核实 |
| 京东万象(京东云) | https://dop.jd.com/portal | API 调用型数据 | 按接口调用次数 / 套餐包计费;示例:短链生成约 0.001 元 / 次(【单一来源·未核实】,来自京东云文档) | 【官方文档】API 价有官方依据;成品数据集无公开价 |
| 腾讯云媒体 AI | https://cloud.tencent.com/ | 视频处理(非数据集售卖) | 视频理解约 1.5 元 / 分钟、视频摘要约 0.28 元 / 分钟(【单一来源·未核实】,第三方评测,非官网定价页) | 【单一来源·未核实】 |
| 百度智能云 / 华为云 / 火山引擎 | https://cloud.baidu.com/ 、https://www.huaweicloud.com/ 、https://www.volcengine.com/ | 以模型服务 / 算力为主 | 企业询价 / 按模型调用计费;无训练数据集公开单价 | 【企业询价】 |
| 通联数据 | https://www.datayes.com/ | 金融文本语料 | 企业询价 / 年订阅;可见数字仅为社区估算(约 1–3 万/年),无官方/公示价,不采纳 | 【单一来源·未核实】 |
| Wind(万得) | https://www.wind.com.cn/ | 金融文本语料 | 真实锚点:记者取得的 Wind 报价单原文——单终端账号年费 39,800 元,经济数据库(EDB)34,600 元/年,采购 200 终端均价降至 24,540 元(上海证券报 2023-09-11 报价单原文 + 红星资本局 2024-09-23 销售确认,互证) | 【权威媒体原文核实(报价单)】 |
| 北大法宝 | https://www.pkulaw.com/ | 法律文本语料 | 真实可核实单价:单库年使用权 4.3 万–11.95 万元(多校采购公示区间);14 库打包 8.2 万元(财政部政府采购网 2025-06-12 + 华中师大 2024-07-04 结果公告,互证,注意 8.2 万为打包价非单库价);训练批量授权企业询价 | 【公示核实】财政部 + 校方公示一致 |
| 医脉通(HK2192) | https://www.medlive.cn/ | 医疗文本语料 | 机构订阅;训练授权企业询价。规模锚点:2024 年收入 5.585 亿元、净利 3.303 亿元(港股年报,公示级);业务本质为医生平台+医药营销,其“金标数据“语料库用于内部模型,未见对外售卖单价 | 【公示/财报核实(营收)】训练数据单价无法核实 |
| 丁香园 | https://www.dxy.cn/ | 医疗文本语料 | 机构订阅;训练授权企业询价。规模锚点:2020 年 E 轮 5 亿美元(上证报/新浪/百度百科多源一致);医疗数据开放平台为“填需求→客户经理对接“模式,无公开价 | 【权威媒体原文核实(E轮)】单价无法核实 |
采购防骗要点
- 主流合规训练数据以企业询价 / 项目制 / 授权为主,公开明码标价的极少。可多源印证的“硬价格信号“主要是央企/政府公开采购中标公示(如中移动系列采购,单包数百万元至数千万元级,含 6% 增值税)以及上市公司财报/年报披露的数据业务营收与客户集中度。
- 已升级核实的“真实价格锚点“(均来自 ≥2 独立来源):Scale AI(Meta 2025 以约 $14.3B 获 49% 股权,四家权威媒体原文一致)、Appen(原最大客户年花费约 70–75M,ASX 年报)、TELUS International(2020 年以 US935M / C$1.2B 收购 Lionbridge AI 整个 AI 数据部门,TELUS 新闻稿/Business Wire/Nasdaq/Kirkland 四源一致)、FactSet(约 $12,000/席位/年,厂商公开价 + SEC 备案互证)、Innodata(FY2024 营收 $170.5M、最大客户约 $82M,10-K)、Labelbox(企业中位数约 $40K/年,Vendr 交易流)、Toloka(2025 年融资 $72M,Reuters 转载 + Tadviser 双源一致)、海天瑞声/数据堂(财政部与中移动中标公示,金额互证且税率自洽)、Wind(单终端 39,800 元/年,记者取得报价单原文 + 销售确认)、北大法宝(单库年使用权 4.3 万–11.95 万元,多校公示)、医脉通(2024 年收入 5.585 亿元,港股年报)、丁香园(2020 年 E 轮 5 亿美元,多源一致)。
- 重要澄清:$935M 是 TELUS 收购 Lionbridge AI 的价,与 Defined.ai 无关。Defined.ai(前 DefinedCrowd)独立运营、从未被收购,累计融资约 $62.3M(Fortune + Privco 两源互证)。请勿将二者混淆。
- 警惕低价“千亿 token 中文语料包“:合规厂商(海天瑞声、数据堂、视觉中国等)均强调已获授权、全链路溯源,不按“裸 token 量“低价零售;低价裸语料包通常存在版权瑕疵,不建议用于商业大模型训练。
- 凡标注【单一来源·未核实】的数字(如视觉中国微图单图 36 元、京东万象 0.001 元/次、腾讯云视频按分钟价、通联/同花顺/恒生聚源的年费估算),均仅来自单一渠道,请务必向官方核实后再决策,切勿当作成交价。
- 易混淆澄清:视觉中国 5.24 亿 / 2.09 亿元为“内容授权/定制“整体业务收入(招股书未单列 AI 训练数据线);北大法宝 8.2 万元为 14 库打包价,单库实际 4.3 万–11.95 万元;中移动 2025 项目与 2026–2027 框架为两个独立项目,引用时请注意年份。
- 网页爬取类数据(Bright Data / Zyte / Webz.io)用于预训练存在服务条款与版权风险,需确认授权范围。
价格锚点与计价单位对照表
把上文分散的报价按“计价单位“归类,便于横向比价(仅列已核实或已锚定的条目):
| 计价单位 | 代表站点 | 典型价格 / 锚点 | 可信度 |
|---|---|---|---|
| 按成功记录(网页爬取) | Bright Data | 1.3–2.5 / 1000 条 | 【官方挂牌价】 |
| 按成功响应(网页爬取) | Zyte | 0.06–1.27 / 1000 次(API),1.01–16.08 / 1000 次(浏览器渲染) | 【官方挂牌价】 |
| 按月订阅(标注 SaaS) | Roboflow | $79/月(Core,年付) | 【官方挂牌价】 |
| 按席位 / 年(金融终端) | Bloomberg | 25,000–32,000 / 席位 / 年 | 【多源核实】 |
| 按席位 / 年(金融终端) | FactSet | ~$12,000 / 席位 / 年 | 【权威媒体+公示】 |
| 按席位 / 年(金融终端) | LSEG Eikon/Workspace | ~$22,000 / 席位 / 年(精简版 $3,600) | 【权威媒体原文】 |
| 按终端 / 年(金融终端) | Wind(万得) | 39,800 元 / 终端(EDB 34,600 元,量大降至 24,540 元) | 【权威媒体原文(报价单)】 |
| 按库 / 年(法律语料) | 北大法宝 | 单库 4.3 万–11.95 万元;14 库打包 8.2 万元 | 【公示核实】 |
| 按标注单元(LBU) | Labelbox | 0.10 / LBU;企业中位数 ~40K/年 | 【第三方成本平台】 |
| 按项目 / 标包(政企采购) | 海天瑞声 / 数据堂 | 229 万–6237 万元 / 标包(含 6% 增值税) | 【公示核实】 |
| 按股权 / 并购(规模锚点) | Scale AI / TELUS-Lionbridge / Defined.ai | Meta $14.3B 获 Scale 49%;TELUS $935M 收 Lionbridge AI;Defined.ai 融资 $62.3M | 【权威媒体/公示】 |
| 按融资轮(规模锚点) | Surge AI / Toloka / 丁香园 / V7 / 曼孚 | Surge 估值 $15–25B;Toloka $72M;丁香园 E 轮 5 亿;V7 估值 ~2 亿;曼孚 Pre-C 数亿元 | 【权威媒体/单一来源】 |
说明:绝大多数“按 token / 按张 / 按小时“的细粒度单价在合规厂商处并不公开,实际采购以“项目制 / 授权 / 标包“为主。上表“规模锚点“类(股权、并购、融资、营收)用于判断厂商体量,不能直接换算成单价。
数据交易所计价机制(国内)
国内四大数交所(上海、深圳、北京、贵阳)皆采用“挂牌 — 供需议价 / 授权“模式,计价维度通常为以下三类,但具体金额需进场洽谈,无公开单品价:
- 按数据集授权:一次性买断或限期授权某一数据集的使用权。
- 按年订阅:对持续更新的数据产品(如行情、舆情、产业库)按年付费。
- 按调用量:API 形式按查询/调用次数或流量计费(常见于金融、位置、气象类)。
可核实的大盘规模(用于判断平台活跃度,非单品价):
- 上海数据交易所:2024 年挂牌数据产品超 4500 种,全年交易额超 40 亿元(政府/媒体披露)。
- 贵阳大数据交易所:2025-05 发布 939 个高质量数据集(贵阳市大数据局官网 + 人民网 + 省政府三方互证),数据集交易额超 9000 万元(无单品明细)。
- 深圳 / 北京国际大数据交易所:均设 AI / 高质量数据集专区,挂牌授权模式,无公开单品价。
提示:数交所上架的数据集多为“高质量、已合规“数据,适合对版权要求高的商业训练场景;但需进场与数据商谈授权范围与价格,流程比直接采购成品数据集更长。
贡献
欢迎补充更多国内外优质数据集站点(含免费与商业化)。提交 PR 时请保持本 README 的格式与分类,附上可访问的链接、数据类型与报价(如适用),并标注价格来源与可信度,不要使用 emoji。
相似文章
@seclink: 这个项目有点意思, 它开源了一些可以用来做算法训练和研究的数据集合。
This project open-sources datasets that can be used for algorithm training and research.
@VincentLogic: 每天被 Arxiv 的新论文淹没?头都大了。 刚发现一个宝藏网站,专门聚合最新的 AI 论文和模型基准测试(Benchmarks)。 界面很干净,直接看 Trending 或者按周/月筛选。最爽的是每篇论文都直接关联了它用到的 bench…
推荐一个免费网站 sophon.at/papers,聚合最新 AI 论文和模型基准测试,界面干净,支持按 Trending 或周/月筛选,每篇论文直接关联所用 benchmark 和 model。
@ChrisSlacker: 50个超实用的GitHub仓库 1. iFixAi — AI对齐测试 → https://t.co/70ZaaoerS3 2. public-apis — 免费API合集 → https://t.co/x0Lqj0ww9B 3. buil…
一份整理了50个实用的GitHub仓库的精选列表,涵盖AI对齐测试、API合集、学习资源、AI Agent框架、大模型推理工具等,适合开发者和AI从业者收藏。
@yaojingang: 经好友拔刀刘同意,将他们近期抓取的国内各大AI平台数据集进行开源 清洗后的数据集、论文预印本以及第一份分析报告,已推送到GitHub仓库,地址见评论区 这应该是面向国内各大AI平台的最新、最全的一份公开GEO原始数据集 包括了豆包、Dee…
好友拔刀刘开源了国内8个AI平台的搜索结果数据集,包含620个标准问题、21万条引用记录,并提供清洗后的数据、论文预印本和分析报告。
@seclink: 分享今日信息差选题,自媒体同学可以关注。 面向创作者的云基础设施信息差分析 一、AI 推理服务的"免费军备竞赛" 海外已形成完整的免费 AI 推理生态,但中国开发者几乎不知道。 Groq 提供每分钟 30 次免费请求,无需绑定信用卡。它用…
分析海外免费AI推理生态,包括Groq等提供免费请求的服务,指出中国开发者对此信息差较大。