@seclink: 分享 数据集 的 收录站点 ,免费的研究数据集 和 收费的都有!

X AI KOLs Timeline 工具

摘要

一个GitHub仓库整理了国内外用于大模型与生成式AI训练的数据集下载站点,涵盖文生文、文生图、文生视频,按地区和类型分类,免费与付费资源均有收录。

分享 数据集 的 收录站点 ,免费的研究数据集 和 收费的都有! https://t.co/IycmdYASJs
查看原文
查看缓存全文

缓存时间: 2026/08/06 14:39

分享 数据集 的 收录站点 ,免费的研究数据集 和 收费的都有!

https://t.co/IycmdYASJs


XiaomingX/awesome-datasets

Source: https://github.com/XiaomingX/awesome-datasets

Awesome Datasets

收集国内外可用于大模型(LLM)与生成式 AI 训练的数据集下载站点,对标 ModelScope 数据集。覆盖文生文(文本预训练与后训练)、文生图、文生视频三类需求,按数据类型与地区分类整理。

所有链接均经过整理核对,少数站点因网络环境限制未能在本机直接验证,已在条目后用 (核对) 标注,发布前建议在浏览器中确认。

目录


综合类枢纽

这些平台同时涵盖文本、图像、视频等多模态数据,是首选的入口。

站点地区链接说明
Hugging Face Datasets国际https://huggingface.co/datasets最大的机器学习数据集托管与版本管理平台,绝大多数数据集可免费下载(部分需申请授权)
ModelScope 魔搭中国https://modelscope.cn/datasets阿里推出的开源模型与数据集社区,国内最接近 Hugging Face 的平台,多数数据集免费下载
OpenDataLab 开放数据平台中国https://opendatalab.com/上海人工智能实验室推出的开放数据集平台,覆盖文本/图像/视频,注册后可免费下载
Kaggle Datasets国际https://www.kaggle.com/datasets社区化数据集仓库,含内置 Notebook 环境,登录后可免费下载
OpenXLab 浦源中国https://openxlab.org.cn/datasets面向具身智能与基础模型的开放数据集/模型平台,免费下载
GitHub国际https://github.com/大量研究数据集以代码仓库形式发布(常通过 Git LFS 或下载脚本分发),免费
Google Dataset Search国际https://datasetsearch.research.google.com/跨站数据集搜索引擎,索引全网数据集并跳转至原始来源

文生文:文本预训练与后训练数据

国际站点(文本)

  • Hugging Face Datasets

    • 链接:https://huggingface.co/datasets
    • 类型:文本 / 多模态
    • 说明:各类 ML 数据集的最大枢纽,免费浏览,多数可免费下载(部分需授权)。
    • 代表数据集:RedPajama-Data-1TC4FineWebOpenAssistantDolly-15kSlimPajama
  • Kaggle Datasets

    • 链接:https://www.kaggle.com/datasets
    • 类型:文本 / 图像 / 视频 / 表格 / 多模态
    • 说明:社区数据集仓库,含内置 Notebook 环境,登录后免费下载。
    • 代表数据集:Common CrawlWikipedia 转储、各类 NLP 与指令数据。
  • GitHub

    • 链接:https://github.com/
    • 类型:文本 / 图像 / 视频 / 代码 / 多模态
    • 说明:研究数据集的主要发布源(常通过 Git LFS、Hugging Face 链接或下载脚本分发),免费。
    • 代表数据集:RedPajama-Data(togethercomputer)、The Pile(EleutherAI)、AlpacaVicuna 训练数据。
  • Papers with Code — Datasets

    • 链接:https://paperswithcode.com/datasets
    • 类型:文本 / 图像 / 视频 / 多模态
    • 说明:与论文和榜单关联的数据集索引,跳转至下载源,免费。
    • 代表数据集:覆盖 NLP、CV、ML 各领域的基准数据集。
  • Common Crawl

    • 链接:https://commoncrawl.org/
    • 类型:文本(网页语料)
    • 说明:免费开放的原始与处理后网页爬取数据(WARC/WAT/WET、CC-MAIN),PB 级,可通过 S3/HTTPS 下载。
    • 代表数据集:每月 CC-MAIN 爬取、CCNet 处理文本。
  • The Pile(EleutherAI)

    • 链接:https://pile.eleuther.ai/
    • 类型:文本
    • 说明:EleutherAI 构建的 800GB+ 多样化英文文本语料,用于 LLM 预训练,免费下载。
    • 代表数据集:Pile-CCPile-arXivPile-GithubPile-StackExchangePile-Books3
  • Academic Torrents

    • 链接:https://academictorrents.com/
    • 类型:文本 / 图像 / 视频 / 多模态
    • 说明:基于 BitTorrent 的分布式研究数据集与论文仓库,社区维护,免费。
    • 代表数据集:The PileRedPajamaImageNetLAION 子集。
  • RedPajama

    • 链接:数据集 https://huggingface.co/datasets/togethercomputer/RedPajama-Data-1T ;项目 https://www.redpajama.ai/ (核对)
    • 类型:文本
    • 说明:LLaMA 1.2T token 训练集的开放复现(Together AI 等),免费下载。
    • 代表数据集:RedPajama-Data-1TRedPajama-Data-v2(30+ 万亿 token)。
  • Zenodo

    • 链接:https://zenodo.org/ (核对)
    • 类型:文本 / 图像 / 视频 / 多模态
    • 说明:CERN 支持的通用途科研数据仓库,提供 DOI,免费上传/下载。
    • 代表数据集:大量学术语料、OSCAR、ML 补充数据集。
  • Figshare

    • 链接:https://figshare.com/
    • 类型:文本 / 图像 / 视频 / 多模态
    • 说明:提供 DOI 的学术图表/数据集仓库,免费下载。
    • 代表数据集:众多科研补充数据集。
  • Google Dataset Search

    • 链接:https://datasetsearch.research.google.com/
    • 类型:文本 / 图像 / 视频 / 多模态
    • 说明:跨网数据集搜索引擎,索引并跳转至原始来源,免费使用。
    • 代表数据集:索引 Kaggle、Zenodo、data.gov、高校仓库等。
  • Data.gov(美国)/ data.gov.uk(英国)

    • 链接:https://www.data.gov/ 、https://data.gov.uk/
    • 类型:文本 / 表格 / 多模态
    • 说明:官方开放政府数据门户,免费下载,可用于公版文本/语料。
    • 代表数据集:法律法规、专利、公共记录、人口普查文本。
  • CEUR Workshop Proceedings

    • 链接:https://www.ceur-ws.org/
    • 类型:文本
    • 说明:计算机 workshop 论文的开放获取论文集,是论文附属数据集与语料的来源。
    • 代表数据集:各 workshop 发布的 NLP/ML 数据集。

国内站点(文本)

  • ModelScope 魔搭 — 数据集

    • 链接:https://modelscope.cn/datasets
    • 类型:文本 / 图像 / 视频 / 音频 / 多模态
    • 说明:阿里开源模型与数据集社区,国内最接近 Hugging Face 的平台,多数免费下载(部分需授权)。
    • 代表数据集:Belle SFT 数据、COIG 中文指令数据、ZeroList 系列。
  • OpenDataLab 开放数据平台

    • 链接:https://opendatalab.com/
    • 类型:文本 / 图像 / 视频 / 多模态
    • 说明:上海人工智能实验室推出的大型开放数据集平台,注册后免费下载。
    • 代表数据集:Wukong 中文图文、MSCOCO-CN 等大量学术数据集。
  • 阿里天池 Tianchi

    • 链接:https://tianchi.aliyun.com/
    • 类型:文本 / 图像 / 视频 / 表格 / 多模态
    • 说明:阿里数据科学竞赛与数据集平台,多数数据集免费下载。
    • 代表数据集:天池中文语料、竞赛数据集、NLPCC 评测数据。
  • 百度 AI Studio / 千帆

    • 链接:https://aistudio.baidu.com/
    • 类型:文本 / 图像 / 视频 / 多模态
    • 说明:百度的 AI 开发平台,含数据集市场与免费数据集,提供免费额度。
    • 代表数据集:DuReader(机器阅读理解)、中文诗歌/语料集。
  • BAAI 智源研究院 开放数据

    • 链接:https://data.baai.ac.cn/ 、https://www.baai.ac.cn/
    • 类型:文本 / 图像 / 视频 / 多模态
    • 说明:北京智源人工智能研究院开放数据门户,免费科研数据集。
    • 代表数据集:WuDaoCorpora(200GB 中文文本)、COIGFlickr30k-CN
  • OpenXLab 浦源

    • 链接:https://openxlab.org.cn/datasets
    • 类型:文本 / 图像 / 视频 / 多模态
    • 说明:面向具身智能与基础模型的开放数据集/模型平台,免费下载。
    • 代表数据集:OpenX-EmbodimentInternVideo 数据。
  • OMEGA 开放多模态数据计划

    • 链接:https://opendatalab.com/ (搜索 “OMEGA”)(核对具体落地页)
    • 类型:多模态 / 文本 / 图像
    • 说明:OpenDataLab 生态下的超大规模开放多模态数据计划,免费。
    • 代表数据集:OMEGA 多模态语料、中文网页文本集。
  • DataBall 数据球

    • 链接:https://databall.cn/ (核对)
    • 类型:文本 / 图像 / 多模态
    • 说明:中文开放数据集聚合/搜索门户,免费浏览与下载。
    • 代表数据集:精选中文 NLP 与 CV 数据集。
  • TianGong 天工

    • 链接:https://www.tiangong.org.cn/ (核对)
    • 类型:文本 / 多模态
    • 说明:天工智能发起的开放 AI 数据计划,免费科研数据集。
    • 代表数据集:TianGong 中文文本与多模态语料。
  • CNGBdb 国家基因库

    • 链接:https://db.cngb.org/
    • 类型:文本 / 生物信息
    • 说明:国家基因库数据库,免费生物与基因组序列数据,仅适用于科研/生物医学 LLM 预训练。
    • 代表数据集:基因组/多组学序列仓库(如 GSA)。

文生图:图像生成训练数据

国际站点(图像)

  • LAION

    • 链接:https://laion.ai/
    • 类型:图像 / 多模态(图文)
    • 说明:支撑 Stable Diffusion 的开放大规模图文数据集,免费(部分子集因安全原因下线/重链)。
    • 代表数据集:LAION-5BLAION-400MLAION-AestheticsCOYO-700M
  • ImageNet

    • 链接:https://www.image-net.org/
    • 类型:图像(分类)
    • 说明:经典 1400 万图像标注数据集,非商业研究可免费使用(需注册)。
    • 代表数据集:ImageNet-1kImageNet-21k
  • COCO(Common Objects in Context)

    • 链接:https://cocodataset.org/
    • 类型:图像(检测 / 描述)
    • 说明:大规模目标检测、分割与图像描述数据集,研究免费。
    • 代表数据集:COCO 2017(captions、instances、keypoints)。
  • Google Conceptual Captions

    • 链接:https://ai.google.com/research/ConceptualCaptions/
    • 类型:图文
    • 说明:网页规模的图文对数据,用于视觉-语言训练,免费下载。
    • 代表数据集:CC3MCC12M
  • Pexels

    • 链接:https://www.pexels.com/ (核对直接下载权限 — 受 API/许可限制)
    • 类型:图像 / 视频
    • 说明:CC0 免费图库与视频,按 Pexels 许可下载(用于模型训练再分发需谨慎)。
    • 代表数据集:精选图库/视频库。
  • Pixabay

    • 链接:https://pixabay.com/ (核对直接下载权限 — 受 API/许可限制)
    • 类型:图像 / 视频
    • 说明:CC0 免费图像、插画与视频,按 Pixabay 许可下载。
    • 代表数据集:大型 CC0 媒体库。
  • Hugging Face Datasets(交叉引用)

    • 链接:https://huggingface.co/datasets
    • 代表图文数据集:laion/laion-400-opendiffusiondbtextcapscoyo-700m
  • Kaggle Datasets(交叉引用)

    • 链接:https://www.kaggle.com/datasets
    • 代表:ImageNet、COCO、各类描述数据集。

国内站点(图像)

  • Wukong 悟空(通过 OpenDataLab / BAAI)

    • 链接:https://opendatalab.com/ 、https://data.baai.ac.cn/
    • 类型:图文
    • 说明:1 亿中文图文对,用于中文文生图模型训练,免费。
    • 代表数据集:Wukong-100M
  • ModelScope / 天池 / AI Studio(见上文交叉引用)— 托管中文图文与绘画风格数据集(如 Taiyi 扩散数据、Guofeng 风格集)。


文生视频:视频生成训练数据

国际站(视频)

  • WebVid(WebVid-10M)

    • 链接:https://github.com/m-bain/webvid
    • 类型:视频-文本
    • 说明:1000 万+ 库存视频片段与描述对,广泛用于训练文生视频模型,研究免费(需注册授权)。
    • 代表数据集:WebVid-10MWebVid-2M
  • Panda-70M

    • 链接:https://github.com/snap-research/Panda-70M (项目页 https://snap-research.github.io/Panda-70M/ )
    • 类型:视频-文本
    • 说明:7000 万高质量视频-描述对,自动标注自 YouTube,免费(研究用途,受 YouTube 条款约束)。
    • 代表数据集:Panda-70M
  • InternVid

    • 链接:https://github.com/OpenGVLab/InternVideo (数据 https://huggingface.co/datasets/OpenGVLab/InternVid-Full )
    • 类型:视频-文本
    • 说明:约 2.3 亿视频-文本对,用于视频理解与生成,免费。
    • 代表数据集:InternVid-FullInternVid-10M
  • Hugging Face Datasets(交叉引用)

    • 链接:https://huggingface.co/datasets
    • 代表视频-文本数据集:InternVid-FullPanda-70M 索引、WebVid 镜像、SkyTimelapse
  • Academic Torrents(交叉引用)

    • 链接:https://academictorrents.com/
    • 代表:WebVid 及各类视频基准种子。
  • SkyTimelapse

    • 链接:https://github.com/weixiong-ur/VideoSummarization (搜索 “SkyTimelapse”)(核对具体仓库)
    • 类型:视频(延时)
    • 说明:天空延时视频数据集,用于视频预测/生成,研究免费。
    • 代表数据集:SkyTimelapse-320k

国内站(视频)

  • OpenDataLab / OpenXLab / BAAI(交叉引用)

    • 链接:https://opendatalab.com/ 、https://openxlab.org.cn/datasets 、https://data.baai.ac.cn/
    • 代表视频数据集:InternVid-Full(托管)、VideoChat 指令数据、具身视频集。
  • ModelScope 魔搭(交叉引用)

    • 链接:https://modelscope.cn/datasets
    • 代表:中文视频-文本、数字人说话视频数据集。

使用建议

  • 预训练语料优先:Common Crawl、The Pile、RedPajama、WuDaoCorpora、Belle/COIG。
  • 后训练/SFT/RLHF 数据:Hugging Face、ModelScope、OpenAssistant、Dolly、ShareGPT 类指令集。
  • 文生图:LAION、COCO、Conceptual Captions、Wukong。
  • 文生视频:WebVid、Panda-70M、InternVid。

下载前请务必确认各数据集的许可证(License)与适用条款,区分研究用途与商业用途,避免侵权。

商业化可采购的预训练数据集站点(付费 / 授权)

以下站点提供可付费采购或商业授权的预训练数据(文本 / 图像 / 视频 / 多模态),区别于上文的免费公开枢纽。多数企业级数据服务商不公开挂牌单价,采用“企业询价 / 项目制 / 授权“模式;少数公开计价的已单独标注。

价格交叉验证说明(重要)

为防止单一媒体渠道误导或被虚假报价欺骗,本节的报价均按以下口径标注可信度:

  • 【官方挂牌价】:来自厂商官网定价页,已核实。
  • 【中标/采购公示价】:来自政府或央企公开采购公示(如财政部政府采购网、中国移动采购公示),多源一致,可信度最高。
  • 【企业询价】:官网不公开报价,需联系商务,无公开数字。
  • 【单一来源·未核实】:仅单一渠道(多为媒体/第三方评测)给出数字,且未能从第二来源印证,仅供参考,请务必自行向官方复核。

凡属【单一来源·未核实】的数字均已在条目标注,请勿直接采信。

国际商业化站点

站点链接数据类型报价与计价单位可信度
Bright Datahttps://brightdata.com网页文本 / 爬虫数据Web Scraper API 按成功记录计费:约 $1.5 / 1000 条(按需),Scale 套餐约 $1.3 / 1000 条;成品数据集约 $2.5 / 1000 条【官方挂牌价】官网定价页核实
Zytehttps://www.zyte.com网页爬取数据Zyte API 约 0.06–1.27 / 1000 次成功响应(按承诺档位);浏览器渲染 1.01–16.08 / 1000 次【官方挂牌价】官网定价页核实
Roboflowhttps://roboflow.com图像 / 视频标注与训练公开档:免费(15 credits/月);Core 79/月(年付),99/月(月付);企业版定制【官方挂牌价】官网定价页核实
Bloomberg Terminalhttps://www.bloomberg.com/professional金融文本 / 行情终端约 25,000–32,000 / 席位 / 年(通常两年租约)【中标/多源】Wall Street Prep、雪球等多源一致
Scale AIhttps://scale.com文本 / 图像 / 视频 / 多模态企业询价;真实锚点:Meta 2025 以约 $14.3–14.8B 获其 49% 非投票权股份(Bloomberg/Reuters/NYT/The Information 四源一致);2024 营收约 $870M(Reuters);2022 年美国国防部合同 $250M(公开公示)【权威媒体原文核实】+$250M 合同【公示核实】
Surge AIhttps://surge.ai文本 / LLM 训练数据企业询价;真实锚点:2024 营收约 $1.2B、估值 $15–25B(Bloomberg 2025-07-30 原文);单条/每小时标注单价无可核实公开费率卡【权威媒体原文核实】
Appenhttps://appen.com语音 / 文本 / 图像 / 视频企业询价;真实锚点:原最大客户(Google)退出前年花费约 $70–75M(由 FY2024 Q2 披露的前置 Google 收入 $18.3M 年化得出,ASX 年报);注意 CNBC 报道的 $15/小时为承包商劳务价,非买家价【财报核实】
TELUS Internationalhttps://www.telusinternational.com多语言文本 / 语音 / 图像企业询价;真实锚点:其收购 Lionbridge AI 作价 US935M(C1.2B,2020),TELUS 新闻稿 / Reuters / Nasdaq 三源一致【财报/公示核实】
Defined.aihttps://defined.ai语音 / 文本 / 图像(市场)企业询价;规模锚点:累计融资约 $62.3M(A 轮 $11.8M 见 Fortune 2018、B 轮 $50.5M 见 Privco 2020,两源互证),独立运营、未被收购;数据集市场为 custom pricing(Datarade/Spotsaas 共同确认未公开)【权威媒体+第三方核实】融资可核实;单价无法核实
Webz.iohttps://webz.io新闻 / 网页文本企业询价;免费层锚点明确:News API Lite 为 1000 次/月(每次最多 10 篇,开源文档仓库可查);付费单价仍 quote-only【单一来源·未核实(免费层)】付费单价无法核实
LexisNexishttps://www.lexisnexis.com法律 / 新闻 / 商业文本企业/学术询价;官方定价页明确 “prices vary by client, customized solutions”,无公开机构价;个别高校旧数据(如 2011 年印度高校 Rs.48 万/年)不可外推【权威媒体原文核实(官方定制声明)】单价无法核实
FactSet / LSEG / Refinitivhttps://www.factset.com金融文本 / 时序真实锚点:FactSet 公开标价约 $12,000 / 席位 / 年(厂商公开价,FY2024 ASV $2.28B 印证);LSEG Eikon/Workspace 约 $22,000 / 席位 / 年(精简版 $3,600)【权威媒体+公示核实】
Innodatahttps://innodata.com文本 / GenAI 数据企业询价(上市公司);真实锚点:FY2024 营收 $170.5M,最大客户占 48% 约 $82M,近期扩约约 $24M(NASDAQ:INOD 10-K)【财报核实】
Encordhttps://encord.com图像 / 视频标注企业询价;独立未退出公司,无公开价、无第三方中位数、无收购价,规模锚点仅为“2021 年 A 轮约 $20M 级“【无法核实】
V7https://www.v7labs.com图像 / 视频标注企业询价;规模锚点:2022 年估值约 $2 亿、累计融资约 $3,600 万(量子位 2022-11-29,单一来源);官网 V7 Go 明确 “custom, usage-based pricing”【单一来源·未核实(融资)】单价无法核实
Labelboxhttps://labelbox.com多模态标注公开档 Free–$3,500/月;真实锚点:企业版客户年费中位数约 $40,000/年(Vendr 交易流),标注单元 LBU $0.10【第三方成本平台核实】
Tolokahttps://toloka.ai众包标注 / RLHF企业询价;规模锚点:2025 年融资 72M(Bezos Expeditions 领投,Reuters 转载 + Tadviser 双源一致),源自 Yandex、现属 Nebius Group;买家最低消费与单任务费率未公开(0.01–$5/任务为工人侧报酬)【权威媒体原文核实(融资)】单价无法核实
Datarade(聚合)https://datarade.ai聚合 2600+ 供应商买家免费浏览;单数据集由供应商定价(多数询价)【官方挂牌价】平台模式核实
AWS Data Exchangehttps://aws.amazon.com/data-exchange数据集市场免费 + 付费订阅 + API 按量;单价见各商品页【官方挂牌价】平台模式核实
Snowflake Marketplacehttps://marketplace.snowflake.com数据市场多为免费实时共享; monetized 列表由供应商定价【官方挂牌价】平台模式核实

注意:Bright Data、Zyte 提供的网页爬取文本用于大模型预训练存在服务条款与版权风险,采购前请确认授权范围。Bloomberg / LexisNexis / FactSet 等金融与法律文本授权清晰但昂贵且受限,不适合作为大规模预训练语料堆。

国内商业化站点

站点链接数据类型报价与计价单位可信度
海天瑞声https://haitianruisheng.com/语音 / 文本 / 图像 / 视频 / 多模态企业询价;可核实中标价:财政部 2025-05-19 人工智能数据集服务中标 229.3 万元;中移动 2025 大模型数据集包4(语音识别)含税 615.14 万元(不含税 580.32 万元,增值税 6%,与公示完全一致);中移动 2026–2027 框架海天瑞声标包(视频+音频)约 6237 万元【公示核实】财政部 + 千里马/寻标宝公示一致
数据堂https://www.datatang.com/文本 / 语音 / 图像 / 多模态企业询价;可核实中标价:财政部 2025-05-07 互联网数据采购中标 485 万元(北京政府采购合同互证);中移动 2025 包5(文本知识库)含税 383.72 万元;年报营收 3.62 亿元、毛利率 49.84%(新三板 831428)【公示/财报核实】财政部 + 中移动公示 + 年报
标贝科技https://www.data-baker.com/语音 / 文本 / 图像 / 视频企业询价;官方平台证据:阿里云市场店铺“图像语音点云数据标注采集定制服务“近 180 天成交 0 笔、无标价,为引流/询价入口【官方平台核实】无公开单价
视觉中国https://www.vcg.com/多模态(图 / 视频 / 3D)企业询价;真实锚点:港股招股书披露 2025 内容授权服务收入 5.24 亿元、内容定制服务收入 2.09 亿元(每日经济新闻/新浪/澎湃等多家引用招股书,互证);注意该数字为内容业务整体收入,招股书未单列“AI 训练数据“营收线;头部大模型客户付费金额无可核实披露。微图 Veer 单图 36 元为【单一来源·未核实】,非官方价目表【权威媒体原文核实(招股书)】
BasicFinder 数据工场(倍赛)https://www.basicfinder.com/采集 / 标注 / 训练数据企业询价;规模锚点:2019 年 A 轮数千万元(36氪),自营 12 家数据中心、2000+ 全职标注师;无公开单价(worker/buyer 均未披露)【单一来源·未核实(融资)】单价无法核实
曼孚科技 / Testin 云测 等标注商https://www.mindflow.tech/ 、https://www.testin.cn/标注为主,少量成品数据集企业询价 / 项目制;无公开单价。曼孚规模锚点:多轮融资(2022 Pre-B 5000 万、2025 B+++ 近亿、2026 Pre-C 数亿元,投资界/多家媒体);Testin 2011 年成立、百万级客户,无公开财务数据【单一来源·未核实(曼孚融资)】单价无法核实
上海数据交易所https://www.chinadep.com/多模态高质量数据集挂牌授权 / 按调用;无公开单品价(大盘:2024 年挂牌产品超 4500 种、交易额超 40 亿元,政府/媒体披露)【权威媒体核实(大盘)】单品仍询价
贵阳大数据交易所https://www.gzdex.com.cn/高质量数据集(文字/音频/图/视频,含预训练/指令微调集)挂牌但无公开单品价;规模可核实:2025-05 发布 939 个高质量数据集(贵阳市大数据局官网 + 人民网 + 省政府三方互证),数据集交易额超 9000 万元(无单品明细)【官方核实】规模可核实;单品仍询价
深圳数据交易所https://www.szdex.com/AI / 高质量数据集挂牌授权;无公开单价【企业询价】
北京国际大数据交易所https://www.bjbdp.com.cn/数据交易板块挂牌授权;无公开单价【企业询价】
阿里云市场(数据交换)https://market.aliyun.com/dataexchange标准 / 定制数据集数据集购买 / 订阅 + 请求者付费;单数据集单价进商品页查【官方挂牌价】平台机制核实
京东万象(京东云)https://dop.jd.com/portalAPI 调用型数据按接口调用次数 / 套餐包计费;示例:短链生成约 0.001 元 / 次(【单一来源·未核实】,来自京东云文档)【官方文档】API 价有官方依据;成品数据集无公开价
腾讯云媒体 AIhttps://cloud.tencent.com/视频处理(非数据集售卖)视频理解约 1.5 元 / 分钟、视频摘要约 0.28 元 / 分钟(【单一来源·未核实】,第三方评测,非官网定价页)【单一来源·未核实】
百度智能云 / 华为云 / 火山引擎https://cloud.baidu.com/ 、https://www.huaweicloud.com/ 、https://www.volcengine.com/以模型服务 / 算力为主企业询价 / 按模型调用计费;无训练数据集公开单价【企业询价】
通联数据https://www.datayes.com/金融文本语料企业询价 / 年订阅;可见数字仅为社区估算(约 1–3 万/年),无官方/公示价,不采纳【单一来源·未核实】
Wind(万得)https://www.wind.com.cn/金融文本语料真实锚点:记者取得的 Wind 报价单原文——单终端账号年费 39,800 元,经济数据库(EDB)34,600 元/年,采购 200 终端均价降至 24,540 元(上海证券报 2023-09-11 报价单原文 + 红星资本局 2024-09-23 销售确认,互证)【权威媒体原文核实(报价单)】
北大法宝https://www.pkulaw.com/法律文本语料真实可核实单价:单库年使用权 4.3 万–11.95 万元(多校采购公示区间);14 库打包 8.2 万元(财政部政府采购网 2025-06-12 + 华中师大 2024-07-04 结果公告,互证,注意 8.2 万为打包价非单库价);训练批量授权企业询价【公示核实】财政部 + 校方公示一致
医脉通(HK2192)https://www.medlive.cn/医疗文本语料机构订阅;训练授权企业询价。规模锚点:2024 年收入 5.585 亿元、净利 3.303 亿元(港股年报,公示级);业务本质为医生平台+医药营销,其“金标数据“语料库用于内部模型,未见对外售卖单价【公示/财报核实(营收)】训练数据单价无法核实
丁香园https://www.dxy.cn/医疗文本语料机构订阅;训练授权企业询价。规模锚点:2020 年 E 轮 5 亿美元(上证报/新浪/百度百科多源一致);医疗数据开放平台为“填需求→客户经理对接“模式,无公开价【权威媒体原文核实(E轮)】单价无法核实

采购防骗要点

  • 主流合规训练数据以企业询价 / 项目制 / 授权为主,公开明码标价的极少。可多源印证的“硬价格信号“主要是央企/政府公开采购中标公示(如中移动系列采购,单包数百万元至数千万元级,含 6% 增值税)以及上市公司财报/年报披露的数据业务营收与客户集中度。
  • 已升级核实的“真实价格锚点“(均来自 ≥2 独立来源):Scale AI(Meta 2025 以约 $14.3B 获 49% 股权,四家权威媒体原文一致)、Appen(原最大客户年花费约 70–75M,ASX 年报)、TELUS International(2020 年以 US935M / C$1.2B 收购 Lionbridge AI 整个 AI 数据部门,TELUS 新闻稿/Business Wire/Nasdaq/Kirkland 四源一致)、FactSet(约 $12,000/席位/年,厂商公开价 + SEC 备案互证)、Innodata(FY2024 营收 $170.5M、最大客户约 $82M,10-K)、Labelbox(企业中位数约 $40K/年,Vendr 交易流)、Toloka(2025 年融资 $72M,Reuters 转载 + Tadviser 双源一致)、海天瑞声/数据堂(财政部与中移动中标公示,金额互证且税率自洽)、Wind(单终端 39,800 元/年,记者取得报价单原文 + 销售确认)、北大法宝(单库年使用权 4.3 万–11.95 万元,多校公示)、医脉通(2024 年收入 5.585 亿元,港股年报)、丁香园(2020 年 E 轮 5 亿美元,多源一致)。
  • 重要澄清:$935M 是 TELUS 收购 Lionbridge AI 的价,与 Defined.ai 无关。Defined.ai(前 DefinedCrowd)独立运营、从未被收购,累计融资约 $62.3M(Fortune + Privco 两源互证)。请勿将二者混淆。
  • 警惕低价“千亿 token 中文语料包“:合规厂商(海天瑞声、数据堂、视觉中国等)均强调已获授权、全链路溯源,不按“裸 token 量“低价零售;低价裸语料包通常存在版权瑕疵,不建议用于商业大模型训练。
  • 凡标注【单一来源·未核实】的数字(如视觉中国微图单图 36 元、京东万象 0.001 元/次、腾讯云视频按分钟价、通联/同花顺/恒生聚源的年费估算),均仅来自单一渠道,请务必向官方核实后再决策,切勿当作成交价。
  • 易混淆澄清:视觉中国 5.24 亿 / 2.09 亿元为“内容授权/定制“整体业务收入(招股书未单列 AI 训练数据线);北大法宝 8.2 万元为 14 库打包价,单库实际 4.3 万–11.95 万元;中移动 2025 项目与 2026–2027 框架为两个独立项目,引用时请注意年份。
  • 网页爬取类数据(Bright Data / Zyte / Webz.io)用于预训练存在服务条款与版权风险,需确认授权范围。

价格锚点与计价单位对照表

把上文分散的报价按“计价单位“归类,便于横向比价(仅列已核实或已锚定的条目):

计价单位代表站点典型价格 / 锚点可信度
按成功记录(网页爬取)Bright Data1.3–2.5 / 1000 条【官方挂牌价】
按成功响应(网页爬取)Zyte0.06–1.27 / 1000 次(API),1.01–16.08 / 1000 次(浏览器渲染)【官方挂牌价】
按月订阅(标注 SaaS)Roboflow$79/月(Core,年付)【官方挂牌价】
按席位 / 年(金融终端)Bloomberg25,000–32,000 / 席位 / 年【多源核实】
按席位 / 年(金融终端)FactSet~$12,000 / 席位 / 年【权威媒体+公示】
按席位 / 年(金融终端)LSEG Eikon/Workspace~$22,000 / 席位 / 年(精简版 $3,600)【权威媒体原文】
按终端 / 年(金融终端)Wind(万得)39,800 元 / 终端(EDB 34,600 元,量大降至 24,540 元)【权威媒体原文(报价单)】
按库 / 年(法律语料)北大法宝单库 4.3 万–11.95 万元;14 库打包 8.2 万元【公示核实】
按标注单元(LBU)Labelbox0.10 / LBU;企业中位数 ~40K/年【第三方成本平台】
按项目 / 标包(政企采购)海天瑞声 / 数据堂229 万–6237 万元 / 标包(含 6% 增值税)【公示核实】
按股权 / 并购(规模锚点)Scale AI / TELUS-Lionbridge / Defined.aiMeta $14.3B 获 Scale 49%;TELUS $935M 收 Lionbridge AI;Defined.ai 融资 $62.3M【权威媒体/公示】
按融资轮(规模锚点)Surge AI / Toloka / 丁香园 / V7 / 曼孚Surge 估值 $15–25B;Toloka $72M;丁香园 E 轮 5 亿;V7 估值 ~2 亿;曼孚 Pre-C 数亿元【权威媒体/单一来源】

说明:绝大多数“按 token / 按张 / 按小时“的细粒度单价在合规厂商处并不公开,实际采购以“项目制 / 授权 / 标包“为主。上表“规模锚点“类(股权、并购、融资、营收)用于判断厂商体量,不能直接换算成单价。

数据交易所计价机制(国内)

国内四大数交所(上海、深圳、北京、贵阳)皆采用“挂牌 — 供需议价 / 授权“模式,计价维度通常为以下三类,但具体金额需进场洽谈,无公开单品价:

  • 按数据集授权:一次性买断或限期授权某一数据集的使用权。
  • 按年订阅:对持续更新的数据产品(如行情、舆情、产业库)按年付费。
  • 按调用量:API 形式按查询/调用次数或流量计费(常见于金融、位置、气象类)。

可核实的大盘规模(用于判断平台活跃度,非单品价):

  • 上海数据交易所:2024 年挂牌数据产品超 4500 种,全年交易额超 40 亿元(政府/媒体披露)。
  • 贵阳大数据交易所:2025-05 发布 939 个高质量数据集(贵阳市大数据局官网 + 人民网 + 省政府三方互证),数据集交易额超 9000 万元(无单品明细)。
  • 深圳 / 北京国际大数据交易所:均设 AI / 高质量数据集专区,挂牌授权模式,无公开单品价。

提示:数交所上架的数据集多为“高质量、已合规“数据,适合对版权要求高的商业训练场景;但需进场与数据商谈授权范围与价格,流程比直接采购成品数据集更长。

贡献

欢迎补充更多国内外优质数据集站点(含免费与商业化)。提交 PR 时请保持本 README 的格式与分类,附上可访问的链接、数据类型与报价(如适用),并标注价格来源与可信度,不要使用 emoji。

相似文章

@VincentLogic: 每天被 Arxiv 的新论文淹没?头都大了。 刚发现一个宝藏网站,专门聚合最新的 AI 论文和模型基准测试(Benchmarks)。 界面很干净,直接看 Trending 或者按周/月筛选。最爽的是每篇论文都直接关联了它用到的 bench…

X AI KOLs Timeline

推荐一个免费网站 sophon.at/papers,聚合最新 AI 论文和模型基准测试,界面干净,支持按 Trending 或周/月筛选,每篇论文直接关联所用 benchmark 和 model。

@yaojingang: 经好友拔刀刘同意,将他们近期抓取的国内各大AI平台数据集进行开源 清洗后的数据集、论文预印本以及第一份分析报告,已推送到GitHub仓库,地址见评论区 这应该是面向国内各大AI平台的最新、最全的一份公开GEO原始数据集 包括了豆包、Dee…

X AI KOLs Timeline

好友拔刀刘开源了国内8个AI平台的搜索结果数据集,包含620个标准问题、21万条引用记录,并提供清洗后的数据、论文预印本和分析报告。