标签
本文讨论了利用Hugging Face上的开放训练数据来训练Marin’s 535B模型的过程,涉及来自152个数据集的25万亿token,并具有允许训练的许可证。
本文介绍了一个工具,显示了20个当前AI模型的发布时长和训练截止日期,并强调每个模型的数据可能有多陈旧。
本文通过使用OLMo-2和Pythia开放预训练语料库中的精确重复计数来研究语言模型中的成员推理,揭示了典型的重复水平显示出最小的暴露痕迹,并且明显的成员信号通常与句子知名度等因素混淆。
本文介绍了一个大型开放的土壤压实测试数据集,并建立了用于预测压实参数的机器学习基准,强调了用于实际筛选的物理约束模型。
Reactor Atlas 是一个交互式地图和数据库,自1954年以来记录了地球上所有的核反应堆,具有技术记录、动画解释以及停机和事件的实时监控。
SolarWM引入了一个开放框架和统一训练配方,用于通过跨多样数据源的可扩展训练构建交互式视频世界模型,从而实现长时程实时运行。
Rocky Linux 创始人 Gregory Kurtzer 宣布了 OpenWALDO 项目,旨在开放 AI 训练数据,以促进真正的开源 AI 发展。
世界火车地图是一份覆盖120个国家1247条著名火车路线的交互式地图集,最近由TrainRouter更名而来。它提供路线事实、统计数据和一个开放数据集。
Daniel van Strien将来自大英图书馆49,455本数字化图书(约1510–1900年)的1,080,814张公有领域图片上传至Hugging Face Hub,并按图片类型分为四个配置。
This paper argues that Latin America lacks the datasets and benchmarks layers needed to build its own AI, and proposes DataHub, an open, incentive-driven platform with a task-first ontology to index and contribute regional datasets.
这本freeCodeCamp手册教读者如何使用真实洪水数据在Python中构建生产级ETL管道,涵盖增量加载、类型强制转换、去重和幂等性。
MIT开发的医疗数据库演变为PhysioNet——一个全球性生物医学数据存储库,被全球数千名研究人员使用,正如近期《自然·健康》论文所述。
PhononBench-MP40 是一个基准数据集,包含超过46,000个源自Materials Project的晶体的声子稳定性标签和光谱,旨在评估工作流定义的声子稳定性并支持材料筛选。
The Book Prize Index 是一个可检索的获奖图书索引,旨在让文学奖记录对读者、研究者、图书馆员和出版者开放且有用。
使用Three.js构建的Shinjuku Station室内3D地图,数据来源于日本国土交通省的公开政府数据。
一个数据驱动的可视化项目,通过记录的事件重建FIFA World Cup 2026的每一场比赛,呈现完全由数据构建的印象。