@gui_penedo:今天我们宣布成立 Macrodata Labs。过去几年,@HKydlicek 和我一直在将互联网的很大一部分转化为……

X AI KOLs Following 工具

摘要

今天,Macrodata Labs 宣布成立,同时推出了 Refiner,一个用于处理机器人数据集的开源框架。该框架旨在帮助团队从演示和传感器数据中提取更多信号。

今天我们宣布成立 Macrodata Labs。 过去几年,@HKydlicek 和我一直在将互联网的很大一部分转化为一些最大的开放 LLM 预训练数据集。通过 FineWeb、FineWeb2、FinePDFs、FineTranslations 以及相关工作,我们亲眼见证了计算和数据的规模化如何推动 LLM 的进步。 我们开始看到机器人领域也出现类似的起飞。 借助 LLM 和 VLM 的进步,机器人技术终于开始规模化。但物理数据比文本数据更杂乱:大视频文件、多速率传感器、多种不同格式,以及关于记录哪些信号、哪些标注重要、如何将所有背景转化为更好策略的开放性问题。 这使得机器人领域的数据工作尤为重要。团队需要从每一次演示、轨迹、视频帧和传感器流中提取尽可能多的信号,而不是每次更换机器人、传感器、格式或标注方法时都重建整个数据栈。 我们认为目前仍然缺乏合适的工具。这正是我们创建 Macrodata Labs 的原因。我们的第一步是 Refiner,一个用于处理机器人数据集的开源框架。 我们设计 Refiner 是为了处理多种机器人格式,并帮助团队从每次演示中提取更多信号。今天发布的版本支持手部追踪、子任务标注和奖励模型评分。 我们还推出了 Refiner 的云端版本,这样团队可以专注于数据而非基础设施。只需更改一行代码,同一管道就可以在我们的平台上扩展,其中内置了分片、检查点、模型部署、故障恢复和详细的可观测性。 我们很幸运得到了 Air Street Capital、Drysdale Ventures、OPRTRS club、Kima Ventures、YG (Alex Yazdi)、>commit、Thomas Wolf 以及来自顶尖 AI 实验室和科技公司的众多优秀天使投资人的支持。 我很兴奋能够继续探索如何通过更好的数据工作来推动 AI 的前沿,现在是在物理世界中。 如果你对 @macrodata_labs 感兴趣,或者你正在这个领域进行构建,我非常期待听到你的声音。
查看原文
查看缓存全文

缓存时间: 2026/06/12 08:57

今天,我们正式宣布成立 Macrodata Labs。

在过去几年里,我和 @HKydlicek 将互联网的一大部分内容转化成了数个最大的开源 LLM 预训练数据集。通过 FineWeb、FineWeb2、FinePDFs、FineTranslations 及相关工作,我们得以亲历计算与数据规模的扩展如何推动 LLM 的进步。

如今,我们在机器人领域也看到了类似的发展态势。

借助 LLM 和 VLM 的进步,机器人技术终于开始走向规模化。但物理世界的数据远比文本数据杂乱:大型视频文件、多速率传感器、各种各样的格式,以及关于哪些信号需要记录、哪些标注有意义、如何将所有上下文转化为更好的策略等悬而未决的问题。

这使得机器人领域的数据工作变得尤为重要。团队需要从每一次演示、轨迹、视频帧和传感器流中提取尽可能多的信号,而无需在每次更换机器人、传感器、格式或标注方法时重建整个数据栈。

我们认为目前仍缺少合适的工具。而这就是我们创立 Macrodata Labs 要解决的问题。我们的第一步是推出 Refiner —— 一个用于处理机器人数据集的开源框架。

Refiner 的设计目标是兼容多种机器人数据格式,帮助团队从每次演示中提取更多有效信号。今天发布的版本已支持手部追踪、子任务标注和奖励模型评分功能。

同时,我们还推出了 Refiner 的云版本,让团队可以专注于数据本身,无需操心基础设施。只需修改一行代码,相同的数据处理流水线就能在我们的平台上进行扩展 —— 内置分片、检查点、模型部署、故障恢复和详细的观测能力。

我们很荣幸获得了 Air Street Capital、Drysdale Ventures、OPRTRS club、Kima Ventures、YG (Alex Yazdi)、>commit、Thomas Wolf 以及众多来自顶尖 AI 实验室和科技公司的优秀天使投资人的支持。

我非常期待继续探索如何通过更好的数据工作,将 AI 的前沿进一步推向物理世界。

如果你对 @macrodata_labs 感兴趣,或者你正投身于这一领域,我非常期待收到你的来信。

相似文章