@neural_avb: 顺便说一下,Joel 是那篇关于《合成数据指南》的精彩 HuggingFace 文章的作者。这是一篇马拉松式的综述,每个人都……
摘要
一条推文强调了 Joël Niklaus 关于《合成数据指南》的 HuggingFace 文章,该文章启发了 text-albumentations 库。
顺便说一下,Joel 是那篇关于《合成数据指南》的精彩 HuggingFace 文章的作者。
这是一篇每个人都应该读的马拉松式综述。正是这项工作最终启发了我开发 text-albumentations 库。
太酷了,我的兄弟 Yacine 居然能和他一起跳舞。https://t.co/HjvzjjgO7v
查看缓存全文
缓存时间: 2026/06/18 22:22
顺便说一下,Joel 是那篇关于《合成数据手册》的优秀 Huggingface 文章的作者。
这是一篇每个人都应该读的马拉松式综述。正是这项工作最终启发了我创建 text-albumentations 库。
太酷了,我的兄弟 Yacine 能和他一起跳舞。https://t.co/HjvzjjgO7v
Yacine Mahdid (@yacinelearning): 什么是好的合成预训练数据——来自 Huggingface 的 Joël Niklaus
相似文章
@yacinelearning:各位系好安全带,本周四我们邀请到了@joelniklaus(来自@huggingface)加入直播,分享合成数据如何推动预训练的发展……
Hugging Face 的 Joel Niklaus 将进行直播,探讨合成数据在推动预训练中的作用;团队还发布了一份关于该主题的实践指南。
@neural_avb: 这与 text-albumentations 库的工作方式非常接近。输入文本来源,并生成面向任务的…
本文对比了 text-albumentations 库与新的 Autodata 论文,后者增加了带有弱/强解析器和外部评判器的审查机制,以维持合成数据集的质量。
@ariG23498: 我一直很钦佩 @stevhliu 的工作。我认为他的技术文章是最好的之一。在最新的……
一个系列帖文介绍了 Hugging Face 的 transformers 库如何高效加载模型,涵盖 meta device、safetensors、CUDA 缓存等内容。
@yacinelearning: 很棒的资源,来自Hugging Face,附有幻灯片,介绍了他们如何生成1万亿合成数据,非常酷…
Hugging Face 分享了幻灯片,详细介绍了他们如何生成1万亿个token的合成数据来训练基础模型。
@neural_avb: 有一篇关于On-Policy Distillation的绝佳文章。几个月前出现在HF上。
一条推荐关于On-Policy Distillation文章的推文,该文章发表在Hugging Face上。