pretraining-data

Tag

Cards List
#pretraining-data

Scaling Domain Data Repetition in LLM Pretraining

Hugging Face Daily Papers · 5d ago

This paper studies the trade-off in repeating high-quality domain data during LLM pretraining to maintain performance as models scale, finding that optimal repetition counts increase with model size and are negatively correlated with domain validation loss.

0 favorites 0 likes
#pretraining-data

KletterMix: Climbing Toward High-Quality German Pretraining Data

Hugging Face Daily Papers · 2026-06-02

KletterMix is a high-quality German pretraining corpus built by translating a state-of-the-art English pretraining dataset into German while preserving structure and diversity. Controlled experiments show models trained on KletterMix achieve measurable improvements on German-language benchmarks.

0 favorites 0 likes
#pretraining-data

100 Trillion+ Pretraining data??? This is the largest data I've see a model being trained on.

Reddit r/LocalLLaMA · 2026-06-01

A new AI model is being trained on over 100 trillion tokens, doubling the typical pretraining data size of 27-50 trillion tokens used by other models like Kimi, Mimo, and DeepSeek.

0 favorites 0 likes
#pretraining-data

Pretraining Data Exposure in Large Language Models: A Survey of Membership Inference, Data Contamination, and Security Implications

arXiv cs.CL · 2026-05-27 Cached

A unified survey of pretraining data exposure (PDE) in large language models, covering membership inference, data contamination, and security implications, with a review of attack and defense methods.

0 favorites 0 likes
← Back to home

Submit Feedback