continued-pretraining

Tag

Cards List
#continued-pretraining

From Zero to Hero: An Open LLM Ecosystem for Armenian

arXiv cs.LG · 2026-09-04 Cached

The paper curates and releases open datasets and a model for Armenian, demonstrating that continued pretraining with news and STEM data improves performance and addresses data scarcity in low-resource NLP.

0 favorites 0 likes
#continued-pretraining

Different Perturbations, Different Mechanisms: Understanding Continued Pre-training for Zero-Shot Dialect Robustness

arXiv cs.CL · 2026-08-07 Cached

This paper systematically studies perturbation-based continued pre-training (CPT) for improving zero-shot dialect robustness in multilingual LLMs, comparing six training conditions across German, Italian, and Arabic. It finds that character-noised CPT is the most effective general strategy and reveals that different perturbation methods induce distinct robustness mechanisms.

0 favorites 0 likes
#continued-pretraining

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

arXiv cs.CL · 2026-07-10 Cached

This paper introduces Hidden Decoding, a sequence-length scaling method for LLMs that adds internal computation per token by expanding each token into multiple streams with independent embeddings, using Stream-Factorized Attention to keep costs low. Experiments on models up to 617B parameters show consistent improvements over baselines, demonstrating a practical fixed-backbone scaling path.

0 favorites 0 likes
#continued-pretraining

Riazi-8B: An Urdu Large Language Model for Mathematical Reasoning

arXiv cs.CL · 2026-06-25 Cached

Riazi-8B is an Urdu large language model fine-tuned for mathematical reasoning, achieving improved performance on MGSM-Urdu through continued pre-training and supervised fine-tuning on Urdu Chain-of-Thought data.

0 favorites 0 likes
← Back to home

Submit Feedback