latent-computation

Tag

Cards List
#latent-computation

Hidden Decoding at Scale: Latent Computation Scaling for Large Language Models

arXiv cs.CL · 2026-07-10 Cached

This paper introduces Hidden Decoding, a sequence-length scaling method for LLMs that adds internal computation per token by expanding each token into multiple streams with independent embeddings, using Stream-Factorized Attention to keep costs low. Experiments on models up to 617B parameters show consistent improvements over baselines, demonstrating a practical fixed-backbone scaling path.

0 favorites 0 likes
← Back to home

Submit Feedback