factorization

Tag

Cards List
#factorization

Do Tabular Foundation Models Agree with Themselves?

arXiv cs.LG ↗ · 2026-08-07 Cached

This paper investigates whether tabular foundation models (TFMs) like TabPFN, TabICL, TabDPT, and TabFM produce predictions consistent with any joint distribution. It demonstrates that all evaluated TFMs violate both marginalization and factorization consistency for classification and regression, questioning their Bayesian inference claims.

0 favorites 0 likes
#factorization

Marginal Matching Does Not License Factorized Sampling: Auditing Conditional Style Leakage in Factorized Generative Models

arXiv cs.LG ↗ · 2026-08-07 Cached

This paper shows that matching a marginal Gaussian prior in factorized generative models does not prevent conditional style leakage, where style latents carry class information. Multiple remedies are explored, but the authors conclude that marginal statistics alone cannot certify class-invariance.

0 favorites 0 likes
#factorization

FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

Hugging Face Daily Papers ↗ · 2026-08-05 Cached

FocusMem introduces a latent memory interface for GUI agents that separates content retention, state-conditioned readout, and a trust gate to improve memory reliability. It consistently outperforms fixed-memory baselines across five GUI-agent benchmarks.

0 favorites 0 likes
#factorization

Factorized Spectral Representations for Reinforcement Learning

arXiv cs.LG ↗ · 2026-07-16 Cached

This paper proposes FaStR, a method that factorizes the transition kernel in reinforcement learning using CP decomposition into separate state, action, and next-state encoders, improving sample efficiency especially in high-dimensional locomotion tasks.

0 favorites 0 likes
#factorization

Training transformers where every layer W = V·Uᵀ from initialization reveals a corpus-determined optimal rank - looking for arXiv endorser (cs.LG) [D]

Reddit r/MachineLearning ↗ · 2026-07-03

This paper proposes Native Factorized Weights for transformers, where every linear layer is trained as a product of two low-rank matrices from initialization. Experiments show a corpus-determined optimal rank that minimizes validation loss and a generalization band, outperforming dense baselines with fewer parameters.

0 favorites 0 likes
← Back to home

Submit Feedback