reward-alignment

Tag

Cards List
#reward-alignment

ReNFT: Repairing Mode Collapse in Reward Post-Training via Internal Probability-Mass Recalibration

arXiv cs.LG · 3d ago Cached

ReNFT is a method to repair mode collapse in reward post-training of diffusion generators by internally recalibrating probability mass, improving diversity while retaining high reward scores.

0 favorites 0 likes
#reward-alignment

GRAS: Guided Reduced-Variance Proposals and Adaptive Selection for Training-Free Reward Alignment in Discrete Diffusion

arXiv cs.LG · 2026-08-28 Cached

GRAS is a training-free method for reward alignment in discrete diffusion models that reduces variance in guided proposals and adaptively selects particles, achieving state-of-the-art results on DNA and protein design tasks.

0 favorites 0 likes
← Back to home

Submit Feedback