sampling-methods

Tag

Cards List
#sampling-methods

Privacy Without Regret: Differentially Private Inference-Time Alignment

arXiv cs.LG · 2026-08-28 Cached

This paper introduces Private Best-of-N (PrivBoN) and Private Inference-Time Pessimism (PrivITP) methods that add calibrated noise to reward scores in inference-time alignment to achieve differential privacy and mitigate reward hashing, with minimal additional alignment cost.

0 favorites 0 likes
#sampling-methods

Quasi-Monte Carlo Initialization for Meta-Reinforcement Learning

arXiv cs.LG · 2026-07-27 Cached

This paper explores using quasi-Monte Carlo (QMC) methods for weight initialization in meta-reinforcement learning, showing improved convergence in similar control tasks compared to orthogonal initialization.

0 favorites 0 likes
← Back to home

Submit Feedback