consensus-filtering

Tag

Cards List
#consensus-filtering

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

arXiv cs.AI ↗ · 2026-07-29 Cached

This paper introduces DMAPO, a method for preference optimization that uses multi-evaluator consensus to select high-confidence on-policy responses, achieving strong alignment with significantly less data (only 3.45% acceptance rate) and outperforming baselines like SimPO on several benchmarks.

0 favorites 0 likes
← Back to home

Submit Feedback