preference-optimization

Tag

Cards List
#preference-optimization

SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment

arXiv cs.CL ↗ · 2026-06-11 Cached

SAGE proposes a group-level uncertainty target that constructs an answer-conditioned uncertainty geometry over sampled responses to improve verbal uncertainty alignment in LLMs, and introduces GUPO for training. Experiments across reasoning tasks show improved uncertainty ranking and reduced overconfidence.

0 favorites 0 likes
#preference-optimization

Mechanistic Analysis of Alignment Algorithms in Language Models

arXiv cs.LG ↗ · 2026-06-10 Cached

This paper presents a systematic mechanistic analysis of six preference optimization methods (PPO, DPO, SimPO, ORPO, GRPO, KTO) across three open-weight model families, using probing and sparse autoencoders to reveal how alignment algorithms reshape internal representations in qualitatively distinct ways.

0 favorites 0 likes
#preference-optimization

DOG-DPO:Dynamic Optimization in Geometry for Safety Alignment

arXiv cs.LG ↗ · 2026-06-09 Cached

DOG-DPO is a training-free data selection framework that treats preference pairs as structured geometric signals, decomposing multi-dataset preference geometry into anchor and residual subspaces to select diverse subsets for safety alignment. It achieves strong utility-robustness trade-offs using only 11% of preference pairs across six safety benchmarks.

0 favorites 0 likes
#preference-optimization

MetaEvo: A Meta-Optimization Framework for Experience-Driven Agent Evolution

arXiv cs.LG ↗ · 2026-06-09 Cached

MetaEvo proposes a two-stage framework for continual evolution of LLM-based agents, using preference-based optimization to enhance principle abstraction and modular architecture for experience reuse, outperforming strong baselines on reasoning benchmarks.

0 favorites 0 likes
#preference-optimization

Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

Hugging Face Daily Papers ↗ · 2026-06-08 Cached

Z-Reward is a teacher-student framework that decouples complex reasoning from efficient reward deployment for text-to-image training. It achieves 89.6% human preference accuracy with a 27B teacher and 88.6% with a 9B student, outperforming prior methods.

0 favorites 0 likes
#preference-optimization

@TheTuringPost: 15 Policy Optimization and Preference Optimization techniques important in 2026 GRPO DPO REINFORCE++ DAPO (Dynamic sAmp…

X AI KOLs Timeline ↗ · 2026-06-07 Cached

A comprehensive guide to 15 policy optimization and preference optimization techniques important in 2026, including GRPO, DPO, REINFORCE++, and many newer variants, mapping the landscape of reasoning RL methods.

0 favorites 0 likes
#preference-optimization

From "Weak" Signals to Strong Models: Preference Delta Aggregation with LoRA Merging

arXiv cs.AI ↗ · 2026-06-02 Cached

This paper introduces Preference Delta Aggregation (PDA) and Geometric Alignment Merging (GAM) to aggregate multiple 'weak' preference signals from weaker model pairs via LoRA merging, improving strong LLMs on knowledge reasoning and agentic search tasks by over 6% on average.

0 favorites 0 likes
#preference-optimization

Hallucination Detection-Guided Preference Optimization for Clinical Summarization

arXiv cs.CL ↗ · 2026-05-29 Cached

Introduces HDSR and HDSR-PL, methods that use hallucination detectors to guide iterative self-refinement and preference learning, achieving up to 48% reduction in hallucinations for clinical summarization using Llama and Gemma models on MIMIC-IV-Note.

0 favorites 0 likes
#preference-optimization

Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization

Hugging Face Daily Papers ↗ · 2026-05-27 Cached

This paper introduces BiDPO, a framework that enhances text-to-image models for complex compositional prompts through preference-based fine-tuning and region-level guidance, achieving state-of-the-art results on compositional fidelity benchmarks.

0 favorites 0 likes
#preference-optimization

WeCon: An Efficient Weight-Conditioned Neural Solver for Multi-Objective Combinatorial Optimization Problems

arXiv cs.LG ↗ · 2026-05-25 Cached

Presents WeCon, a weight-conditioned neural solver for multi-objective combinatorial optimization problems that achieves comparable hypervolume to the state-of-the-art while reducing inference time by 40%.

0 favorites 0 likes
#preference-optimization

Conditional Equivalence of DPO and RLHF: Implicit Assumption, Failure Modes, and Provable Alignment

arXiv cs.AI ↗ · 2026-05-22 Cached

This paper proves that the equivalence between Direct Preference Optimization (DPO) and Reinforcement Learning from Human Feedback (RLHF) is conditional and often violated in practice, revealing failure modes where DPO optimizes relative advantage rather than absolute alignment. The authors introduce Constrained Preference Optimization (CPO) for provable alignment and demonstrate state-of-the-art performance.

0 favorites 0 likes
#preference-optimization

Token-weighted Direct Preference Optimization with Attention

arXiv cs.CL ↗ · 2026-05-22 Cached

Proposes AttentionPO, a token-weighted direct preference optimization method that uses attention from the LLM itself to estimate token weights, improving alignment performance on AlpacaEval, MT-Bench, and ArenaHard without requiring a separate reward model.

0 favorites 0 likes
#preference-optimization

Improving Code Translation with Syntax-Guided and Semantic-aware Preference Optimization

arXiv cs.AI ↗ · 2026-05-14 Cached

This paper proposes CTO, a method that improves code translation by combining syntax-guided and semantic-aware preference optimization through contrastive learning and direct preference optimization, achieving significant improvements over existing baselines in C++, Java, and Python translations.

0 favorites 0 likes
#preference-optimization

Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training

arXiv cs.LG ↗ · 2026-05-13 Cached

This paper analyzes spurious correlation learning in preference optimization methods like DPO, identifying mechanisms such as mean spurious bias and causal-spurious leakage. It proposes 'tie training' using equal-utility preference pairs as a mitigation strategy to reduce reliance on spurious features without degrading causal learning.

0 favorites 0 likes
#preference-optimization

YFPO: A Preliminary Study of Yoked Feature Preference Optimization with Neuron-Guided Rewards for Mathematical Reasoning

arXiv cs.CL ↗ · 2026-05-13 Cached

This paper introduces YFPO, a neuron-guided preference optimization framework that uses internal activation signals to improve mathematical reasoning in large language models.

0 favorites 0 likes
#preference-optimization

Enhancing Multilingual Counterfactual Generation through Alignment-as-Preference Optimization

arXiv cs.CL ↗ · 2026-05-13 Cached

The paper introduces Macro, a preference alignment framework using DPO to improve the validity and minimality of self-generated counterfactual explanations across multiple languages.

0 favorites 0 likes
#preference-optimization

StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models

arXiv cs.CL ↗ · 2026-05-13 Cached

This research paper investigates using preference optimization (ORPO, AlphaPO) on small language models like Llama-3.2-3B and Qwen-3-4B to align them with Stoic philosophy using micro-datasets. The study finds that while 300 examples can effectively encode Stoic virtues, small models still struggle with outward-facing cosmopolitan duties.

0 favorites 0 likes
#preference-optimization

Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization

arXiv cs.CL ↗ · 2026-05-11 Cached

This paper introduces a topology-enhanced alignment framework for LLMs, utilizing trajectory topology loss and topological preference optimization based on persistent homology to regularize semantic trajectories in hidden space.

0 favorites 0 likes
#preference-optimization

Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs

Hugging Face Daily Papers ↗ · 2026-05-10 Cached

This paper introduces PNAPO, an offline preference optimization framework for rectified flow models that augments preference data with noise samples and uses dynamic regularization to improve training efficiency and sample efficiency.

0 favorites 0 likes
#preference-optimization

FSPO: Few-Shot Optimization of Synthetic Preferences Personalizes to Real Users

arXiv cs.CL ↗ · 2026-04-20 Cached

FSPO proposes a few-shot preference optimization algorithm for LLM personalization that reframes reward modeling as meta-learning, enabling models to quickly infer personalized reward functions from limited user preferences. The method achieves 87% personalization performance on synthetic users and 70% on real users through careful synthetic preference dataset construction.

0 favorites 0 likes
← Previous
Next →
← Back to home

Submit Feedback