reinforcement-fine-tuning

Tag

Cards List
#reinforcement-fine-tuning

ReliableTableQA:How Much Supervision Does Reliability Annotation Need?

arXiv cs.LG · 2026-07-24 Cached

Introduces ReliableTableQA, a framework for training LLMs to annotate statistical reliability of tabular QA results, showing that a small SFT set is sufficient and GRPO only helps when SFT is under-trained.

0 favorites 0 likes
#reinforcement-fine-tuning

Overcoming Catastrophic Forgetting in Visual Continual Learning with Reinforcement Fine-Tuning

Hugging Face Daily Papers · 2026-05-10 Cached

This paper introduces Retention-aware Policy Optimization (RaPO) to mitigate catastrophic forgetting in visual continual learning using reinforcement fine-tuning. RaPO uses trajectory-level reward shaping and cross-task advantage normalization to close the gap between reinforcement and supervised fine-tuning in class- and domain-incremental learning.

0 favorites 0 likes
← Back to home

Submit Feedback