process-reward-model

Tag

Cards List
#process-reward-model

KV-PRM: Efficient Process Reward Modeling via KV-Cache Transfer for Multi-Agent Test-Time Scaling

arXiv cs.AI · 2026-07-13 Cached

KV-PRM introduces a process reward model that leverages KV-cache transfer to avoid re-encoding, achieving up to 5000x FLOP reduction while maintaining or improving performance on reasoning benchmarks.

0 favorites 0 likes
#process-reward-model

MARD: Mirror-Augmented Reasoning Distillation for Mechanism-Level Drug-Drug Interaction Prediction

arXiv cs.CL · 2026-06-12 Cached

Introduces MARD, a 7B-parameter model for mechanism-level drug-drug interaction prediction using mirror-augmented reasoning distillation, achieving state-of-the-art accuracy at ~1% of frontier API cost and demonstrating genuine pharmacological reasoning over memorization.

0 favorites 0 likes
#process-reward-model

Improving Multimodal Reasoning via Worst Dimension Optimization

arXiv cs.AI · 2026-06-09 Cached

This paper introduces Multimodal Multi-Dimensional Scalarization Process Reward Modeling (MMS-PRM), which enforces the worst dimension's robustness in multimodal reasoning to prevent failures like visual hallucinations from being masked by strong text logic.

0 favorites 0 likes
#process-reward-model

SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

arXiv cs.AI · 2026-06-04 Cached

SCI-PRM introduces a tool-aware Process Reward Model for scientific reasoning, trained on the SCIPRM70K dataset featuring 'Chain-of-Tool' trajectories that interleave reasoning with scientific tool execution. It enables effective test-time scaling and serves as a dense reward signal in reinforcement learning, outperforming proprietary models like GPT-5-Mini on tool-calling steps across scientific benchmarks.

0 favorites 0 likes
#process-reward-model

From Long News to Accurate Forecast: Importance-Aware Fusion and PRM-Guided Reflection for Time Series Forecasting

arXiv cs.AI · 2026-06-03 Cached

This paper introduces a framework for time series forecasting that uses importance-aware news compression and process reward model-guided retrieval to incorporate long news articles within fixed context limits, improving prediction accuracy across finance, energy, traffic, and Bitcoin benchmarks.

0 favorites 0 likes
#process-reward-model

Learning to Retrieve: Dual-Level Long-Term Memory for Text-to-SQL Agents

arXiv cs.CL · 2026-06-02 Cached

This paper proposes MERIT, a dynamic multi-horizon memory retrieval framework for interactive text-to-SQL agents that uses episode-level and turn-level memory with learned retrieval policies optimized via reinforcement learning and a process reward model for dense rewards. Experiments on BIRD-Interact and Spider2-Snow show that MERIT outperforms static and single-horizon dynamic baselines in success rate while requiring fewer interaction turns.

0 favorites 0 likes
#process-reward-model

Process Rewards with Learned Reliability

arXiv cs.CL · 2026-05-18 Cached

BetaPRM is a process reward model that predicts both a step-level success probability and the reliability of that prediction using a Beta belief from Monte Carlo continuations, enabling adaptive computation allocation that reduces token usage by up to 33.57% while improving accuracy.

0 favorites 0 likes
← Back to home

Submit Feedback