bayesian-feedback

Tag

Cards List
#bayesian-feedback

Dual-Axis Policy Optimization for LLM Agents: Bayesian Feedback Attribution and Trajectory Mass Normalization

arXiv cs.AI · 6d ago Cached

The paper introduces BATON, a dual-axis policy optimization framework for LLM agents using Bayesian Feedback Attribution and Trajectory Mass Normalization, demonstrating improved performance in reinforcement learning experiments.

0 favorites 0 likes
← Back to home

Submit Feedback