process-reward-modeling

标签

Cards List
#process-reward-modeling

最弱一环说明一切:通过可学习信用分配的结果监督过程奖励建模

arXiv cs.LG · 2026-06-29 缓存

本文提出通过可学习信用分配的结果监督过程奖励建模(LCA),一个在最弱一环原则下联合学习信用分配和奖励建模的框架,将其形式化为一个使用Softmax加权和池化的多实例学习问题。实验表明,它在多个任务上优于现有的结果监督过程奖励模型(PRMs)。

0 人收藏 0 人点赞
#process-reward-modeling

StepPRM-RTL:基于逐步过程奖励引导的LLM微调以增强RTL综合

arXiv cs.AI · 2026-06-04 缓存

StepPRM-RTL 是一个新颖的框架,结合了逐步轨迹建模、过程奖励建模(PRM)和检索增强微调(RAFT),旨在提升基于LLM的RTL代码生成能力,适用于 Verilog 和 VHDL,在功能正确性指标上比现有最优方法提升超过10%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈