multi-agent-value-decomposition

标签

Cards List
#multi-agent-value-decomposition

LC-ERD:通过一致性规约的奖励分解挖掘潜在逻辑实现自我进化推理

arXiv cs.AI · 2026-05-26 缓存

LC-ERD是一个框架,从LLM生成的推理链中挖掘潜在逻辑,将全局奖励分解为步骤级信号,实现无需人工标注的自我进化推理。它通过变分逻辑势和多智能体值分解来解决标签噪声、粗粒度监督和分布崩溃问题。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈