entropy-regularization

标签

Cards List
#entropy-regularization

基于熵正则化概率门控的稀疏模型发现方法用于稀缺数据联邦学习

arXiv cs.LG · 2026-07-02 缓存

本文提出熵正则化概率门控机制,在稀疏联邦优化中保持不确定性,从而在数据异质性和稀缺数据条件下提升稀疏性恢复能力与测试性能。

0 人收藏 0 人点赞
#entropy-regularization

熵正则化强化学习在机制切换跳扩散过程中的零和随机微分博弈

arXiv cs.LG · 2026-06-30 缓存

本文针对机制切换跳扩散过程中的零和随机微分博弈,提出了一种熵正则化强化学习框架,推导了HJBI方程和演员-评论家算法,并将其应用于投资博弈。

0 人收藏 0 人点赞
#entropy-regularization

AI主权作为国家学习能力:以人为中心的学习力学视角看法国、美国和中国

arXiv cs.AI · 2026-06-02 缓存

本文提出以人为中心的学习力学(HCLM)将国家AI发展解释为一个学习系统,认为AI主权取决于国家调控自身信息动态的能力。文章为法国提供了数学模型和政策启示,将AI政策重新定义为非平衡学习系统的治理。

0 人收藏 0 人点赞
#entropy-regularization

从上下文偏移到风格崩塌:为什么训练目标比规模更重要

arXiv cs.CL · 2026-05-29 缓存

本文研究训练对齐目标如何重塑大型语言模型的语言特征,发现指令微调系统坍塌语言熵的程度显著超过规模预期,并且熵正则化可以缓解这种坍塌。

0 人收藏 0 人点赞
#entropy-regularization

熵正则化演员-评论家方法的精细分析

arXiv cs.LG · 2026-05-26 缓存

本文对熵正则化演员-评论家方法进行了精细的理论分析,表明精确的评论家能起到强大的方差缩减作用,使样本复杂度可与确定性策略梯度相媲美,并且当学到的评论家足够准确时,这些优势得以保留。

0 人收藏 0 人点赞
#entropy-regularization

以人为中心的学习机制:熵正则化表示学习的动态框架

arXiv cs.LG · 2026-05-25 缓存

本文提出了以人为中心的学习机制(HCLM),这是一个用于研究开放和受控学习系统的动态信息理论框架。它通过有效信息力形式化了熵正则化,推导了收敛性和泛化结果,并提供了对尺度律行为的条件性解释。

0 人收藏 0 人点赞
#entropy-regularization

重新审视熵正则化:自适应系数释放其在LLM强化学习中的潜力

arXiv cs.CL · 2026-04-20 缓存

本文提出自适应熵正则化(AER)框架,通过难度感知的系数分配和初始锚定目标熵来动态平衡LLM强化学习中的探索与利用,解决策略熵坍缩问题。在数学推理基准上的实验验证了该方法在准确性和探索能力上的一致性改进。

0 人收藏 0 人点赞
#entropy-regularization

策略梯度与软Q学习之间的等价性

OpenAI Blog · 2017-04-21 缓存

# 策略梯度与软Q学习之间的等价性 来源:[https://openai.com/index/equivalence-between-policy-gradients-and-soft-q-learning/](https://openai.com/index/equivalence-between-policy-gradients-and-soft-q-learning/) OpenAI ## 摘要 策略梯度方法和Q学习方法是无模型强化学习中两种主要方法。Q学习方法在有效时样本效率很高,但目前还不太清楚它们为什么能够工作

0 人收藏 0 人点赞
← 返回首页

提交意见反馈