标签
本文提出了一种熵正则化强化学习方法,用于解决机制切换扩散模型中的线性二次Stackelberg微分博弈,通过集成神经网络来近似价值函数并逃离次优均衡。
本文针对机制切换跳扩散过程中的零和随机微分博弈,提出了一种熵正则化强化学习框架,推导了HJBI方程和演员-评论家算法,并将其应用于投资博弈。
本文提出了面向时间序列基础模型的状态分层评估方法,揭示出聚合指标会掩盖交通状态转换期间的严重失败,并提出了双峰混合增强方法,在保持整体准确性的同时改善覆盖范围。
本文提出一个理论框架,用于量化当训练分布与部署分布因潜在体制动态(建模为马尔可夫切换过程)不同时的部署风险,提供了精确分解和有限样本边界。