机器学习方法在复杂离散选择任务中增强决策制定的分析
摘要
本文评估了四种机器学习模型在政策偏好诱导中的离散选择建模,使用蒙特卡洛实验和真实能源政策案例研究,以评估在个体异质性和选择复杂性下的性能。
查看缓存全文
缓存时间: 2026/08/03 07:33
# 机器学习方法在复杂离散选择任务中增强决策的分析 来源:https://arxiv.org/abs/2607.28854 查看 PDF (https://arxiv.org/pdf/2607.28854) > 摘要:离散选择建模是政策制定过程中用于偏好诱导的常用工具,但这通常通过参数化模型完成。机器学习通过采用数据驱动的方法或学习个体偏好,可以突破基于政策的偏好诱导中离散选择建模的局限。然而,关于机器学习方法在个体异质性下估计个体离散选择规则的效果如何,目前知之甚少,尤其是在偏好诱导过程中经常遇到的挑战情境下。本研究评估了四种机器学习模型(multinomial logistic regression、generalized additive model、twinned neural network 和 Gaussian process)在学习和预测行为科学与社会学中重要的五种选择规则(linear strong utility、monotonic strong utility、ideal point、lexicographic semiorder 和 multiattribute linear ballistic accumulator)方面的能力。通过蒙特卡洛实验评估了在增加 a) 选择方案中的属性数量、b) 训练选择集的数量以及 c) 选择规则的确定性时模型的性能。模拟结果表明,半参数和非参数模型在所有选择规则和实验情境下通常优于参数模型。模型性能通常也随训练选择集数量和选择规则确定性的增加而分别提高 6% 至 96% 和 0% 至 55%。此外,还使用真实的能源政策偏好数据进行了案例研究,其中 TNN 表现最佳,BIC 为 13.351。这项工作展示了半参数和非参数模型在以政策为中心的离散选择建模中的可行性与局限性,并说明了选择任务情境应如何驱动模型选择。 ## 提交历史 来自:Sheng Lun Christine Cao \[查看电子邮件 (https://arxiv.org/show-email/2af25bc8/2607.28854)\] **\[v1\]** 2026年7月30日周四 21:38:37 UTC \(3,537 KB\)
相似文章
基于面板数据的Markov Chain选择模型的估计、预测与分类优化
本文提出了一个针对带面板数据的Markov Chain选择模型的框架,包括利用偏序偏好信息的新型EM算法进行估计、个性化选择预测以及分类优化。在合成数据和sushi数据集上的实验结果表明,相比传统方法有显著改进。
奖励模型的离散化
本文指出了连续奖励模型在强化学习中的过度敏感问题,即同等质量的回复被赋予不同的分数,并提出了一种使用蒙特卡洛dropout的离散化技术,以减少这种过度敏感,同时保持区分能力,从而得到更好的策略并减少奖励破解。
当选择成为风险:多选题约束下大语言模型的安全失效
# 当选择成为风险:多选题约束下大语言模型的安全失效 来源:[https://arxiv.org/html/2604.16916](https://arxiv.org/html/2604.16916) Yuheng Chen1 Zhiyu Wu2 Bowen Cheng3 Tetsuro Takahashi1 1鹿儿岛大学 2复旦大学 3中国石油大学(北京) [email protected] ###### 摘要 大语言模型(LLMs)的安全性对齐主要在开放式生成环境进行评估,模型可通过拒绝回应来规避风险……
奖励模型可能过于敏感(22分钟阅读)
本文认为强化学习中的奖励模型往往过于敏感,对同样好的回答给出不同分数,并提出了一个基于Monte Carlo dropout的免训练离散化算法来降低过度敏感性,从而提高策略质量。
长期决策问题中基于成对偏好的强化学习
本文介绍了Markov decision contest,这是一种用于基于成对偏好的强化学习的新问题模型。它证明了平稳策略的最优性保证、在P中的精确可解性,并提出了一种高效学习的近似算法。