机器学习方法在复杂离散选择任务中增强决策制定的分析

arXiv cs.LG 论文

摘要

本文评估了四种机器学习模型在政策偏好诱导中的离散选择建模,使用蒙特卡洛实验和真实能源政策案例研究,以评估在个体异质性和选择复杂性下的性能。

arXiv:2607.28854v1 公告类型:新 摘要:离散选择建模是政策制定过程中偏好诱导常用的工具,但这通常通过参数化模型完成。机器学习可以通过采用数据驱动方法或学习个体偏好,突破基于政策的偏好诱导中离散选择建模的界限。然而,关于机器学习方法在个体异质性下估计个体离散选择规则的能力,尤其是在偏好诱导中常遇到的挑战背景下,目前了解有限。本研究评估了四种机器学习模型(多项逻辑回归、广义加性模型、孪生神经网络和高斯过程)在学习和预测行为与社会科学中重要的五种选择规则(线性强效用、单调强效用、理想点、词典式半序和多属性线性弹道累积器)方面的能力。进行蒙特卡洛实验以评估模型性能,当增加a)选择备选项中的属性数量,b)训练选择集的数量,以及c)选择规则的确定性时。模拟结果表明,半参数和非参数模型通常在所有选择规则和实验背景下优于参数模型。模型性能通常也随训练选择集和选择规则确定性的增加而分别提高6%至96%和0%至55%。还使用真实能源政策偏好数据进行了案例研究,其中TNN表现最佳,BIC为13.351。这项工作证明了半参数和非参数模型在以政策为中心的离散选择建模中的可行性和局限性,并展示了选择任务背景应如何驱动模型选择。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:33

# 机器学习方法在复杂离散选择任务中增强决策的分析
来源:https://arxiv.org/abs/2607.28854  
查看 PDF (https://arxiv.org/pdf/2607.28854)

> 摘要:离散选择建模是政策制定过程中用于偏好诱导的常用工具,但这通常通过参数化模型完成。机器学习通过采用数据驱动的方法或学习个体偏好,可以突破基于政策的偏好诱导中离散选择建模的局限。然而,关于机器学习方法在个体异质性下估计个体离散选择规则的效果如何,目前知之甚少,尤其是在偏好诱导过程中经常遇到的挑战情境下。本研究评估了四种机器学习模型(multinomial logistic regression、generalized additive model、twinned neural network 和 Gaussian process)在学习和预测行为科学与社会学中重要的五种选择规则(linear strong utility、monotonic strong utility、ideal point、lexicographic semiorder 和 multiattribute linear ballistic accumulator)方面的能力。通过蒙特卡洛实验评估了在增加 a) 选择方案中的属性数量、b) 训练选择集的数量以及 c) 选择规则的确定性时模型的性能。模拟结果表明,半参数和非参数模型在所有选择规则和实验情境下通常优于参数模型。模型性能通常也随训练选择集数量和选择规则确定性的增加而分别提高 6% 至 96% 和 0% 至 55%。此外,还使用真实的能源政策偏好数据进行了案例研究,其中 TNN 表现最佳,BIC 为 13.351。这项工作展示了半参数和非参数模型在以政策为中心的离散选择建模中的可行性与局限性,并说明了选择任务情境应如何驱动模型选择。

## 提交历史

来自:Sheng Lun Christine Cao \[查看电子邮件 (https://arxiv.org/show-email/2af25bc8/2607.28854)\] **\[v1\]** 2026年7月30日周四 21:38:37 UTC \(3,537 KB\)

相似文章

奖励模型的离散化

Hugging Face Daily Papers

本文指出了连续奖励模型在强化学习中的过度敏感问题,即同等质量的回复被赋予不同的分数,并提出了一种使用蒙特卡洛dropout的离散化技术,以减少这种过度敏感,同时保持区分能力,从而得到更好的策略并减少奖励破解。

当选择成为风险:多选题约束下大语言模型的安全失效

arXiv cs.CL

# 当选择成为风险:多选题约束下大语言模型的安全失效 来源:[https://arxiv.org/html/2604.16916](https://arxiv.org/html/2604.16916) Yuheng Chen1 Zhiyu Wu2 Bowen Cheng3 Tetsuro Takahashi1 1鹿儿岛大学 2复旦大学 3中国石油大学(北京) [email protected] ###### 摘要 大语言模型(LLMs)的安全性对齐主要在开放式生成环境进行评估,模型可通过拒绝回应来规避风险……

奖励模型可能过于敏感(22分钟阅读)

TLDR AI

本文认为强化学习中的奖励模型往往过于敏感,对同样好的回答给出不同分数,并提出了一个基于Monte Carlo dropout的免训练离散化算法来降低过度敏感性,从而提高策略质量。

长期决策问题中基于成对偏好的强化学习

arXiv cs.LG

本文介绍了Markov decision contest,这是一种用于基于成对偏好的强化学习的新问题模型。它证明了平稳策略的最优性保证、在P中的精确可解性,并提出了一种高效学习的近似算法。