建构性对齐:调控人机交互中的偏好动态
摘要
本文介绍了建构性对齐,这是一种重新定义AI对齐的范式,将其视为调控人类偏好随时间的演变,而非满足静态偏好。它提出了一个控制理论框架,用于规范AI系统如何影响价值轨迹。
arXiv:2607.00001v1 公告类型: 新
摘要:大多数AI对齐方法将人类偏好视为需要推断和优化的固定目标。这一假设与大量实证证据相矛盾,这些证据表明偏好是多层次的、动态的,并通过互动(尤其是与适应性技术的互动)构建而成。随着AI系统变得更加持久、个性化和嵌入社会,它们越来越参与塑造人们在长期内注意、重视和认可的事物。我们引入了建构性对齐,这是一种重新定义对齐的范式,将其视为对不断演变的人类偏好轨迹的控制问题,而非静态偏好的满足。借鉴行为经济学、心理学和建构主义社会理论,我们将偏好建模为分层状态变量,这些变量在与AI系统的互动中演变。我们使用一个控制理论框架来形式化这一观点,其中系统行为与交互设计共同影响世界状态和人类评价状态。我们认为,对齐主要不是控制AI行为,而是规范AI系统如何影响人类偏好的演变——确保价值轨迹保持一致、获得反思性认可、具有认知基础、防范操纵,并在不确定性中赋能。因此,对齐变成了一个管理长期价值形成的问题,而不仅仅是满足静态偏好。
查看缓存全文
缓存时间: 2026/07/02 05:40
# 人类与AI交互中的偏好动态治理 来源:https://arxiv.org/html/2607.00001 \\版权声明 本文版权归作者所有。根据知识共享署名4.0国际许可协议(CC BY 4.0)允许使用。 \\会议 AAAI-26 机器伦理研讨会:从形式化方法到涌现机器伦理,2026年1月27日,新加坡 \\作者信息 [orcid=0009-0008-7021-3227, [email protected], url=https://linkedin.com/in/mkanwal/] \\fnmark[1]\\cormark[1] [orcid=0000-0002-4645-6607, [email protected], url=https://linkedin.com/in/caryntran/] \\fnmark[1] \\脚注 [1] 这两位作者贡献相同,按字母顺序排列。\\通讯作者[1] (2026年) ###### 摘要 大多数AI对齐方法将人类偏好视为需要推断和优化的固定目标。这一假设与大量实证证据相矛盾,这些证据表明偏好是分层的、动态的,并通过交互——特别是与适应性技术的交互——而构建的。随着AI系统变得更加持久、个性化和深度嵌入社会,它们越来越多地参与塑造人们随时间推移而关注、重视和认可的事物。我们提出**建构性对齐**(Constructive Alignment),这一范式将对齐重新定义为对演化中的人类偏好轨迹的控制问题,而非静态偏好的满足问题。借鉴行为经济学、心理学和建构主义社会理论,我们将偏好建模为分层状态变量,这些变量在与AI系统的交互中演化。我们使用控制理论框架形式化这一观点,在该框架中,系统行为和交互设计共同影响世界状态和人类评价状态。我们认为,对齐主要不是关于控制AI行为,而是关于调节AI系统如何影响人类偏好的演化——确保价值轨迹保持连贯性、获得反思性认可、具有认识论基础、免受操纵,并在不确定性中赋予人类能力。因此,对齐成为治理长期价值形成的问题,而不仅仅是满足静态偏好。 ###### 关键词: AI对齐\\sep偏好动态\\sep偏好形成\\sep人机交互\\sepAI影响\\sep控制理论\\sepDR-MDP > *“我们塑造工具,之后工具又塑造我们。”* —— 马歇尔·麦克卢汉 参见标题图1:**建构性对齐**主张考虑偏好的动态性和建构性本质。偏好被描绘为分层的、持续的过程,随时间推移而演化(蓝色、紫色、粉色),而非需要满足的单一静态目标。交互(黄色),包括与AI的交互,间歇性介入,重塑这些层次,说明偏好如何通过经验被建构和更新。 ## 1 引言 仅仅一个周末的时间,YouTube推荐就能将一位偶然听众转变为狂热粉丝。用户可能对基于大语言模型的AI治疗师和AI恋爱伴侣产生情感依赖,将其作为主要支持来源[heritage_i_2025, meadi_exploring_2025]。政治竞选已经展示了数据驱动广告如何大规模塑造选民态度[greenfield_cambridge_2018]。与此同时,互联网可能正在侵蚀我们持续阅读和专注注意力的能力[firth_online_2019]。在这些案例中,一个共同模式浮现出来:AI系统不仅仅是回应人类偏好,而是参与塑造人们关注、重视并逐渐渴望的事物。随着这些系统变得更有能力、更个性化、更持久,它们在塑造人类偏好和价值观方面的作用变得不可避免。 尽管如此,许多AI对齐文献仍然将对齐问题框架化为使系统行为匹配人类当前偏好的问题。偏好被视为需要推断、聚合或优化的目标,隐含地假设它们是稳定的、良好定义的、且外在于系统的。这种框架忽略了一个关键维度:偏好本身如何随时间变化,以及AI系统如何参与这种变化。 近期工作已开始认识到这一差距。AI伦理和对齐领域的学者认为,偏好是嵌入社会、依赖上下文并通过交互塑造的[franklin_recognising_2022, zhi-xuan_beyond_2024, shen_position_2025]。然而,大多数现有方法仍然关注哪些价值观应作为对齐目标,而非关注在持续与AI系统交互中,价值观如何形成、修订和稳定的过程。 在本文中,我们认为这种遗漏不仅是一个描述性疏忽,更是主流对齐范式的结构性局限。人类偏好跨时间跨度分层、跨情境和人生阶段动态变化,并通过与环境、制度和技术的交互而建构。由于AI系统不可避免地影响这些过程,对齐不能仅仅被理解为针对固定目标的优化问题。它还必须解决系统如何塑造人类偏好产生和演化的条件。 我们提出**建构性对齐**(Constructive Alignment)作为认真对待这一挑战的范式。术语"建构性"借鉴了心理学、学习科学、决策研究和社会科学中的建构主义知识范式。建构主义解释拒绝将知识——包括偏好和目标——视为被动获取或仅通过观察或选择揭示的固定内部表征,而是强调它们通过交互被积极形成。这一范式出现在发展心理学和社会文化心理学(如piaget_origins_1952, vygotskij_mind_1981)、认知科学和人机交互(如suchman_plans_1987, hutchins_cognition_2006)、学习科学(如sawyer_cambridge_2009),以及决策研究和行为经济学中,在后者中偏好被理解为建构而非揭示(如slovic_construction_1995, lichtenstein_construction_2006, bettman_constructive_1998)。在建构主义范式中,交互不仅仅是表达欲求的媒介,更是这些欲求得以形成和修订的机制。建构性对齐在AI语境中采用这一取向,将对齐与人类偏好随时间主动建构的过程视为不可分割。 因此,建构性对齐将对齐重新定义为衡量和治理AI对跨时间和规模的人类偏好形成之影响的问题。它不仅仅询问系统是否满足偏好,而是追问系统行为如何影响个体和网络的偏好轨迹、哪种影响形式是可接受的,以及如何约束这种影响以支持人类能动性和长期利益。在这种观点下,对齐成为一个控制问题,而不仅仅是满足问题。 ## 2 偏好的本质 许多AI研究默默假设人类偏好是稳定的、内部存储的、且仅通过选择揭示的。在这种观点中,偏好先于行动存在,在跨情境中基本保持不变,并可通过适当的测量恢复。虽然这一假设便于形式化建模,但心理学、经济学、社会学和人机交互领域数十年的实证和理论工作表明,它并未描述人类偏好的实际运作方式。 ### 2.1 公理A1:偏好是分层的 人类偏好并非单一的、统一的事物。在任何时刻,人们都在多种共存且可能指向不同方向的偏好影响下行动。这些偏好包括即时欲望和冲动、与结果相关的实用目标、长期承诺,以及关于什么重要性的更抽象价值观。将偏好视为分层的,捕捉了人们在日常情境中实际决策和行为的复杂方式。 #### 短期欲望。 偏好的一个层次由即时情感动机组成——由舒适、愉悦或解脱驱动的短期欲望。这些偏好存在于任何给定时刻,在涉及诱惑、努力或延迟的情境中尤为突出。心理学和经济学研究表明,人们表现出当前偏向偏好,即使与长期目标或福祉冲突,也会对即时满足赋予不成比例的权重[ainslie_specious_1975, laibson_golden_1997]。这种模式已在任务时机和努力分配[heidhues_identifying_2021]、财务决策[xiao_present_2019]以及健康相关的依从性和治疗选择[wang_present_2018]中得到记录。 #### 工具性目标。 偏好的第二个层次涉及选择行动作为达成期望结果的手段。在这个工具层面上,行动根据其有助于实现目标的程度来判断,而非其内在吸引力。目标系统理论的研究[kruglanski_theory_2018, kruglanski_architecture_2015, kruglanski_energetics_2012]表明,人们通常保持目标稳定,同时在环境变化时灵活替换用于实现目标的行动,这一模式也在关于实施意图[gollwitzer_implementation_1999]和适应性自我调节[conner_predicting_2009, webb_does_2006]的工作中得到记录。行动识别理论的补充工作[vallacher_what_1987]表明,人们根据上下文在不同抽象层次上表征和选择行动,强化了偏好结构中手段与目的之间的区分[fishbach_goal_2007]。这些研究表明,对特定行动的偏好与对这些行动所服务目标的偏好共存且有所区别。 #### 身份认同。 偏好的第三个层次由长期承诺组成,例如计划、标准、身份认同和意图,这些随时间持续并在跨情境中指导行为。哲学工作将此层次描述为涉及关于何种动机应指导行动的高阶偏好,而非对即时结果的偏好[frankfurt_freedom_1971]。关于身份认同理论[stryker_past_2000]、基于身份认同的动机[akerlof_economics_2000, aquino_self-importance_2002]和自我调节过程[carver_self-regulation_2001, mcadams_psychology_2001]的心理学和社会学研究显示,人们持有与他们认为自己是谁相一致的稳定承诺,这些承诺在跨情境和时间中塑造行为。 #### 价值观。 偏好的第四个层次由抽象价值观组成,这些价值观在跨社会和跨文化中相对持久。关于基本价值观理论的研究表明,尽管表面偏好存在广泛差异,但不同文化中的人们围绕一小套共享维度——如安全、成就和仁慈——组织价值观,这些维度在跨领域中指导选择[schwartz_universals_1992, schwartz_overview_2012, schwartz_refining_2012, rokeach_nature_1973]。社会学工作同样将价值观视为持久取向,塑造人们认为有意义或恰当的事物,而不唯一决定行为[weber_protestant_1930, hitlin_values_2004]。文化经济学的相关研究表明,这些抽象价值观随时间持续存在,并在大规模上影响经济和社会选择[guiso_does_2006, tabellini_scope_2008]。综合来看,这些发现表明,价值观在比行动、目标或身份认同更高的抽象层次上运作,塑造更大群体中广泛的模式性选择,而非唯一决定具体选择。 #### 形式化模型。 这些区分已在经济学、决策理论和心理学中以多种方式形式化。一些模型将智能体表示为由不同时间跨度的交互系统组成,例如短期和长期自我[thaler_economic_1981, fudenberg_dual-self_2006]。其他模型保留单一偏好关系,但将选择对象扩展到包括菜单、承诺或未来自我,从而使诱惑和自我调节显式化[gul_temptation_2001, amador_commitment_2006]。基于身份认同的模型将长期承诺直接纳入效用函数,允许稳定的自我概念塑造短期选择[akerlof_economics_2000, benabou_identity_2011, benabou_identity_2025]。这些方法展示了编码分层偏好的不同方式。 ### 2.2 公理A2:偏好是动态的 #### 代际变化。 在每个层面,偏好都会变化。在人口层面,大规模跨国调查显示,价值观因代际和历史背景而异,这些差异与经济安全和制度稳定性密切相关[haerpfer_world_2020]。inglehart_modernization_2020认为,人们的核心价值观受其早期生活条件塑造,随着新一代取代老一代,社会价值观发生变化。 #### 人生阶段变化。 在个体内部,偏好也随生命周期转移。生命周期发展理论提出,角色、目标和感知时间视野的变化导致人们随年龄增长而重组其关心的事物[baltes_theoretical_1987]。青春期以对奖励和同伴影响的高度敏感性为特征,增加了新颖性、社会认可和短期结果的重要性[steinberg_social_2017, somerville_teenage_2013, chein_peers_2011]。相比之下,成年和老年期与对情绪调节和有意义关系的日益关注相关,人们越来越优先考虑能提供情感价值和稳定性的目标[carstensen_taking_1999]。纵向研究和元分析研究也显示,人格特质在成年期系统性变化,与随时间增强的自我控制和长期取向一致[roberts_patterns_2006]。 #### 时间推移。 即使结果和信息保持不变,时间的流逝也能改变偏好。由于存在当前偏向,决策的主观体验会随着它从未来移动到当下而发生改变。因此,当两个选项都在遥远未来时人们往往计划等待,但随着选择时刻临近,又会反转偏好,选择即时奖励[ainslie_specious_1975, laibson_golden_1997]。对当前偏向选择的形式化分析(建模为双曲线或拟双曲线折现)表明,随时间动态重新评估决策会导致熟悉的经验,如拖延、延迟和不一致的计划[odonoghue_doing_1999, harris_dynamic_2001]。 #### 上下文与状态变化。 偏好也对波动的生理和环境状态敏感。饥饿和唤醒等内脏状态可靠地改变急躁情绪和风险评估,改变人们在当下认为可取的结果[loewenstein_out_1996, loewenstein_ris
相似文章
塑造人机交互以提供改进路径并平衡竞争性目标
本文讨论如何塑造人机交互,以提供改进路径并平衡相互竞争的目标。
迈向AI对齐的价值理论
本文分析了94篇AI对齐研究论文,考察人类价值观是如何被概念化的,发现许多论文依赖偏好和合成数据,这可能将复杂的文化价值观简化为二元选择。
对齐(Alignment)
本文概述了Anthropic对齐团队的使命与研究重点,该团队通过评估、监督和压力测试等手段开发保障措施,以确保未来的AI系统始终保持有益、诚实和无害。
在人机对齐下借助AI辅助决策的学习
本文研究了在人机对齐条件下学习借助AI做出最优决策的问题,表明对齐可以降低学习的复杂度,并给出了遗憾界。
@AnthropicAI: 在此阅读全文:https://alignment.anthropic.com/2026/teaching-claude-why/…
Anthropic 对齐团队展示了减少 AI 模型中智能体行为失调的技术,包括基于伦理困境建议和宪法文件进行训练,这些方法在分布外场景中具有良好的泛化能力。