标签
本文提出MAVEN,一个用于评估多模态内容宏观社会价值的分层框架,包含一个基准测试和优化评估器,以实现可扩展评估。
本文分析了94篇AI对齐研究论文,考察人类价值观是如何被概念化的,发现许多论文依赖偏好和合成数据,这可能将复杂的文化价值观简化为二元选择。
本文提出了MCF-CVA,一种用于大型语言模型情境价值对齐的多层组合融合框架,该框架利用多个道德智能体以及扩展-约简过程来更好地捕捉伦理多元主义,并优于单智能体基线方法。
本文使用世界价值观调查(World Values Survey)测试不同的提示框架(个性化、角色扮演、第三人称预测)在从大语言模型中获取文化价值观时是否可互换。结果显示,提示框架显著影响模型响应和测量的文化对齐程度,其中第三人称预测在方向性对齐上表现最强。
介绍了Pancasila-Dilemmas,这是一个包含1,834个问题的评估数据集,基于印尼价值观(潘查希拉)来衡量大语言模型与国家特定价值观的对齐程度。对50个大语言模型的评估显示,尤其在宗教和团结困境方面存在显著差距。
介绍PLURAL,一个基于92个国家综合价值观调查的大规模偏好数据集,包含来自20个不同国家的约50万个偏好三元组,旨在改进大语言模型中的文化价值对齐。
本文主张,在AI价值对齐中聚合道德评估时必须考虑语境因素,表明忽略语境可能导致违反弱帕累托原则,类似于辛普森悖论。
本文开发了一个用于评估31个大语言模型环境态度的基准,发现它们往往表现出进步的环境观和情境敏感性,凸显了在可持续发展应用中可操控性和规范可靠性的问题。
哲学家正越来越多地被顶尖AI实验室(如DeepMind和Anthropic)雇佣,以解决伦理和对齐问题,同时AI也在重塑大学的哲学课程。
本文介绍了AllFaith宗教表征基准,用于衡量LLM在回答日常伦理问题时遗漏宗教观点的频率,发现模型相较于人类预期,低估了宗教的作用,尤其是在实际个人情境中。
本文介绍了DVMap,一个用于大语言模型细粒度多元价值对齐的框架,它使用高共识的人口统计-价值映射,而非粗略的国家标签,从而在跨人口统计、跨国家和跨价值维度上实现了强的泛化能力。
本文提出了SoVA,一个使用GraphRAG将心理学理论转化为规范性指令,从而使基于LLM的智能体与人类社会价值观对齐的框架。在DAILYDILEMMAS基准上的实验表明,相比基于提示的基线方法有显著改进。