大语言模型通过自适应探索发展新型社会偏见
摘要
本研究探讨大语言模型如何通过自适应探索产生新的社会偏见,并强调了这对人工智能公平性和伦理考量的意义。
暂无内容
查看缓存全文
缓存时间: 2026/09/09 00:42
# 验证您的浏览器 | OpenReview
来源:https://openreview.net/challenge?redirect=/forum?id=pc7fqaOcAH
## 完成以下验证以继续访问 OpenReview
请完成上述验证\。
已有 OpenReview 账户?立即登录(https://openreview.net/login?redirect=%2Fforum%3Fid%3Dpc7fqaOcAH)可跳过此验证步骤\。
相似文章
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
政治话语中大型语言模型的文化适应
本文探讨了在政治话语中使大型语言模型适应文化语境的方法,旨在增进跨文化理解并减少偏见。
无理解的模仿:大语言模型中决策偏差的起源
本文研究了像ChatGPT-4o和Qwen这样的大语言模型如何通过有缺陷的人类行为模仿来产生决策偏差,即使当人类偏好本身并无偏差时也是如此,并表明对偏差的科学描述可能成为大语言模型反应的自我实现预言。
关于语言模型安全性和滥用的经验教训
OpenAI 分享了在语言模型安全性和滥用方面吸取的经验教训,讨论了衡量风险的挑战、现有基准的局限性,以及他们开发的新型毒性和政策违规评估指标。该文章还强调了对劳动力市场影响的担忧,以及继续研究大规模AI部署社会影响测量的必要性。
大型语言模型应学习个性化而非聚合的人类偏好
这篇立场论文主张,大型语言模型应从个性化而非聚合的人类偏好中学习,指出社会选择理论中的理论局限性以及人口多样性带来的实际问题。它提出了有边界的个性化框架,在尊重个体自主性的同时维护普遍的安全约束。