大语言模型通过自适应探索发展新型社会偏见

Hacker News Top 论文

摘要

本研究探讨大语言模型如何通过自适应探索产生新的社会偏见,并强调了这对人工智能公平性和伦理考量的意义。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/09 00:42

# 验证您的浏览器 | OpenReview 来源:https://openreview.net/challenge?redirect=/forum?id=pc7fqaOcAH ## 完成以下验证以继续访问 OpenReview 请完成上述验证\。 已有 OpenReview 账户?立即登录(https://openreview.net/login?redirect=%2Fforum%3Fid%3Dpc7fqaOcAH)可跳过此验证步骤\。

相似文章

无理解的模仿:大语言模型中决策偏差的起源

arXiv cs.CL

本文研究了像ChatGPT-4o和Qwen这样的大语言模型如何通过有缺陷的人类行为模仿来产生决策偏差,即使当人类偏好本身并无偏差时也是如此,并表明对偏差的科学描述可能成为大语言模型反应的自我实现预言。

关于语言模型安全性和滥用的经验教训

OpenAI Blog

OpenAI 分享了在语言模型安全性和滥用方面吸取的经验教训,讨论了衡量风险的挑战、现有基准的局限性,以及他们开发的新型毒性和政策违规评估指标。该文章还强调了对劳动力市场影响的担忧,以及继续研究大规模AI部署社会影响测量的必要性。

大型语言模型应学习个性化而非聚合的人类偏好

arXiv cs.LG

这篇立场论文主张,大型语言模型应从个性化而非聚合的人类偏好中学习,指出社会选择理论中的理论局限性以及人口多样性带来的实际问题。它提出了有边界的个性化框架,在尊重个体自主性的同时维护普遍的安全约束。