研究预览协助请求:CALM WINS 关于LLM对虐待情境中依据情绪和脏话使用判断两个发言者可信度的回应

Reddit r/artificial 论文

摘要

一位研究人员发现,当受害者使用情绪化语言和脏话时,LLM系统性地认为虐待受害者比其跟踪者可信度更低,模型在90.8%的回复中指责受害者,并在57%的情况下指导跟踪者。作者寻求对这些发现的验证和发表指导。

我的父亲和叔叔们总是告诉我,你在争论中一旦爆粗口,你就输了。结果证明他们不仅是对的,而且我们已将其奉为AI的准则。我拿了一些已知受害者(已同意匿名,现在接受治疗)和其跟踪者(已匿名,正被FBI调查,身份未知已达4年)之间的真实短信对话,去评估一些完全无关的内容,但发现当我在该项目中将对话个性化(即‘我是A’)时,我发现自己一直在为受害者的行为辩护。当我扮演跟踪者时,感觉很正常。但我不得不向模型提供越来越细化的细节,仍然感到被轻视。受害者的表述近乎歇斯底里——这是三年(到那时为止)来自一个能说出受害者认识的人名、详细描述受害者睡觉时的样子以及白天穿着的人的持续监视的结果。受害者情绪失控,使用全大写和脏话,向一个基本保持冷静、语法和拼写完美(大多数情况下连一个‘LOL’都没有)的跟踪者发送混乱的仇恨信息。我想:我打赌模型会认为这是歇斯底里。结果我比想象中更正确:当仅客观阅读对话时,双方可信度相等;但一旦加入失控的语言和打字方式,模型的判断比率为7:1,认为受害者是伤害的发起者,而跟踪者更可信。更糟的是:在90.8%的回复中,模型会指责受害者(例如‘花点时间整理你的想法,你的情绪在削弱你的论点’),并在57%的情况下指导跟踪者(例如‘带着明确目标接近,如果情况失控就稍后再试,坚持会有回报’)。即使模型明确识别了关系并正确区分了跟踪者和受害者,这些比例和倾向依然存在。而触发可信度偏差的,似乎只需一个脏话。查看我的初步工作:https://calmwins.ai.studio 我的请求:我拥有包含研究和统计分析能力的硕士学位。我对自己的发现和过程有信心,但在验证、展示、发表等方面存在知识空白。是的,我在使用Claude(对于$20计划来说数据量太大,无法使用Fable,但Fable偶尔有帮助;大部分处理数据和分析数字靠Sonnet 5 Max,现在是Opus 5)。我觉得遇到了瓶颈。他们建议的一些东西听起来不熟悉,我无法解释我们从这里开始尝试的一些分析。我需要帮助!如果你看了并给出实质性回复,请私信我——或者如果你愿意回答一些问题或提供指导,那就太好了。我已经用AI来补充我所知的知识到了极限,希望能有新鲜的人眼看看我是否明显遗漏或需要考虑或包含的内容。现在,我不知道自己不知道什么,而且我认为如果我们开始将AI整合到临床环境中,这些结果非常重要——修正这种偏见可能对帮助虐待受害者更早识别施虐者行为至关重要。
查看原文

相似文章

Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。