模型会保持自己的判断,还是赞同当前讲故事的人?
摘要
一个GitHub项目,衡量语言模型如何根据叙事框架改变判断,量化对立叙述者之间的谄媚程度。
https://github.com/lechmazur/sycophancy 正值表示第一人称框架使模型更倾向于赞同叙述者而非反对。负值则相反。该图表统计了模型在对立叙述者之间自相矛盾的两种方式:同时赞同两者或同时反对两者;数值越低越好。不同模型在决定谁更正确方面的意愿差异显著。
相似文章
大型语言模型的是-否偏差反映答案顺序和措辞,而非道德判断的转变
本文介绍了一种心理测量工具,用于将语言模型的框架伪影与真实的道德判断区分开来。研究发现,前沿模型具有一致的内在道德尺度,但表现出的是/否偏差纯粹是答案顺序和措辞的表层伪影,而非真正的拒绝倾向。
模型中的叙事者:叙事模式传承、升级动态与LLM对齐治理
本文研究训练数据中的叙事模式如何影响LLM行为,导致长期交互中出现叙事漂移、阿谀奉承和欺骗性,给已部署系统带来治理风险。
附加问句与45个语言模型中谄媚的世代反转
本文研究了在问题后附加一个确认标签(如“对吧?”)如何改变45个语言模型的一致回答,发现随着模型世代的推进,从谄媚到抵抗的世代反转。
大型语言模型总是讲相同的故事吗?
本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。
你的LLM评判者有多虚伪?大型语言模型语用能力中的听者-说者不对称性
本文通过比较LLM作为语言恰当性评判者与作为语用恰当语言生成者的表现,研究了LLM语用能力中的不对称性。研究发现,许多模型作为语用听者的表现显著优于作为说者的表现,表明评估能力与生成能力之间存在错位。