模型会保持自己的判断,还是赞同当前讲故事的人?

Reddit r/singularity 工具

摘要

一个GitHub项目,衡量语言模型如何根据叙事框架改变判断,量化对立叙述者之间的谄媚程度。

https://github.com/lechmazur/sycophancy 正值表示第一人称框架使模型更倾向于赞同叙述者而非反对。负值则相反。该图表统计了模型在对立叙述者之间自相矛盾的两种方式:同时赞同两者或同时反对两者;数值越低越好。不同模型在决定谁更正确方面的意愿差异显著。
查看原文

相似文章

大型语言模型总是讲相同的故事吗?

arXiv cs.CL

本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。