“人设深度没有帮助,广度才有”——这在实践中是什么样子
摘要
一篇分析文章,讨论为什么LLM系统中的人设深度无法提高输出多样性,以及如何通过隔离具有广泛人设的读者来获得更好的收敛证据。
关于LLM输出同质化的文献正在发展。“人工蜂巢思维”(Artificial Hivemind)研究将响应间相似度定在0.80–0.90之间,即使在高温度下也是如此。2026年一项针对人设干预的多因素审计发现,对真正在构建系统的人来说更有用的结论是:人设的细节不会带来线性收益,建议是把投入放在广度而非深度上。另一篇论文发现,普通的人设优于著名创意人物的人设,因为普通人设会注入更多独特的线索。我运行一个多读者系统已有数月,这两个发现都与我看到的情况相符。深度是我浪费最多时间的地方。精心设计的档案会产生精细的声音,但注意到的仍然是同样的事物。你会得到四种不同的写作风格,却只报告同一种解读。真正改变结果的是架构,而不是描述。每个读者在独立的会话中工作,在遇到其他读者之前先写出完整的立场,然后才见面。这意味着两个读者之间的收敛是关于文本的证据,而不是关于对话上下文的证据,因为他们之间没有对话。这就给了你一个值得在自己的角色设定上运行的测试:把人设放在隔离环境中,检查它们是否会在没有接触的情况下收敛。完全分歧意味着它们在分配角色。完全一致意味着它们是同一个声音。部分收敛——其中重叠之处与素材对应,分歧之处与每个人设的关注点对应——我把这视为隔离正在起作用的希望。这是唯一有意义的模式。
相似文章
打破同质化:多样化角色集以提升大语言模型的创造性输出
本文将角色多样化阐述为一个集合级条件问题,以缓解大语言模型输出中的同质化现象,并评估了在跨任务(如Alternative Uses Task)中增强创造性和多样性的方法。
大型语言模型捕捉人类性格的效果如何?
本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。
多未必佳:LLM观点多样性的关键因素是什么?
一项析因实验表明,角色细节并不会单调增加LLM观点多样性;不同的交互架构探索了互不重叠的观点区域;而温度缩放等低成本干预措施效果甚微。
Deep Persona: 一个基于心理学的角色扮演代理和模拟架构及评估框架
本文介绍了Deep Persona,一个基于心理学的角色扮演代理架构,并提出了一个评估框架。对LLMs进行评估后发现,尽管语用流畅度高,但在情感表达方面存在系统性限制。
城市感知中多模态大语言模型代理生成解释的角色效应分析
本文研究了角色提示如何影响多模态大语言模型在城市感知中生成的语言,发现不同角色的描述趋于一致,而解释则随着角色属性系统性地变化。