“人设深度没有帮助,广度才有”——这在实践中是什么样子

Reddit r/ArtificialInteligence 新闻

摘要

一篇分析文章,讨论为什么LLM系统中的人设深度无法提高输出多样性,以及如何通过隔离具有广泛人设的读者来获得更好的收敛证据。

关于LLM输出同质化的文献正在发展。“人工蜂巢思维”(Artificial Hivemind)研究将响应间相似度定在0.80–0.90之间,即使在高温度下也是如此。2026年一项针对人设干预的多因素审计发现,对真正在构建系统的人来说更有用的结论是:人设的细节不会带来线性收益,建议是把投入放在广度而非深度上。另一篇论文发现,普通的人设优于著名创意人物的人设,因为普通人设会注入更多独特的线索。我运行一个多读者系统已有数月,这两个发现都与我看到的情况相符。深度是我浪费最多时间的地方。精心设计的档案会产生精细的声音,但注意到的仍然是同样的事物。你会得到四种不同的写作风格,却只报告同一种解读。真正改变结果的是架构,而不是描述。每个读者在独立的会话中工作,在遇到其他读者之前先写出完整的立场,然后才见面。这意味着两个读者之间的收敛是关于文本的证据,而不是关于对话上下文的证据,因为他们之间没有对话。这就给了你一个值得在自己的角色设定上运行的测试:把人设放在隔离环境中,检查它们是否会在没有接触的情况下收敛。完全分歧意味着它们在分配角色。完全一致意味着它们是同一个声音。部分收敛——其中重叠之处与素材对应,分歧之处与每个人设的关注点对应——我把这视为隔离正在起作用的希望。这是唯一有意义的模式。
查看原文

相似文章

大型语言模型捕捉人类性格的效果如何?

arXiv cs.AI

本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。