persona

#persona

角色扮演时，模型是否相信自己所说的话？

arXiv cs.CL ↗ · 2天前缓存

这篇论文通过线性探针研究角色扮演是否仅改变LLM的输出，还是也改变了其内部的真实性表征。研究发现，角色扮演对输出的改变大于对内部信念的改变，而涌现性错位则导致内部表征发生更大变化。

0 人收藏 0 人点赞

#persona

arXiv cs.CL ↗ · 2026-05-25 缓存

本文研究了指令调优的LLM如何在残差流中结合角色和任务规范，发现在答案形成阶段，这种结合近似可加，使得替换时KL散度极小，但该可加机制并不能解释完整的多token生成过程。

0 人收藏 0 人点赞

#persona

Reddit r/ArtificialInteligence ↗ · 2026-05-22

一项研究表明，仅改变人物提示的格式（散文与要点）就戏剧性地翻转了LLM在囚徒困境中的行为，从96%的合作率降至20%，说明了在内容相同的情况下对格式的极端敏感性（p < 0.001）。

0 人收藏 0 人点赞