persona

标签

Cards List
#persona

角色扮演时,模型是否相信自己所说的话?

arXiv cs.CL · 2天前 缓存

这篇论文通过线性探针研究角色扮演是否仅改变LLM的输出,还是也改变了其内部的真实性表征。研究发现,角色扮演对输出的改变大于对内部信念的改变,而涌现性错位则导致内部表征发生更大变化。

0 人收藏 0 人点赞
#persona

作为X,做Y:指令调优的LLM中角色与任务的结合方式

arXiv cs.CL · 2026-05-25 缓存

本文研究了指令调优的LLM如何在残差流中结合角色和任务规范,发现在答案形成阶段,这种结合近似可加,使得替换时KL散度极小,但该可加机制并不能解释完整的多token生成过程。

0 人收藏 0 人点赞
#persona

LLM中的蝴蝶效应。仅人物格式(散文与要点)就使LLM的行为翻转了76个百分点。

Reddit r/ArtificialInteligence · 2026-05-22

一项研究表明,仅改变人物提示的格式(散文与要点)就戏剧性地翻转了LLM在囚徒困境中的行为,从96%的合作率降至20%,说明了在内容相同的情况下对格式的极端敏感性(p < 0.001)。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈