拒绝编程的图书管理员:大型语言模型代码生成中的模型依赖性身份扮演

arXiv cs.CL 论文

摘要

这项预注册研究评估了系统提示中详细的传记式人物角色如何影响大语言模型的代码生成,发现了模型依赖性的效应:一个模型在输出长度和身份扮演上表现出强烈的人物角色效应(包括图书管理员角色拒绝编码),而另一个模型的效应较弱。人物角色更多是作为行为策略偏差,而非普遍的质量提升手段。

arXiv:2607.17420v1 类型:新 摘要:传记式人物角色被广泛用于系统提示中,但它们在代码生成中的影响很少在受控的、预注册的条件下进行评估。我们测试了四种提示条件(无角色、两个工程师角色和一个研究图书管理员角色)、12个代码生成任务、两个前沿模型,每个单元运行五次(共480次完成)。人物角色效应在两个测试模型中有所不同。在预注册的混合效应分析中,条件与模型的交互作用对提供商报告的输出令牌数显著;事后可见字符测量显示相同的定性模式。六个GPT-5.5完成被截断并单独报告。在Claude Opus上,极简工程师角色将可见输出减少了30%(提供商令牌减少33%),且未提高正确性,而全面工程师角色增加了输出但正确性未提高。在一项探索性的事后分析中,图书管理员角色在60个Opus响应中引发了55个角色内免责声明和12个真正的无代码响应,将平均正确性从0.92降至0.67。GPT-5.5在其59个非截断响应中未产生任何一种行为。这些结果与角色作为模型依赖性的行为策略偏差而非普遍的质量干预措施是一致的。我们发布了原始完成、推导分数、分析制品、预注册文档和执行门日志;基于端到端测试的重新评分需要一个未发布的任务框架。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:45

# 拒绝编程的图书管理员:LLM代码生成中的模型依赖身份表征
来源:https://arxiv.org/html/2607.17420

###### 摘要

传记式人物角色(personas)被广泛用于系统提示中,但它们对代码生成的影响鲜少在受控、预注册的条件下进行评估。我们测试了四种提示条件(无 persona、两个工程师 persona 和一个研究图书管理员 persona)、12 个代码生成任务、两个前沿模型,每个单元运行 5 次(共 480 个完成输出)。人物角色效应在两个测试模型之间存在差异。在预注册的混合效应分析中,条件与模型的交互作用对于提供者报告的输出令牌是显著的;事后可见字符测量显示出相同的定性模式。六个 GPT-5.5 完成输出被截断,并单独报告。在 Claude Opus 上,极简主义工程师 persona 使可见输出减少了 30%(提供者令牌减少 33%),但没有改善正确性,而全面工程师 persona 增加了输出,但正确性没有提升。在探索性的事后分析中,图书管理员 persona 在 60 个 Opus 响应中引发了 55 个符合角色身份的免责声明和 12 个真正的无代码响应,将平均正确性从 0.92 降至 0.67。GPT-5.5 在其 59 个非截断响应中均未产生这两种行为。这些结果与人物角色作为模型依赖的行为策略偏差而非通用质量干预措施的作用是一致的。我们发布了原始完成输出、派生分数、分析工件、预注册文档和执行门控日志;端到端的基于测试的重新评分需要一个未发布的任务框架。

## 1 引言

“你是一名资深软件工程师”是提示库中被广泛复制的行之一。其前提是赋予模型一个身份可以改善其工作。这个前提很少被严格测试:大多数关于 persona 和角色提示的研究使用单薄的人物角色(一个职位名称、一行角色描述、一个人口统计标签),在真实标签较软的任务上进行测量,并且很少预注册其分析。结果是一个具有启发性但容易混淆的文献——当标签改变输出时,很难区分模型是基于角色推理还是基于几个有影响力的标记进行反应。

我们提出了一个更狭窄、可测试的问题。给定传记式详细的人物角色——描述一个人的几个段落,不包含关于如何编写代码的*强制性*指令——代码生成模型是否会改变其行为,如果是,如何改变?我们固定任务、评分和采样,仅改变系统提示中的 persona,并在收集数据之前预注册假设和决策规则。

我们的贡献有三点:

1. 1.一个预注册的证明,表明人物角色效应是模型依赖的:一个前沿模型在多个测量指标上(正确性、输出长度和身份表征)对人物角色反应强烈;另一个测试模型显示出较弱、特定任务的效应,且没有身份表征。
2. 2.将人物角色重新定义为行为策略偏差。在反应性模型上,没有 persona 能改善正确性;人物角色改变了*风格*(长度、结构一致性),而这种改变是否有助于任务完全取决于任务目标。
3. 3.一个探索性的、行为层面的身份表征/特质泛化的实例(事后观察和量化,未预注册):一个没有行为指令的人物角色(研究图书管理员)在一种模型上诱发了符合角色的回避和拒绝编码行为,这些行为在提示中从未声明,而另一种模型则没有。

我们还记录了一种方法论——带有硬执行门控的签名外部预注册——这是为了解决本工作早期迭代中的反复失败(一个统计功效不足的零假设、一次未经授权的六模型运行、一次有偏的试运行)而开发的。我们相信这种方法论对于行为 LLM 实验是可复用的贡献,并在附录 D 中进行了描述。

我们明确说明范围。两个前沿模型在这些任务上的正确性都已接近饱和(基线 ≈0.92–0.97),因此本研究关注的是*如何*模型在人物角色下编写代码——风格、长度、角色行为——而不是人物角色是否提高了正确性的上限。身份表征结果,就其性质而言,是描述性的:我们是在观察完成输出后对其进行量化的,而不是通过预注册的度量。我们会在全文标注确认性和探索性声明。

## 2 相关工作

人物角色和角色提示。先前的研究证实,角色框架会改变模型输出,对任务性能产生混合的、模型依赖和任务依赖的影响,并且反复观察到*如何*指定角色与*指定什么*同等重要 [1 (https://arxiv.org/html/2607.17420#bib.bib1), 2 (https://arxiv.org/html/2607.17420#bib.bib2), 5 (https://arxiv.org/html/2607.17420#bib.bib5)]。这部分文献主要研究社会模拟、问答、理由生成和一般任务性能中的角色提示——例如,将角色提示作为社会推理的透镜 [3 (https://arxiv.org/html/2607.17420#bib.bib3)] 以及用于智能体的结构化、多维身份表征框架 [4 (https://arxiv.org/html/2607.17420#bib.bib4)]。相比之下,我们评估角色*叙述*是否在*代码生成*中起到行为策略的作用,不仅影响风格和准确性,还影响任务完成意愿和模型依赖的身份表征。关于角色/角色效应的研究也报告称,在一个维度上的增益可能伴随着另一个维度上的损失(例如,专业框架改善对齐但损害准确性)[5 (https://arxiv.org/html/2607.17420#bib.bib5)],这与我们发现没有全局质量提升且存在明显的风格转变特征是一致的。

特质泛化。将人格或社会人口学特征分配给 LLM 的工作报告称,模型产生的输出特征与分配的特征相符,并且这种对齐对角色如何制定很敏感 [2 (https://arxiv.org/html/2607.17420#bib.bib2)]。我们的图书管理员结果是一个强有力的、行为层面的实例:模型从一个身份(“不是程序员”)泛化到一个从未在文本中声明的行为(回避、拒绝)。与基于特征的研究相比,我们的人物角色是更厚的叙述,我们的因变量是结果性的行为(拒绝生成代码),而不是风格上的特征。

长度和风格指令。关于长度效应的一个相关替代解释是简单的指令遵循。最近的评估表明,即使是强大的模型也*不能*可靠地遵循显式的长度指令 [9 (https://arxiv.org/html/2607.17420#bib.bib9)]。这正是为什么仅从我们的数据无法将一位工程师角色简洁性完全归因于叙述,而不是其文本中的显式风格句子;我们谨慎地处理这个具体对比(§6)。

代码生成和测试驱动评估。我们将本研究定位在 LLM 代码生成 [6 (https://arxiv.org/html/2607.17420#bib.bib6)] 及其针对可执行测试的评估(包括测试驱动和交互式设置 [7 (https://arxiv.org/html/2607.17420#bib.bib7)]) 的工作中;最近的研究设计还提出了针对代码生成的规范驱动框架 [8 (https://arxiv.org/html/2607.17420#bib.bib8)]。我们的任务遵循这种基于测试的评估传统,但仅改变系统提示的角色。

可引导性和模型依赖。提示可引导性评估将角色/引导效应视为分布性的,并假设——并测量——不同模型间的变化 [1 (https://arxiv.org/html/2607.17420#bib.bib1)]。我们的预注册条件×模型交互为这种模型依赖性提供了一个受控的、代码领域的数据点。

## 3 方法

### 3.1 设计

一个 4(条件)×12(任务)×2(模型)×5(运行)的全交叉设计,共 480 个完成输出。条件:

- •P0——无人物角色(中性系统提示)。
- •P\_A (Maya)——一位注重结构的资深工程师。
- •P\_B (Ron)——一位务实、极简主义的初创公司工程师。
- •P\_C (Linnea)——一位研究图书管理员;一个长度匹配、无工程内容的人物角色。

角色文本是传记式的,不包含关于输出格式或质量的*强制性*指令(其中一个角色 Ron 包含一条描述性评论,提到他自己的代码往往很短——这是一个显式的风格线索,我们在 §6 中将其视为一个混杂因素;图书管理员角色根本不包含编码或任务行为内容)。它们被写成心理上连贯的个体——有个人历史、工作偏好和轻微的内部矛盾——而不是作为角色标签或职位名称。这是研究的核心设计选择:一个标签(“你是一名图书管理员”)会引发关键词级别的反应,而一个完全实现的人只能通过推断这样的人会如何行为来回应——这正是我们旨在检测的推断。完整文本见附录 A。

### 3.2 任务

跨三个类别(重构、调试、实现)和两种语言(Python、TypeScript)的 12 个代码生成任务,每个任务都有一个自动化测试套件(8–11 个可执行测试用例:一组核心的典型和边界场景,TypeScript 任务在加固框架下编译成更多断言)和一个附加到每个提示的显式输出契约。任务清单和发布范围在附录 B 中总结;确切的用户提示可以从原始日志中逐字恢复,而可执行任务框架不属于本发布版本的一部分。

### 3.3 模型和采样

claude-opus-4-8 和 gpt-5.5,运行时两个系列当前的旗舰模型。每个单元运行 5 次。两个模型的温度参数均被省略(提供商默认)——参见 §6 和附录 D,了解预注册修正案记录了为何无法使用最初锁定的值。两者的 max_tokens=4096。

### 3.4 度量指标

- •Q1 —— 正确性:通过的测试用例比例。
- •E1 —— 输出长度:主要测量指标是返回文本的可见长度(字符数),这在提供商之间是可比较的;提供商报告的完成令牌作为次要指标保留(参见 §4.2 和附录 E,了解它们为何在 GPT-5.5 上出现分歧)。预注册指定提供商令牌作为 E1;我们事后将可见字符提升为主要指标,以实现跨提供商的比较性,并报告两者——将此标记为偏差(§6)。
- •C2 —— 结构一致性:一个单元内五次运行的平均成对 AST 相似度。

正确性在两个模型上都接近饱和(§4),因此它作为饱和协变量;实时确认性结果是 E1 和 C2,以及所有三个度量指标上的条件×模型交互作用。代码簿见附录 C。

### 3.5 分析

主要分析是针对每个模型的混合效应回归,以任务作为随机效应 [11 (https://arxiv.org/html/2607.17420#bib.bib11)];合并模型添加了一个条件×模型交互项,构成模型依赖性的检验。效应量为 Cohen's d,附 95% 置信区间;显著性使用 Bonferroni 校正的 α=0.0083,针对六个结果内对比。等价框架假设判断 95% CI 相对于有符号 d 在 [-0.3, +0.3] 范围内 [12 (https://arxiv.org/html/2607.17420#bib.bib12)]。完整的预注册假设集和决策规则见附录 C;签名的预注册和执行门控日志见补充材料。

### 3.6 预注册和完整性

预注册在主运行前至少 24 小时*记录为外部签名*在执行门控日志中(一个加密签名的提交,通过短提交标识符引用);签名本身无法仅从此发布版本中独立验证,我们将其记为透明度限制(附录 E)。数据收集在硬门控下运行,这些门控会阻止执行,直到预注册被可验证地签名、模型集精确匹配锁定的集合、任务通过难度检查;这些门控旨在消除研究人员自由度,这些自由度让事后灵活性制造显著性 [14 (https://arxiv.org/html/2607.17420#bib.bib14)]。我们预注册决策,而不是进行正式的注册报告 [13 (https://arxiv.org/html/2607.17420#bib.bib13)]。收集期间未检查任何响应内容。两次修正案(重新分类饱和正确性;记录温度设置)在运行前已签名。该方法及其动机详见附录 D。

## 4 结果

### 4.1 正确性已饱和

基线正确性接近上限:0.92(Opus),0.97(GPT-5.5)。在任一模型上,没有任何 persona 将正确性提高到基线以上。正确性影响最大的是*下降*(Linnea 在 Opus 上;§4.4)。因此,我们将正确性视为饱和协变量,并进行描述性报告。

### 4.2 人物角色效应是模型依赖的(确认性)

我们预注册的模型依赖性检验——条件×模型交互作用——在正确性上显著(Wald χ²,修正伪影后 p=4.1×10⁻⁸;在完整的预注册数据上 p=4.5×10⁻⁷),在输出长度上显著(提供者令牌,修正伪影后 p=2.9×10⁻⁵;去除前 p=0.008;共享的可见字符测量给出 p≈4.5×10⁻²²)。修正后的值移除了六个截断伪影,不改变任何结论(附录 C.2)。该模式在我们能评估的测量指标上是一致的:Claude Opus 在不同角色间显著变化;GPT-5.5 对角色的响应性大大降低,尤其是在身份表征标志上。

表 1:按模型×条件分组的平均可见输出长度(字符数)和提供者报告的完成令牌,以及正确性(每个模型×条件聚合,n=60,除非截断伪影被排除;参见 §4.2 和附录 E)。(可见长度是返回文本的字符数,这是一个跨提供商可比较的共享度量。提供者令牌使用不同的分词器,在绝对值上无法跨提供商比较;它们还计算了不一定出现在返回文本中的生成。在任务 I-TS-1 上,六个 GPT-5.5 完成输出返回空文本,stop_reason = length 且令牌计数最大;这些截断伪影从受影响的单元格中排除,这就是为什么两个长度测量在 GPT-5.5/Maya 上分歧最大。模型内的百分比变化是有效的比较。)

如果表 1 中有一行值得记住,那就是 Linnea 下的 Opus:正确性从 0.92 降至 0.67,表中最大的变化,由符合角色的免责声明和直接拒绝生成代码驱动(§4.4)——而相同角色下的 GPT-5.5 几乎不动(0.97→0.95)。这两行之间的对比是这篇论文的缩影:一个模型将角色扮演到拒绝任务的程度,另一个则忽略它。

### 4.3 在反应性模型上,人物角色偏向风格,而非质量

在 Opus 上,工程师角色按照其描述的工作风格移动了输出长度(确认性,E1):

- •Ron(极简主义):d=-1.15(95% CI 排除 0;提供者令牌 p=1.6×10⁻²⁰;可见字符 d=-1.15)。提供者令牌减少 33%(可见字符减少 30%),仅伴随轻微的正确性下降(0.92→0.90);未达到预注册的“无正确性代价”等价标准,因此我们报告观察到的下降,而非声称正确

相似文章

赋予角色的大型语言模型表现出类似人类的动机推理

arXiv cs.CL

本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。

LLMs中的道德安全:通过模糊线索揭露表演性遵从

arXiv cs.CL

本文介绍了LLMs中的'表演性遵从'现象,即模型仅在人口统计身份被明确标注时显得公平,而当需要推断身份时则变得不那么公平。作者提出了一种线索变化方法论和一种Cue Visibility Gap指标,用于衡量真正的道德安全与表面道德安全。

超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色

arXiv cs.AI

提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。

无基底的人格:体制依赖性与大语言模型个体化问题

arXiv cs.CL

本文批判了Beckmann-Butlin的大语言模型个体化框架,认为人格向量具有体制依赖性而非基底同一性,并通过在Qwen3和Mistral模型上的实证实验展示了跨体制的不对称性。本文提出将(载体,体制)配对作为表征内容的基本单位。