更少澄清,更好代码:编程助手中跨会话个性化歧义适应的基准测试
摘要
本文介绍了CAPA,一个用于编程助手中跨会话个性化歧义适应的基准测试,刻画了六种歧义机制,并在600个编码会话中评估了12个LLM,包括有无用户历史的情况。
arXiv:2607.26611v1 公告类型:新
摘要:AI辅助编程日益将非正式的用户意图转化为可执行软件,然而编程请求通常包含以用户特定方式在不同任务和会话中反复出现的歧义。现有的消歧方法通常在当前编码会话中孤立地处理每个有歧义的请求,通常通过引发额外的澄清。然而,来自同一用户的已解决会话历史是否可以作为记忆,用于在新打开的会话中解决重复出现的个性化歧义,仍未得到充分探索。我们将个性化歧义适应定义为一个新任务:给定用户先前已解决的编程会话和一个新的有歧义的请求,助手应识别重复出现的歧义模式,生成预期的可执行解决方案,并尽量减少澄清。为了对该任务进行基准测试,我们引入了CAPA,它通过六种机制来表征个性化编程歧义,并使用受控的三阶段生成流水线将这些机制注入到无歧义的可执行任务中。CAPA包含60个均衡的用户-歧义单元中的600个编程会话,包括300个留出的评估会话。我们在无历史和同用户历史条件下评估了12个最新的LLM,使用可执行成功率、首轮成功率和完成轮数。我们的分析考察了任务难度、用户身份和基于记忆的历史使用,并进一步提出了同用户历史门控作为一种轻量级的推理时方法。CAPA为开发长期编程助手奠定了基础,这些助手能更好地将生成的代码与用户意图对齐,同时减少重复的澄清。
查看缓存全文
缓存时间: 2026/07/31 04:00
# 更少澄清,更好代码:面向编码助手的跨会话个性化歧义适配基准测试
来源:https://arxiv.org/html/2607.26611Zijian Xu1, 3\equalcontrib, Wenshuo Zhang2\equalcontrib, Zisen Qin1, Rui Sheng2, Yushi Sun2, Huamin Qu2, Chuhan Shi1\corresponding###### 摘要 AI辅助编码正越来越多地将非正式的用户意图转化为可执行的软件,然而编码请求中往往包含以用户特定方式跨任务、跨会话反复出现的歧义。现有的消歧方法通常在当前编码会话内孤立地处理每个歧义请求,通常通过引导用户提供额外澄清信息来实现。但是,来自同一用户的已解决会话历史能否作为记忆,用于解决新会话中反复出现的个性化歧义,这一点仍未得到充分探索。我们将*个性化歧义适配(personalized ambiguity adaptation)*定义为一个新任务:给定用户先前已解决的编码会话和一个新的歧义请求,助手应识别出重复出现的歧义模式,生成符合用户意图的可执行解决方案,并尽量减少澄清。为了对该任务进行基准测试,我们提出了 CAPA,它通过六种机制刻画个性化编码歧义,并使用受控的三阶段生成流水线将这些机制注入到无歧义的可执行任务中。CAPA 包含 60 个均衡的用户–歧义细胞(cell)上的 600 个编码会话,其中包括 300 个留出评估会话。我们在无历史和有同用户历史两种条件下,使用可执行成功率(Executable Success, ES)、首轮可执行成功率(First-Turn Executable Success, FT-ES)以及完成所需轮次(Turns-to-Completion, TTC)评估了 12 个最新的 LLM。我们进一步研究了任务难度、用户身份和记忆管理如何影响适配,并提出了一种轻量级的用户历史门控方法。CAPA 为开发长期编码助手奠定了基础,使其能更好地将生成代码与用户意图对齐,同时减少重复澄清。
## 引言
AI辅助编码已成为将非正式意图转化为可执行软件的常见方式。用户通过自然语言对话请求编码助手实现功能、调试故障、适配现有程序或修改项目。然而,这些请求往往存在歧义,因为用户可能省略细节,或通过重复出现的、用户特定的模式来表达意图。例如,当用户要求“归一化”某个特征时,请求可能指的是最小–最大缩放,也可能指 z-score 标准化。熟悉该用户的协作者可能会从之前的编码会话中知道,该用户一贯指的是后者;而编码助手则可能选择最小–最大缩放,生成一个技术上有效但并非用户本意的实现。一个长期编码助手应当同样能从先前的编码会话中推断出这类重复出现的解释方式;否则,它就必须反复请求澄清,或继续做出同样的错误假设,从而增加交互次数和用户的认知负担。
近期工作解决了这个问题的重要部分,但大多是在孤立场景中进行。歧义研究探讨语言模型能否检测到规格不足的请求、重写这些请求,或提出有效的澄清问题 (Tanjimet al.2025b (https://arxiv.org/html/2607.26611#bib.bib22); Zhanget al.2024 (https://arxiv.org/html/2607.26611#bib.bib2))。这些方法通常将歧义视为当前编码会话内的局部问题,而显式澄清则试图通过额外用户轮次来消除不确定性。个性化和长期记忆研究则关注模型如何跨会话检索、更新和应用用户特定信息 (Salemiet al.2024 (https://arxiv.org/html/2607.26611#bib.bib8); Maharanaet al.2024 (https://arxiv.org/html/2607.26611#bib.bib9))。然而,歧义可能是用户特定的:同一用户倾向于在不同任务中留下同类型的信息空缺。助手能否利用同用户历史或个性化记忆在不反复澄清的情况下解决此类歧义,尤其是在开放式可执行编码场景中,仍未得到充分探索。这种能力对于构建随使用时间推移而变得更准确、交互更高效的长期助手至关重要。
为了填补这一空白,我们将*个性化歧义适配*定义为编码会话中的一个新任务。给定用户先前已解决的会话和一个开启留出会话的新的歧义请求,助手利用该历史所揭示的重复出现的歧义模式来推断本意实现。只有在历史证据不足时才应请求澄清,目标是在尽可能少的轮次内生成正确的可执行解决方案。与将每个请求放在局部上下文中处理的传统歧义消解方式不同,该任务评估的是对用户特定歧义的跨会话适配能力。它促使助手在最小化重复澄清中断的同时,将生成代码与用户意图对齐。
为了对该任务进行基准测试,我们提出了 CAPA(Cross-SessionAdaptation toPersonalizedAmbiguity,跨会话个性化歧义适配),其构建分为两步。首先,我们将Liet al.(2024 (https://arxiv.org/html/2607.26611#bib.bib6)) 的语言歧义类型改编为六种个性化编码歧义机制。每种机制都捕捉了导致必需实现信息被省略、模糊化或规格不足的、反复出现的用户相关原因;这些机制基于 WildChat 中的真实编码对话 (Zhaoet al.2024 (https://arxiv.org/html/2607.26611#bib.bib7))。其次,我们在用户画像上实例化这些机制,并将一个三阶段流水线应用于无歧义的 HumanEval 任务 (Chenet al.2021 (https://arxiv.org/html/2607.26611#bib.bib13))。该流水线通过控制任务关键信息来构造歧义的初始请求,将其扩展为已解决的多轮编码会话,并验证个性化歧义模式在会话之间保持一致。最终基准包含 600 个编码会话,排列在 60 个均衡的用户–歧义细胞中,每个细胞有 5 个已解决的历史会话和 5 个留出评估会话。
我们在 CAPA 上对 12 个最新的 LLM 进行了基准测试,涵盖闭源前沿模型、开放访问前沿模型和较小的开源模型,并使用可执行成功率(ES)、首轮可执行成功率(FT-ES)和完成所需轮次(TTC)系统评估其个性化歧义适配能力。我们进一步分析了该任务的关键方面,包括适配如何随任务难度变化、历史收益是否依赖于正确匹配的用户身份,以及基于记忆的历史管理如何影响历史使用。基于这些分析,我们提出了同用户历史门控作为提高性能的轻量级方法。
总之,我们的贡献如下:
- •一个新任务,面向长期编码助手。我们将个性化歧义适配定义为从已解决的编码会话中推断用户重复出现的歧义消解模式,并将其迁移到新的可执行任务,同时尽量减少澄清。
- •一个数据生成流水线。我们提出 CAPA,包括一个六机制的编码导向分类法、一个三阶段生成与一致性验证流水线,以及 600 个编码会话,这些会话组织为均衡的同用户历史和留出评估集。
- •一种交互感知评估。我们使用 ES、FT-ES 和 TTC 评估了 12 个模型,并对任务难度、用户身份、历史门控以及基于记忆的适配进行了受控研究。
## 相关工作
歧义与澄清。当请求存在多个合理解释或缺乏在这些解释之间做出选择所需的信息时,就会产生歧义 (Tanjimet al.2025b (https://arxiv.org/html/2607.26611#bib.bib22))。歧义可能源于语法、词汇含义或缺失的对话上下文,这推动了歧义分类法和歧义问答设置的出现 (Church and Patil1982 (https://arxiv.org/html/2607.26611#bib.bib23); Navigli2009 (https://arxiv.org/html/2607.26611#bib.bib24); Schlangen2004 (https://arxiv.org/html/2607.26611#bib.bib25); Liuet al.2023a (https://arxiv.org/html/2607.26611#bib.bib26); Minet al.2020 (https://arxiv.org/html/2607.26611#bib.bib1))。先前工作同时处理歧义检测和消解。检测方法使用基于特征的分类器、神经模型或 LLM 提示来决定是回答还是寻求信息 (Trienes and Balog2019 (https://arxiv.org/html/2607.26611#bib.bib28); Dhole2020 (https://arxiv.org/html/2607.26611#bib.bib29); Guoet al.2021 (https://arxiv.org/html/2607.26611#bib.bib27); Leeet al.2023 (https://arxiv.org/html/2607.26611#bib.bib40); Tanjimet al.2025a (https://arxiv.org/html/2607.26611#bib.bib30); Kuhnet al.2022 (https://arxiv.org/html/2607.26611#bib.bib31));CLAMBER 进一步测试 LLM 是否能识别出模糊需求并提出有用的问题 (Zhanget al.2024 (https://arxiv.org/html/2607.26611#bib.bib2))。消解方法使用对话或检索上下文重写规格不足的查询 (Elgoharyet al.2019 (https://arxiv.org/html/2607.26611#bib.bib33); Ananthaet al.2021 (https://arxiv.org/html/2607.26611#bib.bib41); Maet al.2023 (https://arxiv.org/html/2607.26611#bib.bib34)),在长形式回答中涵盖多种解释 (Stelmakhet al.2022 (https://arxiv.org/html/2607.26611#bib.bib35); Kimet al.2023 (https://arxiv.org/html/2607.26611#bib.bib36); Inet al.2025 (https://arxiv.org/html/2607.26611#bib.bib37)),或提出澄清问题 (Aliannejadiet al.2019 (https://arxiv.org/html/2607.26611#bib.bib38); Xuet al.2019 (https://arxiv.org/html/2607.26611#bib.bib39); Zhang and Choi2025 (https://arxiv.org/html/2607.26611#bib.bib4); Kimet al.2024 (https://arxiv.org/html/2607.26611#bib.bib32); Zhanget al.2025 (https://arxiv.org/html/2607.26611#bib.bib43))。在编码领域,Orchid 研究函数级生成中的模糊需求 (Yanget al.2026a (https://arxiv.org/html/2607.26611#bib.bib17)),而 ClarifyCodeBench 评估生成前澄清 (Fanget al.2026 (https://arxiv.org/html/2607.26611#bib.bib18))。这些方法减少了不确定性,但需要额外的推理、输出或交互 (Tanjimet al.2025b (https://arxiv.org/html/2607.26611#bib.bib22)),并且是在当前会话内或通过新获取的信息来消解请求。CAPA 则追问:助手能否从用户的先前会话中推断出重复出现的消解模式,并在新的编码会话中复用它。
个性化与长期记忆。个性化助手跨会话保留证据,推断稳定的用户特征,并在之后选择性地应用它们。LaMP 评估基于历史的个性化分类和生成,而 PersonaMem 研究在会话间用户画像演变时的用户画像构建和回复选择 (Salemiet al.2024 (https://arxiv.org/html/2607.26611#bib.bib8); Jianget al.2025 (https://arxiv.org/html/2607.26611#bib.bib10))。LoCoMo、LongMemEval 和 Momento 测试多会话回忆、时间推理、知识更新和基于记忆的行动 (Maharanaet al.2024 (https://arxiv.org/html/2607.26611#bib.bib9); Wuet al.2024 (https://arxiv.org/html/2607.26611#bib.bib12); Merinet al.2026 (https://arxiv.org/html/2607.26611#bib.bib53))。记忆系统使用检索记录、自然语言画像或学习到的表征,并越来越多地将情景证据与整合后的用户模式分开 (Huet al.2025 (https://arxiv.org/html/2607.26611#bib.bib48); Caoet al.2026 (https://arxiv.org/html/2607.26611#bib.bib44); Daset al.2026 (https://arxiv.org/html/2607.26611#bib.bib45); Zhanget al.2026 (https://arxiv.org/html/2607.26611#bib.bib46); Houet al.2026 (https://arxiv.org/html/2607.26611#bib.bib47));实际系统也会随时间提取、组织、检索、更新和整合用户信息 (Chhikaraet al.2025 (https://arxiv.org/html/2607.26611#bib.bib49); Xuet al.2026 (https://arxiv.org/html/2607.26611#bib.bib50); Inet al.2026 (https://arxiv.org/html/2607.26611#bib.bib51); Uddinet al.2026 (https://arxiv.org/html/2607.26611#bib.bib11); Jianget al.2026 (https://arxiv.org/html/2607.26611#bib.bib52))。与我们的设置最接近的是,APeB 从行为轨迹中推断潜在购物意图,而 PRefine 将重复出现的偏好迁移到缺失的工具调用参数上 (Yanget al.2026b (https://arxiv.org/html/2607.26611#bib.bib54); Yoonet al.2026 (https://arxiv.org/html/2607.26611#bib.bib55))。两者都将记忆与消歧联系起来,但目标分别是产品选择或受模式约束的工具。CAPA 则将可复用的信号视为个性化歧义消解模式,并测试其在不同编码会话之间的迁移。
交互式编码基准。可执行基准客观评估程序正确性。HumanEval 和 MBPP 评估从显式规格生成函数的能力,而 EvalPlus 加强了测试覆盖 (Chenet al.2021 (https://arxiv.org/html/2607.26611#bib.bib13); Austinet al.2021 (https://arxiv.org/html/2607.26611#bib.bib14); Liuet al.2023b (https://arxiv.org/html/2607.26611#bib.bib15))。交互式基准包括用于仓库级问题解决的 SWE-bench,以及用于在可复现反馈环境中进行对话生成的 ConvCodeWorld (Jimenezet al.2024 (https://arxiv.org/html/2607.26611#bib.bib19); Hanet al.2025 (https://arxiv.org/html/2607.26611#bib.bib21))。HumanEvalComm 和 Orchid 专门研究不完整、不一致或模糊的需求 (Wu and Fard2025 (https://arxiv.org/html/2607.26611#bib.bib16); Yanget al.2026a (https://arxiv.org/html/2607.26611#bib.bib17)),但这些歧义属于单个任务或对话,而非稳定的跨会话用户模式。CAPA 结合了可执行编码、多轮会话和同用户历史。它既评估最终正确性,也评估先前会话是否减少了澄清。
## 基准任务
CAPA 评估编码助手能否利用某个反复出现的用户的先前多轮编码会话,来消解在新开启会话中的个性化歧义。我们首先定义数据层次结构和符号,然后构造基于历史的条件化评估任务(图1 (https://arxiv.org/html/2607.26611#Sx3.F1))。
图1:历史条件化个性化歧义适配任务概览。助手接收 \(n\) 个已解决的同用户编码会话的公开对话轨迹,以及一个启动留出会话 \(\tau_{i,k}\) 的新歧义请求。它利用跨会话证据推断用户重复出现的歧义模式,仅在必要时请求澄清,并为留出任务 \(P_{i,k}\) 生成代码。
### 个性化多会话编码数据
我们区分四个交互层次。一个*助手轮次(assistant turn)*将最新用户消息与一个助手响应配对。一个*对话轨迹(dialogue trace)*是在解决一个编码任务过程中产生的此类轮次的有序序列。一个*编码会话(coding session)*是完整的以任务为中心的交互,包括初始请求、对话轨迹以及由隐藏裁判评估的隐藏可执行测试用例,该隐藏裁判决定任务是否完成。一个*用户轨迹(user trajectory)*是来自同一用户的有序编码会话序列。
设用户 \(U_i=(\pi_i, a_i, r_i)\) 由一个画像 \(\pi_i\)、一个重复出现的歧义机制 \(a_i\) 和一个个性化解析模式 \(r_i\) 刻画。画像控制与歧义无关的沟通特征,而 \((a_i, r_i)\) 则规定必需的实现信息如何被反复模糊化,以及该歧义应如何被消解。对于该用户的第 \(k\) 个编码任务 \(P_{i,k}\),对应的编码会话为 \(\tau_{i,k}\)。相似文章
PRAGMA:在长期对话中评估个性化指导与记忆对齐
本文介绍了PRAGMA,一个用于评估长期对话中个性化指导的基准,揭示了当前大型语言模型系统在用户特定指导的有效记忆检索和推理方面存在困难。
APeB:大型语言模型智能体个性化能力的基准测试
提出了APeB,一个用于评估LLM智能体个性化能力的基准,专注于从原始查询和交互历史中推断用户意图和偏好。发现当前模型在初期查询上表现不佳,而历史感知的细化方法可以改善这一情况。
ContextEcho: 面向长时代理编码会话中人设漂移的基准测试
本文介绍ContextEcho,一个用于在长时间使用工具的编码会话中测量大语言模型人设漂移的基准测试和可复用的工具包,揭示即使像Anthropic Sonnet 4.5这样的前沿模型也会表现出显著的漂移,并且这种漂移在会话压缩后仍可能持续存在。
探索智能体记忆系统的跨场景通用性:诊断与强基线
本文评估了面向LLM智能体的八种记忆系统在五种不同场景下的表现,发现给予智能体对存储和检索的主动控制(而非被动管道)能够获得最佳的跨场景泛化能力,并由此提出了AutoMEM框架。
面向时间干预下个人LLM智能体的用户条件化评估
本文认为,评估个人LLM智能体需要跨不同的用户条件化状态重放时间干预,并指出现有基准中的空白。它提出了一个最小基准设计和用于用户条件化适应的报告指标。