跨LLMs的回复语义变异性:对基于对话评估的设计启示

arXiv cs.CL 论文

摘要

本研究考察了不同模型和对话上下文中LLM生成的回复的语义一致性,强调了维护基于对话评估的稳定响应所需的基础设施和设计策略。

arXiv:2608.24920v1 公告类型:新 摘要:本研究考察当底层LLM改变时,LLM生成的回复是否保持语义一致。使用真实协作对话中的消息,我们比较了在两种条件下LLM生成的回复的语义相似性:有和没有先前聊天历史。结果显示,模型选择和对话上下文都影响响应相似性和与人类回复的一致性。这些发现表明,仅提示和对话上下文可能不足以保持跨LLM的响应一致性,强调了在LLM快速持续演变中维护稳定和可比较响应所需的基础设施和设计策略。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:12

# 跨大语言模型生成的回复语义可变性:对话式评估设计的启示
来源:https://arxiv.org/html/2608.24920  
郝建刚  
单位:ETS研究学院  
单位:美国新泽西州普林斯顿  
邮箱:[jhao@ets\.org](mailto:)  
单位:已被“人工智能在测量与教育中的应用会议(AIME 2026)”录用

###### 摘要

本研究考察了当底层大语言模型(LLM)改变时,LLM生成的回复是否保持语义一致性。我们使用真实协作对话中的消息,比较了在两种条件下(有无先前聊天记录)不同LLM生成回复的语义相似性。结果表明,模型选择和对话上下文都会影响回复相似性以及与人类回复的一致性。这些发现表明,仅靠提示和对话上下文可能不足以在不同LLM间保持回复一致性,突显了在LLM快速发展和持续演进的过程中,需要能够维持稳定且可比回复的基础设施和设计策略。

## 1 引言

大型语言模型(LLMs)和生成式AI正在为沟通与协作等复杂技能评估创造一种新范式(Hao et al., 2024)。这些技能长期以来因通过情境化和动态交互而非孤立回应来表现,难以通过传统题型进行大规模测量(Mislevy, 2018)。基于LLM的智能体可以与学习者进行自然、自适应的互动,为激发这些技能更丰富、更真实的证据提供了新机会。

与此同时,LLM赋能的交互引入了适应性与标准化之间的根本张力。标准化评估假设,可比的学习者输入应导致可比的评估条件和展示目标构念证据的机会。相反,基于LLM的智能体动态生成响应,适应学习者输入、对话上下文和模型行为。因此,不同的学习者可能经历不同的交互路径,而相同的学习者输入可能因LLM、提示、部署设置或先前聊天记录的不同而收到语义不同的回复。LLM的快速演进进一步加剧了这一挑战,因为新模型不断推出,旧模型更新或淘汰,难以随时间保持稳定的评估条件。

从测量的角度看,关键问题并非AI回复是否变化,而是它们是否保持了足够的测量目标构念的一致性。AI生成的回复不必在措辞上完全一致,但应保持预期的评估功能,维持与任务相关的交互模式,并为学习者提供展示目标构念的可比机会。否则,不受控制的变异性可能引入与构念无关的方差,威胁到教育评估的基础要求——效度、信度、公平性和可比性(AERA, APA, & NCME, 2014)。

这一挑战并非全新。评估长期以来都在处理由任务情境、评分者和交互过程引起的变异性,同时寻求支持可比的分数解释。例如,在人类主导的访谈中,访谈者可能在说话风格、追问或人际动态上有所不同,但评估仍应产生对目标构念的可解释评价。同样,标准化写作评估可能在不同版本或施测中使用不同的提示,同时保持分数可比性。因此,目标不是消除变异性,而是确保其保持在可接受范围内,不引入削弱效度、信度和公平性的与构念无关的方差。

传统的对话系统,如智能辅导系统中使用的那些,通常采用由意图检测、对话状态跟踪和基于规则的响应选择组成的模块化架构(Corbett et al., 1997; Graesser et al., 2018; Young et al., 2013; Zapata-Rivera et al., 2015)。虽然对定义明确的交互有效,但这种基于规则和符号的方法通常在处理开放式对话时缺乏灵活性,且难以扩展。相比之下,基于LLM的系统主要依赖提示和对话历史来指导响应生成,用自然语言指令替代了传统对话管理管道的大部分(Wei et al., 2022),这使得交互更自然,但也导致生成的响应变异性更大。

为了优化这种权衡,LLM-符号,或更广泛的神经符号方法,在基于对话的学习和评估任务中越来越多地被采用(例如,Hou et al., 2025; Zapata-Rivera et al., 2026)。在这类系统中,LLM用于解释学习者输入、检测意图、分类对话动作或生成响应,而基于规则的动作则由单独的软件模块或由被提示遵循预定义规则的LLM执行。原则上,这种设计可以在保持LLM灵活性的同时,更好地控制相关响应的一致性。

然而,在实践中,即使是神经符号设计,实际的设计决策也严重依赖于两种LLM能力:准确分类话语和在相似对话上下文中生成语义一致的响应。Hao等人(2025, 2026)已经证明了基于LLM的话语编码的准确性;因此,本研究聚焦于第二种能力。由于LLM演进迅速,频繁更新、新模型发布和模型淘汰,理解模型选择和对话上下文如何影响LLM生成响应的语义一致性,是构建健壮的基于对话评估的关键一步。

在本研究中,我们考察了不同LLM和对话上下文条件下,针对真实协作对话中抽取的消息,LLM生成回复的语义可变性。通过分析模型内相似性、与人类回复的一致性以及跨模型相似性,我们提供了关于底层LLM变化如何影响响应一致性的实证证据。结果突显了随着LLM持续演进,支持一致且可比的基于对话评估的基础设施和设计策略的必要性。

## 2 方法

### 2.1 数据来源与抽样

本研究使用了来自双人在线协作问题解决科学任务的对话数据。数据于2018年通过Amazon Mechanical Turk收集。在每个任务中,两名参与者通过基于聊天的沟通协作完成,每个团队产生大约50到100轮对话。为了刻画交互进程,根据消息在每个对话中的相对轮次位置,将其划分为早期、中期和晚期部分。

对于本研究,我们随机选择了99个团队的数据。每条消息被视为潜在的焦点消息,并保留原始交互中人类队友生成的实际回复作为参考人类响应。人类回复被编码为与相应焦点消息具有低、中或高相关性。对于每个焦点消息,所有先前的通信轮次被用作可用的对话历史。

分析聚焦于人类回复被编码为高度相关的晚期焦点消息。此选择产生了61条焦点消息。选择这些消息是因为它们拥有更丰富的先前对话上下文,且人类回复可清晰解释,适合用于考察LLM生成响应的语义一致性。

### 2.2 实验条件

研究评估了四种LLM:GPT-4o mini、GPT-5.4、GPT-5.4 mini和GPT-5.4 nano。所有模型均使用附录A所示的相同系统指令进行提示。为了考察对话上下文的作用,我们比较了两种提示条件。在“无历史记录”条件下,提示仅包含系统指令和焦点消息。在“有历史记录”条件下,提示额外包括所有先前的对话轮次作为上下文。对于每种条件下的每个焦点消息,每个LLM使用相同的提示生成了100个独立的回复。调用LLM API时,temperature是一个影响响应生成随机性的解码参数。由于temperature可能影响响应变异性,当模型部署端点支持时,我们将其设置为0.7。在评估的模型中,此选项仅适用于GPT-4o mini。

### 2.3 语义相似性

使用文本嵌入的余弦相似性量化语义相似性,这是自然语言处理中广泛用于比较文本含义的方法。首先,使用OpenAI的text-embedding-3-large模型将每个焦点消息、人类回复和LLM生成的回复编码为嵌入向量。嵌入模型将每个文本表示在高维语义空间中,语义相似的文本在空间中位置更接近。然后计算嵌入向量对之间的余弦相似性,以衡量文本之间的语义相似程度,数值越高表示语义一致性越强。

### 2.4 探索性分析

第一:我们比较了每个焦点消息下,不同LLM和聊天历史条件中LLM生成回复之间的平均成对相似性。该分析旨在评估不同模型和提示条件是否为相同的焦点消息产生了语义相似的响应集。我们还计算了每个LLM生成的回复与相应人类回复之间的平均相似性,以考察LLM响应与人类响应的接近程度。

第二:我们比较了在相同聊天历史条件下,同一LLM生成的回复之间的相似性与不同LLM为相同焦点消息生成的回复之间的相似性。该分析旨在考察当生成LLM改变时,回复是否保持语义可比性。

第三:我们考察了语义相似的焦点消息是否引发了语义相似的LLM回复。对于每对焦点消息,我们计算了焦点消息嵌入之间的余弦相似性。然后比较两个焦点消息生成的回复集。该分析测试了当输入焦点消息语义相似时,LLM是否生成了可比的回复。

第四:我们直接比较了有和没有聊天历史时LLM生成回复的语义相似性。该分析考察了包含先前对话上下文在多大程度上改变了生成回复的语义内容。

### 2.5 统计分析

除了探索性分析外,我们还进行了统计分析以估计总体效应。我们拟合了线性混合效应模型,以考察LLM类型和聊天历史条件是否与生成的回复相似性的两个维度相关。第一个结果是生成回复之间的平均成对相似性,反映平均语义一致性。第二个结果是成对相似性的标准差,反映语义相似性的分布或变异性。这两个结果被分别建模,因为它们捕捉了响应行为的不同方面:较高的平均相似性表示更强的语义一致性,而较低的变异性表示更稳定的响应生成。

固定效应包括LLM类型、聊天历史条件、它们的交互项以及LLM生成的回复与观察到的人类回复之间的平均相似性。GPT-4o mini和“无历史记录”条件作为参考类别。包含了焦点消息的随机截距,以考虑同一焦点消息跨模型和聊天历史条件的重复观测。

## 3 结果与发现

### 3.1 探索性分析1结果

图1比较了不同LLM和上下文条件下的两种形式的语义相似性。顶部面板显示了同一焦点消息的100个LLM生成回复之间的平均成对相似性分布。底部面板显示了LLM生成回复与人类回复之间的平均相似性分布。

这些结果表明,在所有情况下,包含聊天历史记录并不会使LLM回复彼此更加相似。其对相似性的影响取决于LLM。LLM生成的回复与人类回复始终不相似,尽管包含聊天历史可以略微改善这种情况。

参见图注 图1:按模型和上下文条件划分的语义相似性。
### 3.2 探索性分析2结果

图2比较了在相同焦点消息下,同一LLM和不同LLM生成的回复的平均相似性。对角线单元格显示同一LLM生成的回复之间的平均成对相似性,而非对角线单元格显示不同LLM生成的回复之间的平均相似性。分别显示了“无历史记录”和“有历史记录”条件的热图。

在两种条件下,对角线值均持续高于非对角线值。这表明每个LLM生成的回复与其自身响应更相似,而不是与其他LLM生成的响应相似。在无历史记录条件下,LLM内相似性范围为0.751至0.780,而LLM间相似性范围为0.443至0.595。在有历史记录条件下,LLM内相似性范围为0.715至0.795,而LLM间相似性范围为0.475至0.604。

在评估的模型中,GPT-5.4在两种提示条件下均表现出最高的模型内相似性,特别是在提供对话历史时。跨模型比较进一步显示,GPT-5.4家族内的模型彼此更相似,而不是与GPT-4o mini相似。总之,这些发现表明响应一致性受模型架构和系谱的影响,来自同一家族的模型比来自不同家族或世代的模型产生语义上更具可比性的回复。

参见图注 图2:按上下文条件划分的LLM内和LLM间平均相似性。
### 3.3 探索性分析3结果

图3考察了LLM是否为语义相似的焦点消息生成了可比的回复。x轴代表每个区间内焦点消息对之间的平均相似性,y轴代表为这些焦点消息对生成的LLM回复之间的平均相似性。每个面板对应一个LLM,并分别显示了“无历史记录”和“有历史记录”条件的线条。

在所有四种LLM中,“无历史记录”条件显示出焦点消息相似性与其LLM生成回复相似性之间清晰的正相关关系。这意味着当两条焦点消息在语义上更相似时,LLM生成的回复也更相似。这种模式表明,在没有额外对话上下文的情况下,LLM响应强烈地锚定于焦点消息本身。

“有历史记录”条件也显示出正相关,但通常较弱。在几种模型中,尤其是GPT-5.4 mini和GPT-5.4 nano,“有历史记录”线条增长更慢,并且在较高的焦点消息相似性水平下仍低于“无历史记录”线条。

相似文章

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。