KnowSim:使用学习型用户模拟器评估LLM助手的信息校准

arXiv cs.AI 论文

摘要

本文介绍了KnowSim,一个通过建模用户知识状态来评估LLM助手信息校准的评估框架,经人类判断验证并优于基线模拟器。

arXiv:2608.17150v1 公告类型:新 摘要:为了有效与用户协作完成知识密集型任务,大型语言模型(LLM)必须执行信息校准:将内容匹配到用户不断发展的理解能力和认知负荷。然而,用于评估和训练LLM的用户模拟器未明确建模用户知识,因此既不能产生跨知识水平的真实交互,也不能反映随着知识发展交互如何展开。为弥补这一差距,我们引入了KNOWSIM,这是一个围绕用户模拟器构建的评估框架,该模拟器维护显式知识状态,表示为具有先决条件关系的信息单元图,根据基于学习理论的更新规则演化。KNOWSIM直接从知识状态轨迹计算三个指标(知识增益、交付校准、认知负荷),反映信息校准的关键机制方面。我们在两个领域对705个人机会话进行验证,按知识水平分层:其排名与人类判断显著一致(73-74%的符号一致性),优于三个基线模拟器。应用于9个LLM时,KNOWSIM揭示最佳模型因用户知识水平而异,暴露了标准评估中不可见的 aptitude-treatment 交互。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:53

# KnowSim:基于学习型用户模拟器的LLM助手信息校准评估  
来源:https://arxiv.org/html/2608.17150 \[2pt\]  
Shaoyang Zhang、Philippe Laban、Q. Vera Liao\[12pt\]  
密歇根大学、韩国科学技术院、微软研究院\[4pt\]  
\{lyoonjoo\}@umich\.edu  

###### 摘要  
为在知识密集型任务中与用户有效协作,大语言模型(LLMs)必须实现*信息校准*:根据用户不断演化的认知能力和理解程度调整内容输出。然而当前用于评估和训练LLM的用户模拟器未明确建模用户知识状态,因此既无法生成跨知识水平的真实交互,也无法反映知识演化对交互过程的影响。为弥补这一空白,我们提出KnowSim¹¹¹yoonjoolee\.com/knowsim (https://yoonjoolee.com/knowsim/),该评估框架以维护显式知识状态的用户模拟器为核心——该状态由具有先决关系的信息单元图谱构成,并基于学习理论设定的更新规则动态演化。KnowSim直接从知识状态轨迹中计算三个指标(知识增益、传递校准、认知负荷),揭示信息校准的关键机制层面。我们在两个领域中,根据知识水平分层验证了705次人机对话会话:其排序结果与人类判断高度吻合(73-74%符号一致率),优于三种基线模拟器。在对9个LLM的应用中,KnowSim发现最佳模型会随用户知识水平而变化——这种能力-治疗交互作用在传统评估中不可见。  

## 1 引言  
![图片](图1:KnowSim模拟两位不同知识水平用户向同一助手提出相同医学问题。新手患者在第一轮未吸收任何信息(认知负荷超载),逐步获取前提知识后仅实现有限增益并伴随高负荷;资深医生因已掌握前提概念,每轮吸收一个概念,最终以低负荷达成完全掌握。从演化知识状态直接计算的指标(KG、DC、CO)解释了*为何*相同回复对一位用户有帮助却压垮另一位用户。)  
随着LLMs将复杂信息综合为流畅回复的能力增强,用户日益将其视为知识密集型任务中的协作伙伴——例如理解疾病症状与分析科学数据(34 (https://arxiv.org/html/2608.17150#bib.bib38))。然而RLHF等训练范式(28 (https://arxiv.org/html/2608.17150#bib.bib4))鼓励单次回复提供全面答案,却未指明多轮对话中信息应如何序列化传递。设想医生与患者均询问"滤泡性淋巴瘤转化为弥漫性大B细胞淋巴瘤有哪些征兆?"医生能轻松理解涵盖症状表现、指标升高和影像学检查的密集回复,但缺乏前置概念知识的患者可能难以消化(图1 (https://arxiv.org/html/2608.17150#S1.F1))。此类任务中的有效协作需要*信息校准*而非信息最大化——根据用户当前理解程度和认知能力,以恰量、适度深度、合序的方式传递信息。  

近期研究开始探索基于LLM的用户模拟器作为多轮对话中人类评估或反馈的可扩展替代方案(10 (https://arxiv.org/html/2608.17150#bib.bib10);25 (https://arxiv.org/html/2608.17150#bib.bib7);4 (https://arxiv.org/html/2608.17150#bib.bib42);26 (https://arxiv.org/html/2608.17150#bib.bib41)),但当前基于LLM的模拟器存在两个关键局限:首先,缺乏知识状态建模使其无法评估不同知识水平用户的信息校准效果,仅能衡量整体效用(6 (https://arxiv.org/html/2608.17150#bib.bib40));其次,未追踪知识演化过程使其无法衡量客观知识增益,转而依赖模拟对话的表面质量评估,常通过LLM进行判断(49 (https://arxiv.org/html/2608.17150#bib.bib39))。这可能导致奖励看似有帮助但未真正支持用户实际学习理解过程的模型(5 (https://arxiv.org/html/2608.17150#bib.bib36))。  

我们提出KnowSim,一个以知识状态导向用户模拟器为核心的评估框架。该模拟器将用户对特定主题的理解状态表示为由*信息单元*(IU)构成的图谱——每个单元为独立概念,通过先决关系相互连接。当与基于LLM的助手交互时,模拟器通过以下机制更新状态:评估助手对各IU的解释质量、判断用户基于当前状态能否理解吸收这些IU,并根据认知负荷调节吸收过程(2 (https://arxiv.org/html/2608.17150#bib.bib13))。反映信息校准关键方面的评估指标(知识增益、传递校准、认知负荷)直接从模拟器内部状态计算得出,为助手如何帮助或阻碍用户提供了机制性解释。  

我们通过跨两个差异领域的人类研究验证KnowSim:数学问题求解(11 (https://arxiv.org/html/2608.17150#bib.bib11),具有可验证推理和明确定义的先决结构)与专家级问答(21 (https://arxiv.org/html/2608.17150#bib.bib12),知识更具开放性)。我们按初始知识水平(新手/中级/高级)招募参与者,构建KnowChat数据集,包含705段助手在两个维度变化的对话:信息传递策略与基础模型,每组对话配有主观评分,数学问答部分包含前后知识测试。KnowSim的条件排序与人类判断一致(73-74%符号一致率,p\{=\}.003),在新手水平契合度最高,并优于三种基线模拟器(10 (https://arxiv.org/html/2608.17150#bib.bib10))。随后我们将KnowSim应用于9个前沿及中层LLM的基准测试,揭示最佳模型随用户知识水平而变化——这种权衡在传统聚合排行榜中不可见。  

我们的贡献包括:  
- • **知识状态导向的用户模拟器**:基于学习理论构建,产生机制性指标(知识增益、传递校准、认知负荷),解释*为何*助手能帮助或阻碍用户。  
- • **跨领域验证的人类评估基准**:发布跨两个领域、两个比较维度、按知识水平分层的705段人机对话会话。模拟器优于三种基线,与人类排名的符号一致率达73-74%。  
- • **前沿模型基准测试**:将验证后的模拟器应用于9个LLM,发现最佳模型随用户水平变化——例如DeepSeek V4最大化新手知识增益,而Gemini 3.1 Pro更适用于资深用户。  

## 2 基于知识的信息校准评估模拟器  
### 2.1 问题形式化  
我们研究*信息校准*在多轮对话中的评估问题:助手传递的信息与用户现有及演化知识的匹配程度。  

##### 对话与知识状态  
对话 C=\(u_1,a_1,...,u_T,a_T\)**C**\(=\(u_{1},a_{1},\\ldots,u_{T},a_{T}\)**由用户消息 **u_t****u**\(_{t}\)**和助手回复 **a_t****a**\(_{t}\)**交替构成,聚焦于由问题 **q****q**(如数学题、信息查询)确定的特定主题。我们将对该主题或问题的完整理解表示为*信息单元*(IU)的有向无环图 **G_q=(V,E)****G**\(_{q}\)=\(V,E\)**:每个节点 **v∈V****v**\\in **V**是与回答 **q****q**相关的独立概念,每条边 **(v_i,v_j)∈E****(v**\(_{i}\),v**\(_{j}\)**)\\in **E**表示 **v_i****v**\(_{i}\)**是理解 **v_j****v**\(_{j}\)**的前提。用户在第 **t****t**轮的*知识状态*是映射 **s_t:V→{unaware, stru ggling, partial, knows\_well}****s**\(_{t}\):V\\to\\\{\\texttt{unaware},\\texttt{struggling},\\texttt{partial},\\texttt{knows\\\_well}\\\}**。**s****s**根据助手轮次提供的IU及用户吸收能力演化,具体见§2.2.3 (https://arxiv.org/html/2608.17150#S2.SS2.SSS3)。初始状态 **s_0****s**\(_{0}\)由用户知识水平 **ℓ∈{novice, intermediate, advanced}****ℓ**\\in\\\{\\text{novice},\\text{intermediate},\\text{advanced}\\\}(图1 (https://arxiv.org/html/2608.17150#S1.F1))参数化。  

##### 校准质量  
助手轮次 **a_t****a**\(_{t}\)相对于 **s_{t-1}****s**\(_{t-1}\)*校准良好*,需满足引入的IU:(i) 新颖性:尚未标记为 **knows\_well****knows**\_**well**;(ii) 可理解性:根据 **s_{t-1}****s**\(_{t-1}\)满足先决可达性;(iii) 可处理性:在第 **t****t**轮用户认知吸收能力范围内。*校准良好的助手*是指其轮次在整个对话过程中持续满足这些条件。条件(i)-(iii)通过§2.2 (https://arxiv.org/html/2608.17150#S2.SS2)所述评估指标操作化。  

##### 评估任务  
给定助手模型 **M****M**、具有IU图谱 **G_q****G**\(_{q}\)的问题 **q****q**和用户知识水平 **ℓ****ℓ**,我们模拟 **M****M**与初始化为 **s_0(ℓ)****s**\(_{0}(\\ell)\)的用户间多轮对话,并从状态轨迹 **s_0,s_1,...,s_T****s**\(_{0},s\(_{1},\\ldots,s\(_{T}\)计算校准指标。这些指标设计为可自动计算、基于底层状态转换可解释,并与人类对校准质量的判断一致,其验证见§4 (https://arxiv.org/html/2608.17150#S4)。  

### 2.2 用户模拟方法  
模拟器在用户消息生成与状态更新流水线间交替执行,后者根据用户从每个助手回复中吸收的知识更新知识状态。完整提示词和细节见§A (https://arxiv.org/html/2608.17150#A1)。  

#### 2.2.1 IU图谱构建  
针对每个问题 **q****q**,IU图谱 **G_q****G**\(_{q}\)基于参考答案 **r****r**构建:任何全面覆盖 **q****q**相关概念的文本,如具有可验证答案任务的标准答案,或开放主题的教程/百科条目。**G_q****G**\(_{q}\)中节点对应于理解 **r****r**所需概念,边表示其间的先决关系。**G_q****G**\(_{q}\)通过基于LLM的提取(§A.7 (https://arxiv.org/html/2608.17150#A1.SS7))获得,并在所有模拟条件下保持固定。为模拟知识水平 **ℓ****ℓ**的用户,我们按比率 **R_ℓ****R**\(_{\\ell}\)采样IU标记为 **knows\_well****knows**\_**well**、**partial\_understanding****partial**\_**understanding**或 **struggling****struggling**来初始化 **s_0****s**\(_{0}\)。采样遵循拓扑顺序,优先选择基础先决概念。  

#### 2.2.2 用户消息生成  
每轮用户模拟器LLM基于对话历史和当前状态 **s_{t-1}****s**\(_{t-1}\)生成 **u_t****u**\(_{t}\)。生成过程强制执行知识一致性行为:用户不会自发提及 **unaware****unaware**概念,对 **struggling****struggling**概念会犯现实错误,并正确应用 **knows\_well****knows**\_**well**概念。根据 **s_{t-1}****s**\(_{t-1}\)中 **partial\_understanding****partial**\_**understanding**及以上IU的局部邻域密度,我们确定*表述模式*(明确/模糊/谦逊)以进一步调节查询特异性——自信用户提出精确问题,而信心不足者提出宽泛问题。  

#### 2.2.3 每轮知识状态更新  
每对轮次 **(u_t,a_t)****(u**\(_{t},a\(_{t}\))后,用户知识状态 **s_t****s**\(_{t}\)通过以下步骤更新:(1) *信号提取*阶段:根据 **s_{t-1}****s**\(_{t-1}\)从 **u_t****u**\(_{t}\)和 **a_t****a**\(_{t}\)中读取每个IU的交互信号;(2) *状态更新*阶段:应用基于学习理论的更新规则。  

##### 信号提取  
对图谱 **G_q****G**\(_{q}\)、状态 **s_{t-1}****s**\(_{t-1}\)和 **(u_t,a_t)****(u**\(_{t},a\(_{t}\)进行单次LLM调用,为每个IU **v∈V****v**\\in **V**分配两个标签。从助手轮次,**v****v**的*教学质量*被标记为 **well\_explained****well**\_**explained**(如定义推导、示例解析等)、**shallow****shallow**(即仅提及或部分处理)或 **not\_mentioned****not**\_**mentioned**。从用户消息,**v****v**的*参与度*被标记为 **reasoning****reasoning**(即用户对该IU进行独立推理)、**articulation****articulation**(即用户重述助手已产生的内容)或 **none****none**。  

##### 状态更新  
给定提取的信号,**s_t****s**\(_{t}\)在两组规则下确定性计算:助手提供信息的*吸收驱动因素*和用户认知的*约束条件*。  

##### 吸收驱动因素  
状态转移由助手的*教学质量*驱动。**well\_explained****well**\_**explained** IU将用户状态推进一步。**shallow****shallow**提及仅触发 **unaware→struggling****unaware**→**struggling**转换,对更高级状态无效——仅命名概念产生认知,而理解提升需实质性解释(40 (https://arxiv.org/html/2608.17150#bib.bib3))。**not\_mentioned****not**\_**mentioned** IU保持不变。  

##### 吸收约束条件  
三个约束限定状态转移以模拟人类认知极限。*先决上限*通过先决概念的当前掌握度限制每个IU的可达状态:用户未理解基础概念 **v_i****v**\(_{i}\)便无法真正掌握 **v_j****v**\(_{j}\)(2 (https://arxiv.org/html/2608.17150#bib.bib13))。*认知过载*对用户与助手共同提及的IU计算状态加权负荷 **L_t****L**\(_{t}\),其中较不熟悉的IU贡献更高负荷,用户 **reasoning****reasoning**尝试也增加负荷。当 **L_t****L**\(_{t}\)超过容量 **τ****τ**时,Sigmoid衰减函数连续降低正向转移幅度,任何轮次的分段进展损失会延续至后续轮次(36 (https://arxiv.org/html/2608.17150#bib.bib9);35 (https://arxiv.org/html/2608.17150#bib.bib5))。*单调性*防止知识状态倒退,确保已学概念在会话内不被遗忘。完整定义和参数值见§A.5 (https://arxiv.org/html/2608.17150#A1.SS5)。  

#### 2.2.4 对话终止  
模拟器不施加固定轮次限制,而是基于*学习进展*假设(27 (https://arxiv.org/html/2608.17150#bib.bib14);20 (https://arxiv.org/html/2608.17150#bib.bib15))——当感知到进展时参与度持续,进展饱和或停滞时参与度下降——在两种进展条件触发终止。当用户(i)达成目标IU *掌握*或(ii)出现*持续无进展或过载*(五轮窗口内认知负荷过载、无状态正向转移、无实质性教学三者中至少两项持续存在)时终止。未触发终止的对话最多进行15轮。检测详细参数见§A.6 (https://arxiv.org/html/2608.17150#A1.SS6)。  

### 2.3 评估指标  
框架产生三个指标,反映校准质量的结果与要求,从状态轨迹 **s_0,...,s_T****s**\(_{0},\\ldots,s\(_{T}\)及知识状态更新的每轮分类确定性计算:  

##### 知识增益(KG)  
所有IU的序数进展总和,状态映射为 **unaware=0****unaware**=0、**struggling=1****struggling**=1、**partial=2****partial**=2、**knows\_well=3****knows**\_**well**=3:  
**KG=∑_{v∈V} max(0, s_T(v)−s_0(v))**  
**(1)**  

##### 传递校准(DC)  
助手传递可教学内容与用户吸收能力的匹配程度,通过解释IU的精确率 **(E_t****E**\(_{t}\))与召回率的调和平均数衡量:

相似文章

并非所有技能都有帮助:衡量与修复智能体知识

arXiv cs.CL

本文指出,在LLM智能体中简单积累技能可能导致性能倒退,因为对某些任务有益的技能反而会损害其他任务。作者提出Assay框架,该框架衡量每个技能的因果贡献,并对每个任务进行掩码处理,在不更新权重的情况下,在AppWorld和τ-bench上取得了最先进的结果。

RealUserSim:通过真实用户模拟弥合智能体基准测试中的现实差距

arXiv cs.AI

本文介绍了RealUserSim,一个将基于LLM的用户模拟扎根于来自14,000+真实对话的人类行为数据中的框架,旨在弥合智能体基准测试中的现实差距。研究表明,基于真实数据的模拟将行为匹配率从24.2%提升至45.3%,并揭示了协作型模拟器无法发现的失效机制。

大型语言模型中的置信度校准

arXiv cs.AI

本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。