像对我五岁小孩一样解释或任意难度:评估语言模型响应的交互潜力
摘要
本文提出一个框架,用于评估LLM在科学查询中生成不同语言复杂度的多个响应的能力。研究发现,模型常常不一致地变化复杂度,表现最好的Claude Sonnet 4.5仅能在46%的情况下正确调整复杂度。
arXiv:2606.06788v1 公告类型: 新
摘要:在科学信息检索任务中,对大型语言模型(LLM)的评估越来越以使用为中心,例如与真实用户进行实时或多轮评估。这些评估仍然假设一个单一的静态聊天界面,但随着模型被集成到新界面中,评估必须转向纳入界面特定的标准。我们基于一项包含$16$名参与者的形成性研究,提出了一个新的评估框架,该框架测试模型针对同一查询生成多个在语言可解释轴(语言复杂度)上不同的响应的能力,灵感来源于人机交互设计文献中的直接操作界面。我们评估了GPT-5.1、GPT-5 mini、Claude Sonnet 4.5 + Thinking和DeepSeek-V3.1,针对$98$个科学查询,在每个查询上生成5个不同语言复杂度的响应。虽然模型在响应之间变化了复杂度,但大多数变化仍然不一致,表现最好的模型(Claude Sonnet 4.5)仅在$46\%$的情况下正确地向正确方向改变了可靠的复杂度度量。我们的发现在增加样本量和替代复杂度水平的情况下仍然成立。
查看缓存全文
缓存时间: 2026/06/08 09:20
# 像对我五岁孩子一样解释,或随你选:评估语言模型响应的交互潜力
来源:https://arxiv.org/html/2606.06788
Indu Panigrahi 和 Tal August
Siebel School of Computing and Data Science
University of Illinois Urbana-Champaign
\{indup2, taugust\}@illinois.edu
###### 摘要
在科学信息检索任务中,对大语言模型(LLM)的评估越来越以用户为中心,例如通过真实用户进行实时或多轮评估。这些评估仍然假设一个单一的静态聊天界面,但随着模型被整合到新界面中,评估必须转向纳入界面特定的标准。我们基于一项形成性研究(N=16)提出一个新的评估框架,该研究测试模型生成同一查询的多个响应的能力,这些响应在语言的可解释维度(语言复杂度)上有所不同,灵感来自人机交互文献中的直接操作界面。我们评估了 GPT-5.1、GPT-5 mini、Claude Sonnet 4.5 + Thinking 和 DeepSeek-V3.1,为 98 个科学查询分别生成 5 个不同语言复杂度级别的响应。虽然模型在响应之间改变了复杂度,但大多数变化仍不一致,表现最佳的模型(Claude Sonnet 4.5)仅以 46% 的概率将可靠复杂度指标朝正确方向移动。我们的发现在增加样本量和替代复杂度级别时仍然成立。
像对我五岁孩子一样解释,或随你选:评估语言模型响应的交互潜力
Indu Panigrahi 和 Tal August
Siebel School of Computing and Data Science
University of Illinois Urbana-Champaign
\{indup2, taugust\}@illinois.edu
## 1 引言
当前对大语言模型(LLM)在信息检索任务中的评估越来越以用户为中心,这源于模型的快速改进及其在已部署系统中的整合。例如,更多评估侧重通过真实用户进行实时或多轮评估(Bragget al., 2026b (https://arxiv.org/html/2606.06788#bib.bib21))。然而,这些评估通常假设一个单一的静态用户界面(即聊天界面)。随着模型被整合到新界面中(例如,阅读或写作界面,Joshi and Vogel, 2026 (https://arxiv.org/html/2606.06788#bib.bib47); Leeet al., 2024 (https://arxiv.org/html/2606.06788#bib.bib45)),评估必须转向纳入界面特定的标准。我们聚焦于这样一个任务和使用场景:混合专业知识用户进行科学信息检索。科学家越来越多地使用 LLM 进行文献阅读(Foket al., 2023 (https://arxiv.org/html/2606.06788#bib.bib15); Loet al., 2023 (https://arxiv.org/html/2606.06788#bib.bib22))和综合(Asaiet al., 2026 (https://arxiv.org/html/2606.06788#bib.bib2); OpenAI, 2025 (https://arxiv.org/html/2606.06788#bib.bib5))。科学文本的读者可能根据其背景(例如,初级或高级研究员)和特定情境(例如,在熟悉或不熟悉的学科中阅读)偏好不同的响应,例如偏好更简单或更复杂的摘要和解释(Guoet al., 2021 (https://arxiv.org/html/2606.06788#bib.bib19); Augustet al., 2022 (https://arxiv.org/html/2606.06788#bib.bib29); Joshiet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib7))。过去的评估侧重于模型生成与不同预期受众一致的响应的能力(Joshiet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib7)),或针对特定用户个性化响应(Guoet al., 2024b (https://arxiv.org/html/2606.06788#bib.bib23); Murthyet al., 2022 (https://arxiv.org/html/2606.06788#bib.bib20))。然而,单个响应可能与用户不匹配,未能融入正确的上下文(Foket al., 2024 (https://arxiv.org/html/2606.06788#bib.bib8)),或者即使正确也可能本质上不够充分。例如,“按需提供细节”的设计范式(Minet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib35))表明,用户在看到初始摘要后,可能希望获得更多细节,即使他们最初不想要详细的响应。虽然用户可能会提示模型提供更多细节,但通常直接操作文本(例如,文本复杂度的滑块)对于终端用户控制来说是一种更有效的机制(Zhanget al., 2026 (https://arxiv.org/html/2606.06788#bib.bib46))。我们不问模型能否生成单个最佳科学摘要,而是问模型能否生成多个摘要,从而使用户能够有效地选择和操控。我们聚焦于模型响应中的语言复杂度(例如,术语、信息量,Guoet al., 2024a (https://arxiv.org/html/2606.06788#bib.bib51); Joshiet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib7)),并通过一项形成性用户研究(N=16)验证我们的方法。参与者使用一个原型聊天界面探索不熟悉的 STEM 主题,该界面支持直接操控响应语言复杂度(图 1 (https://arxiv.org/html/2606.06788#S3.F1))。利用现有科学问答基准(Asaiet al., 2026 (https://arxiv.org/html/2606.06788#bib.bib2)),我们测试了 5 个最新模型(GPT-5.1、GPT-5 mini、Claude Sonnet 4.5 + Thinking 和 DeepSeek-V3.1),为 98 个科学查询分别生成 5 个不同响应复杂度级别的响应¹。我们基于响应版本之间的关系来定义模型性能。我们发现,虽然模型能够在响应之间改变复杂度,但大多数变化仍不一致。例如,在术语变化方面表现最佳的模型(Claude Sonnet 4.5)仅以 46% 的概率将术语朝正确方向改变(信息量指标为 33%,参见第 4.3 节 (https://arxiv.org/html/2606.06788#S4.SS3))。此外,尽管模型持续增加了较低复杂度响应的复杂度指标,但在较高层级,指标的变化对大多数模型而言接近偶然水平。我们还表明,我们的发现在增加样本量(N=459)和替代受众标签时仍然成立。总之,本文做出以下贡献:
1. 一个新的评估框架,测试模型沿着兴趣维度生成多个不同版本响应的能力。我们将该框架实例化应用于科学信息检索。
2. 一套三个复杂度指标,受已有工作启发,并基于一项有 16 名参与者在不熟悉学科中阅读科学文献的用户研究。为了评估模型,我们定义了响应版本之间复杂度指标关系的标准。
3. 对 5 个模型在科学查询上的评估结果,显示模型通常无法可靠地将复杂度指标朝正确方向调整。我们的发现在不同模型以及更改版本生成锚点(即,使锚点彼此更远)时仍然成立。
## 2 相关工作
### 2.1 用于信息检索的 LLM
随着 LLM 能够快速生成不同版本文本的能力提升(Kirket al., 2024 (https://arxiv.org/html/2606.06788#bib.bib33); Augustet al., 2024 (https://arxiv.org/html/2606.06788#bib.bib17); Joshiet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib7); Wuet al., 2023a (https://arxiv.org/html/2606.06788#bib.bib34)),许多基于 LLM 的界面被开发出来,帮助人们搜索论文(Muddet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib3))、浏览论文(Foket al., 2023 (https://arxiv.org/html/2606.06788#bib.bib15))、跨文档聚合信息(Singhet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib24); Whitfield and Hofmann, 2023 (https://arxiv.org/html/2606.06788#bib.bib26))以及理解内容(Augustet al., 2023 (https://arxiv.org/html/2606.06788#bib.bib18); Rustet al., 2025b (https://arxiv.org/html/2606.06788#bib.bib25); Foket al., 2023 (https://arxiv.org/html/2606.06788#bib.bib15); Rustet al., 2025a (https://arxiv.org/html/2606.06788#bib.bib13); Foket al., 2024 (https://arxiv.org/html/2606.06788#bib.bib8))。一种流行的选择是基于对话的问答系统,例如 Elicit (Whitfield and Hofmann, 2023 (https://arxiv.org/html/2606.06788#bib.bib26))、ASTA (Singhet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib24)) 和 OpenAI 的 Deep Research (OpenAI, 2025 (https://arxiv.org/html/2606.06788#bib.bib5))。
### 2.2 将 LLM 响应适配到用户
将 LLM 响应适配到用户主要有两种方式:交互性(即用户决定看到什么)(Minet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib35); Sundaret al., 2010 (https://arxiv.org/html/2606.06788#bib.bib36); Färberet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib32); Headet al., 2021 (https://arxiv.org/html/2606.06788#bib.bib31)) 和个性化(即系统决定用户看到什么)(Kimet al., 2025b (https://arxiv.org/html/2606.06788#bib.bib57); Adaret al., 2017 (https://arxiv.org/html/2606.06788#bib.bib58); Augustet al., 2022 (https://arxiv.org/html/2606.06788#bib.bib29); Acharyaet al., 2018 (https://arxiv.org/html/2606.06788#bib.bib30))。过去在复杂度适应方面的评估隐含了个性化背景,即模型的目标是生成一个正确的响应,评估 LLM 是否能在提示“像对一个五年级学生解释一样”时生成五年级阅读水平的简化文本(Beks van Raaijet al., 2024 (https://arxiv.org/html/2606.06788#bib.bib37); Hedlinet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib14); Joshiet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib7); Färberet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib32))。我们转而聚焦于交互背景,评估模型生成一系列响应的能力,允许用户在复杂度级别之间进行选择。我们探索这种替代框架,因为用户可能根据当下的需求选择自己的版本(Foket al., 2024 (https://arxiv.org/html/2606.06788#bib.bib8)),而不是基于静态属性(例如,教授想要本领域某个术语的简单定义)。虽然用户可以通过提示模型来获取此类信息,但迭代指定信息需求可能耗时且分散注意力(Zamfirescu-Pereiraet al., 2023 (https://arxiv.org/html/2606.06788#bib.bib10))。
## 3 形成性用户研究
由于我们分析语言复杂度的动机与交互背景(即用户直接操控语言)相关,我们首先进行一项形成性研究,以构建后续模型评估(第 4 节 (https://arxiv.org/html/2606.06788#S4))。具体来说,我们旨在 (i) 验证交互式复杂度的实用性,(ii) 证实参与者与复杂度相关的语言特征,以及 (iii) 识别使交互式复杂度成功的模型响应标准。在本节中,我们描述用户研究设计(第 3.1 节 (https://arxiv.org/html/2606.06788#S3.SS1))和发现(第 3.2 节 (https://arxiv.org/html/2606.06788#S3.SS2))。
### 3.1 研究流程
我们进行了一项被试内研究,共 16 名参与者,主要来自研究和 STEM 背景。为了测试直接操控响应复杂度的实用性,研究在交互式聊天条件(参与者使用交互式复杂度,如下所述)和常规聊天条件之间进行了平衡。为了模拟使用界面探索新主题的体验,我们要求每位参与者提供两个他们感兴趣但在此之前几乎不了解的主题。符合知识密集型领域信息检索的动机,我们要求这些主题属于 STEM。在研究期间,参与者有 15 分钟时间与每个界面交互,并完成两项简单的信息检索任务;说明和任务的详细信息见附录 A.9 (https://arxiv.org/html/2606.06788#A1.SS9)。在与每个界面交互时,参与者被要求积极说出他们的思考过程、推理和印象。在每个条件之后,我们问了几个关于参与者体验和对界面及其聊天响应看法的问题;访谈指南见附录 A.8 (https://arxiv.org/html/2606.06788#A1.SS8)。本研究已获得我们机构 IRB 的批准。
#### 条件
交互式复杂度条件为用户提供了一个滑块机制来调整聊天响应的语言复杂度,可从 5 个级别中选择,标记为 1 到 5,其中 1 为最简单(图 1 (https://arxiv.org/html/2606.06788#S3.F1))。常规界面在视觉和功能上类似,但无滑块。所有响应均使用 GPT-5 mini 生成,选择该模型是因为其低延迟适合交互环境。

图 1:交互式语言复杂度界面
用户可以通过将响应滑块(A)移动到不同档位来操控文本复杂度。与之前显示版本显著不同的句子会被高亮(B);通过比较句子级别的 BERTScores(Zhanget al., 2020 (https://arxiv.org/html/2606.06788#bib.bib41))与阈值来确定显著差异。预设默认值为 3,但也可以更改默认值以适用于所有滑块。
#### 响应生成
我们使用参与者提供的主题,通过最近的 RAG 管道(ScholarQA, Singhet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib24))结合 Claude Sonnet 4.5 预先生成科学报告。使用这些报告作为单一真实文档,我们提示 GPT-5 mini 生成滑块响应,观众定义为:大学生、博士生初级、博士生高级、博士后研究员和高级研究员。我们基于先前的工作来划分这些级别,这些工作根据教育水平对模型响应进行了分层(Joshiet al., 2025 (https://arxiv.org/html/2606.06788#bib.bib7); Science Journal for Kids, (https://arxiv.org/html/2606.06788#bib.bib49); Augustet al., 2024 (https://arxiv.org/html/2606.06788#bib.bib17)),使级别适应预期的提示(即科学文献查询)。我们使用一个提示来生成全部 5 个级别。附录 A.1 (https://arxiv.org/html/2606.06788#A1.SS1) 包含该提示并描述了其他测试过的提示。
#### 参与者
我们招募了 16 名参与者,主要来自学术机构。由于我们采用了滚雪球抽样,大多数参与者具有学术背景和 STEM 背景。参与者详细信息见附录 A.6 (https://arxiv.org/html/2606.06788#A1.SS6)。研究通过 Zoom 视频通话进行,持续 1 小时,之后所有参与者获得一张 25 美元礼品卡,高于当地最低工资政策。
#### 评估
为了分析研究转录文本中的定性数据,我们采用了开放性编码(Saldaña, 2021 (https://arxiv.org/html/2606.06788#bib.bib73)),其中一位作者从 4 个研究中创建了初始编码手册(这些研究在两种条件之间随机均匀抽样),然后所有作者进行迭代,直到达成最终版本。相似文章
大型语言模型响应的全面评估:多因素评分系统
本文提出了一种用于评估大型语言模型(LLM)响应的多因素评分系统,综合了准确性、简洁性、事实一致性、可读性和连贯性。应用于TruthfulQA数据集,揭示了主流模型的优势与局限,提供了一个透明的评估框架。
跨LLMs的回复语义变异性:对基于对话评估的设计启示
本研究考察了不同模型和对话上下文中LLM生成的回复的语义一致性,强调了维护基于对话评估的稳定响应所需的基础设施和设计策略。
研究提示语言和响应语言对LLM内容生成的影响
本文研究提示语言和响应语言如何影响LLM的内容生成,发现提示语言显著影响输出长度,同时通过概念改写保持语义保真度。
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
大型语言模型有多像人类?一个关注语域的语言评估框架
本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。