一种以人为本的大语言模型育儿建议基准测试方法

arXiv cs.AI 论文

摘要

本文提出了一种以人为本的基准测试方法,用于评估大语言模型在育儿建议方面的表现,使用专家制定的评分标准,在英语和中文中评估了15个大语言模型在100个场景下的表现。

arXiv:2608.14622v1 公告类型:新 摘要:人们越来越多地使用大语言模型(LLMs)寻求建议,包括育儿建议。育儿是一个关键且社会敏感的领域。因此,评估LLMs提供的建议需要超越聚合信息质量指标的指标,考虑回应的关系和行为元素。本文使用育儿专家创建的多维评分标准,通过LLM-as-a-judge方法评估了15个LLMs在100个育儿场景下的表现,涵盖两种语言(英语和中文)。结果显示,聚合分数可能隐藏评分标准项目的特定弱点,模型隐含地鼓励不同的育儿风格,语言影响回应。我们强调了评估输出可审计性的重要性,以及在育儿等领域评估LLM生成建议的挑战。我们的发现为选择LLMs进行直接用户交互以及开发面向用户的育儿建议应用提供了重要见解。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:53

# 以人为中心的LLMs育儿建议评估基准方法
来源:https://arxiv.org/html/2608.14622  
Yunke Zhao\equalcontrib1, Isobel Voysey\equalcontrib1, Alastair van Heerden2, Rob Hughes2, Jun Zhao1

###### 摘要
人们越来越多地使用大语言模型(LLMs)寻求建议,包括育儿建议。育儿是一个关键且具有社会敏感性的领域。因此,评估LLMs提供的建议需要超越聚合信息质量基准的指标,考虑回应的关系性和行为性要素。本文采用育儿专家制定的多维评分标准,使用LLM-as-a-judge方法,评估了15个LLMs在100个育儿场景中生成的英语和中文双语回应。结果显示,聚合评分可能掩盖评分标准条目特定的缺陷,模型隐含鼓励不同的育儿风格,且语言会影响回应内容。我们强调了评估结果可审计性的重要性,以及评估育儿等LLM生成建议领域所面临的挑战。我们的研究为选择直接与用户交互的LLMs及开发面向用户的育儿建议应用提供了重要见解。

## 1引言
父母经常需要就如何最好地照顾孩子做出复杂决策。长期以来,父母依靠家人、朋友和专业人士的建议来支持这些决策,而相当一部分人通过在线来源获取信息和建议,包括社交媒体、育儿论坛和传统搜索引擎(Mertens等, 2024; Baker等, 2017)。如今,ChatGPT等大语言模型(LLMs)正日益成为这一信息生态系统的一部分,早期证据表明一些父母已开始使用LLMs寻求育儿指导和支持(Sharmin和Afrin, 2026)[1]。  
现有评估面向父母或育儿相关领域的LLMs研究主要集中在健康信息任务上,其输出通常可以根据相对明确的事实正确性、安全性或完整性标准进行评估(McFayden等, 2024; Bushuven等, 2023; Sezgin等, 2023)。然而,育儿建议的质量远不止事实准确性。育儿是一种具有社会和文化情境的实践,受价值观、规范、儿童发展信念以及不同的亲子关系理论影响(Lin等, 2023; Lansford, 2022)。在许多育儿情境中,可能没有唯一客观正确的答案。相反,建议的质量可能受其可操作性、所采用的语气以及与特定文化背景或家庭长期挑战的关联性影响。这些特性为评估LLM生成的育儿建议带来了挑战。传统的以准确性或匹配人类偏好为中心的基准方法(Bean等, 2025)可能无法捕捉育儿支持的关系性和价值负载特性。因此,评估育儿建议需要更以人为中心的方法,不仅要考虑建议是否安全准确,还要考虑模型提供支持的社会性、模型隐含强化的育儿风格,以及建议在文化和语言背景上的差异。

在本文中,我们提出了一种用于评估LLM生成育儿建议的多语言评估流程。该流程结合了场景生成与精炼、大规模回应生成、基于评分标准的LLM裁判评估,以及基于成熟育儿理论的育儿风格分析。使用英语和普通话(中文)的100个育儿场景,我们在多个建议质量和育儿风格维度上比较了15个LLMs的回应。我们的工作探讨了以下问题:
1. 基于评分标准的评估如何揭示不同模型和语言间用户面向建议质量的不同形式?
2. LLM生成的建议中如何体现隐含的育儿风格,以及这种风格在不同模型和语言间有何差异?

通过我们的工作,我们做出了三项主要贡献:
- • 可扩展的多语言LLM生成育儿建议评估流程:该流程涵盖场景生成、回应生成、基于LLM的评判和自动化分析。流程还包括各种故障修复策略、每个分数的可审计输出轨迹,以及在另一种语言中进行相同评估的选项。
- • 以人为中心的育儿建议评估框架:专家指导的评分标准超越了事实正确性,纳入了LLM生成建议的关系性和行为质量,并通过隐含育儿风格的分类进一步扩展。
- • LLMs在建议质量和育儿风格方面的实证比较:我们的研究发现,不同模型和模型家族之间的建议质量存在广泛差异,并且模型在八个评估标准上表现出不同的能力优势,证实了LLMs在支持用户场景中的多维性。此外,用英语回应时,模型在育儿风格上更倾向于权威型,而用中文回应时则更倾向于专制型。

## 2背景
### 2.1 LLMs与育儿
随着全球核心家庭的兴起,许多父母上网寻求育儿信息和社会支持(Mertens等, 2024; Baker等, 2017; Dworkin等, 2013),这标志着从主要依赖家人、密友和儿童保育专业人士(如教师、儿科医生)的前几代人转变而来。LLMs的发展为父母,尤其是西方国家的父母,提供了新机遇,他们迫切需要提供信息、建议和社会支持的工具(Sharmin和Afrin, 2026),因此有必要评估这些系统。研究尚未确定父母使用LLMs在现实世界中的普遍程度,但父母现有的在线行为模式加上普通公众中的高使用率,使得研究LLMs用于育儿支持具有价值。例如,Yun和Bickmore(2025)发现21%的成年调查参与者正在使用LLMs寻求健康信息,这促使研究人员评估LLMs作为父母寻求其子女健康信息工具的可行性(McFayden等, 2024; Bushuven等, 2023; Sezgin等, 2023; Leslie-Miller等, 2024)。所有这些工作都表明LLMs在这些情境中的潜力,但作者指出了其不足,例如缺失或不准确的引用(Sezgin等, 2023; McFayden等, 2024)或未能提供适当的、可操作的建议(Bushuven等, 2023; McFayden等, 2024)。在这些案例中,ChatGPT是主要被研究的LLM。研究人员已经研究了不同基础模型(例如GPT-3.5与GPT-4)(Kim等, 2025; Bushuven等, 2023)和不同数据来源(例如仅训练数据与可访问互联网与可访问育儿特定内容库)(Kim等, 2025)对育儿建议质量的影响,但目前尚无研究比较来自多个不同模型家族的广泛模型集在育儿建议方面的表现。为弥补这一空白,我们首次比较了来自多个模型家族的LLMs生成的通用育儿建议。

### 2.2 LLMs的人机中心评估
评估LLMs仍然是一个挑战。传统方法依赖于自动化基准来捕捉在狭义指定任务上的表现,但这在表现良好具有高度主观性的任务中效果不佳(Xiao等, 2024)。因此,研究人员试图评估AI与人类价值观和偏好的对齐程度,但这带来了自身的挑战。许多形式的人在回路评估耗时且资源密集,限制了评估的广度。这在育儿领域的LLMs文献中有所反映,其中的评估通常仅基于少量问题或简短情境,数量从最少的3个(Leslie-Miller等, 2024)到22个(Bushuven等, 2023)不等。当涉及到针对一组偏好进行优化时,不同群体间可能存在巨大差异,促使研究人员仔细考虑在何种任务中为谁的偏好进行优化(Kirk等, 2024)。育儿建议通常是主观的,这使其难以评估。之前关于寻求信息的父母使用LLMs的研究主要局限于医学领域,专家们在适当和不适当的行动方案上基本达成一致,因此这些工作主要关注信息的准确性。Bushuven等(2023)分析了LLMs对儿科紧急情况简短情境的回应,将诊断、建议拨打医疗专业人员电话和给予急救人员的建议编码为正确或错误。McFayden等(2024)根据正确性、清晰度和简洁性三个维度对ChatGPT关于自闭症问题的回应进行评分。然而,对于更一般的育儿问题(如合适的管教方式),提供一组“正确”答案与LLM回应进行比较并不可行,特别是考虑到前述育儿方式在个体和文化上的差异。此外,Sharmin和Afrin(2026)发现一些母亲向LLMs寻求建议以避免社会评判,这表明建议的关系维度(如共情)尤为重要。这在育儿领域的现有工作中很大程度上被忽视了。McFayden等(2024)考虑了建议的可理解性和可操作性,以及所使用的语言是更偏向医学还是神经多样性肯定式。诸如这样的回应特征可能影响父母对LLMs的感知;Leslie-Miller等(2024)发现,当父母不知道信息来源时,ChatGPT和儿科医生回应的可信度和感知专业性没有差异。  
评估育儿建议需要考虑超越简单正确性的主观和关系维度。LLM-as-a-judge方法可以对这种复杂回应进行可扩展的评估,但先前的研究指出了潜在的偏差,包括对更长答案和同家族模型的偏好(Stureborg等, 2024; Koo等, 2024)。因此,我们开发了一个流程,结合多个LLM裁判和专家指导的多维评分标准,旨在评估建议的信息质量及其关系特征。

### 2.3 文化敏感的育儿建议
评估用于育儿的LLMs不仅需要考虑LLMs与父母之间互动的关系方面,还需要考虑所建议的父母与子女之间的互动。育儿是一种具有社会和文化情境的实践(Lin等, 2023; Lansford, 2022),这意味着育儿建议往往超越纯粹的信息内容,以促进特定的行为模式、态度和方法——关于父母应如何回应和与子女相处的规范性指导——通常被称为育儿风格。大多数文化认为适当或理想的育儿风格各不相同(Lin等, 2023; Grusec等, 2017),在文化内部也是如此,因为个人的育儿决定也受其个人经历影响(Rutigliano等, 2023)。此外,研究表明,与积极子女结果相关的育儿风格也取决于文化;专制型育儿可能在重视自主性的个人主义社会中对儿童产生负面影响,但在集体需求至关重要的集体主义社会中则表现良好(Rudy和Grusec, 2001)。因此,专业人士倡导在支持父母时理解和融入文化因素(Harkness和Super, 2020; Schilling等, 2021; Baumann等, 2015)。现有工作表明,通用LLMs在文化敏感回应方面表现欠佳,即提供考虑用户信仰和态度的建议,而这些信仰和态度受其社区中普遍存在的价值观、规范和假设影响(Aldaweesh等, 2026),且主要代表WEIRD(西方、受教育、工业化、富裕、民主)情境(Qiu, 2025)。之前关于育儿建议的LLMs评估尚未将文化或情境作为相关因素纳入,通常考虑少量情境且未承认或改变情境(例如,“我该如何为孩子设定界限和进行管教?”(Kim等, 2025))。同样,LLMs的表现和回应风格可能因语言而异(Chevi, 2025),这在育儿领域尚未得到分析。在本文中,我们通过开发一个流程扩展了现有评估,该流程评估LLMs在一组特定情境下的表现,并根据Baumrind、Maccoby和Martin的反应性-要求性理论(Baumrind, 1971; Maccoby和Martin, 1983)对育儿风格进行分类,以表明模型关于父母应如何回应子女及与子女相处的规范性立场。该评估在英语和中文中进行,以进一步研究建议质量和特征的语言间差异。

## 3方法
### 3.1 评估流程概述
我们开发了一个多阶段评估流程来评估LLM生成育儿建议的质量和特征...

相似文章

迈向LLM的人权基准测试:一种试点方法论

arXiv cs.LG

本文介绍了HumRightsBench,这是首个经过专家验证的、基于场景的基准测试,用于评估大语言模型在国际人权法方面的法律推理能力。在前沿模型上的试点结果显示,总体准确率在0.339到0.577之间,凸显了在检测义务违反方面的显著差距。

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。

DLawBench:通过多轮法律咨询评估大语言模型

arXiv cs.CL

DLawBench是一个新的基准测试,用于评估大语言模型在多轮法律咨询中的表现,涵盖中国和美国法律,包含四种客户类型。实验表明仍有很大改进空间,最佳模型在法律推理上仅达到0.562。