GEMCo:一种经过验证的、可伦理发布的代理,用于替代不可获取的咨询数据
摘要
本文介绍了GEMCo,这是首个公开可用的德语多轮电子邮件咨询对话语料库,经过真实咨询数据验证,可作为不可获取敏感数据的可伦理发布代理。
arXiv:2607.23621v1 Announce Type: new
Abstract: 本文介绍了GEMCo,一种可发布的人工撰写的代理,用于替代不可获取的咨询数据:包含86个完整的德语电子邮件咨询对话(728条消息)、专家撰写的案例以及由训练有素的角色扮演者参与的咨询师会话。该代理通过与124个真实咨询对话的保留参考集进行验证。代理与真实对话在咨询师策略和客户情绪方面进行了相互比较。差距虽可检测但很小。生成式验证支持了这一分析。该验证方法本身可推广到任何无法共享真实数据但可以制作人工代理的领域。隐私和伦理使得真实咨询数据保持封闭。GEMCo在设计上不包含任何此类数据,因此可以公开发布——这是该领域语言研究的第一步。
查看缓存全文
缓存时间: 2026/07/28 06:30
# GEMCo:一种经过验证、符合伦理的可发布代理,用于替代无法获取的咨询数据
来源:https://arxiv.org/html/2607.23621
Philipp Steigerwald Eric Rudolph Mara Stieler Jennifer Burghardt Jens Albrecht
Technische Hochschule Nürnberg Georg Simon Ohm, 德国
\{philipp\.steigerwald, eric\.rudolph, mara\.stieler, jennifer\.burghardt, jens\.albrecht\}@th\-nuernberg\.de
###### 摘要
本文介绍 GEMCo,一个可发布、由人工撰写的代理数据集,用于替代无法获取的咨询数据:包含 86 个完整的德语电子邮件咨询对话(728 条消息),涵盖专家撰写的案例以及由受过训练的角色扮演者参与的咨询师会话。¹¹数据:github\.com/th\-nuernberg/GEMCo (https://github.com/th-nuernberg/GEMCo)。该数据集通过一个包含 124 个真实咨询对话的保留参考数据集进行验证。代理数据与真实对话在咨询师策略和客户情绪方面进行了相互比较。差异可检测但很小。生成式验证为分析提供了支持。验证方法本身具有通用性,适用于任何无法共享真实数据但可以发布人工制作代理数据的领域。隐私和伦理因素使得真实咨询数据无法公开。GEMCo 在设计上不携带任何此类信息,因此可以发布——这是该领域语言研究的第一步。
GEMCo:一种经过验证、符合伦理的可发布代理,用于替代无法获取的咨询数据
Philipp Steigerwald Eric Rudolph Mara Stieler Jennifer Burghardt Jens Albrecht
Technische Hochschule Nürnberg Georg Simon Ohm, 德国
\{philipp\.steigerwald, eric\.rudolph, mara\.stieler, jennifer\.burghardt, jens\.albrecht\}@th\-nuernberg\.de
## 1 引言
基于文本的咨询在心理健康服务提供中扮演着越来越重要的角色 (Engelhardt 2021 (https://arxiv.org/html/2607.23621#bib.bib29)),然而,用于咨询师培训、质量保证或辅助系统(如接待和分诊机器人)的计算工具需要数据,但由于数据的高度敏感性,这些数据很少可用 (Malgaroli 等人 2023 (https://arxiv.org/html/2607.23621#bib.bib1))。几乎所有可用的对话资源都是英文的(表 1 (https://arxiv.org/html/2607.23621#S1.T1)),范围从危机对话到转录的专业咨询会议。Crisis Text Line 在受限访问下持有大规模的文本支持数据 (Althoff 等人 2016 (https://arxiv.org/html/2607.23621#bib.bib15)),而 ESConv 则公开了众包的情感支持聊天数据 (Liu 等人 2021 (https://arxiv.org/html/2607.23621#bib.bib14))。更接近专业实践的是 DAIC-WOZ,它记录了临床访谈 (Gratchet 等人 2014 (https://arxiv.org/html/2607.23621#bib.bib16))。AnnoMI 和 HOPE 是专业咨询会议的转录本 (Wu 等人 2022 (https://arxiv.org/html/2607.23621#bib.bib19); Malhotra 等人 2022 (https://arxiv.org/html/2607.23621#bib.bib24))。PsyQA 规模大但属于单轮对话,每个问题配一个长咨询答案,而非多轮对话 (Sun 等人 2021 (https://arxiv.org/html/2607.23621#bib.bib25))。
德语可用的资源少得多。SMHD-GER 收集的是社交媒体帖子而非咨询对话 (Zanwar 等人 2023 (https://arxiv.org/html/2607.23621#bib.bib23))。OnCoCo 1.0 标注的是单一在线咨询消息而非完整对话线程 (Albrecht 等人 2026 (https://arxiv.org/html/2607.23621#bib.bib27))。德语有超过 1 亿使用者,但尚无本地化的德语异步多轮咨询语料库。对真实客户的伦理义务使得真实的咨询数据无法公开发布。
表 1:心理健康 NLP 对话资源。Mt. = 多轮;Pr. = 专业人士;✓ = 是,– = 否。* 单条消息,非完整线程。
本文做出三项贡献:1. (i) GEMCo,第一个公开可用的德语异步多轮电子邮件心理健康支持咨询语料库:包含 86 个完整、人工撰写的线程(GEMCo-A,专家撰写的案例;GEMCo-B,由受过训练的角色扮演者参与的咨询师会话),以 CC BY 4.0 协议发布,作为无法获取的咨询数据的*代理*。2. (ii) 一种用于验证此类代理的通用方法。将可发布的人工制作代理与无法共享的真实数据进行比较。差异通过真实数据自身的分半重采样噪声进行缩放,因此可以判断其是否处于自然变异范围内。该方法只需要保留数据集的聚合标签分布,因此可迁移到任何敏感领域。3. (iii) 验证本身(针对咨询进行)。在语料库、进展和消息层面,将 GEMCo-A、GEMCo-B 及其合并池与 124 个保留的真实对话进行比较,并辅以训练信号的生成式探测。
## 2 语料库描述
GEMCo — 代理 — 已发布 (CC BY 4.0) ✓
真实 ⋅ 124 保留 (研究伦理) 真实,人人对话
GEMCo-A ⋅ 50 人工撰写、人工审核
GEMCo-B ⋅ 36 真实人类咨询师 × 人工角色扮演者
验证用于研究用途:代理 ≈ 真实数据的噪声带 ≪ 跨领域 (图 3 (https://arxiv.org/html/2607.23621#S3.F3))
针对真实数据的噪声带进行验证
图 1:研究设计。可发布的人工生成代理语料库(GEMCo-A + GEMCo-B)针对保留的真实参考数据集进行验证。
GEMCo 由一所德国大学与活跃的德语在线咨询从业者共同构建。可发布的人工生成代理语料库来自两个来源。GEMCo-A 的专家撰写案例来自该国最大的咨询服务机构之一。GEMCo-B 通过角色扮演创建,参与者来自该机构以及其他两家德国咨询服务机构。每个线程都是完整的人工撰写的异步电子邮件交流,咨询师被指示像在实际实践中一样进行咨询。第三组数据包含 124 个由知情同意的真实客户捐赠的真实对话,即保留的*真实数据*,用于聚合验证,但无法发布(图 1 (https://arxiv.org/html/2607.23621#S2.F1))。*代理数据*和*真实数据*之间的区别在于可发布性,而非真实性。三个语料库中的每条消息都是人工撰写的,没有机器生成的内容。GEMCo-A 和 GEMCo-B 以 CC BY 4.0 协议完整发布。
### 2.1 GEMCo-A:专家案例撰写
两位执业咨询师合作撰写了 50 个线程(403 条消息),借鉴了他们在在线咨询方面的经验。两人都是研究生学历的社会教育工作者,接受过系统和以客户为中心的培训,拥有数十年的咨询经验,其中在线咨询经验超过十年。他们模拟每个案例,依据咨询对话通常如何开始、他们在实践中遇到的典型初次请求类型,并以此为基础构建。双方内容一起撰写,并在每个案例成型过程中进行迭代修订。然后,每个线程由第三位专业人士(一名经认证的在线咨询师,同时也是社会科学研究员)独立阅读以评估其真实性。这些案例有意涵盖了各种问题类型,从育儿、学校、关系到身份认同、怀孕、悲伤、自残、家庭冲突以及沟通风格。由于是虚构且不包含真实个人数据,GEMCo-A 可以不受限制地发布。
### 2.2 GEMCo-B:角色扮演会话
GEMCo-B 是在为期四周的实地部署中收集的 (Steigerwald 等人 2025 (https://arxiv.org/html/2607.23621#bib.bib13)),该部署将 34 名专业咨询师与 13 名扮演求助者角色的受训学生配对。九名咨询师从事教育和家庭咨询工作,十四名从事成瘾咨询,十一名刚刚完成认证。每个学生同时与两到三名咨询师通信,自由诠释共享的案例概览(家庭、青年、成瘾),因此线程是在数周内通过真正的异步交流产生的。多对共享同一个案例概览,从而控制了主题重叠。由此产生的 36 个线程包含 325 条消息,体现了 34 位从业者的风格多样性,其中两位每人完成了两个线程。只有求助者角色是由经过训练的人类(而非模型)扮演的,因此咨询本身是真实的,咨询师一方完全真实。所有参与者同意捐献其数据,且所有客户都是角色扮演的,因此 GEMCo-B 没有保密约束。
### 2.3 保留的真实数据
124 个真实对话是在真实的咨询机构中,通过自愿、可撤销的数据捐献方式获得,并获得了知情同意。数据在到达研究团队之前,已在咨询服务内部进行了匿名化和假名化处理。本文仅从这些真实咨询数据中报告聚合统计数据。与代理数据的结构差异是可以预期的(表 2 (https://arxiv.org/html/2607.23621#S2.T2))。早期退出是最明显的差异。近四分之一的真实线程在最多两条消息后结束,通常是客户的询问和咨询师的回复,没有后续消息。其他 95 个线程则持续更长时间,而代理数据包含 86 个从头到尾完整的线程。尽管真实客户的消息明显更长(表 2 (https://arxiv.org/html/2607.23621#S2.T2)),但这只是验证后续会定位到的客户方差异的初步迹象。真实数据永远不会发布,仅作为后续章节衡量 GEMCo 的参考标准。高度匹配表明可发布的代理数据是一个伦理上干净的替代品,适用于无法共享真实对话的场景。所有检查均使用全部 124 个真实对话,除非分析依赖于对话位置或顺序。进展分箱(第 5 节 (https://arxiv.org/html/2607.23621#S5))和消息内转换(第 6 节 (https://arxiv.org/html/2607.23621#S6))使用 48 个完整线程,其中位置定义明确。筛选条件会在适用时进行说明和解释。
表 2:两个已发布子语料库和保留的真实参考数据的语料库统计。
## 3 标注流程
电子邮件线程:代理、真实、跨领域
跨度:语义块
OnCoCo 行为(咨询师,38 个类别)
GoEmotions(客户,28 个类别)
顶层行为:9 个类别
Ekman 情绪:7 个类别
咨询师策略:块序列
客户情绪:块序列
SaT 分类 → 分类 → 折叠 → 合并
(2) 分类 (1) 分割 (3) 折叠 (4) 块合并
图 2:标注流程。每封电子邮件被分割成跨度,在最细粒度的 OnCoCo(咨询师)和 GoEmotions(客户)级别进行分类,折叠为九个行为/七种情绪,并进行块合并(§3.1 (https://arxiv.org/html/2607.23621#S3.SS1)–§3.4 (https://arxiv.org/html/2607.23621#S3.SS4))。
代理数据和真实数据集都经过同一个共享流程,该流程从两个维度标记跨度(语义块):咨询师如何构建他们的干预措施,以及客户情绪如何表达。两个英文咨询语料库随后作为跨领域对比(第 4 节 (https://arxiv.org/html/2607.23621#S4)):ESConv (Liu 等人 2021 (https://arxiv.org/html/2607.23621#bib.bib14)) 的众包情感支持聊天数据,以及 AnnoMI (Wu 等人 2022 (https://arxiv.org/html/2607.23621#bib.bib19)) 的动机访谈转录本。选择这两个语料库是因为它们与 GEMCo 环境接近,每个都是心理健康支持语料库,尽管都不是异步电子邮件咨询。它们通过相同的分类器处理,应用于它们自身的轮次分割(附录 B (https://arxiv.org/html/2607.23621#A2))。该流程分为四个阶段(图 2 (https://arxiv.org/html/2607.23621#S3.F2)):(1) 分割成语义跨度(§3.1 (https://arxiv.org/html/2607.23621#S3.SS1)),(2) 在最细粒度级别对每个跨度进行分类,(3) 折叠到九个行为和七种情绪的分析级别(§3.2 (https://arxiv.org/html/2607.23621#S3.SS2),§3.3 (https://arxiv.org/html/2607.23621#S3.SS3)),然后 (4) 按每个分类法进行块合并(§3.4 (https://arxiv.org/html/2607.23621#S3.SS4)),定义后续所有测量计算的基本单元。
### 3.1 分割
咨询电子邮件通常较长,交织着多个关注点和情绪——咨询师的消息会包含问候、分析、提供帮助和结束语,客户的消息会依次表达多种情绪——因此对每条消息使用单一标签几乎没有意义。为了保留这种内部结构,该流程首先将每封电子邮件分割成跨度(阶段 1,图 2 (https://arxiv.org/html/2607.23621#S3.F2)),即语义块,通常与句子对应,每个块携带一个咨询师行为标签和一个情绪标签。咨询文本往往连续不断,没有清晰的句子边界,因此每封电子邮件使用预训练的 Segment-any-Text (SaT) 模型 (Frohmann 等人 2024 (https://arxiv.org/html/2607.23621#bib.bib34)) 进行分割,这是一种神经分割器,即使在缺少标点符号的情况下也能恢复边界,经检查比仅依靠标点分割更可靠。分割被刻意保持精细。后续的按分类法块合并(§3.4 (https://arxiv.org/html/2607.23621#S3.SS4))会重新组合相同标签的相邻块,从而消除过度分割,而更粗糙的分割则可能将不同的标签合并为一个。GEMCo-A 贡献了 9,444 个跨度,GEMCo-B 贡献了 4,493 个(代理数据共 13,937 个),真实数据另有 14,388 个——代理数据和真实数据合并后的 1,315 条消息中共有 28,325 个跨度。
### 3.2 咨询师行为 (OnCoCo)
咨询师跨度使用 OnCoCo (Albrecht 等人 2026 (https://arxiv.org/html/2607.23621#bib.bib27)) 进行分类(阶段 2,图 2 (https://arxiv.org/html/2607.23621#S3.F2)),这是一个为在线咨询构建的行为分类体系,其数据集和分类器已公开发布。其交叉验证的宏 F1 在最细粒度叶级别为 .72,当正确标签在前两个候选之列时升至 .83,剩余错误大多落在邻近类别上。该模型在双语(德语-英语)咨询消息语料库上进行训练,该语料库已手动分割并标注了行为跨度,输入格式与 SaT 产生的跨度级输入相同,因此训练和应用共享同一分割方式。作为双语模型,它也能标注英文跨领域语料库(附录 B (https://arxiv.org/html/2607.23621#A2))。本文将输出折叠为九个顶层类别,每个类别捕捉咨询师的行为(图 4 (https://arxiv.org/html/2607.23621#S5.F4)),这些类别比叶级别更粗糙,因此更可靠。四个是形式类:消息开头的形式礼节 [FA]、结尾的形式礼节 [FC]、构建回复的调节 [Mod] 以及其他 [O]。五个是治疗过程影响因子:分析与澄清 [AC]、目标达成一致 [AO]、创造动机 [CM]、资源激活 [RA] 以及帮助与问题解决 [HP]。每个类别的描述及示例见附录 H (https://arxiv.org/html/2607.23621#A8)。
参见图注 参见图注
(a) 咨询师策略 (OnCoCo, 9 个类别)。
参见图注
(b) 客户情绪 (Ekman, 7 个类别)。
图 3:代理-真实 JSD 的双基线尺度(对数轴)。
### 3.3 客户情绪 (Ekman)
每个客户跨度还会进一步进行情绪分类(阶段 2,图 2 (https://arxiv.org/html/2607.23621#S3.F2)),使用 Lalk 等人 (2025 (https://arxiv.org/html/2607.23621#bib.bib8)) 的分类器,该分类器预测 28 个 GoEmotions 类别 (Demszky 等人 2020 (https://arxiv.org/html/2607.23621#bib.bib6))。这 28 个类别被映射到 Ekman 的六种基本情绪加上中性 (Ekman 1992 (https://arxiv.org/html/2607.23621#bib.bib5)),即本分析用于表示客户感受的七个标签,映射关系遵循 GoEmotions 自身定义。该映射表以及更完整的 GoEmotions 级别分析在附录 E (https://arxiv.org/html/2607.23621#A5) 中给出。该分类器是目前最接近 GEMCo 的可用模型,是为相似文章
Counsel:面向智能体任务的元评估数据集
Counsel 是首个公开的人类对 LLM 评价进行元评估的数据集,专为智能体任务设计,旨在提升自动化评估方法的校准性与可靠性。
DS@GT ARC 在 eRisk 2026 中的应用:具有结构化算法指导的混合多智能体大语言模型系统用于对话式抑郁症筛查
本文描述了提交给 eRisk 2026 挑战赛的用于对话式抑郁症筛查的混合多智能体大语言模型系统,该系统使用付费的 GPT-5-nano 或开源 Gemma 27B 模型,并辅以算法指导(对话树、可靠性加权聚合、基于聚类的插补),以较低成本实现具有竞争力的 BDI-II 评估。
Psy-Chronicle: 一种合成长时序校园心理咨询对话的结构化流程
本文介绍了Psy-Chronicle,一个用于合成长时序校园心理咨询对话的结构化框架,并发布了CPCD,一个包含90,000个跨多次会话对话的中文数据集,以及一个用于评估模型长时序咨询能力的基准测试。
CoCoGEC:用于鲁棒语法错误纠正的反事实生成
提出CoCoGEC,一种反事实生成框架,通过改变GEC训练数据中与错误无关的上下文来提升模型鲁棒性,在扰动基准上取得了显著的F0.5提升。
引导语言模型更具同理心:通过人类与LLM协作生成文化敏感的心理健康建议
本文提出了RP-RCAF提示策略,用于在低资源语言中生成文化敏感的心理健康建议,并介绍了G-REFS评估框架,实验表明在多个LLM上均优于传统提示方法。