设计合成讨论生成系统:在线引导案例研究
摘要
本文介绍了合成讨论生成(SDG),一种新颖的NLP框架,用于创建模拟讨论,从而在社会科学研究中实现低成本的预实验。作者证明,较小的量化模型(7B-8B参数)可以以比GPT等专有模型低44倍的成本生成有效的模拟,并将该框架应用于评估在线讨论中的LLM引导者。
arXiv:2503.16505v4 Announce Type: replace-cross
摘要:社会科学研究中的一个关键挑战是涉及人类参与者的实验成本高昂。我们提出了合成讨论生成(SDG),这是一个新颖的自然语言处理(NLP)方向,旨在创建模拟讨论,从而实现低成本的预实验,并开发了一个理论性、任务无关的框架,用于设计、评估和实施这些模拟。我们认为,使用诸如OpenAI GPT家族之类的专有模型进行此类实验在成本和能力方面往往是不合理的,尽管它们在当前研究中很普遍。我们的实验表明,较小的量化模型(7B-8B)可以以比专有模型低44倍以上的成本生成有效的模拟。我们在在线引导的背景下使用我们的框架,其中人类积极参与讨论以改进讨论,这与传统的内容审核不同。通过将此问题作为我们框架的下游任务,我们展示了合成模拟可以产生可泛化的结果,至少能在引入人类讨论者之前揭示局限性。在LLM引导者中,一个关键限制是它们无法确定何时介入讨论,导致不理想的频繁介入,进而产生类似于人类互动中观察到的偏离模式。此外,我们发现不同的引导策略在某种程度上影响对话动态。除了我们的理论SDG框架外,我们还提出了一种用于实验设计的成本比较方法,探索了可用的模型和算法,提供了一个开源Python框架,以及一个包含多个模型生成的LLM讨论的大型公开数据集。
查看缓存全文
缓存时间: 2026/04/20 08:32
# 设计合成讨论生成系统:在线促进的案例研究 来源:https://arxiv.org/html/2503.16505 ###### 摘要\. 社会科学研究中的一个关键挑战是涉及人类参与者的实验成本高昂。尽管已有研究探索使用大型语言模型(LLMs)作为不完美的替代品,但关于如何定义、设计和评估此类实验的工作仍然很少。在本文中,我们识别出合成讨论生成(SDG)这一新颖的自然语言处理(NLP)方向,旨在创建模拟讨论,从而实现成本高效的预实验。基于现有的SDG系统和跨学科文献,我们开发了一个理论性的、任务无关的框架,用于设计、评估和实施这些模拟。我们认为,使用专有模型(如OpenAI GPT系列)进行此类实验,在成本和能力上往往不合理,尽管它在当前研究中很普遍。我们的实验表明,较小的量化模型(7B–8B)可以产生有效的模拟,其成本比专有模型低44倍以上。我们在在线促进的背景下使用我们的框架,在线促进中人类积极参与讨论以改进讨论,这与传统的内容审核(仅移除讨论中的不当内容)不同。现代社交网络的极大规模促使研究人员开发LLM促进者,但由于需要与人类讨论者进行昂贵实验,其能力在很大程度上仍未被评估。通过将这个问题视为我们框架的下游任务,我们表明合成模拟至少可以通过在引入人类讨论者之前揭示局限性来产生可泛化的结果。在LLM促进者中,一个关键的局限性是它们无法确定何时介入讨论,导致不希望的频繁干预,从而产生类似于人类互动中观察到的偏离模式。此外,我们发现不同的促进策略在一定程度上影响对话动态。除了我们的理论SDG框架外,我们还提出了一种用于实验设计的成本比较方法,探索了可用的模型和算法,提供了一个开源Python框架,以及一个跨多个模型的大型公开可用的LLM生成讨论数据集。
LLMs, 讨论, 促进, 合成, 实验
††journal:TSC
††ccs:计算方法 自然语言生成
††ccs:计算方法 话语、对话与语用学
††ccs:计算方法 语言资源
††ccs:以人为中心的计算 开源软件
††ccs:以人为中心的计算 社交网站
††ccs:以人为中心的计算 社交媒体
††ccs:以人为中心的计算 协作与社交计算设计与评估方法
## 1\. 引言
参见说明 参见说明
维恩图显示 \acl{sdg} \(\acs{sdg}\) 是三个学科的结合。右图:有向无环图将基础概念(“在线讨论”、“促进”、“LLMs”、“SDG”)与使用SDG进行在线促进实验联系起来。
图 1. 左:合成讨论生成 (https://arxiv.org/html/2503.16505#id6.6.id6)\(SDG (https://arxiv.org/html/2503.16505#id6.6.id6)\) 是生成式基于代理的建模 (https://arxiv.org/html/2503.16505#id11.11.id11)\(GABM (https://arxiv.org/html/2503.16505#id11.11.id11)\) 的一个子集,专注于通过文本进行的交互。设计 SDG (https://arxiv.org/html/2503.16505#id6.6.id6) 系统需要三个学科的知识:社会科学帮助我们理解系统应如何运作,自然语言处理 (https://arxiv.org/html/2503.16505#id3.3.id3)\(NLP (https://arxiv.org/html/2503.16505#id3.3.id3)\) 提供自动化生成和评估的工具,软件工程 (https://arxiv.org/html/2503.16505#id2.2.id2)\(SWE (https://arxiv.org/html/2503.16505#id2.2.id2)\) 使我们能够构建可扩展和可泛化的系统。右图:我们可以使用 SDG (https://arxiv.org/html/2503.16505#id6.6.id6) 来发现和解决新兴的LLM促进领域中的问题,而无需昂贵的人类实验。
生成式人工智能 (https://arxiv.org/html/2503.16505#id1.1.id1)\(AI (https://arxiv.org/html/2503.16505#id1.1.id1)\) 技术的进步使得通过大型语言模型(LLMs)研究人类行为成为可能。由于这些模型是在大量人类讨论数据上预训练的,研究人员假设它们可以复制某些人类行为,用于行为社会科学研究\(Grossmannet al.,2023 (https://arxiv.org/html/2503.16505#bib.bib122); Törnberget al.,2023 (https://arxiv.org/html/2503.16505#bib.bib129); Argyleet al.,2023 (https://arxiv.org/html/2503.16505#bib.bib112)\)或人机算法交互\(Korreet al.,2025 (https://arxiv.org/html/2503.16505#bib.bib108); Choet al.,2024 (https://arxiv.org/html/2503.16505#bib.bib102); Parket al.,2022 (https://arxiv.org/html/2503.16505#bib.bib33)\),通常通过创建合成模拟平台来实现\(Parket al.,2022 (https://arxiv.org/html/2503.16505#bib.bib33); Törnberget al.,2023 (https://arxiv.org/html/2503.16505#bib.bib129); Rossettiet al.,2024 (https://arxiv.org/html/2503.16505#bib.bib128); Zhouet al.,2024 (https://arxiv.org/html/2503.16505#bib.bib137); Chuanget al.,2024 (https://arxiv.org/html/2503.16505#bib.bib244); Liet al.,2025 (https://arxiv.org/html/2503.16505#bib.bib149); Baloget al.,2024 (https://arxiv.org/html/2503.16505#bib.bib134)\)。然而,由于LLMs的涌现属性仅在最近才被发现,目前使用合成代理的研究采用了各种临时方法来定义、运行和评估模拟讨论实验\(Mouet al.,2024 (https://arxiv.org/html/2503.16505#bib.bib246); Parket al.,2022 (https://arxiv.org/html/2503.16505#bib.bib33),2023 (https://arxiv.org/html/2503.16505#bib.bib247); Törnberget al.,2023 (https://arxiv.org/html/2503.16505#bib.bib129); Abdelnabiet al.,2024 (https://arxiv.org/html/2503.16505#bib.bib34); Ulmeret al.,2024 (https://arxiv.org/html/2503.16505#bib.bib18); Parket al.,2024 (https://arxiv.org/html/2503.16505#bib.bib82)\)。为了整合目前碎片化的合成模拟研究领域,我们是第一个识别和定义这个迄今为止隐含的研究方向:
###### 定义 0\. 合成讨论生成 (https://arxiv.org/html/2503.16505#id6.6.id6)\(SDG (https://arxiv.org/html/2503.16505#id6.6.id6)\):通过使用合成参与者模拟文本人类讨论,最终目标是理解和提取人类讨论的代表性见解。SDG (https://arxiv.org/html/2503.16505#id6.6.id6) 是生成式基于代理的建模 (https://arxiv.org/html/2503.16505#id11.11.id11)\(GABM (https://arxiv.org/html/2503.16505#id11.11.id11)\) 的一个特例,后者是一种计算性方法,通过模拟代理的交互来研究复杂行为和涌现现象。与通用的 GABM (https://arxiv.org/html/2503.16505#id11.11.id11) 系统不同,SDG (https://arxiv.org/html/2503.16505#id6.6.id6) 参与者没有预定义的动作和行为集;相反,两者都通过自由文本表达。SDG (https://arxiv.org/html/2503.16505#id6.6.id6) 通常用作解决其他任务(在本研究中称为*“下游任务”*)研究问题的手段,在这些任务中需要人类参与和持续的对话上下文,而不是单一交换(在这种情况下,简单的提示就足够了)。示例包括谈判\(Abdelnabiet al.,2024 (https://arxiv.org/html/2503.16505#bib.bib34)\)、社会实验\(Parket al.,2022 (https://arxiv.org/html/2503.16505#bib.bib33)\)和人类角色复制\(Parket al.,2024 (https://arxiv.org/html/2503.16505#bib.bib82)\)。尽管下游任务范围广泛,但我们认为,一个设计良好的 SDG (https://arxiv.org/html/2503.16505#id6.6.id6) 方法论可以泛化到大多数此类任务。
在使用 SDG (https://arxiv.org/html/2503.16505#id6.6.id6) 的研究中,缺乏统一的设计方法论导致创建、运行和评估这些实验的有效性更加困难。此外,*尚无研究涉及如何系统地创建、评估和使用可泛化的LLM讨论模拟来解决研究问题*,而无需人类参与者和评估者。在本研究中,我们回答了以下研究问题(RQ):
###### RQ 0\. 我们如何设计和评估可扩展的111此处的可扩展性意味着系统能够在实验规模增加时保持一致的性能和质量,而无需不成比例地增加计算资源或财务成本。SDG 模拟,使得它们(a)复制真实人类讨论中发现的已知代表性行为,以及(b)可用于获得对现实世界现象的进一步见解?
我们首先创建一个理论性的、下游任务无关的 SDG (https://arxiv.org/html/2503.16505#id6.6.id6) 框架。由于没有关于如何创建 SDG (https://arxiv.org/html/2503.16505#id6.6.id6) 系统的标准或指南,我们检查文献中的任务特定系统,并使用软件工程 (https://arxiv.org/html/2503.16505#id2.2.id2)\(SWE (https://arxiv.org/html/2503.16505#id2.2.id2)\) 的经验教训来推导设计规则(§3.1 (https://arxiv.org/html/2503.16505#S3.SS1))。通过此分析,我们将合成讨论生成 (https://arxiv.org/html/2503.16505#id6.6.id6)\(SDG (https://arxiv.org/html/2503.16505#id6.6.id6)\) 形式化为一个独特的研究方向,并识别出有效合成模拟的四个核心设计原则。我们分解了 SDG (https://arxiv.org/html/2503.16505#id6.6.id6) 的需求,并推导出一组必须实现和单独评估的隔离组件(§3.3 (https://arxiv.org/html/2503.16505#S3.SS3), §3.4 (https://arxiv.org/html/2503.16505#S3.SS4)),包括LLM角色的构建和动态讨论的执行。为了评估观察到的行为是否代表现实世界模式,我们构建了一个基于 GABM (https://arxiv.org/html/2503.16505#id11.11.id11) 文献并针对 SDG (https://arxiv.org/html/2503.16505#id6.6.id6) 调整的评估套件,用于验证这些组件的必要性和完整性(§3.2 (https://arxiv.org/html/2503.16505#S3.SS2))。我们的研究结果表明,角色驱动的模拟提高了生成内容的多样性,使其更接近人类讨论,而仔细的指令提示可以在仅使用对话上下文的情况下,在安全对齐的LLMs中诱导持续的有毒行为。此外,我们观察到LLM代理往往不会拒绝参与,展示了在建模现实对话动态方面的固有局限性。
在创建了理论SDG (https://arxiv.org/html/2503.16505#id6.6.id6)框架后,我们解决了可扩展性问题:如何最小化运行模拟实验的成本?最近的大多数研究\(Abdelnabiet al.,2024 (https://arxiv.org/html/2503.16505#bib.bib34); Parket al.,2022 (https://arxiv.org/html/2503.16505#bib.bib33),2023 (https://arxiv.org/html/2503.16505#bib.bib247); Baloget al.,2024 (https://arxiv.org/html/2503.16505#bib.bib134); Törnberget al.,2023 (https://arxiv.org/html/2503.16505#bib.bib129)\)使用专有模型,如OpenAI GPT系列。我们认为,使用此类模型会增加推理成本,这固有地限制了使用这些模型在现实世界问题中进行的实验的数量、效率和可扩展性(§4.1 (https://arxiv.org/html/2503.16505#S4.SS1))。确实,我们表明,小的(7B-8B参数)量化模型足以满足我们的目的(发现1 (https://arxiv.org/html/2503.16505#Thmfinding1)),并且能够以一小部分成本复制人类讨论中观察到的几种社会动态(附录B (https://arxiv.org/html/2503.16505#A2))。通过开发一种在人类实验、专有模型和本地托管的LLMs之间进行成本比较的方法(§4.1 (https://arxiv.org/html/2503.16505#S4.SS1)),我们估计,使用较小模型的方法与人类实验相比实现了*成本降低1,600倍*,与最近的中等能力专有模型(GPT-5.1—参见表8 (https://arxiv.org/html/2503.16505#S4.T8))相比降低了*44倍*。
接下来,我们通过将LLM促进作为下游任务(§5 (https://arxiv.org/html/2503.16505#S5))来研究此类模拟是否能够产生可迁移到人类讨论的见解。平台设计者和研究人员传统上专注于识别、标记和删除有问题的内容,这种方法在文献中常被称为“内容审核”\(Seering,2020 (https://arxiv.org/html/2503.16505#bib.bib92); Cresciet al.,2022 (https://arxiv.org/html/2503.16505#bib.bib116)\)。然而,完全自动的内容审核在实践中是不够的\(Horta Ribeiroet al.,2023 (https://arxiv.org/html/2503.16505#bib.bib93); Schaffneret al.,2024 (https://arxiv.org/html/2503.16505#bib.bib86); Smallet al.,2023 (https://arxiv.org/html/2503.16505#bib.bib1); Korreet al.,2025 (https://arxiv.org/html/2503.16505#bib.bib108)\)。更有效的方法是使用人类促进者,222一些出版物使用术语“主持人”,其含义与我们分配给“促进者”的相同\(Korreet al.,2025 (https://arxiv.org/html/2503.16505#bib.bib108)\)。他们积极参与讨论。然而,这种方法无法在现代社交媒体网站上大规模应用,这些网站每天进行数十万次讨论。LLMs已被提议作为可扩展的促进者\(Korreet al.,2025 (https://arxiv.org/html/2503.16505#bib.bib108); Smallet al.,2023 (https://arxiv.org/html/2503.16505#bib.bib1)\),然而实验和开发仍然成本高昂,并且受到需要人类讨论者的限制\(Rossiet al.,2024 (https://arxiv.org/html/2503.16505#bib.bib121); Smallet al.,2023 (https://arxiv.org/html/2503.16505#bib.bib1)\)。主要问题在于,促进不能在隔离的、单轮“听-答”设置中有意义地评估;它需要持续的对话上下文\(Choet al.,2024 (https://arxiv.org/html/2503.16505#bib.bib102)\),并且需要多个人类参与者与LLM促进者积极对话。我们的研究是第一个使用多个参与者评估LLM促进者的研究,也是第一个使用合成参与者代替人类的研究。虽然使用LLM参与者以及相对有限的近期促进工作限制了研究结果的范围,但我们的实验揭示了可泛化的结果。具体来说,我们识别出一个严重且之前未报告的限制:LLM促进者无法选择不干预,即使干预是不必要的(发现2 (https://arxiv.org/html/2503.16505#Thmfinding2))。据我们所知,这种无法保持沉默的行为在之前的文献中未被记录。这种行为已被观察到会在在线社区的人类参与者中引发挫败感和毒性\(Korreet al.,2025 (https://arxiv.org/html/2503.16505#bib.bib108)\)。333我们在实验中复制了这种模式(附录B (https://arxiv.org/html/2503.16505#A2);表14 (https://arxiv.org/html/2503.16505#A2.T14))。最重要的是,未能发现这个问题可能导致研究人员投入大量资金。相似文章
为测试面试对话系统生成多样化的用户模拟器角色
本文提出了一种方法,利用大型语言模型自动生成多样化的用户角色,用于测试面试对话系统,以减少人工努力并增加模拟用户行为的多样性。
想要更好的合成数据?引导它:用于低资源语言生成的激活引导
本文研究了激活引导作为替代少样本提示的方法,用于生成低资源语言的合成数据。作者提出了LanguageSteering和QualitySteering策略,表明在早期层进行引导可以提高数据多样性并改善下游模型性能。
PragAlign:基于反馈引导的实用对齐框架,用于控制合成对话生成
PragAlign引入了一个基于反馈引导的框架,用于控制合成对话生成,使用基于LLM的评估器来改善与意图、情感、连贯性和流畅性的对齐,实现了99.50%的接受率,而一次性生成仅为72.25%。
利用大型语言模型生成合成消费者洞察
本研究探讨了大型语言模型能否为投射技术生成合成消费者数据,通过比较人类与LLM在城市旅游感知上的回应,发现两者在主题上高度重叠,但在风格、语言结构和多样性生成方式上存在重要差异。
DuplexGen:自适应合成人机话轮切换对话
DuplexGen 引入了一种自适应合成人机话轮切换对话的方法,解决了对话式 AI 中自然交互时机的挑战。