程序问题:面向数据驱动的公民商议的行动感知LLM角色建模
摘要
一个可复现的流水线将公共Zoom录音转换为带有发言人归属的转录文本,并丰富角色画像、话题及行动标签,然后在此数据上微调LLM角色。行动感知微调显著提升了角色保真度、一致性和商议响应性,从而实现了逼真的公民商议模拟。
arXiv:2511.17813v3 公告类型:替换
摘要:基于LLM的模拟能够支持对公民商议的受控研究,但现有系统缺乏发言人归属数据以及评估长篇幅机构行为的方法。ASR转录通常使用匿名标签(如$Speaker\_1$),这使得模型无法学习跨会议中稳定的参与者行为。我们提出了一个可复现的流水线,将公共Zoom录音转换为带有发言人归属的转录文本,并丰富角色画像、话题以及诸如$[propose\_motion]$之类的实用行动标签。利用该流水线,我们发布了三个政府商议公共数据集(上诉法院听证会、学校董事会会议和市议会会议),并在此行动感知数据上微调LLM角色。我们从四个维度评估模拟:角色保真度、角色一致性、机构保真度和行为连贯性。行动感知微调将困惑度降低了67%,使基于分类器的角色保真度翻倍,投票尝试次数提高了多达$3.6\times$,并将商议响应性提升了高达70%。人工评估显示,模拟片段通常难以与真实商议区分开来,这表明了数据驱动的公民模拟研究的实际基础。
查看缓存全文
缓存时间: 2026/07/13 08:00
# 议事点:基于行动感知的LLM人物建模用于数据驱动的公民审议 来源:https://arxiv.org/abs/2511.17813 查看 PDF(https://arxiv.org/pdf/2511.17813) > 摘要:基于LLM的模拟能够实现对公民审议的可控研究,但当前系统缺乏说话人归因数据以及评估长时制度行为的方法。ASR转录通常使用匿名标签(如$Speaker\_1$),导致模型无法学习不同会议中稳定的参与者行为。我们提出一套可复现的流程,将公开的Zoom录音转换为带有说话人归因的转录文本,并附有角色档案、主题以及诸如$[propose\_motion]$之类的语用"行动标签"。利用该流程,我们发布了三个政府审议公开数据集(上诉法院听证会、学校董事会会议和市议会会议),并在这种行动感知数据上微调了LLM角色。我们从四个维度评估模拟结果:角色保真度、角色一致性、制度保真度以及行为连贯性。行动感知微调将困惑度降低了67%,使基于分类器的角色保真度翻倍,将投票尝试次数提升至$3.6$倍,并将审议响应能力提高达70%。人工评估表明,模拟片段往往难以与真实审议区分开,这为数据驱动的公民模拟研究奠定了实践基础。 ## 提交历史 来自:Scott Merrill \[查看邮件(https://arxiv.org/show-email/daa16231/2511.17813)\] **[\[v1\]](https://arxiv.org/abs/2511.17813v1)** 2025年11月21日星期五 22:07:33 UTC (1,726 KB) **[\[v2\]](https://arxiv.org/abs/2511.17813v2)** 2026年3月14日星期六 18:19:24 UTC (1,615 KB) **\[v3\]** 2026年7月10日星期五 02:38:19 UTC (5,117 KB)
相似文章
PersonaArena:用于评估和增强大语言模型中人格层面角色扮演的动态模拟框架
PersonaArena 是一个动态模拟框架,利用大规模社交内容语料库和多智能体辩论评判机制,评估并提升大语言模型在真实社交场景中保持连贯且真实的人格层面角色扮演能力。
超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色
提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。
城市感知中多模态大语言模型代理生成解释的角色效应分析
本文研究了角色提示如何影响多模态大语言模型在城市感知中生成的语言,发现不同角色的描述趋于一致,而解释则随着角色属性系统性地变化。
在对话前了解你:面向多轮对话中LLM个性化的用户状态建模
本文提出PUMA,一个用于多轮对话中LLM个性化的框架,该框架建模潜在用户状态,并利用自由能原理选择对话行为,在医疗咨询基准测试中提升了长程对话效果。
低宜人性人格条件化实现安全LLM微调
本文介绍了一种基于人格驱动的重写流水线,通过将LLM微调条件化为低宜人性,以降低越狱敏感性和有害输出,同时保持对话温度,无需安全标签或改变训练目标。