程序问题:面向数据驱动的公民商议的行动感知LLM角色建模

arXiv cs.CL 论文

摘要

一个可复现的流水线将公共Zoom录音转换为带有发言人归属的转录文本,并丰富角色画像、话题及行动标签,然后在此数据上微调LLM角色。行动感知微调显著提升了角色保真度、一致性和商议响应性,从而实现了逼真的公民商议模拟。

arXiv:2511.17813v3 公告类型:替换 摘要:基于LLM的模拟能够支持对公民商议的受控研究,但现有系统缺乏发言人归属数据以及评估长篇幅机构行为的方法。ASR转录通常使用匿名标签(如$Speaker\_1$),这使得模型无法学习跨会议中稳定的参与者行为。我们提出了一个可复现的流水线,将公共Zoom录音转换为带有发言人归属的转录文本,并丰富角色画像、话题以及诸如$[propose\_motion]$之类的实用行动标签。利用该流水线,我们发布了三个政府商议公共数据集(上诉法院听证会、学校董事会会议和市议会会议),并在此行动感知数据上微调LLM角色。我们从四个维度评估模拟:角色保真度、角色一致性、机构保真度和行为连贯性。行动感知微调将困惑度降低了67%,使基于分类器的角色保真度翻倍,投票尝试次数提高了多达$3.6\times$,并将商议响应性提升了高达70%。人工评估显示,模拟片段通常难以与真实商议区分开来,这表明了数据驱动的公民模拟研究的实际基础。
查看原文
查看缓存全文

缓存时间: 2026/07/13 08:00

# 议事点:基于行动感知的LLM人物建模用于数据驱动的公民审议
来源:https://arxiv.org/abs/2511.17813
查看 PDF(https://arxiv.org/pdf/2511.17813)

> 摘要:基于LLM的模拟能够实现对公民审议的可控研究,但当前系统缺乏说话人归因数据以及评估长时制度行为的方法。ASR转录通常使用匿名标签(如$Speaker\_1$),导致模型无法学习不同会议中稳定的参与者行为。我们提出一套可复现的流程,将公开的Zoom录音转换为带有说话人归因的转录文本,并附有角色档案、主题以及诸如$[propose\_motion]$之类的语用"行动标签"。利用该流程,我们发布了三个政府审议公开数据集(上诉法院听证会、学校董事会会议和市议会会议),并在这种行动感知数据上微调了LLM角色。我们从四个维度评估模拟结果:角色保真度、角色一致性、制度保真度以及行为连贯性。行动感知微调将困惑度降低了67%,使基于分类器的角色保真度翻倍,将投票尝试次数提升至$3.6$倍,并将审议响应能力提高达70%。人工评估表明,模拟片段往往难以与真实审议区分开,这为数据驱动的公民模拟研究奠定了实践基础。

## 提交历史

来自:Scott Merrill \[查看邮件(https://arxiv.org/show-email/daa16231/2511.17813)\] **[\[v1\]](https://arxiv.org/abs/2511.17813v1)** 2025年11月21日星期五 22:07:33 UTC (1,726 KB) **[\[v2\]](https://arxiv.org/abs/2511.17813v2)** 2026年3月14日星期六 18:19:24 UTC (1,615 KB) **\[v3\]** 2026年7月10日星期五 02:38:19 UTC (5,117 KB)

相似文章

超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色

arXiv cs.AI

提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。

低宜人性人格条件化实现安全LLM微调

arXiv cs.CL

本文介绍了一种基于人格驱动的重写流水线,通过将LLM微调条件化为低宜人性,以降低越狱敏感性和有害输出,同时保持对话温度,无需安全标签或改变训练目标。