立法证词中的自我介绍检测
摘要
本文介绍了一个用于检测立法委员会证词中自我介绍的机器学习流程,使用词袋和BERT概率等特征。XGBoost取得了最佳F1分数0.9747,并通过BERT增强特征进一步改进。
arXiv:2608.07891v1 公告类型:新
摘要:自我介绍在立法委员会证词中很常见。成功检测自我介绍并提取说话者姓名,对于政府会议场景下的说话人识别任务非常有帮助。本文提出了一个使用机器学习检测立法委员会证词中自我介绍的流程。我们从跨越五个州立法会议的154万条话语中构建训练数据集,应用姓名匹配启发式方法自动生成标签,并训练了三个分类器:决策树、随机森林和XGBoost,用于发现自我介绍并提取说话者姓名。我们构建了一个结合词袋、位置上下文、结构信号、介绍性短语指示符和话语上下文特征的特征集。在三个分类器中,XGBoost取得了最佳性能,F1分数为0.9747,总错误数最少;加入微调后的BERT概率特征进一步提升了性能。作为扩展,我们使用微调后的BERT分类器对完整候选数据集进行评分,并将BERT概率输出作为特征添加。这个BERT增强的XGBoost模型将F1分数从0.9747提升到0.9782,并将测试总错误数从241减少到207。相对于决策树基线(F1 0.9323)的主要提升来自于话语上下文特征和提升集成策略;BERT提供了适度的补充信号。对假阳性的分析表明,少数是真实的自我介绍,但因源数据中的姓名不一致而被错误标记,这说明测量指标在一定程度上低估了真实性能。
查看缓存全文
缓存时间: 2026/08/11 08:06
\leftheader Dimitrijevic, Das, Liu, & Khosmood Pallavi Das, Kasey Liu, Foaad Khosmood California Polytechnic State University ###### 摘要 自我介绍在立法委员会证词中十分常见。成功检测到自我介绍并提取说话人的姓名,对于政府会议场景下的说话人识别任务具有极大的帮助。在本文中,我们提出了一条使用机器学习检测立法委员会证词中自我介绍的流水线。我们从涵盖五个州立法会期的154万条话语中构建训练数据集,应用姓名匹配启发式规则自动生成标签,并训练了三个分类器:决策树、随机森林和XGBoost,用于发现自我介绍并提取说话人姓名。我们构建了一个融合词袋、位置上下文、结构信号、介绍短语指示符和话语上下文特征的特征集。在三个分类器中,XGBoost以0.9747的F1分数和最少的总错误数取得最佳性能;加入微调的BERT概率特征后性能进一步提升。作为扩展,我们使用微调的BERT分类器对完整候选数据集进行评分,并将BERT概率输出作为特征加入。该BERT增强的XGBoost模型将F1分数从0.9747提升至0.9782,并将测试总错误数从241降至207。相对于决策树基线(F1分数0.9323)的主要提升来自话语上下文特征和提升集成策略;BERT提供了适度的互补信号。对误报的分析表明,其中少数实际上是真实的自我介绍,只是由于源数据中姓名不一致而被错误标注,这意味着所测得的指标在适度程度上低估了真实性能。 ###### 关键词: 自我介绍检测、立法证词、文本分类、NLP、XGBoost、随机森林、决策树、BERT ## 1 引言 图1:一位公众成员(左,站立)在加利福尼亚州萨克拉门托就AB 715发表立场,摄于2025年9月10日。 近几十年来,新闻机构在流程和经济模式上遭受了严重冲击,导致其预算、能力和报道范围大幅缩减,尤其是在地方和州级层面[howe2022exploring]。因此,它们在民主中的基本功能受到削弱,最显著的表现是,由于资源匮乏,州政府报道显著减少。由于记者无法亲身出席重要的政府会议,他们越来越依赖视频和转录文本。然而,转录文本常常缺失或不够全面,缺乏诸如说话人识别等关键特征。Digital Democracy项目正是为了弥补这一缺口而创建,旨在利用人工智能工具帮助记者获取重要的标注信息,例如说话人识别。正是这后一个问题激发了我们的工作。 生成全面的立法议事记录成本高昂且具有挑战性。尽管基本的转录文本可以通过语音转文字、转录和说话人日志技术相当准确地生成,但议事记录中的说话人识别和标注部分仍然存在困难。具体而言,立法听证会与其他许多政府委员会听证会一样,通常有两类参会者:已知说话人和未知说话人。绝大多数发言来自已知说话人(立法者、工作人员、其他政府官员、注册说客),以往他们的出席记录使得语音识别或人脸识别等成熟技术能够用于识别说话人。其他线索如姓名牌或视频标注也可能在屏幕上显示立法者的姓名。然而,许多未知说话人没有先前的记录、没有姓名牌、也没有名牌,视频也可能完全不显示正确的姓名。 未知说话人通常会在开场话语中自我介绍,这意味着他们的姓名通常只被提及一次。为了利用这一信息,我们首先将说话人识别为属于“未知”类别的人。然后,我们必须识别哪条话语是“自我介绍”话语,即某人首次说出自己姓名的话语。最后,我们必须提取正确的命名实体,并将其作为说话人身份的候选。同一人随后的话语可以根据说话人日志结果进行标记,这些结果通常与转录内容同时提供。这样,一个困难且昂贵的问题中相当大的一部分,可以通过一个相对轻量级的方案来解决。 本文提出了一条新的流水线,通过解析说话人的自我介绍话语来识别和提取立法议事记录中的说话人姓名。我们首先使用Digital Democracy 2015-2018语料库,其中包含四个州立法机构的全面议事记录[foaad2024digital]。我们创建了一个适当平衡的数据集,其中话语被标注为自我介绍正类或负类。随后,我们运用特征工程设计了一个能够区分这两类的分类器。 ## 2 文献综述 ### 2.1 Digital Democracy项目 本研究的基础在于Digital Democracy项目[blakeslee2015digital]。该平台的目标是促进州立法议事记录的透明度和可访问性。通过该项目对多个美国州立法机构的听证会和法案讨论中的转录文本、视频以及元数据的聚合,使得对这些议事记录的大规模计算分析成为可能。[latner2017measuring]分析了该平台研究立法行为的能力,特别是在2015-2016年会期的加利福尼亚州,通过探索公民、立法者和其他各方的参与模式进行了研究。该研究最早证明了Digital Democracy语料库可以用于定量政治分析,而我们的工作直接建立在此基础上,并扩展为使用自然语言处理(NLP)工具和概念对话语进行机器学习分类。 ### 2.2 立法语境下的转录与说话人标注 [ruprechter2018]考察了支持Digital Democracy平台的人工辅助转录流水线,并指出说话人识别是转录中最耗时的步骤之一。即使使用先进的专业工具,这一过程也无法完全自动化,因为转录文本中的说话人身份常常不一致且存在噪声。在后续研究中,[ruprechter2020]对转录流水线中的工具改进进行了量化和分析,发现引入某些功能可以将转录效率提高10%。与我们的工作最直接相关的是[kauffman2018multimodal],他们使用多模态方法解决立法话语中的说话人识别问题,结合
相似文章
检测议会文本中未披露的LLM生成内容
本文通过训练一个可解释的文本分类器,评估了英国和瑞典议会文本中未披露的LLM生成内容的程度,发现自2022年以来未披露的LLM使用量稳步增加。
自我评价之言:大语言模型在机器翻译中的口头化置信度研究
本文研究了从大语言模型中提取机器翻译输出置信度的口头化方法,并将其与内部token概率进行了比较。研究发现,尽管两种方法在错误检测和校准方面表现相似,但内部置信度与口头化置信度之间几乎没有相关性。
欺骗语义:法律领域欺骗检测与通用领域最先进方法的基准测试
本文综述并评测了法律语境下基于NLP的自动欺骗检测,比较了微调Transformer和七个大语言模型(LLM)在七个数据集上采用多种提示策略的表现。结果表明存在明显的领域敏感性:微调模型在数据丰富的通用领域表现出色,而少样本LLM在低资源法律场景中具有竞争力。
LLMs 能内省吗?现实检验
本文认为,近期关于LLMs内省能力的说法并不成立,因为仅凭行为证据无法区分真正的内省与基于表面线索的模式匹配。作者重新审视了两种评估范式,发现模型依赖于输入层特征,而非真正访问内部状态。
LLMSniffer:通过GraphCodeBERT和监督对比学习检测大模型生成代码
LLMSniffer是一个检测框架,通过监督对比学习微调GraphCodeBERT来区分AI生成的代码和人工编写的代码,在GPTSniffer和Whodunit基准测试上分别达到78%和94.65%的准确率。该方法通过结合代码结构感知嵌入、对比学习和注释移除预处理,解决了学术诚信和代码质量保证方面的关键挑战。