评估荣誉候选人的数据科学方法

arXiv cs.CL 论文

摘要

本文首次应用数据科学,利用自然语言处理技术评估英国荣誉系统,并引入一种新型情感分析算法Minos,以评估公众对荣誉获得者的意见。

arXiv:2608.26135v1 Announce Type: new 摘要:我们提出一个模块化数据科学管道,用于从碎片化、非结构化的开源情报(OSINT)中估计公众对个人的情绪。该方法结合网页搜索、文本提取、相关性过滤、分词、共指消解和情感分析,将异构网页材料转换为可审计的个人级情绪分布。我们将AFINN和VADER与MINOS进行比较,MINOS是一种领域知情的情感算法,旨在检测与声誉风险、不当行为和正面公众贡献相关的语言。应用于已知声誉结果的公众人物时,MINOS在正面、模糊和负面案例之间给出了最清晰的分离。结果表明,链式NLP和OSINT方法可以支持透明、可重复、人在环中的情绪评估,用于高风险决策支持。我们在英国荣誉系统上演示了该方法,其中个人需要展示高标准的公众行为以维持荣誉。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:19

# 基于数据科学的荣誉制度候选人评估方法
来源:https://arxiv.org/html/2608.26135
作者:弗朗西斯卡·冯·布劳恩-贝茨(司法部,英国伦敦;联合反恐监狱与缓刑中心,英国伦敦)[[email protected]](mailto:[email protected]);孙丽塔·森(Arndit有限公司,英国剑桥);印度塔卢克达(印度理工学院德里分校,新德里,印度);阿尼尔班·拉希里(Kainos公司,英国伦敦)

###### 摘要
本文首次将数据科学方法应用于英国荣誉制度。我们提出了一套全面的自然语言处理方法体系,用于评估公众对荣誉获得者的情绪态度。为形成对英国国王荣誉申请人的评价,我们评估了现有的两种情感分析算法(Afinn和Vader),并开发了全新的自研算法Minos。本研究取得的积极结果表明,该系统可用于辅助人工评估,以更好地判断现有荣誉获得者是否维持、或潜在获得者是否可能维持荣誉制度所要求的高标准行为规范。我们的创新方法具有普适性,可应用于任何具有充足网络足迹的个体,在招聘、国家安全和调查新闻等多个领域具有应用价值。

## 1. 引言

近一千年来,荣誉制度一直表彰着为英国作出卓越贡献的个人。这一复杂而古老的体系需要借助前沿技术,在21世纪保持其公平性与透明度。本文是(据我们所知)首次将数据科学应用于荣誉制度的研究。文章展示了如何综合运用多种自然语言处理技术,构建一个全面、开源的智能分析框架,以衡量公众对荣誉获得者的看法。

本文从四个方面改进了现有研究水平:
- • 采用来源广泛的资料,而非仅依赖社交媒体或新闻文章;
- • 展示了一种新颖的算法,用于识别人格特质中的积极或消极倾向,并与现有的两种情感分析算法进行对比;
- • 使用共指消解技术对输入信息的相关性进行严格审查;
- • 探索了来自不同领域、具有不同程度知名度(或非知名度)的个体案例

我们应用于此问题的各项技术本身并非全新。自互联网早期以来,网页抓取技术就以多种形式存在,包括网络爬取、网页索引和网页内容存档。分词技术作为自然语言处理的核心组成部分已发展超过30年。共指消解是关联指向同一实体的不同语言表达的任务,这一语言学问题早在公元前一世纪的西塞罗时代就已为人所知。情感分析方法多种多样。我们首先使用了两种现成模型——Afinn和Vader,随后在第4节构建了自研算法Minos。我们的创新之处在于将这些技术整合起来,在具有挑战性的背景下为用户解决完整问题。

本文结构如下:第2节概述荣誉制度;第3节定义研究对象;第4节详细描述方法论,包括数据收集、清洗、分词、共指消解、情感分析和结果提取;第5节展示网页抓取相对于人工研究的首个优势——分析通过相关性筛选的网页文本比例;第5节同时总结情感分析结果;第6节对工作流程和结果进行总结,并讨论未来研究中需解决的挑战。

## 2. 荣誉制度

本节概述荣誉制度的核心要点,特别是“资格剥夺”概念。

现代荣誉制度表彰那些为英国公共生活作出卓越贡献的个人,涵盖慈善与志愿服务、教育、科学、艺术、商业等多元领域。该制度设立不同等级的奖项,以反映获得者在其领域的影响程度和持续贡献时间。或许独特之处在于,个人必须在获得荣誉后继续保持高标准的品行才能保有该荣誉。任何达不到这些标准的人都可能面临荣誉被撤销的风险(即使在去世后),这一过程称为“资格剥夺”。

荣誉提名来自公众提交和公务员系统,经过一系列筛选委员会审议,再通过审查后获得最终的皇家批准。这项审查工作需要投入大量资源,以确认提名细节的事实准确性,并通过专业机构和政府部门进行犯罪记录和诚信核查。

维护公众对荣誉制度的信心要求获奖者持续保持高标准行为。当获奖者的行为使该制度声誉受损时,奖项可能被剥夺,或在极少数情况下被死后撤销。在严重刑事定罪和/或专业资格被取消的情况下,资格剥夺“几乎已成定局”。其他可能导致声誉损害的原因往往涉及复杂微妙的情况,需要谨慎考量。历史上,奖项通常在职业生涯后期授予以降低资格剥夺风险。近年来,奖项更注重对成就的及时认可,这与近期提交至资格剥夺委员会的案件数量增加可能存在因果关联。

资格剥夺决策由独立的资格剥夺委员会处理,该委员会缺乏调查权,而是依靠包括官方调查和法庭诉讼在内的证据。在这种高风险环境中,清晰可靠的智能分析框架对基于个案实质进行判断至关重要。自动化的数据驱动方法可显著增强对潜在不当行为的主动检测能力,支持及时干预以维护制度的完整性。

## 3. 研究对象选择

为严格验证我们的创新方法,我们设立了对照组与资格剥夺组:
- • “声名狼藉”组:行为与公共利益背道而驰者;
- • “获奖保留”组:已获得荣誉并持续保有者,其行为持续支持公共利益;
- • “资格剥夺”组:被剥夺荣誉,或死后被委员会撤销荣誉者。

每组选取20名案例。

获奖组和剥夺组案例选自《伦敦公报》公告。我们选择了不同级别的奖项,从最高级的骑士/女爵士到最低级的成员级别。我们特别注意涵盖十大荣誉委员会下属的广泛领域,从艺术科学到商业、体育和公共服务,并尽可能平衡男女比例。两组的关键区别在于——与“获奖组”不同——所有被剥夺组案例均因品行不端而失去荣誉。这种不良行为的严重程度在犯罪性质、持续时间和荣誉授予至剥夺的时间间隔等方面差异巨大。

声名狼藉组包含远超资格剥夺“刑事定罪”门槛的案例。我们选择了罪行(及定罪情况,如可能)属公开信息的个人,同样注意男女比例平衡。

我们期望性能良好的算法和构建合理的方法能够清晰区分各组:
- • 对获奖组呈现高度积极评价
- • 对剥夺组接近中性值
- • 对声名狼藉组呈现高度消极评价

若无法实现这种区分,我们就无法对新案例的评分进行反向映射。换言之,我们无法基于这组已知案例训练算法,来准确分类测试集中的任意案例。

至此,我们明确了待解决的问题和用于测试方案的研究对象。将在第4节详细阐述解决方法。

## 4. 方法论

本节概述算法的关键阶段,总结于图1。

[图片说明]图1. 方法论控制流程图。梯形代表输出(起始输入除外),矩形代表二元决策,圆角矩形代表结果。

### 4.1. 数据收集、处理与筛选

流程初始阶段通过自动化在线搜索,收集候选人的公开可访问数据。为模拟人工研究,我们使用Selenium网页驱动程序自动查询候选人全名,通过BeautifulSoup从结果中提取纯文本,并保留原始来源及URL以确保可追溯性和可审计性。

我们遇到若干限制:无法访问付费墙或订阅内容、部分页面因遵守robots.txt协议被屏蔽、动态生成的JavaScript内容提取不完整。尽管如此,排名前60-70位的搜索结果为我们的概念验证提供了充足文本。

使用nltk将纯文本按句子分段,该工具能有效处理缩写、省略号、非标准标点等语言复杂性,为后续分析提供稳健的句子级处理。

我们过滤掉少于500字符或未包含案例“最广为人知全名”(与搜索时使用的完整法律姓名不完全等同)的文章。此筛选策略妥善处理了复姓、中间名、贵族头衔、称号及非正式称谓变体等问题。

最终数据集为情感分析提供了聚焦且相关的基础,显著降低了噪声并提升了后续分析步骤的准确性。

### 4.2. 共指消解

应用共指消解技术处理文本数据中频繁出现的间接提及问题。这一关键步骤通过确保内容正确归属特定候选人,显著提高了情感分析的可靠性和准确性。

基于监督学习的Python算法通过海量英语文本集训练,系统性识别代词和缩略引用并关联回候选人全名。当存在同名案例时,可使用额外的区分属性进一步辅助消歧,该技术已通过广泛验证。

### 4.3. 情感分析算法

我们的情感分析评估了多种算法的适用性:首先评估词汇方法Afinn,该算法为单个词赋予-5到+5的整数分数,但缺乏上下文理解能力;接着研究Vader,这是针对非正式社交媒体文本优化的规则模型,擅长处理强化词和习语,但在处理正式内容时仍存局限。

认识到这些局限性,我们开发了Minos——专为荣誉评估场景定制的情感算法。Minos整合了全面的正向和负向词汇表,特别强调与不当行为和犯罪相关的术语。初始词库取自Afinn和Vader算法,经语言学家和其他领域专家评估,增补了新闻报道中常用于正面或负面描述个体的词汇。包含负面术语的句子无论出现何种积极表达均自动获得负面分数,有效反映了荣誉制度对获得者行为的严格标准。关于MINOS算法的评分和决策规则详细描述超出本文范围,具体实现请参阅代码库。

### 4.4. 后验边缘化

情感分析为每个案例生成跨越所有有效文本的多模态分布。我们对这些分布进行积分以获得中心点,传达个体的“平均”情感倾向。

虽然同一算法的输出可进行比较,但不同算法间无法直接对比。这是因为各方法具有不同(有时无界)的先验分布,且无法全部归一化到单位区间。

最终输出还识别并标注了具有显著积极/消极情感的句子及来源URL。如此,荣誉制度筛选人员可获取摘要中心值、完整后验分布、异常值,以及通过原始网络搜索筛选后留存的文章和句子数量。该方法便于高效人工评估,使委员会能快速验证所呈证据的准确性、相关性和可靠性,确保决策保持信息充分、可复现和可审计。

## 5. 结果、分析与讨论

### 5.1. 相关性筛选

对网络来源文章的筛选至关重要,以确保仅保留与案例评估直接相关的内容。

相似文章