探索ESC获奖者的嵌套图

arXiv cs.AI 论文

摘要

本文介绍了ConceptFlow,一个与scikit-learn兼容的Python库,用于形式概念分析,生成嵌套线图,应用于分析Eurovision Song Contest获奖者的投票模式和音乐特征。

arXiv:2608.13630v1 公告类型:新 摘要:我们介绍了ConceptFlow,一个与scikit-learn兼容的Python库,用于形式概念分析,它从多值形式上下文构建和渲染嵌套线图。给定一个多值上下文及其属性到概念尺度的划分,ConceptFlow执行概念缩放,计算因子格,识别相应子直积的填充节点,并生成交互式可视化。 我们应用ConceptFlow于1975年至2025年的Eurovision Song Contest获奖者,探索投票模式和音乐特征之间的关系。投票支持通过一个外尺度捕获,涵盖区域、文化、历史和政治维度,而内尺度通过节奏和调性捕获音乐特征。生成的嵌套线图揭示了跨两个尺度的含义,暴露了获奖条目如何被投票与其共享的音乐属性之间的依赖关系。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:48

# 使用嵌套图探索欧洲歌唱大赛获奖者
来源:https://arxiv.org/html/2608.13630

作者信息:
- **Anurag Sharma**
  - 单位:德国卡塞尔大学知识与数据工程组(KDE)
  - 单位:德国卡塞尔大学信息系统设计跨学科研究中心(ITeG)
  - 电子邮箱:[{sharma,noehre,stumme}@cs.uni-kassel.de](mailto:{sharma,noehre,stumme}@cs.uni-kassel.de)
- **Marcel Nöhre**
  - 单位:德国卡塞尔大学知识与数据工程组(KDE)
  - 单位:德国卡塞尔大学信息系统设计跨学科研究中心(ITeG)
  - 电子邮箱:[{sharma,noehre,stumme}@cs.uni-kassel.de](mailto:{sharma,noehre,stumme}@cs.uni-kassel.de)
- **Gerd Stumme**
  - 单位:德国卡塞尔大学知识与数据工程组(KDE)
  - 单位:德国卡塞尔大学信息系统设计跨学科研究中心(ITeG)
  - 电子邮箱:[{sharma,noehre,stumme}@cs.uni-kassel.de](mailto:{sharma,noehre,stumme}@cs.uni-kassel.de)

###### 摘要

我们介绍了 *ConceptFlow*,一个兼容 scikit-learn 的形式概念分析(FCA)Python 库,它可以从多值形式背景中构建和渲染嵌套线图。给定一个多值背景及其属性的概念标尺划分,ConceptFlow 执行概念标度化、计算因子格、识别对应子直积的已填充节点,并生成可视化交互。

我们将 ConceptFlow 应用于 1975 年至 2025 年的欧洲歌唱大赛(ESC)获奖者,探索投票模式与音乐特征之间的关系。投票支持通过涵盖区域、文化、历史和政治维度的外标尺来捕捉,而内标尺则通过节奏和调性来捕捉音乐特征。生成的嵌套线图揭示了两个标尺之间的蕴含关系,揭示了获奖曲目被投票的方式与其共同音乐特性之间的依赖关系。

###### 关键词:

ConceptFlow,形式概念分析,嵌套线图,欧洲歌唱大赛

## 1 引言

欧洲歌唱大赛(ESC)是一个年度音乐竞赛,每个参赛国家提交一首歌曲并评判所有其他国家的歌曲。自 1975 年以来,每个国家将其分数 1-8、10 和 12 分配给其最喜欢的十场表演,从不为自己投票。这些分数的决定方式,由评委、公众电话投票还是两者结合,在几十年中反复变化。该比赛长期以来还存在偏见投票的声誉,国家之间持续存在联盟。例如,希腊和塞浦路斯可靠地互相给予 12 分 [3 (https://arxiv.org/html/2608.13630#bib.bib1)]。

形式概念分析(FCA)为研究这种关系提供了一个自然框架,在单一概念结构中表示投票模式和音乐特征。在本文中,我们介绍了 *ConceptFlow* [6 (https://arxiv.org/html/2608.13630#bib.bib7)] 的嵌套线图功能,这是一个兼容 scikit-learn 的 FCA Python 库,其组件遵循 scikit-learn 估计器接口。我们通过分析 ESC 获奖者来演示其用法。外标尺捕捉了跨分类集群的投票支持,而内标尺则捕捉了音乐特征。由此产生的形式背景揭示了这两个维度之间的蕴含关系,揭示了获奖曲目被投票的方式与其共同音乐特性之间的依赖关系。

## 2 背景

我们假设读者熟悉 FCA [2 (https://arxiv.org/html/2608.13630#bib.bib2)]。简而言之,一个 *形式背景* $(G,M,I)$ 由一个对象集 $G$、一个属性集 $M$ 和一个关系 $I \subseteq G \times M$ 组成。一个 *形式概念* 是一对 $(A,B)$,其中 $A$ 是最大对象集,$B$ 是它们共享的属性;这些概念按外延包含关系排序,形成 *概念格* $\underline{\{\mathfrak{B}\}}(G,M,\mathrel{I})$。

令 $\mathbb{K}=\mathbb{K}_{\mathrm{outer}}\mid\mathbb{K}_{\mathrm{inner}}$ 表示两个形式背景的并置。概念格 $\underline{\{\mathfrak{B}\}}(\mathbb{K})$ 同构于因子格 $\underline{\{\mathfrak{B}\}}(\mathbb{K}_{\mathrm{outer}})$ 和 $\underline{\{\mathfrak{B}\}}(\mathbb{K}_{\mathrm{inner}})$ 的一个子直积并半格 [2 (https://arxiv.org/html/2608.13630#bib.bib2)]。因此,每个形式概念 $(A,B) \in \mathfrak{B}(\mathbb{K})$ 都由一个外概念和一个内概念对精确表示。

$\underline{\{\mathfrak{B}\}}(G,M,\mathrel{I})$ 的 *线图* 通过节点表示每个形式概念,并在 $c_1 \leq c_2$ 属于 $\leq$ 的传递归约时,用直线段连接两个节点,将较小概念绘制在较大概念正下方。每个节点在 $\mathbb{R}^2$ 中被分配坐标,这些坐标决定了对应概念在图中的位置。*双加法* 线图形成一个特殊类别:每个概念在 $\mathbb{R}^2$ 中的位置是其外延中对象的向量和其补内涵中属性的向量之和,其中正的 $y$ 分量确保垂直顺序尊重序关系 $\leq$。只需为约简背景的不可约元分配向量即可。在这项工作中,我们考虑了 DimFlux [5 (https://arxiv.org/html/2608.13630#bib.bib3)],它将 *DimDraw* 坐标投影到加法空间,并使用基于力的模型对其进行可读性优化。

*嵌套线图* 通过将形式背景的属性集分解为多个 *标尺* 来可视化其概念格。上下文不被看作所有属性上的单一概念格,而是被视为共享相同对象集的子背景的并置。一个因子格显示为 *外* 图,而另一个因子格的副本放置在其每个概念内部 [2 (https://arxiv.org/html/2608.13630#bib.bib2)]。这种嵌套线图的构建在第 4 节 (https://arxiv.org/html/2608.13630#S4) 中有详细描述。

## 3 ESC 数据集与标尺构建

我们分析了 1975 年至 2025 年欧洲歌唱大赛的 50 位获胜者,不包括取消的 2020 年比赛。投票结果和歌曲元数据来自公开可用的 Eurovision Song Contest Dataset<sup>1</sup>。对于每位获奖者,我们收集最终投票结果<sup>2</sup>以及音乐元数据,包括歌曲的 BPM 和调性。由此产生的多值形式背景构成了下面描述的概念标度化过程的输入。

外标尺捕捉获奖曲目是否从与其有紧密联系的国家获得了强有力的支持。我们研究了四种不同类型的联系:*区域*、*文化*、*历史* 和 *政治*。对于这四种类型中的每一种,我们手动对参赛国集合进行了聚类,如我们的博客<sup>3</sup>所述,以反映通常讨论的投票亲和力来源 [3 (https://arxiv.org/html/2608.13630#bib.bib1), 7 (https://arxiv.org/html/2608.13630#bib.bib5)]。对于任何聚类中的每个获奖曲目 $g$ 和集群 $m$,如果获奖者 $g$ 从 $m$ 中符合条件的国家平均获得了至少八分,则我们设定 $(g,m) \in I$。

内标尺捕捉获奖歌曲的两个音乐特性:节奏和调性。节奏使用阈值标尺进行转换,阈值为 100 和 150 BPM,产生布尔属性 *≥100 BPM* 和 *≥150 BPM* [4 (https://arxiv.org/html/2608.13630#bib.bib6)]。由于该标尺是序数的,每首节奏至少 150 BPM 的歌曲也满足 *≥100 BPM*。调性通过二分标尺表示,具有互斥的属性 *major* 和 *minor*。

## 4 构建嵌套线图

在这项工作中,我们介绍了 *ConceptFlow*,一个兼容 scikit-learn 的 FCA Python 库,提供 FCA 基础、概念标度化和可视化工具 [6 (https://arxiv.org/html/2608.13630#bib.bib7)]。给定一个多值形式背景(如第 3 节 (https://arxiv.org/html/2608.13630#S3) 中描述的 ESC 数据集),我们通过概念标度化独立构建外形式背景和内形式背景,并计算它们对应的概念格。

### 4.1 构建因子格

构建从一个多值形式背景开始,其对象集 $G$ 由 50 位 ESC 获奖者组成。然后应用概念标度化推导出两个形式背景,$\mathbb{K}_{\mathrm{outer}}=(G,M_{\mathrm{outer}},I_{\mathrm{outer}})$ 和 $\mathbb{K}_{\mathrm{inner}}=(G,M_{\mathrm{inner}},I_{\mathrm{inner}})$,其中 $M_{\mathrm{outer}}$ 包含四种聚类的所有国家集群,而 $M_{\mathrm{inner}}=\{\geq 100\,\textrm{BPM},\geq 150\,\textrm{BPM},\textrm{minor},\textrm{major}\}$。

$\mathbb{K}_{\mathrm{outer}}$ 和 $\mathbb{K}_{\mathrm{inner}}$ 的概念格提供了嵌套线图的因子格。由于两个背景共享相同的对象集,它们满足第 2 节 (https://arxiv.org/html/2608.13630#S2) 中描述的并置条件。

### 4.2 计算已填充节点

我们并不显式构建完整并置的概念格,而是直接从两个因子格计算已填充节点。对于每个对象 $g \in G$,我们确定其对象概念 $\gamma_{\mathrm{outer}}(g)$ 和 $\gamma_{\mathrm{inner}}(g)$,它们构成初始原子坐标对集合
$P_{0}=\left\{(\gamma_{\mathrm{outer}}(g),\gamma_{\mathrm{inner}}(g)) \mid g\in G\right\}\cup\left\{(\bot_{\mathrm{outer}},\bot_{\mathrm{inner}})\right\}$。
我们显式地添加 $(\bot_{\mathrm{outer}},\bot_{\mathrm{inner}})$,因为它代表 $(M',M)$,该对象始终包含在子直积中。等价地,它是空集的并(上确界),因此无法通过取非空并从原子对生成。

然后我们重复计算所有坐标对的分量并,直到不再生成新的对。结果的不动点恰好是子直保并嵌入
$\varphi:\underline{\{\mathfrak{B}\}}(\mathbb{K})\rightarrow\underline{\{\mathfrak{B}\}}(\mathbb{K}_{\mathrm{outer}})\times\underline{\{\mathfrak{B}\}}(\mathbb{K}_{\mathrm{inner}})$
的像,该映射识别出需要在嵌套线图中填充的内形式概念。

### 4.3 渲染

在确定已填充节点后,使用 DimFlux [5 (https://arxiv.org/html/2608.13630#bib.bib3)] 对两个因子格进行布局。外层格绘制一次,而内层格的布局仅计算一次,然后作为固定模板重用于每个外概念内部。因此,相应的内概念在整个可视化中占据相同的相对位置,使得外概念之间的差异仅通过哪些节点被填充来体现。

然后,完整的嵌套线图被导出为一个包含节点位置、边、标签和已填充坐标对的 JSON 表示。该表示被渲染为一个交互式的 D3.js [1 (https://arxiv.org/html/2608.13630#bib.bib4)] 可视化,将可视化层与底层的 FCA 实现清晰分离,使得渲染组件独立于构建算法。

## 5 结果

请参见图注图1:使用 ConceptFlow 生成的 ESC 获奖者嵌套线图。已填充节点代表原始背景的概念,而空心节点对应于组合背景中可见的蕴含。已填充节点代表将原始背景分解为外标尺和内标尺后的概念。未填充节点对应于蕴含。要确定一个未填充节点蕴含什么,需定位其下方唯一的最大已填充节点,可以在同一内层格内,如果必要的话,在较低的外层概念中。由于未填充节点的属性包含在此已填充节点的属性中,因此引入的附加属性构成了蕴含。

嵌套线图(图1 (https://arxiv.org/html/2608.13630#S5.F1))<sup>4</sup>使分析数据集中成立的投票模式与音乐特征之间的若干蕴含关系可视化。在考虑的 50 位 ESC 获奖者中,每首节奏至少 150 BPM 的获奖歌曲也获得了文化支持。另一个依赖关系涉及节奏和调式。在接受区域或文化支持的获奖者中,每首小调歌曲的节奏都至少 100 BPM。这反映在慢节奏小调歌曲对应节点的缺失,而代表节奏至少 150 BPM 小调歌曲的节点是已填充的。

该图还揭示了涉及投票支持属性组合的关系。特别是,结合文化支持、小调和至少 150 BPM 节奏的获奖者也获得了政治和历史支持。因此,嵌套图中相应节点的缺失表明,这种组合在没有额外投票支持属性的情况下从未出现过。

这些观察说明了嵌套表示如何在子直积的特定节点内定位蕴含。该图没有代数地列出蕴含,而是展示了音乐组合在何处是可能的,以及在何处被额外的投票支持条件所排除。

## 6 结论

我们介绍了 *ConceptFlow*,一个兼容 scikit-learn 的形式概念分析 Python 库,支持概念标度化、概念格构建和交互式嵌套线图。以欧洲歌唱大赛为例,我们演示了嵌套线图如何将多个概念标尺组合到单一可视化中,使投票模式与音乐特征之间的关系和蕴含变得直接可见。ESC 分析作为该库能力的演示,而非对 ESC 投票行为的全面统计研究。

未来的工作将扩展 ConceptFlow,增加额外的概念标尺、蕴含理论支持以及进一步的交互式可视化能力。特别是,我们计划计算典范蕴含基并将其集成到交互式界面中,允许用户直接在可视化中检查与概念和图表未填充区域相关的蕴含。这将加强形式概念分析中可视化与知识发现之间的联系。

## 参考文献

- \[1\]

相似文章

SciForma:科学图表的结构忠实生成

Hugging Face Daily Papers

介绍了SciForma,一个用于生成具有高结构保真度的科学方法图表的框架,使用多维联合偏好优化(M-DPO)和结构清单来确保在组件、箭头和文本轴上的正确性。该9B模型在基准评估上超越了开源基线和GPT-Image-1.5。

VCG-Bench:面向统一视觉中心的生成与编辑结构化基准

arXiv cs.CL

VCG-Bench 是一个统一基准,用于评估视觉-语言模型在结构化图表生成与编辑任务上的表现,引入了一种基于符号 mxGraph XML 的“以图表为代码”范式,以及一个包含 6 个领域共 1,449 张图表的分类数据集。