印加基普斯中的结构模式挖掘:无监督聚类、来源分类以及圣谷匹配的计算验证
摘要
本文提出了一种可重复的机器学习流程,用于印加基普斯中的结构模式挖掘,利用开放基普斯存储库中的无监督聚类和监督分类来识别结构组并验证先前发现,所有代码和数据均公开可用。
arXiv:2607.00185v1 公告类型:新论文
摘要:基普斯(Khipus)——结绳装置——是印加帝国(约公元1400-1532年)的主要记录媒介,但其系统尚未被破译。我们提出了一种可重复的机器学习流程,应用于开放基普斯存储库(Open Khipu Repository, OKR),这是一个包含619个基普斯、共54,403根绳子和110,677个结的公共数据库。我们为每个基普斯设计了27个结构特征,并应用了:(i) 通过UMAP和HDBSCAN进行的无监督聚类,恢复了三个结构上不同的组(轮廓系数=0.769);(ii) 通过梯度提升进行的监督来源分类,在印加晚期地平线帝国风格上达到了F1=0.86;(iii) 基于SHAP的可解释性,识别出绳子扭转方向是帝国基普斯的主要结构区分因素。我们还报告了两个方法论上感兴趣的发现。第一,有一个聚类并非由地理区域主导,而是由19世纪的欧洲博物馆收藏主导,这表明殖民时期的获取和记录实践在结构上编码在了语料库中。第二,我们独立计算验证了Medrano和Urton(2018)报告的六个圣谷(Santa Valley)基普斯的recto/verso(半族)结构,仅使用公共OKR数据库,无需物理接触这些物品,就复现了总附着比和单个混合标本的识别。此外,我们报告了一个负面结果:以n-gram编码的绳结类型序列顺序,除了聚合特征外,未提供额外的来源信号。所有代码和数据均公开可用。
查看缓存全文
缓存时间: 2026/07/02 05:36
# 印加奇普的结构模式挖掘:无监督聚类、来源分类以及圣谷匹配的计算验证
来源:https://arxiv.org/html/2607.00185
Maria Contreras
###### 摘要
奇普——一种结绳记事装置——是印加帝国(约公元1400-1532年)的主要记录媒介,然而其系统至今未被破译。我们提出了一种可复现的机器学习流程,应用于开放奇普资料库(OKR),这是一个包含619件奇普、54,403条绳线和110,677个绳结的公共数据库。我们为每件奇普设计了27个结构特征,并进行了:(i) 通过UMAP和HDBSCAN进行的无监督聚类,恢复了三个结构不同的群组(轮廓系数=0.769);(ii) 通过梯度提升进行的监督式来源分类,对印加晚期地平线帝国风格达到了F₁=0.86;(iii) 基于SHAP的可解释性分析,识别出绳捻方向是帝国风格奇普的主要结构区分特征。我们进一步报告了两项方法论上有趣的发现。首先,有一个群组并非由地理区域主导,而是由19世纪的欧洲博物馆收藏主导,这表明殖民时期的获取和记录实践已在语料库中结构性地编码。其次,我们为Medrano和Urton (2018) 报道的六件圣谷奇普的正反面(社会半偶族)结构提供了独立的计算验证,再现了整体的附着方向比率以及单个混合标本的识别——仅使用公开的OKR数据库,无需物理接触实物。我们还报告了一个负面结果:以n-gram编码的绳结类型序列顺序,在聚合特征之外并未增加来源信号。所有代码和数据均已公开提供。
关键词:计算考古学,奇普(khipu),奇普(quipu),无监督学习,UMAP,HDBSCAN,梯度提升,SHAP,数字人文,安第斯研究
## 1 引言
印加帝国是前哥伦布时期美洲最大的政体,在安第斯山脉管理着数百万人,却没有传统意义上的文字系统。取而代之的是,印加国家依赖于奇普(khipus,克丘亚语中意为“结”):由棉或骆驼纤维捻合或编织而成的绳线组合,通过打结来记录数字乃至可能的叙事信息。西班牙编年史家描述了专业的记录员——奇普卡马约克斯(khipukamayuqs)——他们将这些装置作为行政文件来解读。
全世界博物馆和私人收藏中约有1,000件奇普幸存至今。虽然许多奇普的十进制数字惯例已被充分理解 (Ascher and Ascher, 1997; Urton, 2003),但它们是否以及如何编码语言、名称或叙事,仍是安第斯研究中的主要未解难题之一。迄今为止,大多数定量研究要么聚焦于单个标本,要么专注于匹配相关奇普之间的数字总和 (Urton and Brezine, 2005)。整个语料库的结构维度——即哪些构建惯例区分了不同地区和时期的奇普——尚未得到系统的计算性研究关注。
本文将现代机器学习方法应用于开放奇普资料库(OKR),这是最全面的公开奇普数据库。我们的贡献包括:
1. 一个可复现的特征工程流程,将OKR的关系型结构转换为每件奇普的27维特征向量(第3节)。
2. 一项无监督分析(UMAP + HDBSCAN),揭示了三个分离良好的结构聚类,其中一个反映了殖民时期的收藏偏差而非地理来源(第4节)。
3. 一个带有可解释性分析的监督式来源分类器,将绳捻方向识别为印加帝国制造的标志(第5节)。
4. 对Medrano和Urton (2018) 报道的圣谷社会半偶族结构的独立计算验证(第6节)。
## 2 相关工作
将奇普作为数据进行系统研究始于Ascher和Ascher (1997),其描述性代码构成了现代数据库的基础。由Urton和Brezine发起的哈佛奇普数据库项目,大规模地规范了绳结、绳线和颜色属性的记录;Urton和Brezine (2005)利用它展示了普鲁楚科(Puruchuco)奇普之间的层级会计关系,其中较低层级的绳线总和在较高级别的奇普上再次出现。Urton和Chu (2015)描述了与储存农产品相关的因卡瓦西(Inkawasi)奇普。
在破译方面,Medrano和Urton (2018)将来自圣谷的六件奇普与一份1670年的殖民时期贡赋人口普查记录进行了匹配,认为主绳绳结的总和对应评估的贡赋,而绳线附着方向(正面/反面)则编码了社会半偶族(*hanan*/*hurin*)的归属关系。FitzPatrick (2024)随后完善了这一对应关系。Hyland (2017)利用社群知识提出了科亚塔(Collata)奇普的一种语音解读。在计算方面,Clindaniel (2019)将网络和统计方法应用于OKR的结构,而Medrano (2021)则构建了殖民时期奇普转写的语料库语言学类型学。
我们的工作在范围上有所不同:我们并非分析单一档案或追求语音破译,而是利用无监督和监督学习来刻画整个OKR语料库的特征,并为先前发表的一项破译主张提供独立的计算复现。
## 3 数据集与特征工程
### 3.1 开放奇普资料库
OKR以无服务器SQLite数据库的形式分发,包含619件奇普、54,403条绳线和110,677个绳结的数据,这些数据汇集自Ascher、Pereyra、哈佛奇普数据库项目等的工作。我们查询了四个主要表格:`khipu_main`(标本元数据:来源、地区、博物馆)、`cord`(每条绳线的长度、捻向、层级、附着方式)、`knot`(每个绳结的类型、方向、圈数)以及`ascher_cord_color`(颜色编码)。所有619件标本都记录了地理来源信息;其中522件(84.3%)具有更精细的区域标签。
### 3.2 特征
我们将绳线和绳结级别的属性聚合为每件奇普的27维特征向量,分为四组:
- **绳线结构**:绳线数量、绳线长度的均值与标准差、最大绳线层级、子绳比率。
- **捻向**:S向和Z向绳线的数量及其比率。
- **绳结**:绳结总数、平均圈数、绳结方向计数、以及绳结类型(单结、长结、八字结等)的独热编码计数。
- **颜色**:独特颜色数量、颜色熵、以及多色指示符。
颜色熵 \( H = -\sum_i p_i \log p_i \) 捕捉了调色板的多样性,其中 \( p_i \) 是颜色 \( i \) 在某件奇普上的相对频率。缺失值作为零进行插补;在无监督分析之前对特征进行标准化处理。
## 4 无监督聚类
我们使用UMAP (McInnes et al., 2018)(`n_neighbors=15`,`min_dist=0.1`,欧几里得距离度量,固定随机种子)将标准化的27维特征矩阵降至二维,并使用HDBSCAN (Campello et al., 2013)(`min_cluster_size=10`,`min_samples=5`)对嵌入结果进行聚类。这种组合无需预先指定聚类数量。
该过程产生了**三个聚类,无噪声点**,轮廓系数为**0.769**,表明分离效果很强(图1)。将聚类成员与元数据进行交叉参考:
- **聚类 0**(17件奇普):印加晚期地平线帝国风格——一个规模小、高度内聚的群组,在嵌入空间中孤立存在。
- **聚类 1**(442件奇普):主要来自秘鲁中央海岸——主体语料库风格。
- **聚类 2**(160件奇普):由欧洲和北美博物馆收藏主导(见第4.1节)。
<figcaption>图1:619件奇普的UMAP嵌入。*左图*:HDBSCAN聚类(轮廓系数=0.769)。*右图*:按地理区域着色的相同嵌入。孤立的较小聚类(左下)几乎完全对应印加晚期地平线帝国风格。</figcaption>
### 4.1 殖民时期收藏偏差
聚类 2 并非由地理区域定义。其主要来源是博物馆机构——柏林民族学博物馆(Museum für Völkerkunde)、宾夕法尼亚大学博物馆(University Museum)等——反映了19世纪欧洲的获取模式。对聚类 2 和聚类 1 进行双样本 t 检验发现,捻向比率特征的差异在 \( p \approx 3.7 \times 10^{-276} \) 水平上显著。进一步检查表明,这种差异很大一部分源于特定收藏中集中的*未记录*捻向数据(编码为“U”):因此,这种偏差既是地理上的(哪些奇普被获取),也是方法论上的(它们被记录的详尽程度如何)。两者都是殖民时期人类学的遗产,并且都意味着OKR并非印加奇普的中性样本——这是任何语料库范围破译工作中都需注意的警示。
<figcaption>图2:聚类 2(左)和聚类 1(右)的主要博物馆来源。聚类 2 由欧洲和北美机构(例如柏林民族学博物馆)主导,反映了19世纪的殖民获取模式,而非单一的地理来源。</figcaption>
## 5 来源分类与可解释性
### 5.1 设置
我们训练一个梯度提升树分类器(XGBoost)来从结构特征预测地理区域,仅限于带有区域标签的标本。样本数少于10个的类别被归为“其他”,从而在135个有标签的标本上得到七个类别。我们使用五折分层交叉验证进行评估,优化加权F₁分数。通过随机搜索调整超参数。
### 5.2 结果
调优后的模型总体加权F₁得分为0.46——这是一个适中的基线,主要反映了有标签样本数量少和类别不平衡的问题。每个类别的结果更具信息量(表1):印加晚期地平线类别的F₁达到0.86,远高于随机水平,证实了帝国奇普遵循高度标准化、可通过机器学习学习的构建惯例。沿海类别(中央海岸 vs. 南海岸)经常混淆;后续的t检验发现,这两类之间27个特征中仅有1个存在显著差异(\( p < 0.05 \)),表明是真正的结构相似性而非模型失效。
<figcaption>表1:各类别的F₁分数(调优后的XGBoost,5折交叉验证)。</figcaption>
<figcaption>图3:调优后分类器的混淆矩阵(5折交叉验证预测)。印加晚期地平线类别得到很好的恢复;混淆主要集中在结构相似的中央海岸和南海岸类别之间。</figcaption>
### 5.3 SHAP可解释性
我们应用SHAP (Lundberg and Lee, 2017)来解释印加晚期地平线的预测结果。按重要性排序,主要特征为:绳捻方向、平均绳线长度(帝国奇普更短且更均匀)、绳结数量(更高)、长度方差(更低)以及颜色熵(更低)。综合来看,这些特征描述了一种高度标准化的器物:构建统一、调色板受限、记录密集——与中央集权官僚机构的产出特征相符。按聚类分解捻向显示,S向捻向在帝国奇普中占主导地位(85.3%),而模型对Z向捻向的依赖反映了它在帝国标本中的*稀缺性*,即作为一个负面预测因子。
<figcaption>图4:印加晚期地平线类别的SHAP汇总图(基线模型,F₁=0.80;调优后的模型达到F₁=0.86,但产生相同的特征排序)。每个点代表一件奇普;水平位置显示该特征对预测的贡献,颜色编码特征值。绳捻方向(knot_dir_Z)和绳线长度特征是主要的区分因素。</figcaption>
## 6 圣谷匹配的计算验证
Medrano和Urton (2018)将六件圣谷奇普(哈佛编号UR087–UR092;OKR编号KH0323–KH0328;利马坦普尔·拉迪卡蒂博物馆)与一份1670年的殖民时期贡赋人口普查记录进行了匹配,认为绳线附着方向编码了社会半偶族归属关系。我们测试了是否可以从公开的OKR中独立复现这一结构主张。
正面(recto)和反面(verso)直接从OKR的 `cord.ATTACHMENT_TYPE` 字段读取,其中每条绳线被编码为“R”(正面)、“V”(反面)或“U”(未指定);不对此字段进行超出其本身的推断。提取六件标本的全部1,078条绳线并统计附着类型字段,我们发现聚合的比率为**49.0% 正面 / 51.0% 反面**(排除249条未指定的绳线)。这与Medrano和Urton (2018)报道的大约47%/53%的群体级比率非常接近。更引人注目的是,六件奇普中有五件是纯粹的正面或纯粹的反面,而只有一件标本(KH0326)是混合的(40 正面 / 69 反面)——精确复现了原始研究中识别出一件混合奇普的结论(表2)。
<figcaption>表2:基于OKR计算的六件圣谷奇普的正面/反面绳线数量。五件是纯粹的;KH0326是唯一一件混合标本。</figcaption>
据我们所知,这构成了首次仅使用公共数据库、无需物理接触实物而对圣谷社会半偶族结构进行的独立计算验证。我们强调该主张的范围:我们复现了*结构*(正面/反面)模式,而非与367比索贡赋总额的完整数字匹配,后者需要超出当前范围的绳结位置值解码,留待未来工作解决。
## 7 局限性
若干局限性制约了我们的结论。有标签的分类子集很小(135件标本),限制了可实现的性能并扩大了交叉验证的方差。区域标签本身可能无法捕捉有意义的文化或时间边界,中央/南海岸的混淆也表明了这一点。语料库表现出有据可查的收藏和记录偏差(第4.1节)。最后,相当一部分的捻向和数值字段未被记录,而我们对缺失特征进行的零值插补,虽然标准,但可能会削弱真实信号。我们还探讨了绳结类型沿绳线的*顺序*是否在聚合计数之外携带来源信号,将绳结类型二元组编码为TF-IDF特征;这些并未改善分类结果(\( \Delta F_1 \approx -0.006 \)),这表明要么顺序信息不编码区域,要么有标签样本量太小而无法检测到此类信号。这些因素都不会削弱无监督分离或圣谷复现的结论,但它们使得来源分类的结果有所缓和。
## 8 伦理考量
奇普不仅仅是考古学上的数据点;它们是印加人及其后裔的知识遗产。相似文章
超越特征重要性:聚类解释中模式检测方法的比较分析
本文对事后分析方法(随机森林替代模型、LIME、PCA)在检测聚类结果中的结构化模式方面进行了比较评估,使用注入模式的人工合成数据集。研究发现,没有一种方法能持续检测所有模式类型,凸显了现有可解释性工具的不足。
C-Mining:通过几何错位无监督发现文化数据合成的种子
C-Mining提出了一个无监督框架,通过利用嵌入空间中的跨语言几何错位来发现LLM训练数据中的文化种子,实现可扩展的合成数据生成以支持文化对齐,无需手动或LLM监督。
打破结构孤立:通过社区感知采样和结构熵的可扩展图聚类
本文提出SCISE,一个可扩展的无监督图聚类框架,通过社区感知采样和结构熵克服小批量训练中的结构孤立问题,在基准数据集上取得了最先进的结果。
@freeCodeCamp:聚类是无监督机器学习中的一项关键技术,可帮助你在数据中发现有价值的见解。……
freeCodeCamp 发布了一本关于 Python 聚类的综合手册,涵盖 K-means、层次聚类和 DBSCAN 聚类,并附有实现和可视化。
一种可复现的、面向Katharevousa希腊语议会文本的Universal Dependencies风格流水线
本文介绍了一种可复现的流水线,用于构建面向Katharevousa希腊语议会文本的Universal Dependencies风格解析资源,包括OCR重建、LLM辅助标注以及多个解析器的评估。最佳模型(XLM-R)达到了0.8893的UPOS准确率和0.5162的LAS,显著优于现成的基线模型。