WikiSTAR:一个揭示科学维基百科文章隐藏历史的系统

arXiv cs.CL 论文

摘要

WikiStar 是一个利用 LLM 分类器对维基百科文章修订历史中具有科学意义的编辑进行标注的系统,使用户能够交互式地探索科学知识如何随时间演变。该系统包含一个基准数据集,并通过领域专家的用户研究进行了验证。

arXiv:2607.12441v1 公告类型:新 摘要:维基百科在塑造公众对科学的理解方面发挥着关键作用,其公开可访问的修订历史是科学知识如何随时间演变的独特记录。然而,具有科学意义的修订被大量常规编辑所掩盖,导致每篇文章的科学历史隐藏不露。我们提出了 WikiSTAR(Scientific Tracking of Article Revisions),一个交互式系统,用于探索文章修订历史中具有科学意义的变化。利用基于 LLM 的分类器和专家设计的多标签分类法,WikiSTAR 首先对编辑类型进行标注,例如添加技术术语、新的研究发现以及科学叙述的变化。然后,通过交互式视图,可以以任意粒度追踪文章完整的修订历史——从揭示何时以及在哪些部分添加或完善了科学内容的总体趋势,到单个编辑——展示了科学知识以前所未有的规模发展。在一项用户研究中,来自三个领域的专家发现 WikiSTAR 揭示了新的模式和研究问题,并实现了以前不可行的分析。我们开源了我们的系统、代码以及一个人工标注的基准数据集。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:22

# 揭示科学类维基百科文章隐藏历史的系统

来源:https://arxiv.org/html/2607.12441
Omer Ehrlich1∗Nitzan Barzilay1∗Rona Aviram2Tom Hope1,3 1耶路撒冷希伯来大学2内盖夫本·古里安大学3艾伦人工智能研究所 \(Ai2\) omer\.ehrlich@mail\.huji\.ac\.il, nitzan\.barzilay@mail\.huji\.ac\.il

###### 摘要

维基百科在塑造公众对科学的理解中扮演着关键角色,其公开可访问的修订历史是科学知识随时间演变的独特记录。然而,具有科学意义的修订被大量常规编辑所掩盖,使得每篇文章的科学历史隐藏起来。我们提出WikiStar(文章修订的科学追踪),一个交互式系统,用于探索文章修订历史中具有科学意义的变化。该系统利用LLM分类器和专家设计的多标签分类法,首先标记编辑类型,例如添加技术术语、新的研究发现以及科学叙事的变化。然后,通过交互式视图,可以以任意粒度追踪文章的完整修订历史——从揭示何时以及在哪些部分添加或完善科学内容的总体趋势,到单个编辑——展示了以前不可能实现的大规模科学知识发展。在一项用户研究中,来自三个领域的专家发现WikiStar揭示了新的模式和研究问题,并实现了以前不切实际的分析。我们发布我们的系统、代码以及一个人工标注的基准。111![[无题图片]](https://arxiv.org/html/2607.12441v1/img/github-logo.png)代码 (https://github.com/omerehrlich/WikiStar)![[无题图片]](https://arxiv.org/html/2607.12441v1/img/hf-logo.png)WikiStar\-Bench数据集 (https://huggingface.co/datasets/omerehrlich/WikiStar-Bench)![[无题图片]](https://arxiv.org/html/2607.12441v1/img/hf-logo.png)WikiStar演示 (https://huggingface.co/spaces/omerehrlich/WikiStar)

参见标题图1:用于追踪维基百科文章中科学编辑历史的WikiStar流水线。(1) 将每次修订分割成章节,并在修订之间匹配这些章节,以恢复每个被编辑章节的前一版本。(2) 对每个编辑对进行多标签编辑类型分类。(3) 通过交互式视图进行探索,从总体模式到单个编辑。
WikiStar:揭示科学类维基百科文章隐藏历史的系统

Omer Ehrlich1∗Nitzan Barzilay1∗Rona Aviram2Tom Hope1,31耶路撒冷希伯来大学2内盖夫本·古里安大学3艾伦人工智能研究所 \(Ai2\)omer\.ehrlich@mail\.huji\.ac\.il, nitzan\.barzilay@mail\.huji\.ac\.il

\*\*脚注文本:同等贡献。## 1 引言

维基百科是世界上最大的在线百科全书,由世界各地的志愿者编写并持续重写。作为一个广泛参考的来源,它塑造了公众对科学和学术话题的理解。其公开可访问的修订历史使学者能够追踪学术领域内和跨领域思想的发展,并考察公共知识如何演变(Benjakob等人,2023 (https://arxiv.org/html/2607.12441#bib.bib6),2021 (https://arxiv.org/html/2607.12441#bib.bib14))。维基百科上的科学文章特别适合研究知识演变。先前的研究表明,它们通过广泛使用可靠的学术来源,紧密跟踪科学文献的发展,使其不仅仅是面向公众的总结(Simons等人,2024 (https://arxiv.org/html/2607.12441#bib.bib24); Benjakob等人,2023 (https://arxiv.org/html/2607.12441#bib.bib6))。因此,它们的修订历史可能构成一个丰富的纵向记录,展示科学概念如何被引入、讨论、完善和稳定。

然而,一篇文章在其生命周期中可以积累数千次编辑——仅“AI”文章就有超过18,000次章节编辑——而具有科学意义的编辑只占很小一部分,埋没在诸如重新措辞和格式调整等常规更改之中。手动隔离有意义的编辑非常耗费人力,因此具有科学意义的编辑仍然隐藏且难以访问。

先前的工作对维基百科编辑进行分类(Yang等人,2017 (https://arxiv.org/html/2607.12441#bib.bib1); Rajagopal等人,2022 (https://arxiv.org/html/2607.12441#bib.bib9)),并构建工具来探索作者身份和编辑冲突(Viégas等人,2004 (https://arxiv.org/html/2607.12441#bib.bib28); Flöck和Acosta,2014 (https://arxiv.org/html/2607.12441#bib.bib29); Guo等人,2023 (https://arxiv.org/html/2607.12441#bib.bib30)),但这两条线都针对全页面或令牌级别的通用编辑。相反,我们在章节级别工作,并专注于科学意义,这定位了每次编辑,揭示了章节的科学内容如何随时间发展,并驱动了我们系统的交互式视图。

我们提出WikiStar(文章修订的科学追踪),一个检测、量化和情境化维基百科文章中科学文本随时间变化的系统(图LABEL:fig:system-small)。我们引入了*科学编辑分类*的任务:使用包含十个专家设计标签的分类法,用它们所做的科学意义变化来标记章节级别的编辑。WikiStar提取章节级别的编辑,使用LLM对照分类法对每次编辑进行分类,并通过交互式视图呈现结果,这些视图追踪一篇文章的科学内容如何随时间和章节演变(图2 (https://arxiv.org/html/2607.12441#S2.F2))。这使得维基百科的科学编辑历史对维基百科研究人员以及更广泛的科学家、记者和其他对科学如何在线呈现感兴趣的人变得可访问。

在一项用户研究中,维基百科编辑、科学新闻以及科学史与科学哲学领域的专家发现,WikiStar揭示了他们难以手动发现的模式,引发了新的研究问题,并实现了以前不实用的分析。

最后,我们发布WikiStar\-Bench,一个带有人工标注、标记了科学意义的章节级维基百科编辑数据集。

总而言之,我们的主要贡献:

1. (1)我们创建了WikiStar,一个探索维基百科文章科学内容如何随时间演变的系统。我们通过一项包含三个领域领域专家的用户研究验证了WikiStar,他们发现它非常有用。
2. (2)我们引入了维基百科文章章节的科学编辑分类任务,该任务基于我们针对科学显著变化的十个标签分类法,并发布WikiStar\-Bench,一个包含三个领域1,387个章节编辑的人工标注数据集。

## 2 科学编辑分类

参见标题图2:WikiStar系统概述。(1) 提取与分类:系统将每个维基百科修订分割成章节,将每个被编辑的章节与其前一版本匹配,并将每个编辑对分类为科学编辑类型。(2) 交互式探索:交互式视图让用户探索分类后的历史:Over Time视图显示编辑类型的时间趋势,Section Comparison视图比较所选章节之间的编辑类型。在这些视图中选择一个点或单元格,会生成其编辑的摘要,并可访问底层编辑。在本节中,我们首先介绍维基百科编辑的*科学编辑分类*任务。为了支持这项任务,我们发布WikiStar\-Bench,一个人工标注的基准,并使用它来比较七个LLM作为分类器。

如引言所述,由于具有科学意义的编辑只占文章编辑的一小部分,我们将*科学编辑分类*定义为用其所做的科学变化类型来标记每个维基百科编辑。我们将其视为一个基于章节级别编辑的多标签分类任务。给定一个章节及其前一版本,我们称之为*章节编辑对*,任务是从我们的十个科学编辑类型分类法(§2.2 (https://arxiv.org/html/2607.12441#S2.SS2))中分配所有适用的标签,或者在没有科学变化发生时分配Non\-Scientific Edit标签。

我们选择章节作为粒度单位有两个原因。首先,它为分类提供了适量的上下文:整个修订会膨胀提示长度并降低输出一致性 (Shivashankar和Steinmetz (2024 (https://arxiv.org/html/2607.12441#bib.bib17)); Fieblinger等人 (2024 (https://arxiv.org/html/2607.12441#bib.bib18)),而单个句子则丢弃了判断更改是否具有科学意义所需的上下文。其次,章节将每次编辑定位到文章的一个特定方面,让WikiStar能够追踪科学内容如何在各章节之间分布以及如何随时间发展。

### 2.1 章节识别与链接

将文章的修订日志转化为章节级别的编辑需要两个操作:将每个修订解析成其组成章节,并将每个被编辑的章节与其前一版本配对——或者,对于一个新创建的章节,识别出它没有前一版本。

获取章节文本:使用MediaWiki API维基媒体基金会 (2025 (https://arxiv.org/html/2607.12441#bib.bib35)),我们检索文章的每个修订作为原始wikitext及其元数据(修订ID、时间戳、编辑者)。每个修订通过一个遵循维基百科标记约定的基于正则表达式的解析器被分割成章节。由于每个修订包含文章的完整章节列表,其中大部分与前一版本相比没有变化,我们只保留发生变化的章节,因此每个条目对应一个被编辑的章节。

匹配章节编辑对:*科学编辑分类*任务需要每个章节在编辑前后的版本,我们称之为*章节编辑对*。匹配版本具有挑战性,因为章节并不稳定:编辑者会重命名、拆分和合并它们,而维基百科将每个修订存储为扁平的全文,没有标识符链接章节版本。为了定位章节的早期版本,我们向后搜索修订,并计算与候选章节的两个相似度度量:标题相似度(归一化编辑距离)和内容相似度(章节内容嵌入的余弦相似度)。我们将章节与满足任一度量超过阈值的最近候选者匹配。这种简单方法在实践中效果很好;更高级的匹配留给未来的工作。

### 2.2 科学编辑分类法

一组封闭的标签让WikiStar能够按类型聚合、过滤和可视化编辑。我们设计了一个包含十种有科学意义的编辑类型的分类法——例如New Scientific Information和Change in Scientific Narrative——加上一个Non\-Scientific Edit标签,由一位科学维基百科专家设计,并针对真实编辑迭代完善。完整定义见附录A (https://arxiv.org/html/2607.12441#A1),附录E (https://arxiv.org/html/2607.12441#A5)中提供了选定类型的带注释示例。

### 2.3 WikiStar\-Bench

我们策划了WikiStar\-Bench,第一个带有科学标签的章节级维基百科编辑的人工标注数据集,作为科学编辑分类的评估资源发布。它包含三个科学领域的1,387个示例——生物学 (821)、计算机科学 (288) 和神经科学 (278)——每个领域至少涵盖9个流行的维基百科页面。每个示例是一个单一的章节编辑对,包含其元数据和来自我们分类法的人工标注黄金标签。

#### 标注过程:

WikiStar\-Bench数据集由四位标注者标注:三位STEM研究生和一位助理教授,他拥有生物学博士学位并研究科学维基百科。标注者独立标注每个章节编辑对,从我们的10标签分类法中分配所有适用的标签,如果没有适用的标签,则分配Non\-Scientific Edit标签。

#### 标注者一致性:

为确保人工标注的可靠性,所有标注者标记了一个共享的104个示例的子集。使用平均配对Cohen's κ (Cohen,1960 (https://arxiv.org/html/2607.12441#bib.bib34))的标注者一致性很高 (κ=0.89),表明整体一致性很强。在更主观和解释性的标签上,一致性自然较低(例如*Change in Scientific Narrative*,κ=0.7,以及*Scientific Clarification Added*,κ=0.8)。

### 2.4 结果

#### 实验设置:

对照WikiStar\-Bench的黄金标签,我们报告每个标签的精确率和召回率,以及宏平均和微平均F1(我们的主要指标)。我们评估了七个LLM作为分类器:GPT\-5.4、GPT\-5\-mini、GPT\-5.1 (OpenAI,2025a (https://arxiv.org/html/2607.12441#bib.bib40))、GPT\-4o (Hurst等人,2024 (https://arxiv.org/html/2607.12441#bib.bib38))、o3\-mini (OpenAI,2025b (https://arxiv.org/html/2607.12441#bib.bib39))、LLaMA 3.3 70B (Dubey等人,2024 (https://arxiv.org/html/2607.12441#bib.bib37)) 和 Qwen3\-Next\-80B (Yang等人,2025 (https://arxiv.org/html/2607.12441#bib.bib36))。

#### 提示改进:

我们最终的提示以通用的任务解释开头,然后为每个标签提供一个定义和一个最简单的示例。与朴素的单句定义提示相比,最有效的改进是要求模型首先判断编辑是否具有科学意义,并在定义中标记常见错误;这些改进将GPT\-5.4的宏平均F1从0.69提高到0.82。少量样本演示没有帮助(宏平均F1下降到0.78)。附录B (https://arxiv.org/html/2607.12441#A2)报告了不同模型在不同提示版本下的结果。222请参见我们仓库中create_prompt.py (https://github.com/omerehrlich/WikiStar/blob/master/wiki_pipeline/prompts/create_prompt.py)中的提示。

聚合结果:在七个模型中,GPT\-5\-mini和GPT\-5.4是表现最好的两个,得分相当(宏平均F1 0.83 vs. 0.82;微平均F1 0.86 vs. 0.83)。部署的演示使用GPT\-5\-mini,因为其总体结果相当且运营成本较低。所有模型的结果见附录C (https://arxiv.org/html/2607.12441#A3)。跨标签来看,GPT\-5.4低于人工一致性上限(宏平均F1 0.82 vs. 0.91),表明科学编辑分类并非易事,仍有改进空间。

#### 每标签结果:

表1 (https://arxiv.org/html/2607.12441#S2.T1)报告了GPT\-5.4的每标签结果。F1在不同标签间差异很大:在具有明确文本信号的目标标签上最强(例如Wikilink Added为0.89,Academic References Added为0.88),其中剩余的错误主要涉及科学限定词,例如,将一本书视为学术参考文献。在解释性标签上最弱(例如Change in Scientific Narrative为0.61),模型倾向于将标签过度扩展超出其预期范围,经常将Scientific Clarifications误分类为叙事变化。这与这些标签上较低的人工一致性相对应(第2.3节 (https://arxiv.org/html/2607.12441#S2.SS3.SSS0.Px2))。

GPT\-5.4HumanLabelPRF1F1New Sci\. Information\.88\.74\.80\.93Sci\. Information Removed\.84\.92\.87\.94Sci\. Clarification Added\.73\.72\.72\.86Technical Terms Added\.80\.93\.86\.93Researcher Names Added\.93\.82\.87\.92Change in Sci\. Narrative\.54\.70\.61\.72Academic References Added\.90\.86\.88\.97Academic References Removed\.84\.86\.85\.95Wikilink Added\.95\.83\.89\.97Quantitative Information\.75\.86\.80\.95Non\-Scientific Edit\.83\.87\.85\.91Macro avg\.82\.83\.82\.91Micro avg\.84\.83\.83\.92表1:GPT\-5.4在WikiStar\-Bench上的每标签精确率、召回率和F1 (n=1,387),以及人工一致性上限——标注者间在重叠子集上的平均配对F1 (n=104)。*注:人类F1基于n=104的重叠子集计算,而模型指标基于完整的n=1,387数据集。*

相似文章

WikiSpy

Lobsters Hottest

WikiSpy 是一个用于跟踪维基百科变更的工具。

@hwchase17: https://x.com/hwchase17/status/2071963622298050997

X AI KOLs Timeline

文章讨论了AI代理中新兴的'wiki记忆'模式,其中原始源数据被智能压缩成一个持久、结构化的知识层,代理可以高效地使用它。文章将其与基础RAG进行了比较,并给出了DeepWiki和LLM Wiki等例子。

@Huanusa: 个人知识库的天花板来了! GitHub这个 LLM Wiki 项目已经2800+ Star,彻底把普通RAG甩在身后! 它不是每次都“重新检索”的废物模式, 而是让AI直接帮你增量构建一个真正的结构化Wiki —— 知识编译一次,就持续进…

X AI KOLs Timeline

LLM Wiki 是一个开源的桌面应用,利用 LLM 增量构建结构化知识库,支持知识图谱、社区检测、Obsidian 集成和 Chrome 剪藏,旨在替代传统 RAG 方式。