再见 Perspective API:在NLP、CSS和LLM评估中测量基础设施的经验教训

Lobsters Hottest 论文

摘要

本文批评了依赖 Perspective API 进行毒性测量的做法,并主张在NLP和LLM评估中建立社区拥有的测量基础设施,发布了590万文本片段的分数,以在API关闭后促进研究。

<p><a href="https://lobste.rs/s/us078z/bye_bye_perspective_api_lessons_for">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/09/02 13:52

# 构建与治理测量基础设施的经验教训  
来源:https://arxiv.org/html/2604.25580  

## 再见 Perspective API:构建与治理测量基础设施的经验教训  

Manuel Tonneau | 机构:魏岑鲍姆研究所 | 机构:牛津大学  
Angelie Kraft | 机构:魏岑鲍姆研究所  
LK Seiling | 机构:魏岑鲍姆研究所  
Dimitri Staufer | 机构:柏林工业大学  
Pieter Delobelle | 机构:鲁汶大学 | 机构:Pleias  
Jan Fillies | 机构:柏林自由大学  
Anna Ricarda Luther | 机构:不来梅大学 | 机构:ifib研究所  
Jan Batzner | 机构:魏岑鲍姆研究所 | 机构:慕尼黑工业大学 | 机构:慕尼黑机器学习中心  
Mareike Lisker | 机构:柏林HTW | 机构:汉堡大学  
通讯作者:[[email protected]](mailto:[email protected])  

###### 摘要  
perspective API 将于2026年底关闭,这移除了毒性的事实标准测量工具,暴露了研究者对其无法控制的工具的依赖。基于此案例,我们认为一个研究领域必须构建并治理自身的测量基础设施,而非借用外部工具。通过调查241篇使用或研究 perspective 的论文,我们揭示了依赖该工具给研究界带来的代价:结论超出工具支持范围、模型静默重新训练后结果发生漂移、研究者能测量却无法解释差异。这些缺陷在大型语言模型生命周期中被放大——perspective 提供标签、过滤语料库、并为基于此训练的系统打分,导致错误被强化而非纠正。为使该工具在关闭后仍可被研究,我们发布了来自77个数据集的590万条文本片段的 perspective 评分。我们进一步提出领域自有测量基础设施的十项需求,并论证阻碍此类基础设施建设的并非技术能力,而是领域对基础设施工作的价值认知。  

†††这些作者贡献均等。  

![图1: Perspective API在研究中的应用方式——既作为评估对象,也作为测量工具](https://arxiv.org/html/2604.25580/extracted/5983840/fig_01.png)  
*图1:Perspective API在研究中的应用方式——既作为评估对象,也作为测量工具。该图展示了本文批判的实施与供给中的选择:①输入评分基于孤立句子,剥离了发送者、目标与对话上下文。②黑箱模型对模型更新与标注不透明。③输出包含六种属性,但下游工作仅保留毒性分数,并在临时阈值下将其二值化。④研究应用涵盖检测模型评估、计算社会科学(CSS)研究、大型语言模型(LLM)开发与评估,涉及构念不匹配、有偏过滤与循环评估等问题。第3节(https://arxiv.org/html/2604.25580#S3)和第4节(https://arxiv.org/html/2604.25580#S4)将详细展开这些点及其对研究质量的影响。*  

## 1 引言  
网络滥用可能产生深远的现实影响,包括压制边缘群体声音、损害心理健康以及对边缘群体的暴力(Marques, 2023 (https://arxiv.org/html/2604.25580#bib.bib67);Luther等, 2025 (https://arxiv.org/html/2604.25580#bib.bib7))。研究界以大规模自动分类器应对这一问题(Vidgen与Derczynski, 2020 (https://arxiv.org/html/2604.25580#bib.bib81))。其中一款工具尤为关键:由Google Jigsaw开发的 perspective API。自2017年以来,它提供免费、可扩展的API,用于对毒性(即有害内容的总称)进行分类,现被广泛称为“学术界研究网络滥用与粗俗言论的基础”(Nogara等, 2025 (https://arxiv.org/html/2604.25580#bib.bib19))。尽管广受欢迎,Jigsaw近期宣布 perspective API 将于2026年底停止运营,理由是“随着AI能力演进,我们将聚焦新挑战”(Jigsaw, 2026 (https://arxiv.org/html/2604.25580#bib.bib13))。对于以该工具为核心建立工作的社群而言,停服突然撤除了关键基础设施,暴露出该领域对私有、外部控制测量工具的依赖之深。  

本文以 perspective API 为例,论证一个研究领域必须构建并治理其依赖的测量基础设施。我们分析了 perspective API 十年发展历程及其给研究界带来的代价:结论超出工具验证范围、结果无法跨时期比较、偏见无法解释。由此,我们总结了领域自有测量基础设施的经验教训,涵盖构念定义到工作资助等方面。  

我们做出四项贡献:  
首先,我们对241篇使用或研究 perspective 的论文进行了系统文献综述,追踪其在仇恨言论检测、计算社会科学(CSS)、以及大型语言模型(LLM)开发与评估中的应用,分析其被采纳的动因(§2 (https://arxiv.org/html/2604.25580#S2))。  
其次,依据测量验证的标准程序,我们表明 perspective 从未适合其扮演的核心角色(§3 (https://arxiv.org/html/2604.25580#S3)),且当同一工具同时过滤预训练数据与评估由此构建的模型时,这些缺陷会进一步叠加(§4 (https://arxiv.org/html/2604.25580#S4))。  
第三,基于这些缺陷,我们提出五项技术需求与五项治理需求(T1–T5, G1–G5),其中大部分适用于任何测量基础设施,并据此评估现有替代方案(§5 (https://arxiv.org/html/2604.25580#S5))。  
第四,我们发布了77个数据集中590万条文本片段的 perspective 评分,使该工具在关闭后仍可被研究(§5 (https://arxiv.org/html/2604.25580#S5))。  
最后,我们探讨为何未出现替代方案,以及领域需做出何种改变才能构建此类基础设施(§6 (https://arxiv.org/html/2604.25580#S6))。  

## 2 Perspective API 及其研究采用情况  
### 2.1 研究应用  
在学术研究中,perspective 被两类社群以两种不同方式采用(图1 (https://arxiv.org/html/2604.25580#S0.F1)):作为评估对象与作为测量工具。为衡量其应用程度,我们对使用 perspective 的研究进行了系统文献检索(详见附录B (https://arxiv.org/html/2604.25580#A2))。共找到241篇论文,其中18篇为元批判性研究,其余223篇按用法分类:基线模型、CSS测量、预训练过滤或LLM评估。  

#### Perspective 作为基线模型  
在毒性与仇恨言论检测研究中,perspective 主要被视为待评估的系统(n=83)。例如,Pavlopoulos等(2019)(https://arxiv.org/html/2604.25580#bib.bib11)将 perspective 作为 SemEval-2019 冒犯性语言任务的基线进行评估。此类评估衡量的是与基准标签的一致性。若基准编码了不同构念(如冒犯性语言或仇恨言论),结果仅反映 perspective 与该构念的追踪程度,而非毒性测量的质量;若基准编码的是毒性,其标签通常源自生成 perspective 训练数据的同一标注方案,因此一致性证明的是对该方案的遵循度,而非对该方案所编码构念的支持。两者均未确立 Jigsaw 毒性构念的效度。  

#### Perspective 作为测量工具  
相比之下,CSS及LLM开发与评估研究主要使用 perspective API 作为大规模测量毒性的工具。在CSS中,研究者将其应用于大规模在线话语研究(n=50,例如 Theocharis等, 2020 (https://arxiv.org/html/2604.25580#bib.bib5);Kim等, 2021 (https://arxiv.org/html/2604.25580#bib.bib4);Chang等, 2023 (https://arxiv.org/html/2604.25580#bib.bib6);Frimer等, 2023 (https://arxiv.org/html/2604.25580#bib.bib3);Mosleh等, 2024 (https://arxiv.org/html/2604.25580#bib.bib68);Gervais等, 2025 (https://arxiv.org/html/2604.25580#bib.bib9))。在LLM开发中,perspective 被用于过滤预训练数据,即从用于训练与对齐LLM的语料库中移除被标记为有毒的文本(n=29,例如 Welbl等, 2021 (https://arxiv.org/html/2604.25580#bib.bib14))。在LLM评估(基准测试、审计与红队测试)中,perspective 被集成到评估操作化流程中,用于标记模型输出,并在红队测试中标记潜在冒犯性输入(n=61,例如 Gehman等, 2020 (https://arxiv.org/html/2604.25580#bib.bib8);Liu等, 2021 (https://arxiv.org/html/2604.25580#bib.bib16);Lee等, 2023 (https://arxiv.org/html/2604.25580#bib.bib20);Liang等, 2023 (https://arxiv.org/html/2604.25580#bib.bib17))。在这三种用法中,perspective 并非研究对象,而是产生研究发现的工具。因此,无论工具捕获或遗漏什么,都会进入已发表的成果,无论是关于话语的主张还是安全评分。  

### 2.2 采用动因  
在高峰期,perspective 每日处理5亿请求(Jigsaw, 2021 (https://arxiv.org/html/2604.25580#bib.bib59)),并被集成到《纽约时报》、Vox Media和OpenWeb等大型出版商的评论系统中(Jigsaw, 2021 (https://arxiv.org/html/2604.25580#bib.bib59);Rieder与Skop, 2021 (https://arxiv.org/html/2604.25580#bib.bib2)),同时在学术研究中被广泛采纳(Horta Ribeiro, 2024 (https://arxiv.org/html/2604.25580#bib.bib1))。下文我们探讨促成这种广泛采用的因素。  

#### 时机  
Perspective 于2017年推出之际,正值网络滥用激增,包括高调的骚扰活动(Massanari, 2017 (https://arxiv.org/html/2604.25580#bib.bib168))、阴谋论叙事传播(Venturini, 2019 (https://arxiv.org/html/2604.25580#bib.bib50))、跨族裔暴力与种族灭绝(Mozur, 2018 (https://arxiv.org/html/2604.25580#bib.bib51)),以及网络政治极端主义动员(Ganesh与Bright, 2020 (https://arxiv.org/html/2604.25580#bib.bib52))。监管机构作出回应:德国于2017年通过的《网络执行法》(NetzDG)要求平台移除明显非法内容。这将审核负担从用户转移至平台,后者转向集中化且日益自动化的系统(Gillespie, 2018 (https://arxiv.org/html/2604.25580#bib.bib104);Gorwa, 2019 (https://arxiv.org/html/2604.25580#bib.bib47);Gorwa等, 2020 (https://arxiv.org/html/2604.25580#bib.bib49))。这也推动了学术界对自动仇恨言论检测的研究(Waseem与Hovy, 2016 (https://arxiv.org/html/2604.25580#bib.bib83))。因此,perspective 出现在监管压力与新兴研究领域的交汇点,为人工作审核无法触及的领域提供了规模化解决方案(Davidson等, 2017 (https://arxiv.org/html/2604.25580#bib.bib58);Gorwa等, 2020 (https://arxiv.org/html/2604.25580#bib.bib49))。  

#### 成本与可及性  
Perspective API 在其运营的十年间完全免费,而竞争工具如亚马逊的 Rekognition 则按分析图像收费(Amazon Web Services, 2026 (https://arxiv.org/html/2604.25580#bib.bib167))。访问通过向 Jigsaw 申请获得,但接受标准始终不透明(Rieder与Skop, 2021 (https://arxiv.org/html/2604.25580#bib.bib2))。该API提供100毫秒的响应时间,并可申请扩展配额,使大规模研究得以零成本实现。其覆盖18种语言、基于3800万条记录训练的特性(Lees等, 2022 (https://arxiv.org/html/2604.25580#bib.bib18)),进一步促进了英语以外语言的研究(Tonneau等, 2024 (https://arxiv.org/html/2604.25580#bib.bib84))。  

#### 易用性、透明度与性能  
Perspective 接受单句输入且无需预处理,返回可解释的标量分数,降低了其在研究与生产环境中集成的门槛。Jigsaw 提供了模型卡片、阈值指南及部分架构文档(Jigsaw, 2022 (https://arxiv.org/html/2604.25580#bib.bib56)),这种透明度在商业API中并不常见(Hartmann等, 2025b (https://arxiv.org/html/2604.25580#bib.bib12))。该团队还通过出版物、基准数据集(Dixon等, 2018 (https://arxiv.org/html/2604.25580#bib.bib24);Lees等, 2022 (https://arxiv.org/html/2604.25580#bib.bib18))及回应研究者反馈(Jigsaw, 2023 (https://arxiv.org/html/2604.25580#bib.bib57))与学术界保持互动。尽管文档并不完整(如下一节详述),这使 perspective API 成为相对透明且深度融入研究的私有工具。Perspective 在真实世界评估中也优于学术界的仇恨言论模型,尽管其绝对性能并不理想(Tonneau等, 2025 (https://arxiv.org/html/2604.25580#bib.bib21))。  

#### 机构信誉  
机构支持也推动了采用。Perspective 来自 Google 子公司 Jigsaw,并源于与 Wikimedia 的合作(Wulczyn等, 2017 (https://arxiv.org/html/2604.25580#bib.bib106)),这两个机构的声誉赋予该工具可信度。Jigsaw 还提供了该领域后续研究使用的语料库与公开竞赛(Jigsaw与Conversation AI, 2021 (https://arxiv.org/html/2604.25580#bib.bib108))。外部验证随之而来:同样享有声誉的《纽约时报》采用了基于 Jigsaw 构建的审核工具(Google, 2018 (https://arxiv.org/html/2604.25580#bib.bib107))。正是这种机构分量使得 perspective 在验证前就具备了可信度,这也可能是尽管存在§3 (https://arxiv.org/html/2604.25580#S3)记载的偏见,采用仍持续的原因。  

#### 路径依赖与网络效应  
正如 Star(1999)(https://arxiv.org/html/2604.25580#bib.bib48)所论证的,工具通过嵌入实践而成为基础设施。一旦在领域内普及,测量工具就会塑造可测量、可比较和可信的内容,从而产生路径依赖(Bowker与Star, 1999 (https://arxiv.org/html/2604.25580#bib.bib42))。Perspective API 正是这种动态的例证:它被集成到 RealToxicityPrompts(Gehman等, 2020 (https://arxiv.org/html/2604.25580#bib.bib8))和 HELM(Liang等, 2023 (https://arxiv.org/html/2604.25580#bib.bib17))等基准测试套件中,并用于CSS研究中的政治粗俗言论与网络骚扰(Theocharis等, 2020 (https://arxiv.org/html/2604.25580#bib.bib5);Gervais等, 2025 (https://arxiv.org/html/2604.25580#bib.bib9)),使其成为跨研究情境的共同参照点。这种标准化促进了研究间的可比性,进而鼓励持续使用,形成了符合网络效应的自我强化动态(Katz与Shapiro, 1994 (https://arxiv.org/html/2604.25580#bib.bib77))。在这个意义上,Perspective API 被采纳并非必然因其最具效度或性能最优,而是因为它已成为既定的参照点,随时间推移实际上定位为毒性检测的事实标准。  

## 3 Perspective API 是否曾真正适用?——测量开发与基础设施批判  
通过路径依赖与网络效应成为标准,与被验证为标准,并非同一回事。本节通过比较 perspective API 的开发与社会科学中既定的测量验证程序(Clark与Watson, 2019 (https://arxiv.org/html/2604.25580#bib.bib82);Jacobs与Wallach, 2021 (https://arxiv.org/html/2604.25580#bib.bib78)),评估其是否适合在研究中扮演的核心角色。

相似文章

关于语言模型安全性和滥用的经验教训

OpenAI Blog

OpenAI 分享了在语言模型安全性和滥用方面吸取的经验教训,讨论了衡量风险的挑战、现有基准的局限性,以及他们开发的新型毒性和政策违规评估指标。该文章还强调了对劳动力市场影响的担忧,以及继续研究大规模AI部署社会影响测量的必要性。

量化基于LLM的公共话语立场分析中的不稳定来源

arXiv cs.CL

本文提出一个诊断框架,用于在基于LLM的公共话语立场分析中分离预处理流程不稳定性和测量方法不稳定性,发现跨方法的不一致性比流程效应更大且更具系统性,并且聚合指标可能会掩盖这些不稳定性。