审计预测性铅服务线路分类记录与物理验证:纽约州全州研究
摘要
纽约州全州范围的一项研究,对铅服务线路分类的预测模型进行了物理验证审计,发现模型决定存在显著差异和潜在问题。
arXiv:2608.19922v1 公告类型:新
摘要:根据美国《铅铜规则修订》,公用事业公司可以使用预测模型而非检查来确定服务线路的材料。纽约州按地址公布所使用的方法。几乎没有地址同时包含模型分类和物理验证,因此检查是在公用事业公司内部的群体之间进行,而不是配对地址。我们筛选了所有153个纽约地区,这些地区至少以这种方式分类了100个地址。七十五个(49%),覆盖125,990个地址或筛选地址的57%,记录了一个值。零方差本身并不意味着不当行为:75个中有68个与自身的验证匹配或样本量太小无法测试。七个被自身的工作人员矛盾,六个超出了任何抽样解释的范围。五个是纽约市的行政区,它们作为一个系统提交;一个是East Rochester,距离550公里。纽约市是最大的案例:预测模型是43,215个地址的记录基础,在所有地址上,记录的材料都是“已知其他”。该市在121,779个地址上记录“未知”,其中1,880个已经挖掘,铅在120,692个地址上。在模型类别中,两个计数都是零,速率的95%上限为0.0085%。在纽约的其他地区,相同的方法在176,888个地址中的12.21%记录了铅或“未知但可能是铅”的对冲,我们报告了这种比较的弱点。模型清除的群体更年轻,中位建造年份为1984年对比1930年,建造时期约占差距的三分之一,其余不是:固定时期后,基于记录的分类发现铅在4.3-31.9%,物理验证在1.5-14.5%,模型在任何时期都没有。六个时期感知的估计器将预期的铅线路放置在1,150-1,450之间。两个发现不需要比较:7,782个这些地址位于1940年前的建筑中,归档的2025年快照显示公共侧决定是从客户侧模型输出复制的。
查看缓存全文
缓存时间: 2026/08/21 10:30
# 审计记录的预测性服务管线材料分类与物理验证对比:纽约州的一项全州研究 来源:https://arxiv.org/html/2608.19922 Muhammad Sarmad Sohail 致谢:ORCID 0009-0008-2776-5253。数据、代码及复现说明见第10节(https://arxiv.org/html/2608.19922#S10)。 所属机构:独立研究者 ###### 摘要 根据美国《铅和铜规则修订》,供水机构可以通过统计或预测模型确定服务管线的材料,而非进行物理检查。纽约州按地址公布了所采用的方法,这使得模型输出能够与同一机构在相同地点执行的物理验证结果进行审计对比。几乎没有任何地址同时包含两者,因此本文的比较对象始终是同一机构内部的两个群体,而非同一地址的预测结果与开挖结果。 我们筛选了所有153个纽约州地区单位(该文件发布的最精细报告单元),这些地区通过该方法对至少100个地址进行了分类。其中75个地区(49%)覆盖了125,990个地址,占模型分类管线的57%,仅记录了一个不同的材料值。零方差本身并不构成违规,我们亦未如此认定:75个地区中有68个与其自身的物理验证结果一致,或物理验证数据过少无法核查。七个地区与其自身工作人员的验证结果相矛盾,其中六个地区的矛盾无法用抽样解释。五个是纽约市的行政区,作为一个水务系统提交文件;另一个是东罗切斯特,一个相距550公里、完全无关的水务系统,却完全复现了这一模式。 纽约市是最大的案例。预测模型记录了43,215个地址的依据,而所有这些地址的记录材料均为单一值:“Known Other”(已知非铅),即州模板中用于表示已知非铅状态但未指明具体材料的管线术语。该市有其他值可用且频繁使用:在121,779个地址上使用“Unknown”(未知),其中1,880个地址已开挖确认;并在120,692个地址上使用“lead”(铅)。在模型类别中,这两个计数均为零,从43,215个地址中零事件得出的95%置信区间上限为0.0085%。在纽约州其他地区,相同方法记录了“lead”或含糊其辞的“Unknown, but could be lead”(未知,但可能是铅),占176,888个地址的12.21%。我们报告这一对比及其两个弱点:其中93%的明确铅值集中于一个城市——波基普西(Poughkeepsie),该市未进行任何物理验证;而那个含糊的值是纽约市从未在任何方法中使用过的。城市内部的对比不依赖于这两者。 模型清除的群体确实更新,其中位建造年份为1984年,而对照组为1930年;通过与纽约市MapPLUTO数据的空间连接显示,建筑年代差异解释了约三分之一的差距,但无法解释其余部分。在控制建筑年代后,基于记录的分类(同样是一种桌面方法,应用于532,906个地址)在每个年代都发现了铅,比率为4.3%至31.9%。物理验证在每个年代也发现了铅,比率为1.5%至14.5%。预测模型则在所有年代中均未发现铅。三个方法族中的六个年代感知估计器表明,模型清除地址中预期的铅质公共侧管线数量约为1,150至1,150条。 两个发现无需比较群体。纽约州自身的指南允许在记录显示1986年后建造的建筑中使用“Known Other”;但其中7,782个地址位于1940年前建造的建筑中,且所有地址的安装日期字段均为空。此外,存档的2025年快照显示当时公共侧判定尚不存在:它是通过复制客户侧模型输出创建的,该输出针对的是不同所有者、不同管道。 ## 1 引言 《铅和铜规则修订》要求每个美国社区供水系统在2024年10月前公布其服务管线清单。当供水机构不知道管线材料时,该规则允许使用统计或预测方法替代开挖,商业市场也围绕该许可发展起来。供水机构购买这些模型是因为开挖每条管线的成本高出几个数量级。 模型是否有效的问题问得不够频繁,这有结构性原因:最有条件验证模型的主体是销售模型的供应商,而购买模型的供水机构没有动机资助一项可能使其已提交清单无效的检查。 #### 声明的范围。 清单记录的是供水机构提交的内容,而非模型的产出。因此,我们未点名任何供应商,未对任何供应商的模型提出主张,也未报告任何准确性数字。一个没有变化的输出可能对应一个置信但错误的模型;对应一个将不确定预测发送给施工队并仅记录模型在清除管线上的结果的工作流程;对应一个在提交前丢弃不确定性的报告管道。我们审计的是公开记录,以及它是否符合州在文件中使用这些值所附加的条件。第5节(https://arxiv.org/html/2608.19922#S5)回顾了这三种解读,并在数据允许时相互检验。我们有两个发现无需比较群体和估计器,它们也是我们将首先为之辩护的:第5节(https://arxiv.org/html/2608.19922#S5)中的1940年前子组和第3节(https://arxiv.org/html/2608.19922#S3)中的存档快照。 #### 此前针对开挖的验证:弗林特。 存在一项研究。Goovaerts [4 (https://arxiv.org/html/2608.19922#bib.bib4)] 用26,750次开挖(覆盖弗林特市约一半的纳税地块)验证了2017年的一个地理空间模型,报告称铜和镀锌材料的AUC为0.9,但铅仅为0.6,几乎不优于随机猜测;仅在将克里金法替换为成分变体后才提高到0.8。 这并未终结问题。弗林特是一座城市,且自2016年以来是世界上研究最密集的水务系统 [2 (https://arxiv.org/html/2608.19922#bib.bib2), 1 (https://arxiv.org/html/2608.19922#bib.bib1)]。在那里验证的模型比《铅和铜规则修订》早七年,不属于现在合规市场销售的商业产品,且由正在被验证模型的作者进行检查。更重要的是,对于我们接下来要讨论的内容,我们记录的失败模式在本质上有所不同。在弗林特,模型有时尝试预测“铅”但效果不佳。而在这里,跨使用该模型的一半水务系统,记录输出根本没有任何变化。 #### 贡献。 1. 1\. 对零输出方差的筛选,作为对纽约已发布文件的单次聚合运行,应用于所有153个使用模型对至少100个地址进行分类的地区单位(第4节 https://arxiv.org/html/2608.19922#S4)。我们分两阶段报告,因为零方差仅标记问题,矛盾才能确认问题。 2. 2\. 一个独立复现:东罗切斯特在另一个水务系统、地区和规模等级上复现了纽约市的模式。 3. 3\. 对最大案例的衡量依据是该州自身的书面标准,而非我们的判断(第2节 https://arxiv.org/html/2608.19922#S2 和第5节 https://arxiv.org/html/2608.19922#S5)。 4. 4\. 使用从纽约市MapPLUTO连接的建筑年代,将模型应用于较新住房存量所解释的差距部分与未被解释的部分分离,并报告了11个残差估计器的覆盖和校准(第5节 https://arxiv.org/html/2608.19922#S5)。 5. 5\. 一个基于公开协变量的开放基线,报告了区分能力作为训练数据和测试数据分离距离的函数(第6节 https://arxiv.org/html/2608.19922#S6)。 6. 6\. 源文件中的五个解析和语义陷阱,其中一个将纽约市的表观规模放大了两倍(第3节 https://arxiv.org/html/2608.19922#S3)。 ## 2 监管要求到底是什么 纽约州对水务系统的指导 [8 (https://arxiv.org/html/2608.19922#bib.bib8)] 设定了本文其余部分衡量的标准。三个条款很重要。 #### 模型输出并非推定可接受。 关于预测模型是否可以在未经物理验证的情况下使管线“已知”,该指南指出:“模型的输出通常需要物理验证,因为任何模型或统计分析都存在固有不准确之处。但是,在个案基础上,部分模型和统计分析结果将被接受无需物理验证。您必须向州提供足够信息,以评估足够的物理验证是多少。”在系统必须提供的信息中,该指南列出了“随机物理验证过程,例如拟将进行物理验证的SL数量”和“模型的置信区间”。 #### 规则包含一个反馈循环。 该指南总结道:“请注意,州关于所需物理验证率的初步确定可根据物理确认结果的准确性进行修订。”所需的验证率旨在响应开挖所发现的情况。 #### 词汇区分了“非铅”和“可能是铅”。 系统从八个值中选择材料:Lead including lead-lined galvanized(包括内衬铅的镀锌管)、Copper(铜)、Galvanized(镀锌)、Plastic(塑料)、Known Other(已知非铅)、Unknown but could be lead(未知但可能是铅)、Unknown but unlikely lead(未知但不太可能是铅)和Unknown(未知)。八个值中有三个是明确的未知,其中一个表示管线可能是铅。“Known Other”与具名材料并列,并在州模板中将该管线映射为非铅;它断言已知的非铅状态,但未指明材料。该指南允许系统持有“书面记录显示整个配水系统在1986年6月之后建造”且客户拥有的部分同样在铅禁令后建造的情况下,使用此值替代实际材料。 因此,我们并非在询问模型是否准确(此数据无法回答的问题)。我们在询问提交的内容是否符合州写下的标准。 ## 3 数据 #### 来源与快照。 纽约州铅服务管线清单 [9 (https://arxiv.org/html/2608.19922#bib.bib9)] 是一个公开的Socrata数据集。我们使用两个捕获版本:T1,2026-08-11,4,618,115行;T0,2025-06-22,3,747,025行,从互联网档案馆检索。两者均通过SHA-256固定在 [9 (https://arxiv.org/html/2608.19922#bib.bib9)];实时数据集会移动,因此校验和而非端点才是参考。行数解析后与API自身计数完全一致。 #### 陷阱1:行不是管线。 T1的4,618,115行解析为3,744,223个唯一的地区–街道–邮编键。多余部分集中分布:每个纽约市行政区的行数/地址比率为2.001,而超过5,000行的其他地区该比率均不超过1.14。纽约市每个地址提交两行,一行包含公共侧列,另一行仅包含客户侧列。 #### 陷阱2:公共侧是从客户侧复制的,且我们可以确定时间。 在公共侧行中,公共验证方法在100.0%的行上等于客户方法,五种方法构成完美的对角线;公共材料在100.0%的行上等于客户材料。存档快照确定了方向。在T0时,纽约市的817,375个地址各出现一次,且**所有地址的公共侧列均为空白**:其43,440个模型分类仅存在于客户侧。14个月后,相同地址在公共侧也携带了相同的值。公共侧判定并非独立做出;它是从为客户管道产生的模型输出创建的,而根据《铅和铜规则修订》,该管道是另一条所有权不同的管道。 #### 陷阱3:读取材料,而非类别。 地址级别的类别字段折叠为四类《铅和铜规则修订》类别,并在纽约市外报告两侧中较差的一侧:9,625个地址的公共材料确定非铅,但铅类别是由客户侧驱动的。在纽约市内,两者完全一致,原因见陷阱2。此处所有结果均直接读取“Current Public Side SL Material”(当前公共侧服务管线材料)。 #### 陷阱4:方法和材料字段是自由文本。 地区字符串区分大小写,纽约市行政区以代码QN、BK、SI、BX、MN出现:对“Queens”的字面筛选在全州仅返回11行。模型方法以“Statistical Analysis/Predictive Model”形式出现219,899次,另有四种不同拼写形式出现4,603次。第4节(https://arxiv.org/html/2608.19922#S4)的筛选方法广泛匹配,因为限定单一拼写将是读者无法核查的选择。第5节(https://arxiv.org/html/2608.19922#S5)中纽约州其他地区的比较仅使用规范拼写,并报告该选择带来的成本:广泛匹配将引用的比率从176,888个地址的12.21%变为181,065个地址的11.93%。这些额外拼写均未出现在纽约市,因此纽约市的任何数字都不依赖于该选择。 #### 陷阱5:发布的列描述错位了一位。 在数据集自身的元数据中,附在“Current Public Side SL Material”上的描述实际上描述了下一列,且错误已传播。指导文件 [8 (https://arxiv.org/html/2608.19922#bib.bib8)](而非门户元数据)是字段含义的权威依据。 #### 工作群体与外部连接。 纽约市贡献了817,375个地址;我们剔除了3,121个无可解析坐标的地址和343个(0.042%)落在城市宽松边界框之外的地址,剩余813,911个。在模型分类地址中,分别有198个和24个地址因此方式被剔除,且所有43,437个地址在任何排除前均携带“Known Other”,因此没有任何排除会移除铅值。在每个纽约市类别中,建造日期填充率为0.0%,因此我们将每个地址与其最近的MapPLUTO纳税地块 [7 (https://arxiv.org/html/2608.19922#bib.bib7)] 进行连接:检索到的858,602个地块全部成功,95.4%具有可用的建造年份,中位匹配距离为23.4米,99.97%位于100米上限内。 ## 4 全州范围零输出方差筛查 图1:每个拥有至少100个模型分类地址的纽约水务系统(153个系统,221,090个地址)。纵轴是这些分类中记录为铅或“Unknown but could be lead”(未知但可能是铅)的比例。位于底轴的空心标记是模型输出仅取单一值的系统;红色菱形是其中被同一系统自身物理验证所否定的子集。该字段的完整范围正在使用中:波基普西在7,189个地址中记录铅的比例为81.9%,德威特在2,033个地址中使用含糊表述的比例为97.0%。筛查是一次聚合:对于每个地区,其预测模型输出取多少个不同的材料值,而该地区自身的物理验证发现了什么? 在153个地区中,75个(49%)记录恰好一个不同的值,覆盖125,990个地址,占所有筛查的模型分类管线的57.0%。这个数字本身证明不了任何事情。一个服务真正无铅住房存量的系统**应该**返回一个值,而且大多数系统是可辩护的:75个中的68个物理验证也基本未发现铅,或物理验证数据过少无法核查。零方差是标记;矛盾才是确认。 七个地区未能通过第二阶段,该阶段预先定义为至少有200条物理验证管线且其中至少1%为铅(表1 https://arxiv.org/html/2608.19922#S4.T1)。其中五个是纽约市的行政区。 #### 单位是地区,而非水务系统。 服务管线地区是文件发布的最精细地理单元,我们以此进行筛查。它不是被监管实体:纽约州卫生部将五个行政区列在一个公共水务系统下,即纽约市供水系统NY7003493 [10 (https://arxiv.org/html/2608.19922#bib.bib10)。
相似文章
审计挑战:健康大型语言模型输出的变异性
本文发现,基于API和聊天机器人界面等访问模式,大型语言模型在健康建议输出上存在系统性差异,这削弱了评估的有效性。它呼吁模型提供商启用对消费者体验的忠实复制,以进行严格审计。
从NHANES调查数据(2011-2018)分类冠心病风险,并进行全面数据泄露审计和校准检查[P]
一个分析NHANES调查数据以分类冠心病风险的项目,强调数据泄露审计和校准检查,同时比较机器学习模型。
针对代理标签信用风险预测中监督漂移的决策支持审计协议
本文提出了一种设计科学审计协议,用于检测代理标签信用风险预测模型中的监督漂移,并在LendingClub数据上测试了多信号诊断方法。
基于多传感器物理危害评估的大语言模型基准测试
该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。
通道中的天花板:审计临床预测中的学习者差距与测量前沿
本文引入了一个框架,用于审计临床预测模型,通过区分学习者效率低下和测量限制,并在多个队列上进行验证,以指导是改进模型还是数据收集。