经验证的适应方案用于大规模集会空中人群监控:部署协议、严重程度法则及无标签无人机人群计数的诊断工具,面向2034年FIFA世界杯(沙特阿拉伯)

arXiv cs.AI 论文

摘要

本文提出了一种经验证的适应协议,用于无标签无人机人群计数,以确保在诸如2034年沙特阿拉伯FIFA世界杯等大规模活动中的安全性,解决了领域偏移和部署挑战。

arXiv:2608.17625v1 公告类型:新 摘要:沙特阿拉伯将举办2034年FIFA世界杯,并已运营Hajj规模的人群管理。基于无人机的计数必须在与训练语料库完全不同的录像上保持准确性,无需标签,并在拥挤形成前警告危险流入。我们提供了一个经验证的解决方案,基于525次受控运行、全分辨率语料库研究、五次证伪消融和五条件安全互锁评估。无标签适应在四个损坏和五个严重程度中恢复了31-49%的偏移引起的误差,最强方法比冻结源提高了41.8 MAE(95% CI [34.1, 49.6], p=7.5x10^-10, d=2.52)。我们建立了一个严重程度法则,将具有恒定绝对裕度的方法与裕度增长的方法分开,并建立了一个稳定性预算,以识别哪些配置可以安全飞行。在携带真实+48 MAE空中差距的全分辨率语料库上(源重新训练到14.6验证MAE,提高了34%),适应修复了密集场景的低估计数,否则会低估形成的拥挤,而基于流量的风险模块在6个完整片段中的2个上对真实拥堵事件触发。我们定位了可恢复的误差:在一个设计用于支持基于物理的守恒先验的机制中(300帧片段,间隔200毫秒,比标准宽五倍),适应信号是由归一化驱动的,而不是流动驱动的;连续性残差对领域偏移产生的比例计数误差不变,通过四次开/关消融确认,相关系数r=0.999,40%输入损坏仅使精度移动0.05 MAE。无标签偏移门显示偏移幅度和精度损伤是秩无关的(Spearman rho=0.20;在真实偏移中rho=-0.60),量化了幅度门放弃的58%余量。我们建立了无条件适应与尾部监测作为策略,最后以六点协议收尾。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:08

# 面向大规模人群集会的空中人群监测验证性适配:部署协议、严重度定律与无标签无人机人群计数诊断——迈向2034年国际足联世界杯(沙特阿拉伯)
来源:https://arxiv.org/html/2608.17625
AlJawharh AlOtaibi*Jude AlSubaie*所属单位:alanoud@daldata\.ai, aljawharh@daldata\.ai, jude@daldata\.ai所属单位:沙特阿拉伯利雅得

###### 摘要

沙特阿拉伯将举办2034年国际足联世界杯,并已具备朝觐规模的人群管理经验。针对此类场地的无人机计数必须处理训练数据集中从未见过的影像,无需标签即可保持精度,并且必须在踩踏事件发生前对危险的人流涌入发出预警。我们通过525次受控运行、一项全分辨率语料库研究、五项证伪消融实验以及一项针对安全联锁的五条件评估,提供了一个经过验证的解决方案,并解决了部署决策所依赖的三个关键问题。我们验证了适配阶段的有效性。无标签适配具有决定性作用,并在条件恶化时依然有效:它在四种破坏和五个严重度等级下恢复了31-49%的领域偏移引起的误差,其中最强的单一方法相比冻结的源模型获得了41.8mae(平均绝对误差)的提升(95% CI [34.1,49.6],p=7.5×10^{-10},d=2.52)。我们建立了一项*严重度定律*,区分了绝对保护裕度恒定的方法与裕度增长的方法,并提出了一个稳定性预算以识别哪种配置可以安全飞行。在一项全分辨率语料库研究中,该研究包含真实存在的+48mae的空中差距(在将源模型重新训练至14.6验证mae,即34%的改进后达到),适配修复了密集场景下的漏计问题,否则这将导致监控系统低估正在形成的拥挤态势,并且基于通量的风险模块在6个完整长度的目标片段中有2个实时捕捉到了真实的拥堵事件。我们定位了可恢复误差的来源。我们构建了符合物理信息守恒先验要求的实验环境(300帧片段,间隔200毫秒,比标准情况宽五倍,因此帧间存在真实运动),并确定此任务中的适配信号源于归一化而非光流:连续性残差对于领域偏移实际产生的比例计数误差具有可证明的不变性,这一结果通过四个开关消融实验(相关性r=0.999)以及一项使精度变化0.05mae的40%输入破坏得到证实。这告诉从业者应将适配能力用于何处以及不应用于何处。我们推导出了最优部署策略。通过评估无标签偏移门控作为决策策略,我们表明偏移幅度与精度损失是等级无关的(Spearman ρ=0.20;在真实偏移中ρ=-0.60),量化了基于幅度的门控放弃了58%的可用裕度,并确立了“无条件适配配合尾部监控”作为有证据支持的策略。我们以一份六点协议和下一个构建版本的验收标准作为结束。

## 1引言

人群灾难首先是监控失败,其次才是人群控制失败。在几乎每一场现代体育场和朝觐悲剧中,危险的密度积聚在有人采取行动之前已经持续了数分钟。2034年沙特阿拉伯举办的国际足联世界杯,以及该国每年管理的朝觐集会,将把大量人群置于正是这种积聚形成的条件之下。一个能够从空中监视这些人群并在仍有时间干预时发出警报的系统,将解决现有手动监控处理不佳的问题。

无人机搭载的摄像头是自然的传感器选择,而基于航拍视频的人群计数在估算密度方面在原则上已是一项成熟的技术。但在实际接触真实活动时它就失效了。在一个语料库上训练的计数模型,一旦影像在高度、照明、光学或传输质量上有所不同,其精度就会立即下降,而活动影像总是有所不同。更糟糕的是,在活动进行时不存在地面真实计数来修正模型。它必须完全不使用标签来适应输入流。无标签测试时适配,即从测试流本身的自监督目标更新模型,是唯一实用的响应方式[2,1]。

这种设定引出了一个具体且有吸引力的想法。在两个连续帧之间,一个区域内的人数变化只能通过跨越其边界来实现:人员是守恒的。如果计数网络的密度预测与光流测量的运动不一致,那么这种不一致就是网络可以无需标签来纠正的误差。相同的量——人员跨越一条线的通量——也是拥堵的自然预警信号。因此,单一物理定律可能同时提供部署所需的适配信号和安全信号。本文探讨它是否确实如此。

我们构建了我们的想法所暗示的流水线:一个CSRNet密度回归器[7]在测试时根据由RAFT光流[8]计算的人口守恒损失进行适配,并根据安全部署实际施加的要求进行评估。这些要求比单一基准平均值更为严格。集成商必须知道流水线的哪些部分承载着精度,随着条件恶化到危险所在的尾部时这种益处如何变化,系统在其最差运行而非平均运行下的表现如何,以及它是否能够自行决定何时需要适配。我们在DroneCrowd[9]数据集上对每个问题进行了回答,使用受控破坏和全分辨率迁移研究,采用配对统计、效应量和霍尔姆校正,以及两个旨在暴露某个无贡献组件的消融实验。由于守恒先验在帧间隔较短时预计最弱,我们也赋予了其偏好的环境:使用完整语料库进行全分辨率重新训练(验证mae 22.3→14.6),帧采样间距比默认值大五倍。

我们的发现如下:
1. 适配是有效的,且其益处可预测。它在参考严重度下恢复了40-46%的偏移引起的误差,在五级严重度扫描中恢复了30-49%(第5节)。
2. 益处不会随着破坏加剧而退化;我们报告了每种方法的严重度定律,并在组合方法中识别出一个稳定性成本,其最差运行出现在低严重度下(第5节)。
3. 在全分辨率迁移中,适配消除了主导源误差的密集场景漏计问题,并且通量指标在真实拥堵事件上触发(第6节,第9节)。
4. 守恒先验在我们测试的任何条件下(包括为它构建的宽间距环境)都未能改进熵最小化。我们用不变性论证解释了这一点,并将可恢复误差定位到归一化统计量(第7节)。
5. 无标签偏移分数作为门控适配的基础效果不佳,因为其幅度并不能反映偏移造成的精度损失;因此我们建议采用无条件适配配合对最差运行尾部的监控(第8节,第10节)。

## 2相关工作

#### 测试时适配。

在没有标签的情况下使模型适应测试流,已收敛到以归一化层作为干预点。AdaBN[1]在目标数据上重新计算批归一化统计量,无需梯度步;TENT[2]添加了一个单一目标,即通过BN仿射参数最小化预测熵,同时所有卷积权重保持冻结。面向鲁棒性的后续工作——针对误差累积的CoTTA[3]、通过样本选择和抗遗忘的EATA[4]以及通过感知锐度更新的SAR[5],还有无梯度的LAME[6],都继承了这种冻结骨干、以归一化为中心的设计。这种共享设计正是使该方法家族成为我们问题正确背景的原因:由于容量被限制在相同的小参数空间中,任何物理先验带来的优势都必须在那里显现,否则无处显现。我们与AdaBN和TENT进行基准比较,并将鲁棒变体定位为下一个比较对象(第10节)。

#### 人群计数。

使用空洞卷积进行密度图回归,如CSRNet[7],仍然是处理拥挤场景的标准方法,我们直接采用它,因此我们的研究结果关注的是适配目标而非新架构。DroneCrowd[9]是整个研究的语料库;其规模、高度范围和密集的空中视角对我们所针对的大规模集会场景具有代表性。VisDrone[10]定义了相邻的航拍基准,我们明确表示未在其上报告任何结果:我们将DroneCrowd→VisDrone命名为该协议旨在推进的外部有效性里程碑(第10节)。

#### 物理信息先验。

物理信息学习[11]使用一个其输出必须满足的定律来监督网络,并在该定律真正约束解的地方取得成功。人口守恒是计数的自然实例:利用RAFT[8]的位移场,区域内计数的变化必须等于跨越其边界的通量。我们对此计划的贡献是一个明确的否定性表征:连续性残差在何种精确条件下对计数携带梯度,以及在实际发生的偏移下使其失效的不变性(第7节)。因为论证是在残差而非架构层面表述的,所以它适用于任何被相同先验诱惑的密度回归任务。

#### 偏移检测。

无标签分布偏移检测[12]已经发展成熟,但安全联锁施加的要求比文献通常要求的更强:分数必须在*偏移造成了多少精度损失*上单调,而非仅仅在*是否发生偏移*上。我们表明在这些任务中它们是不同的量,并且幅度分数无论其偏移检测能力多强,都是门控适配的错误基础(第8节)。

## 3方法

### 3.1骨干网络与适配家族

我们基于CSRNet密度回归器[7]构建,将每帧映射为密度图$D_t(x)$,其在区域$\Omega$上的积分即为预测计数$C_t(\Omega) = \int_\Omega D_t dx$。遵循TENT[2]的完全测试时协议,仅在测试流上更新批归一化参数;所有卷积权重保持冻结。固定除目标外的所有内容可确保每次比较仅隔离损失而非模型容量的差异。我们比较五种配置:Source(冻结,无适配)、AdaBN(测试流BN统计量)、TENT(熵最小化)、Ours(仅守恒残差)以及TENT+Ours(两个目标结合)。

### 3.2人口守恒先验

人员在相邻帧之间既不会被创造也不会被消灭,因此区域内的计数只能通过跨越其边界的运动来改变。在$\Omega$内没有源或汇的情况下,
$$\frac{\partial}{\partial t}\int_{\Omega} D_t\,dx\;+\;\oint_{\partial\Omega} D_t\,\mathbf{v}_t\cdot\mathbf{n}\,d\ell\;=\;0,$$
其中$\mathbf{v}_t$是帧$t$和$t+1$之间的逐像素位移场,由冻结的预训练RAFT网络[8]估计。写成散度形式并在像素网格上离散化,得到逐像素连续性残差
$$r_t = D_{t+1} - D_t + \nabla \cdot (D_t \mathbf{v}_t),$$
其平方幅度$\mathcal{L}_{\mathrm{phys}} = \|r_t\|_2^2$我们单独最小化或添加到熵目标中,$\mathcal{L} = \mathcal{L}_{\mathrm{ent}} + \lambda \mathcal{L}_{\mathrm{phys}}$。当预测遵守该定律时,两项相消;任何不平衡都是候选的无标签误差信号,第7节将精确确定它能看到和不能看到的误差。

### 3.3基于通量的风险指标

方程(1)中的边界积分产生的副产品是向内通量信号$\Phi_t(\Omega) = -\oint_{\partial\Omega} D_t\,\mathbf{v}_t\cdot\mathbf{n}\,d\ell$:一个区域如果人员流入速度快于流出速度,在变得危险密集之前会记录到持续的正$\Phi_t$。我们使用$\Phi_t$作为*相对*拥堵开始指标,这是其当前具有操作实用性的形式。将其表达为绝对踩踏阈值需要以人/$\mathrm{m}^2$为单位的密度,因此需要到地面平面的米/像素尺度;第9节将该标定指定为绝对模式的验收标准。

### 3.4偏移门控安全措施

适配在推理时修改模型,因此一个成熟的系统应该能够无需标签来决定是否进行干预。我们设计了一个门控,比较输入流的批归一化统计量与从干净数据缓存的统计量,产生一个标量偏移分数$s$,并仅在$s > \tau$时进行适配,其中$\tau = 2s_{\mathrm{clean}}$。第8节将其作为决策策略进行评估,将其提供的结果与每个替代策略本应提供的结果进行比较,这是部署决策所需的形式。

## 4实验协议

表1:三个实验轨道。所有适配都是无标签的,仅更新BN参数。基础模型已明确说明,因为轨道B使用更强的重新训练源模型,并且两个误差尺度在全文中分别报告。#### 轨道A:受控破坏基准。

我们在一个无人机人群计数流上评估CSRNet,包含$n=750$帧。为了将鲁棒性与场景变异性隔离,我们固定场景内容并应用四种合成破坏,模拟航拍捕获的文档化故障模式:加性高斯噪声(传感器噪声)、运动模糊(平台和主体运动)、弱光(黄昏和夜间操作)以及JPEG压缩(带宽受限传输),每个都与干净参考进行比较。五种方法的基准在参考严重度下运行$5$条件$\times$

相似文章

足球迷们,你们正在被监视

Wired

2026年FIFA世界杯将大规模部署包括面部识别和反无人机系统在内的监控技术,引发了对可能被滥用于移民执法和侵犯隐私的担忧。

2026年世界杯美国赛区面部扫描机器人

Reddit r/ArtificialInteligence

本文探讨了在美国世界杯期间部署实时面部识别与生物特征监控来管理人群的提案,强调了公共安全与隐私权之间的争议。