ARGUS: 使用Wi-Fi遥测数据的可扩展注意力引导Transformer人员识别系统

arXiv cs.LG 论文

摘要

ARGUS是一个被动式Wi-Fi感知系统,它利用注意力引导的Transformer从信道状态信息中识别人员,无需附加设备,在降低计算成本的同时实现了高精度。

arXiv:2608.14670v1 公告类型:新 摘要:被动式、无设备人员识别为基于摄像头和可穿戴设备的生物识别提供了替代方案,但现有的无线方法主要依赖步态或活动线索,且很少在大规模上进行评估。本文提出\emph{Argus},一个被动式Wi-Fi感知系统,它利用商用信道状态信息(CSI)进行人员识别,无需附加设备或指定动作。Argus将短时间的CSI数据转换为紧凑的\emph{统计图}:基于给定设备上可用的信道视图构建的统计图。然后,一个轻量级的仅解码器Transformer将粗略的统计图像素作为标记读取,并通过段级对数几率聚合随时间结合证据。在一个154名受试者的CSI数据集上,使用严格的物理分割进行评估,Argus在6秒窗口内达到$78.88\% \pm 1.62\%$的Top-1准确率,在聚合60秒段上的19个重叠窗口后达到$84.85\% \pm 1.31\%$;Top-3和Top-5分别达到$98.61\%$和$99.26\%$。对于60秒的统计图,Argus比原始CSI Transformer基线提高了7.75个百分点,同时每个窗口使用$4.4\times$更少的FLOPs。注意力引导压缩仅使用一半的EHealth补丁即可保持完整的单窗口准确率。在WiMANS上,一个跨三个房间和两个Wi-Fi频段的多用户基准测试中,Argus平均保持在最强每配置基线的1.23个百分点内,同时使用$27\times$更少的推理FLOPs。这些结果表明,紧凑的CSI统计信息可以扩展被动识别,同时揭示了在开放集拒绝和跨房间传输中的部署限制。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:24

# ARGUS:基于注意力引导的Transformer的可扩展Wi-Fi遥测人员识别系统
来源:https://arxiv.org/html/2608.14670
###### 摘要

无源、无需设备的人员识别为基于摄像头和可穿戴设备的生物识别提供了一种替代方案,但现有的无线方法主要依赖步态或活动特征,且很少进行大规模评估。本文介绍了*Argus*,一个无源Wi-Fi感知系统,它能够利用商品级信道状态信息(CSI)识别人员,无需附加设备或规定动作。Argus将短时CSI片段转换为紧凑的*统计图*:基于给定设备上可用信道视图构建的统计映射。一个轻量级的仅解码器Transformer将粗糙的统计图块作为标记读取,段级逻辑聚合则在时间段上合并证据。在一个采用严格物理段划分的154名被试CSI数据集上评估,Argus在6秒窗口上实现了78.88%±1.62%的Top-1准确率,并在60秒段上聚合19个重叠窗口后达到84.85%±1.31%;Top-3和Top-5分别达到98.61%和99.26%。对于60秒的统计图,Argus相比原始CSI Transformer基线提升了7.75个百分点,同时每个窗口的FLOPs减少了4.4倍。注意力引导的压缩仅使用一半的EHealth块即可保持完整的单窗口准确率。在WiMANS(一个跨越三个房间和两个Wi-Fi频段的多用户基准测试)上,Argus平均仅比每个配置的最强基线低1.23个百分点,同时推理FLOPs减少了27倍。这些结果表明,紧凑的CSI统计量可以扩展无源识别的应用规模,同时也揭示了在开放集拒绝和跨房间迁移方面的部署限制。

## 引言

准确高效的身份识别对于门禁控制、个性化服务和关键任务应用至关重要。密码和密钥可能被共享或窃取,而基于摄像头的面部和步态识别会引发隐私问题,并且仍然容易受到欺骗、环境条件、遮挡、视角和传感器放置的影响(Schroff et al.2015;Denget al.2019;Tolosanaet al.2020;Sepas\-Moghaddam and Etemad2023)。这些局限性推动了低成本、非接触式识别方法的发展,这些方法无需摄像头或可穿戴设备即可运行。

使用商品级Wi-Fi的遥测数据提供了一种有前景的低成本替代方案,因为Wi-Fi在家庭、办公室和公共空间无处不在。特别是,Wi-Fi的信道状态信息(CSI)描述了无线信号在环境中传播时的变化,捕捉了受人体影响的衰减、反射和相位变化。

然而,基于CSI的识别仍然具有挑战性。原始CSI流噪声大、维度高,并且带有同步引入的相位偏移(Diaz et al.2023),使用前必须进行校准。它们还会随房间几何形状、硬件和设备放置而变化,这是一个领域偏移问题,CrossSense(Zhang et al.2018)等跨域系统明确解决了这个问题。大多数现有系统还依赖于步态或其他刻意运动,如WiWho(Zeng et al.2016)和NeuralWave(Pokkunuru et al.2018),而针对静止受试者的Transformer方法迄今主要在小规模队列上进行评估(Avola et al.2025;Weiet al.2025)。此外,仅凭闭集准确率并不能全面反映系统性能。一个实用的识别系统应该能够揭示哪些信号成分有助于其决策,支持计算高效的推理,并暴露由不熟悉用户(Scheirer et al.2013)或感知环境变化引起的故障。相关工作部分详细阐述了这些局限性以及为解决它们而提出的方法。

我们介绍了*Argus*,一个基于Wi-Fi CSI遥测的无源人员识别系统。Argus接受一小段原始CSI数据窗口,并将其转换为一个紧凑的摘要映射,称为统计图。统计图保持了无线信号的不同特征,如幅度和相位,并使用均值、标准差、百分位数和能量等统计量来总结每个视图随时间和子载波的变化(附录表4)。一个仅解码器Transformer将粗糙的统计图块作为标记进行处理,并从最终序列表示中预测身份。

我们使用两个不同的CSI数据集评估了Argus:(1) 154名参与者的EHealth CSI数据集(Galdino et al.2023)和(2) WiMANS数据集(Huanget al.2024),这是一个公开基准,包含在多个环境中收集的多用户Wi-Fi感知数据。我们的评估解决了三个问题。首先,在防止相邻窗口之间信息泄露的受试者分层划分下,统计图是否支持大规模队列识别?其次,统计图的哪些区域包含身份相关信息?可以在不显著降低准确率的情况下移除表示的多少部分?第三,基于统计图的设计是否超越了单人闭集识别,扩展到在房间配置和Wi-Fi频段变化下的多用户识别?我们的贡献如下:

- •我们详细介绍了*Argus*的设计和架构,并对其流程进行了彻底评估。我们表明,在154名被试的EHealth数据集上,Argus在6秒窗口上的Top-1准确率为78.88%±1.62%,当比较60秒段时提升至84.85%±1.31%,Top-5达到99.26%。
- •我们证明,紧凑的表示比仅仅扩展原始时间上下文更重要。在匹配的60秒证据下,Argus相比原始CSI Transformer基线提升了7.75个百分点,同时每个窗口的FLOPs减少了4.4倍。
- •我们引入了仅用于验证的注意力遮挡排序方法,用于CSI统计图。保留8个EHealth块中的前4个即可保持完整的单窗口准确率,而保留15个WiMANS块中的10个平均仅损失0.7个百分点。
- •我们评估了部署限制,而不是将闭集准确率视为足够。相邻ID分析揭示了结构化的残余误差,开放集拒绝保持中等水平,WiMANS跨房间实验表明,即使少样本混合训练有帮助,零样本迁移仍然较弱。

## 相关工作

基于CSI的人员识别。传统的生物识别系统,如基于视觉的识别和雷达,虽然准确率高,但受限于视线要求、隐私问题或需要专用硬件(Schroff et al.2015;Wanget al.2024;Vandersmissenet al.2018;Buyukakkaslaret al.2024)。基于雷达的识别通过分析射频反射来避免对照明的依赖,大多数框架利用行走时肢体运动产生的微多普勒特征(Vandersmissenet al.2018)。高分辨率毫米波雷达甚至能分辨呼吸和心跳尺度的位移,为静止受试者提供非接触式生物识别,但这些系统仍然需要专用的传感硬件和特定的雷达部署几何结构(Buyukakkaslaret al.2024)。商品级Wi-Fi CSI通过捕捉由人体存在引起的多径幅度和相位变化提供了一种无源替代方案(Maet al.2019)。最初的CSI识别系统使用特征工程分类器,后来的系统采用CNN、LSTM和其他深度模型进行身份分类(Ding et al.2020;Pokkunuru et al.2018;Wei et al.2025)。这些系统表明CSI携带生物特征信息,但许多系统依赖于显著的由步态或活动引起的信道变化(Zeng et al.2016;Pokkunuru et al.2018)。这限制了它们在静止识别中的适用性,而在这种情况下可用的信号要弱得多。

在房间和人员规模上扩展Wi-Fi识别也很困难。最近的研究探索了跨域感知和少样本身份相似性学习,以提高领域适应性(Zhang et al.2018;Wang et al.2025)。这些方法很重要,因为Wi-Fi信道与房间紧密相关。然而,依赖大肢体运动仍然是一个局限性。专门的射频研究表明,即使人在静止时,生理微运动也能扰动无线信道(Adib et al.2015;Kocheta et al.2025)。Argus的动机正是基于这一观察:信号可能很弱,但如果表示是紧凑、稳定的,并且在大规模下进行评估,它就可以变得可用。

Transformer与可解释性。CSI处理已转向Transformer架构,因为它们可以建模长期时间依赖性并结合幅度和相位扰动(Li et al.2021;Quyet al.2025)。最近的双分支Transformer处理CSI幅度和相位,用于从静止个体进行人员识别(Avola et al.2025),但大多局限于小规模队列。当前的识别研究继续将规模、环境偏移和开放集识别视为未解决的问题(Chenet al.2023;Wei et al.2025)。同时,剪枝和架构优化方法表明,大型注意力模型通常可以在不损失太多准确性的情况下进行缩减(Michel et al.2019;Kwon et al.2022;Youm and Go 2025)。注意力机制也提供了一种检查哪些信号区域影响决策的方法(Abnar and Zuidema 2020;Xu et al.2022)。Argus通过使用注意力引导的遮挡对统计图块进行排序,然后测试这些块是否可以作为压缩输入保留,从而结合了这些思想。

## Argus

Argus是一个用于从CSI流进行无源识别的通用流程。该方法不假设特定数量的无线电、天线、信道仓或注册用户。相反,它仅假设录音可以表示为时间有序的CSI测量流,并且每个测量可以转换为一个或多个信道视图,例如幅度、校准后的相位或复数CSI的其他稳定函数。

**图1:Argus系统架构。**### 统计图表示

原始CSI数据包流包含异常值、包级抖动、依赖硬件的缩放以及冗余的高频变化。因此,直接对每个数据包进行建模会给模型提供许多标记,但并不能保证稳定的生物特征表示。Argus将短时CSI片段转换为*统计图*。假设一个窗口包含复数CSI:

$H \in \mathbb{C}^{T \times K}$,其中$T$个数据包和$K$个子载波。对于实值矩阵$X$,定义鲁棒归一化:

$\rho(X) = \frac{X - \operatorname{median}(X)}{\max(\operatorname{IQR}(X), \epsilon)}$,

其中中位数和四分位距在整个窗口上计算,$\epsilon=10^{-4}$。令$g_W(\cdot)$将相邻子载波平均成$W$个分组的仓。在EHealth实现中,幅度视图是:

$A = g_W \left( \rho( \log(1 + \|H\|) ) \right)$。

对于相位,Argus沿子载波轴展开并移除逐包端点线,

$\hat{\Phi}_{t,k} = \operatorname{unwrap}_{k}(\angle H_{t,k}), \quad a_t = \frac{\hat{\Phi}_{t,K} - \hat{\Phi}_{t,1}}{K-1}$,
$\Phi_{t,k} = \hat{\Phi}_{t,k} - \bigl( a_t(k-1) + \hat{\Phi}_{t,1} \bigr), \quad P = g_W(\rho(\Phi))$。

这种线性相位去趋势遵循常见的CSI观察,即测量的相位包含与同步相关的偏移,这些偏移大致与子载波索引呈线性关系(Diaz et al.2023)。相位差分视图是分组相位的一阶时间差:

$D_{t,w} = P_{t,w} - P_{t-1,w}, \quad D_{1,w} = 0$。

对于每个视图$X^{(v)} \in \{A, P, D\}$,Argus对每个分组仓随时间应用统计行$s_r$,因此:

$S_{v,r,w} = s_r \left( X^{(v)}_{1:T,w} \right)$。

频率行使用减去时间平均值后的时间实FFT功率,丢弃直流仓,并将剩余的仓分成低、中、高三部分。附录表4列举了这些统计行。这些统计量被堆叠成一个形式为$S \in \mathbb{R}^{C \times R \times W}$的张量,其中$C$是可用视图的数量,$R$是统计行的数量,$W$是由捕获几何结构在分组或对齐后诱导的宽度。重要的是,$C$、$R$和$W$是实现选择,而不是方法的假设。不同的无线电或任务可以改变统计图形状,同时保持相同的学习流程。

### 块Transformer

统计图被分割成粗糙的矩形块。每个块被展平并线性投影成一个标记。一个可学习的CLS标记被放置在序列末尾,并由一个轻量级的仅解码器Transformer进行处理。由于CLS标记在最后,因果注意力仍然允许它关注每个统计图块。最终的CLS嵌入被传递到为该任务选择的输出头:对于闭集单人识别是softmax头,对于多用户识别是独立的二进制逻辑输出。

这个设计故意做得很小。目标不是构建一个在原始数据包上的大型序列模型,而是使输入足够稳定,以便短标记序列就足够了。段级推理然后平均来自同一物理录音的重叠窗口的逻辑输出:

$\hat{y} = \arg\max_{y} \frac{1}{T} \sum_{t=1}^{T} z_t(y)$,

其中$z_t(y)$是窗口$t$中身份$y$的逻辑输出。

相似文章

面向设备上机器学习的全传感器智能眼镜平台

arXiv cs.LG

本文介绍了ARGO,一个面向设备上机器学习的智能眼镜平台,该平台集成了多模态传感器套件和优化的YOLOv11模型,用于实时城市障碍物识别,实现了隐私保护的本地处理,具有低延迟和2.483 MB的内存占用。