RAG-HAR+:面向边缘部署的成本高效基于LLM的人体活动识别

arXiv cs.LG 论文

摘要

RAG-HAR+ 是RAG-HAR的一种检索优先、成本优化的扩展,用于从可穿戴传感器进行人体活动识别。它利用检索设计器代理和多数投票机制,在降低LLM使用量的同时保持准确率,并展示了边缘部署的可行性。

arXiv:2607.26631v1 公告类型:new 摘要:基于可穿戴传感器的人体活动识别(HAR)支持医疗保健、康复、健身追踪和智能环境等应用。然而,现有的深度学习方法需要针对特定数据集进行训练、大量标注语料库,以及反复适应新的传感器设置或活动分类。针对人体活动识别的检索增强生成(RAG-HAR)通过将HAR构建为无需训练、检索增强的任务来解决这一问题,其中使用传感器窗口的统计描述来检索相似的标注样本,以指导基于LLM的分类。我们引入了RAG-HAR+,这是一种检索优先且成本优化的扩展,它在加强检索的同时减少了对基于LLM的推理的依赖。RAG-HAR+使用离线检索设计器代理,从多样化的运动描述符池中设计特定于数据集的特征组,使传感器窗口能够使用与数据集特定活动模式更对齐的特征进行比较。在推理过程中,RAG-HAR+对有强检索证据的样本使用检索邻居的多数投票,仅将不确定的情况交给基于LLM的模糊性解决代理。在六个HAR基准测试中,RAG-HAR+在减少LLM使用、令牌消耗和推理时间的同时,保持了具有竞争力或更优的性能。我们进一步扩展了RAG-HAR移动原型,以展示在移动传感场景中检索优先、LLM辅助的HAR的实际可行性。
查看原文
查看缓存全文

缓存时间: 2026/07/30 10:00

# RAG-HAR+:面向边缘部署的高性价比大语言模型人类活动识别方法

来源:https://arxiv.org/html/2607.26631

Hansi Karunarathna, Nirhoshan Sivaroopan, Chamara Madarasingha, Anura Jayasumana, 和 Kanchana Thilakarathna

Hansi Karunarathna 和 Nirhoshan Sivaroopan 对本文贡献相同。Hansi Karunarathna、Nirhoshan Sivaroopan 和 Kanchana Thilakarathna 就职于澳大利亚悉尼大学。Chamara Madarasingha 就职于澳大利亚科廷大学。Anura Jayasumana 就职于美国科罗拉多州立大学。

###### 摘要

基于可穿戴传感器的人类活动识别(HAR)技术支撑着医疗保健、康复、健身追踪和智能环境等多种应用。然而,现有的深度学习方法需要针对特定数据集进行训练、依赖大规模标注语料库,并且需要反复适应新的传感器设置或活动分类体系。面向人类活动识别的检索增强生成方法(RAG-HAR)通过将HAR重构为一种免训练、检索增强的任务来解决这一问题——该方法利用传感器窗口的统计描述来检索相似标注样本,从而指导基于大语言模型(LLM)的分类。我们提出RAG-HAR+,一种以检索优先且成本优化的扩展方法,它在增强检索能力的同时减少了对LLM推理的依赖。RAG-HAR+使用离线的检索设计智能体(Retrieval Designer Agent)从多样化的运动描述特征池中设计出针对特定数据集的特征组,使得传感器窗口能够使用与数据集特定活动模式更匹配的特征进行比较。在推理阶段,RAG-HAR+对具有强检索证据的样本采用检索邻居的多数投票法,仅将不确定的案例交给基于LLM的歧义解析智能体(Ambiguity Resolver Agent)处理。在六个HAR基准测试中,RAG-HAR+在保持竞争力或更优性能的同时,显著减少了LLM调用次数、Token消耗量和推理时间。我们进一步扩展了RAG-HAR移动原型,以证明在以检索优先、LLM辅助的HAR在移动感知场景中的实际可行性。

## I. 引言

基于可穿戴和移动传感器数据的人类活动识别(HAR)技术为医疗保健、康复、健身追踪和工业流程监控等领域的持续监测、异常检测和个性化干预提供了基础[4 (https://arxiv.org/html/2607.26631#bib.bib2),19 (https://arxiv.org/html/2607.26631#bib.bib3),32 (https://arxiv.org/html/2607.26631#bib.bib13)]。由于这些应用需要在资源受限的可穿戴设备、智能手机和边缘网关上持续运行,HAR系统的实用价值不仅取决于识别精度,还取决于每次推理的计算成本、延迟和连接要求。

深度学习(DL)已成为HAR的主流范式,卷积、循环和基于注意力机制的模型在基准测试中取得了强劲的表现[31 (https://arxiv.org/html/2607.26631#bib.bib6),23 (https://arxiv.org/html/2607.26631#bib.bib7),5 (https://arxiv.org/html/2607.26631#bib.bib8)]。然而,基于深度学习的HAR依赖于针对特定数据集的训练流程和超参数调优,在不同受试者、放置位置和设备之间存在域偏移时性能会下降,并且需要大规模标注语料库,收集和标注成本高昂。因此,HAR领域仍然缺乏一种同时具备免训练、可泛化和可扩展特性的解决方案。

大语言模型(LLM)为学习提供了一条不同的路径。它们在广泛语料库上进行预训练,具备人类活动的语义知识、可能支持跨域泛化的强大模式匹配能力,以及针对上下文相关任务的推理能力。然而,原始的传感器数据流无法直接输入LLM,因为它们是连续的多通道时间序列,而LLM处理的是分词后的文本,长时间窗口的时间序列会很快耗尽上下文预算。LLM还缺乏活动特定知识(传感器放置位置、活动定义以及容易混淆的动作示例)的支撑,而这些对于准确预测至关重要。

检索增强生成(RAG)通过将模型建立在具体的标注证据上来解决这两个问题。我们之前的工作RAG-HAR[26 (https://arxiv.org/html/2607.26631#bib.bib1)]将这一思想应用于HAR:它使用多段视图统计量描述每个传感器窗口,将这些描述索引到向量数据库中,检索语义上相似的标注样本,并使用检索到的上下文指导基于LLM的分类,从而在无需训练或微调数据集特定模型的情况下识别活动。这种检索增强的框架对于免训练、可扩展的HAR很有吸引力,但其当前的时间序列分析实现存在两个限制,在持续边缘部署场景中尤为突出。

首先,检索表示是固定的:预定义的时间视图总是用相同的基本统计量(均值、最大值、最小值、标准差、第25百分位数、第75百分位数、中位数)来描述,假设单一的段级表示足以适用于所有活动和数据集。实际上,不同的动作需要不同的检索线索(例如,运动更适合用周期性和频率内容来表征,姿态更适合用信号幅度和方向来表征,短暂的工业手势更适合用强度、形状或局部运动变化来表征),因此固定的时间视图、基本统计量的描述符可能会遗漏最具判别力的证据。

其次,LLM被调用处理每个测试样本。在典型的部署中,感知在可穿戴设备或手机上运行,而LLM托管在云端并通过网络访问,因此每次预测都会产生一次网络往返和随提示长度增长的延迟。检索增强的提示已经很大了,包含查询描述以及多个检索到的样本及其摘要。结果就是持续的Token成本、不确定的延迟以及对网络的刚性依赖——即使是那些检索邻居已经对确定性答案达成一致的窗口,也需要付出这些成本。对于在流式数据上无限重复的推理而言,这种每个样本都依赖在线LLM的模式,而非准确性,成为了部署的主要障碍。

本文提出RAG-HAR+,一种以检索为中心且成本优化的高效边缘HAR框架。其核心思想是改变LLM的使用时机和地点。LLM不再扮演在线分类器、被每个样本调用,而是被前置到流程中,作为一次性离线阶段来设计更强的检索表示,仅在在线阶段作为对少量模糊窗口的歧义解析智能体保留。在离线阶段,结合数据集上下文、候选特征描述和检索反馈,离线检索设计智能体从广泛的特征池中(包括统计、时域、频域和信号形状描述符)选择紧凑的特征组;这些特征组被索引为独立的向量字段,用于多向量检索,使检索表示能够适应每个数据集的活动特征。离线检索设计阶段的好处体现在在线推理过程中。通过生成信息更丰富、与查询活动更匹配的检索上下文,系统可以直接通过对检索邻居进行多数投票来分类大多数窗口。因此,歧义解析智能体仅在检索证据模糊时被调用。在线计算成本因而随预测难度而非测试样本数量而变化。离线设计成本对每个数据集仅产生一次,并分摊到所有后续推理中,从而在保持框架免训练特性的同时,大幅降低了部署成本和延迟。

本文的主要贡献如下:
- • 我们将检索增强HAR中的LLM使用重构为两阶段过程:一次性离线检索优化阶段(LLM设计数据集特定特征组)和在线歧义解析智能体(仅当检索邻居无法提供明确的多数投票预测时调用LLM)。因此,在线推理成本随预测歧义性而非测试样本数量而变化。
- • 我们提出一种迭代的、LLM引导的检索设计智能体,利用数据集上下文和检索反馈,从统计、时域、频域和信号形状特征中构建紧凑的多向量检索组,取代固定的段级统计组。
- • 我们实现了一个基于智能手机的原型,将RAG-HAR+作为活动识别组件嵌入移动健身应用中,展示了设备端延迟以及以检索优先、LLM辅助的HAR在移动边缘场景中的实际可部署性。
- • 我们提供了在六个HAR基准上的扩展评估,并通过消融实验分离了检索设计智能体和歧义解析智能体不同组件的贡献。RAG-HAR+在四个数据集上提升了性能,在另外两个数据集上保持了竞争力,同时大幅减少了89.3%-99.9%的在线LLM使用量,量化了精度-成本-延迟之间的权衡。

## II. 相关工作

### II-A. 用于HAR的大语言模型

LLM近来已被探索用于时间序列分析和基于传感器的推理[9 (https://arxiv.org/html/2607.26631#bib.bib22),7 (https://arxiv.org/html/2607.26631#bib.bib23),14 (https://arxiv.org/html/2607.26631#bib.bib24)],这使得它们对HAR具有吸引力——在HAR中,底层传感器模式必须映射到高级活动。近期方法通过不同形式的适配连接传感器数据和LLM:SensorLLM使用通道特定Token和任务感知调优[20 (https://arxiv.org/html/2607.26631#bib.bib15)],LLM4HAR结合了传感器适配和效率模块[11 (https://arxiv.org/html/2607.26631#bib.bib25)],PH-LLM在专家案例研究和可穿戴数据上微调LLM以用于个性化指导[18 (https://arxiv.org/html/2607.26631#bib.bib26)]。其他工作将学习的传感器编码器与LLM推理相结合,例如使用基于SimCLR的表示来比较测试和参考样本[16 (https://arxiv.org/html/2607.26631#bib.bib27)],并将LLM扩展到相关的感知任务,包括用户识别和活动事件描述[6 (https://arxiv.org/html/2607.26631#bib.bib37),30 (https://arxiv.org/html/2607.26631#bib.bib28)]。虽然这些研究显示了LLM在传感器推理方面的潜力,但它们需要微调、任务特定适配或学习的编码器,这降低了免训练的优势,并限制了对新传感器配置或活动分类体系的适应性。诸如HARGPT等直接提示方法避免了训练,但在细粒度活动和更高维度的传感器输入上性能会下降[13 (https://arxiv.org/html/2607.26631#bib.bib29)]。这些局限性促使将基于LLM的HAR建立在目标感知环境中的相关标注样本之上。

### II-B. 检索增强的HAR

RAG通过检索相关样本或文档,并将其作为上下文提供给LLM进行预测,从而将LLM推理建立在外部证据之上。在HAR中,这允许将查询传感器窗口与目标数据集中相似的标注活动窗口进行比较,为LLM提供其必须区分的运动模式的具体示例。我们之前的工作RAG-HAR[26 (https://arxiv.org/html/2607.26631#bib.bib1)]介绍了一种免训练的检索增强框架,该框架计算传感器窗口的轻量级统计描述符,从向量数据库中检索相似的标注样本,并使用检索到的上下文进行基于LLM的活动分类。然而,RAG-HAR依赖于固定的段级统计视图进行检索,并调用LLM处理每个测试样本。RAG-HAR+通过改进检索和减少在线LLM使用来扩展这一研究方向。它不再使用固定的时间段视图和跨数据集相同的基本统计量,而是利用LLM引导的特征组选择,从更广泛的特征池中构建自适应检索表示。然后,它利用检索置信度直接通过邻居投票对清晰样本进行分类,仅将模糊样本路由到歧义解析智能体。因此,LLM从一个强制性的每个样本分类器转变为担任离线检索设计智能体和在线处理模糊情况的回退机制。

## III. 方法论

请参考图注

图1:RAG-HAR+ 概览。(a) 用于选择数据集特定特征组的离线检索设计智能体。(b) 特征索引和推理流程,其中训练样本被索引用于检索,测试样本通过多数投票或歧义解析智能体进行分类。

### III-A. RAG-HAR+ 概览

RAG-HAR+ 通过引入自适应检索表示和成本优化的推理策略扩展了 RAG-HAR。所提出的框架是免训练的。在本文中,“免训练”意味着 RAG-HAR+ 不会训练或微调用于活动分类的数据集特定深度学习模型。该框架仍然使用带标签的训练样本来构建检索索引,并使用验证集来选择特征组和检索权重,但这些步骤配置的是检索流程,而不是训练数据集特定的分类器或微调 LLM。RAG-HAR+ 使用轻量级数值特征向量来表示 HAR 窗口以进行检索,并且仅在需要 LLM 回退进行分类时,才将选定的窗口转换为结构化的特征描述。与 RAG-HAR (在预定义的时间段上使用相同的一组固定统计描述符并调用 LLM 处理每个测试样本)不同,RAG-HAR+ 让 LLM 扮演两个不同的角色。首先,检索设计智能体在离线状态下使用 LLM 为检索选择数据集特定的特征组。其次,歧义解析智能体在在线状态下使用 LLM 仅解决模糊的测试样本。图1 (https://arxiv.org/html/2607.26631#S3.F1) 总结了 RAG-HAR+ 的整体工作流程。如图1(a) 所示,LLM 首先在离线状态下被检索设计智能体用于选择数据集特定的特征组。从一个初始提示开始,智能体会提出三个候选特征组,这些特征组用于构建索引数据库并在验证集上进行评估。然后,验证反馈被用于构建下一轮的改进提示。经过多轮迭代后,表现最佳的特征组,记为 G1∗, G2∗ 和 G3∗,被选为最终特征组。图1(b) 展示了所选特征组在索引和推理过程中的使用方式。流程从数据预处理1开始,原始 HAR 传感器流被归一化并分割成固定大小的窗口。然后,对每个窗口的所有传感器通道计算从图1(a) 中选择的特征组2。得到的特征组向量被归一化并连同它们的活动标签一起存储在向量数据库中3。在测试阶段4,相同的预处理和特征组计算步骤应用于查询窗口。RAG-HAR+ 随后执行多向量搜索,重新排序检索到的样本,选择 Top-q 个邻居,并对它们的标签应用多数投票,这对应于步骤4.1–4.3。如果单个活动标签获得最高票数,则直接从检索结果预测活动4.4。如果两个或更多标签共享最高票数,则该样本被视为模糊样本,并被路由到歧义解析智能体4.5。

相似文章

RAGognizer:通过检测头集成实现幻觉感知微调

arXiv cs.CL

RAGognizer 提出了一种幻觉感知微调方法,该方法将轻量级检测头集成到大语言模型(LLMs)中,以实现语言建模与幻觉检测的联合优化,适用于 RAG 系统。论文介绍了 RAGognize,一个包含自然发生的闭域幻觉及其词元级标注的数据集,并展示了在降低幻觉率的同时,实现了最先进的幻觉检测性能,且不损害语言质量。

HKUDS/RAG-Anything

GitHub Trending (daily)

HKUDS 发布 RAG-Anything:基于 LightRAG 的开源一站式多模态检索增强生成框架。

ScalableRAG:零摄入成本的高质量RAG

arXiv cs.AI

本文介绍了ScalableRAG,一种检索增强生成方法,通过基于正则表达式的集合创建和聚合推理,在无需任何摄入成本(无需向量数据库或知识图谱)的情况下实现高准确率。它在多个数据集上优于基线方法,并提出了一个有限摄入变体以进一步提升准确率。