HB-PVI: 一个用于复杂活动识别的层次贝叶斯个性化与信息价值框架

arXiv cs.LG 论文

摘要

HB-PVI 是一个层次贝叶斯框架,通过平衡收益和成本来优化复杂活动识别中的个性化决策,展示了一种群体优先的部署策略可以在保持性能的同时减少标注成本。

arXiv:2609.05582v1 公告类型:新 摘要:个性化可以提高活动识别性能,但参与者特定的增益是异质的,且每个额外的校准标签都有获取成本。本研究提出了 HB-PVI,一个层次贝叶斯个性化与信息价值框架,共同建模参与者异质性、四种个性化机制的效益与危害,以及额外标签的经济价值,针对47名参与者的 MUSIC-CAR 复杂活动队列。一种防泄露的、留一法参与者评估结合了顺序蒙特卡洛参与者效应更新器、Student-$t$ 层次增益模型和一步样本信息期望值(EVSI)停止规则。适配器个性化产生了小的正平均 F1 增益,从一个标签的0.00099增长到十个标签的0.00198,而适配器加头和原型残差个性化平均为负。在主要实际效益阈值($\Delta_{\min}=0.01$)和成本设置下,一步 EVSI 在每个决策状态均为零,因此策略未购买任何标签,并为所有47名参与者保留群体推断,完全匹配始终停止(实际等效区域概率 $=1$)。相对于固定的十次适配器个性化,这将标注减少了100%,同时保持后验平均 F1 损失为0.00217(95% 可信区间,0.00048 到 0.00389),后验概率0.9992低于0.005容差。HB-PVI 在216个成本阈值设置中的199个为效用最优,并在所有等于或高于主要标签成本的设置中均最优。这些结果支持在个性化增益相对于标注、计算和危害成本较小时采用群体优先的部署策略,并表明信息价值推理,而非原始预测准确性,应驱动健康传感应用中的个性化决策。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:22

# HB-PVI:复杂活动识别的层次贝叶斯个性化与信息价值框架
来源:https://arxiv.org/html/2609.05582  
Hammed A\. Olayinkahttps://orcid.org/0000-0002-9796-5276††致谢:H\. A\. Olayinka任职于美国马萨诸塞州伍斯特市01609伍斯特理工学院数学科学系(电子邮箱:haolayinka@wpi\.edu)\.

###### 摘要

个性化可提升活动识别性能,但参与者特定收益存在异质性,且每增加一个校准标签都涉及采集成本。本研究提出HB-PVI框架,即一种层次贝叶斯个性化与信息价值框架,该框架联合建模参与者异质性、四种个性化机制的效益与损害,并计算额外标签的经济价值。研究基于包含47名参与者的MUSIC-CAR复杂活动队列数据。采用防泄漏的留一参与者外评估法,结合顺序蒙特卡洛参与者效应更新器、学生t层次增益模型和单步期望样本信息值(EVSI)停止规则。适配器个性化产生了较小的正向平均F1增益,从1个标签时的0.00099增长到10个标签时的0.00198,而联合适配器加分类头及原型残差个性化的平均结果为负值。在主要实际效益阈值(Δmin=0.01)和成本设定下,每个决策状态的单步EVSI恰好为零,因此策略对所有47名参与者均不采购标签并保持群体推断,与"始终停止"策略完全一致(实际等效区域概率=1)。相较于固定10次拍摄的适配器个性化,此方法在保持后验平均F1损失为0.00217(95%置信区间:0.00048至0.00389)、后验概率0.9992低于0.005容差的情况下,将标注量减少了100%。在216种成本阈值设定中,有199种情况下HB-PVI具有效用最优性,且在等于或高于主要标签成本的所有设定中均表现最优。这些结果表明,当个性化收益相对于标注、计算和损害成本较小时,应优先采用群体部署策略,并揭示了在健康传感应用中应基于信息价值推理而非原始预测精度来驱动个性化决策。

###### 索引术语:

自适应标签采集、决策分析、健康传感、人类活动识别、多标签分类、参与者异质性、不确定性量化。

## I引言

通过智能手机和可穿戴传感器被动监测复杂、具有健康指示性的日常生活活动(ADLs),为频繁、依赖评估者的临床评估提供了可扩展的替代方案\[1 (https://arxiv.org/html/2609.05582#bib.bib1)\]。可穿戴传感器人类活动识别(HAR)在过去十年中已显著成熟\[2 (https://arxiv.org/html/2609.05582#bib.bib22)\],然而与简单的移动活动不同,复杂活动(CAs)由顺序执行、同时进行或交错进行的简单活动组成\[3 (https://arxiv.org/html/2609.05582#bib.bib3)\],且同一复杂活动可由不同人以显著不同的方式执行\[4 (https://arxiv.org/html/2609.05582#bib.bib2)\]。因此,跨众多参与者训练的群体模型往往难以泛化到特定新用户\[1 (https://arxiv.org/html/2609.05582#bib.bib1)\],这推动了*个性化*:使用少量参与者特定标签适应群体模型。然而,个性化并非没有代价。在不具代表性或嘈杂的校准窗口上进行适应,可能会损害群体模型已经服务良好的参与者的性能\[1 (https://arxiv.org/html/2609.05582#bib.bib1)\],且每个校准标签都伴随着患者或临床医生时间的获取成本。因此,可部署的个性化策略必须为每个参与者在校准序列的每个时刻决定:*应用*哪种个性化机制(如果有的话),以及*是否*采购另一个标签。

此前对该队列的研究表明,具有固定6-shot用户适配器的个性化Transformer(P-HART)将平均F1从88.0%提升至92.6%,尽管个性化提升了47名参与者中41名的性能,但略微降低了其余6名原本非个性化性能就较高参与者的性能\[1 (https://arxiv.org/html/2609.05582#bib.bib1)\],且复杂活动识别本身比简单活动识别困难得多,在底层MUSIC-CAR数据集上的基线机器学习F1仅为58.8%\[4 (https://arxiv.org/html/2609.05582#bib.bib2)\]。这两项研究均未对个性化决策本身的参与者级不确定性建模,也未将额外校准标签的价值与其成本进行权衡。本文通过HB-PVI(带信息价值的层次贝叶斯个性化)解决这一空白:这是一个完全贝叶斯推断和决策层,以确定性交叉拟合的传感器表征为条件,其功能包括:(1)将群体和参与者不确定性传播到校准活动预测中;(2)建模四种个性化机制的参与者特定效益与损害分布;(3)选择最大化后验期望效用(扣除标注、计算和损害成本)的机制;(4)使用单步期望样本信息值(EVSI)规则\[5 (https://arxiv.org/html/2609.05582#bib.bib18),6 (https://arxiv.org/html/2609.05582#bib.bib21),7 (https://arxiv.org/html/2609.05582#bib.bib14)\]决定是否值得采集另一个标签。将个性化框架构建为顺序标签采购决策,而非一次性模型选择问题,使HB-PVI区别于优化预测准确性而不计适应数据成本的小样本学习和元学习方法\[8 (https://arxiv.org/html/2609.05582#bib.bib24)\]。

HB-PVI建立在大量贝叶斯和决策理论文献基础上。层次部分池化和正则化收缩先验\[9 (https://arxiv.org/html/2609.05582#bib.bib4),10 (https://arxiv.org/html/2609.05582#bib.bib12)\]允许参与者级效应在适度的47名参与者队列中借用信息;采用No-U-Turn采样器的哈密顿蒙特卡洛\[11 (https://arxiv.org/html/2609.05582#bib.bib5),12 (https://arxiv.org/html/2609.05582#bib.bib16),13 (https://arxiv.org/html/2609.05582#bib.bib17)\]提供渐近精确的后验推断,而非变分或拉普拉斯近似\[14 (https://arxiv.org/html/2609.05582#bib.bib10),15 (https://arxiv.org/html/2609.05582#bib.bib11)\];信息价值和贝叶斯实验设计理论\[5 (https://arxiv.org/html/2609.05582#bib.bib18),7 (https://arxiv.org/html/2609.05582#bib.bib14),16 (https://arxiv.org/html/2609.05582#bib.bib9),17 (https://arxiv.org/html/2609.05582#bib.bib15)\]形式化了何时停止收集标签,呼应了长期用于医疗决策和健康技术评估的期望完美/样本信息值(EVPI/EVSI)方法\[18 (https://arxiv.org/html/2609.05582#bib.bib28),19 (https://arxiv.org/html/2609.05582#bib.bib29)\],此处应用于个体参与者的校准序列层面而非群体水平试验设计。本研究使用实际等效区域(ROPE)框架\[20 (https://arxiv.org/html/2609.05582#bib.bib13)\]检验与更简单比较器的实际等效性,并采用应用贝叶斯工作流中标准的收敛和校准诊断方法\[21 (https://arxiv.org/html/2609.05582#bib.bib6),22 (https://arxiv.org/html/2609.05582#bib.bib7)\]。个性化机制(轻量级适配器、分类头微调及其组合)类似于应用于用于复杂活动识别的基于注意力的序列骨干网络的参数高效迁移学习\[23 (https://arxiv.org/html/2609.05582#bib.bib25),24 (https://arxiv.org/html/2609.05582#bib.bib23)\]\[25 (https://arxiv.org/html/2609.05582#bib.bib26),26 (https://arxiv.org/html/2609.05582#bib.bib27),1 (https://arxiv.org/html/2609.05582#bib.bib1)\]。

HB-PVI也与移动健康领域的即时自适应干预和上下文老虎机算法并列,后者根据个人当前上下文实时决定提供哪种干预\[27 (https://arxiv.org/html/2609.05582#bib.bib30),28 (https://arxiv.org/html/2609.05582#bib.bib31)\];这些文献通常将上下文视为免费,而HB-PVI则解决上游问题:上下文本身是否值得采购。

本研究的贡献在于:(i)一个完全贝叶斯个性化效益模型,报告了四种个性化机制有意义的效益与损害的校准参与者特定概率;(ii)一个经过验证的顺序蒙特卡洛参与者效应更新器,在逐个引入适应标签时,保持至少400个不同的群体后验祖先;(iii)一个单步EVSI停止规则,在216种实际效益阈值和成本组合的敏感性网格上进行评估,以确定个性化是否值得其价格;(iv)一个完整的47名参与者防泄漏评估,显示在主要成本下,进一步采购标签没有依据,且"群体优先"策略在完全消除校准标注的同时,将F1保持在主要容差范围内。

## II方法

### II-A队列、设计与泄漏控制

本研究使用MUSIC-CAR队列,包含47名执行顺序、同时和交错复杂ADL(九种活动标签,k=1,...,9k=1,\\dots,9)的参与者,数据来自腕部和口袋安装的智能手机传感器\[4 (https://arxiv.org/html/2609.05582#bib.bib2)\]。外部评估遵循留一参与者外逻辑:对于留出的参与者p⋆p^{\\star},所有表征训练、归一化和超参数选择均排除该参与者。窗口按前瞻性顺序排列为10个窗口的适应块、两个12窗口的保护间隔、一个128窗口的校准块和一个前瞻性测试块,因此在第n次拍摄时(n=0,...,10n=0,\\dots,10)的决策仅使用前n个采购的标签。由于相邻的60秒、5秒步长窗口重叠约92%,主要似然函数使用确定性的、标签盲的非重叠子样本以限制伪重复。

### II-B确定性表征与交叉拟合

采用九成员深度集成的P-HART风格骨干网络\[1 (https://arxiv.org/html/2609.05582#bib.bib1)\](一个带有双向GRU\[26 (https://arxiv.org/html/2609.05582#bib.bib27)\]时间头的注意力编码器\[25 (https://arxiv.org/html/2609.05582#bib.bib26)\]),仅在嵌套训练参与者上训练,并进行特定折的归一化和仅用于训练的主成分分析(PCA)。一个确定性成员提供qq维的池化表征zpi∈Rq\\mathbf{z}_{pi}\\in\\mathbb{R}^{q}(参与者pp,窗口ii),用于调节每个下游贝叶斯模型,因此一个单一、固定的潜在坐标系在所有分析中共享;其余成员仅用于计算进入模型II顺序状态(第II-D节)的预测不确定性摘要(互信息、熵、预测方差),而非作为近似后验。zpi\\mathbf{z}_{pi}下游的每个未知量都被赋予先验,并使用哈密顿蒙特卡洛/NUTS进行采样\[11 (https://arxiv.org/html/2609.05582#bib.bib5),13 (https://arxiv.org/html/2609.05582#bib.bib17),12 (https://arxiv.org/html/2609.05582#bib.bib16)\],因此在泄漏安全表征条件下的推断是完全贝叶斯的,无需变分或拉普拉斯近似\[14 (https://arxiv.org/html/2609.05582#bib.bib10),15 (https://arxiv.org/html/2609.05582#bib.bib11)\]。

### II-C模型I:层次多标签预测与顺序更新

对于参与者pp、窗口ii和活动kk,令ypik∈\{0,1\}y_{pik}\\in\\{0,1\\}表示观测标签。在表征zpi\\mathbf{z}_{pi}条件下,

ypik∼Bernoulli⁡(σ⁡(ηpik)), ηpik=αk+zpiTβk+bpk, y_{pik}\\sim\\mathrm{Bernoulli}(\\sigma(\\eta_{pik})), \\quad \\eta_{pik}=\\alpha_{k}+\\mathbf{z}_{pi}^{\\mathsf{T}}\\bm{\\beta}_{k}+b_{pk}, (1)

其中σ⁡(⋅)σ(⋅)是逻辑斯谛函数;αkα_{k}是活动特定截距;βk\\bm{\\beta}_{k}是活动特定表征系数向量;bpkb_{pk}是活动kk的参与者特定截距,跨活动收集为bp=(bp1,...,bp9)T\\mathbf{b}_{p}=(b_{p1},\\dots,b_{p9})^{\\mathsf{T}}。由于qq维表征相对于每折训练数据是高维的,βk\\bm{\\beta}_{k}的每个分量遵循正则化马蹄先验\[10 (https://arxiv.org/html/2609.05582#bib.bib12)\],具有活动特定的局部和全局收缩尺度以及0.5的有限板尺度(完整规范见补充部分S1);拟合的主要规范仅在βk\\bm{\\beta}_{k}上使用此马蹄先验,没有额外的残差跨活动因子项。参与者截距遵循bp∼N9(0,diag⁡(τb)Ωbdiag⁡(τb))\\mathbf{b}_{p}\\sim\\mathcal{N}_{9}(\\mathbf{0},\\operatorname{diag}(\\bm{\\tau}_{b})\\,\\bm{\\Omega}_{b}\\,\\operatorname{diag}(\\bm{\\tau}_{b})),其中τb\\bm{\\tau}_{b}是活动特定参与者效应尺度,Ωb\\bm{\\Omega}_{b}是具有LKJ先验的相关矩阵\[29 (https://arxiv.org/html/2609.05582#bib.bib8)\]。令Θ\\bm{\\Theta}收集所有群体级参数(αkα_{k}、βk\\bm{\\beta}_{k}、τb\\bm{\\tau}_{b}、Ωb\\bm{\\Omega}_{b}以及下文引入的类似模型II参数)。对于未见参与者p⋆p^{\\star},在采购了n个适应窗口Ap⋆,n\\mathcal{A}_{p^{\\star},n}(来自前n个按时间顺序的适应窗口的标签)后,并记D−p⋆\\mathcal{D}_{\\-p^{\\star}}为排除参与者p⋆p^{\\star}的所有训练侧数据,参与者效应后验为

p(bp⋆,Θ∣D−p⋆,Ap⋆,n)∝p⁡(Ap⋆,n∣bp⋆,Θ)p(bp⋆∣Θ)p(Θ∣D−p⋆). p(\\mathbf{b}_{p^{\\star}},\\bm{\\Theta}\\mid\\mathcal{D}_{\\-p^{\\star}},\\mathcal{A}_{p^{\\star},n})\\propto p(\\mathcal{A}_{p^{\\star},n}\\mid\\mathbf{b}_{p^{\\star}},\\bm{\\Theta})\\,p(\\mathbf{b}_{p^{\\star}}\\mid\\bm{\\Theta})\\,p(\\bm{\\Theta}\\mid\\mathcal{D}_{\\-p^{\\star}}). (2)

该后验通过自适应退火重采样-移动顺序蒙特卡洛算法顺序维持,每次采购一个标签:保留的16,000个群体后验抽样中的每一个生成四个条件独立的参与者效应粒子(共64,000个联合粒子);仅当有效样本量(ESS)低于64,000的25%时才触发系统重采样;随机游走Metropolis-Hastings在每次重采样步骤后更新九维参与者效应,增量似然在更新后重新计算。由于群体级参数从不更新,每个保留状态都要求在粒子最终ESS至少为400的基础上,保留至少400个不同的群体后验祖先;所有47折均通过这两个门槛(完整算法和验证门槛细节见补充部分S1)。

### II-D模型II

相似文章

分层优势加权:面向稀疏回合结果的VLA在线强化学习微调

Hugging Face Daily Papers

本文提出分层优势加权行为克隆(HABC),用于利用具有稀疏二进制回合结果的在线强化学习微调视觉-语言-动作(VLA)策略。HABC通过自适应评价器头和干预感知的信用分配将可行性和效率目标分离,显著提高了接触密集型双手操作任务的成功率。

PAPA:在线个性化主动偏好对齐

arXiv cs.LG

本文介绍了个性化主动偏好对齐(PAPA),一种无需参数化奖励模型、利用实时用户反馈微调扩散模型的方法,提高了推荐和图像生成等个性化任务的效率。