为移动设备构建隐私保护的联邦推荐系统

arXiv cs.LG 论文

摘要

本文提出了一种面向移动设备的隐私保护联邦推荐系统,采用两阶段流水线,包括候选生成和排序,通过 Kotlin Multiplatform 在 Android/iOS 上实现。

arXiv:2605.22924v1 公告类型:新 摘要:传统上,在移动设备上提供个性化内容需要将敏感用户数据集中到中央服务器,这种做法越来越不符合现代隐私期望和地域法规。我们提出了一种面向移动设备的两阶段联邦推荐系统流水线,其核心原则是将非敏感的用户偏好数据与永不离开设备的敏感移动上下文数据分离。第一阶段在云端对非敏感的应用上下文数据运行协同过滤模型,生成相关项目的短列表。第二阶段在设备上利用敏感移动信号对这些候选进行重新排序,只有模型更新/梯度会离开设备。我们在 MovieLens、UCI Human Activity Recognition 以及一个专有试点数据集上验证了该方法,并提供了一个生产就绪的实现,作为可在 Android 和 iOS 上部署的 Kotlin Multiplatform 库。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:56

# 为移动设备构建隐私保护的联邦推荐系统  
来源:https://arxiv.org/html/2605.22924 \\anglais \\department 计算机科学与运筹学系 \\sujet 机器学习 \\EdefEscapeHex PageUn\.chapterPageUn\.chapter\\EdefEscapeHexCouvertureCouverture\\hyper@anchorstartPageUn\.chapter\\hyper@anchorend \(2024\) \\anglais  

## 摘要  

传统上,移动应用严重依赖第三方追踪器和应用使用数据来在其平台上提供推荐。在这种模式下,用户隐私数据被汇集到集中式服务器中,作为训练机器学习算法的存储库。随着通用数据保护条例(GDPR)等隐私法规的出台以及用户对个人数据意识的增强,寻找新的方式向移动用户提供相关内容变得势在必行。为此,在本工作中,我们研究并构建系统,利用联邦学习开发隐私保护的超个性化推荐系统。联邦学习是一种去中心化的机器学习模型训练方法,它不是将所有数据移动到中央数据库,而是在每个设备上本地训练模型,仅共享模型更新而不进行任何数据共享。在本工作中,我们构建了一个两阶段的联邦推荐系统流水线:第一阶段涉及相关项目的候选生成,第二阶段涉及对这些项目进行超个性化排序(针对特定用户)。流水线的第二阶段通常涉及收集敏感的移动用户数据,如人口统计信息、位置、移动使用习惯、传感器数据等。在我们提出的系统中,这一阶段的流水线是联邦化的,因此模型改进可以在不将实际数据离开用户设备的情况下以隐私方式进行。我们使用了多种开源数据集,如 MovieLens[movielens_dataset]、人类活动识别数据集[UCI_HAR]以及由主办公司 Lerna AI 为本次工作提供的一个小型试点数据集。本工作的目标是构建一个联邦推荐引擎的概念验证系统,该引擎可部署在移动设备上进行 beta 测试试点。因此,我们在研究和工程部署方面投入了同等精力。最终系统是一个基于 Kotlin Multiplatform[jetbrains_kotlin_multiplatform]的机器学习库,部署在 Android/iOS 用户设备上。  

\\anglais \\EdefEscapeHex toc\.chaptertoc\.chapter\\EdefEscapeHexContentsContents\\hyper@anchorstarttoc\.chapter\\hyper@anchorend  

###### 目录  

1. 1.公司与项目范围 (https://arxiv.org/html/2605.22924#Ch1)  
   1. 1.1 公司简介:Lerna AI (https://arxiv.org/html/2605.22924#Ch1.S1)  
2. 1.2 项目范围 (https://arxiv.org/html/2605.22924#Ch1.S2)  
   1. 1.2.1 术语 (https://arxiv.org/html/2605.22924#Ch1.S2.SS1)  
3. 1.3 目标 (https://arxiv.org/html/2605.22924#Ch1.S3)  
4. 1.4 时间线 (https://arxiv.org/html/2605.22924#Ch1.S4)  
5. 1.5 工具与工作环境 (https://arxiv.org/html/2605.22924#Ch1.S5)  
2. 2.从移动设备中挖掘数据 (https://arxiv.org/html/2605.22924#Ch2)  
   1. 2.1 引言 (https://arxiv.org/html/2605.22924#Ch2.S1)  
      1. 2.1.1 第 A 部分:活动识别 (https://arxiv.org/html/2605.22924#Ch2.S1.SS1)  
      2. 2.1.2 第 B 部分:在试点数据集上的回测 (https://arxiv.org/html/2605.22924#Ch2.S1.SS2)  
   2. 2.2 Lerna SDK 传感器套件 (https://arxiv.org/html/2605.22924#Ch2.S2)  
   3. 2.3 数据集 (https://arxiv.org/html/2605.22924#Ch2.S3)  
      1. 2.3.1 UCI 数据集 (https://arxiv.org/html/2605.22924#Ch2.S3.SS1)  
      2. 2.3.2 真实场景 HAR 数据集 (https://arxiv.org/html/2605.22924#Ch2.S3.SS2)  
      3. 2.3.3 Lerna 试点数据集 (https://arxiv.org/html/2605.22924#Ch2.S3.SS3)  
   4. 2.4 相关工作 (https://arxiv.org/html/2605.22924#Ch2.S4)  
   5. 2.5 方法论 (https://arxiv.org/html/2605.22924#Ch2.S5)  
      1. 2.5.1 第 A 部分:活动识别 (https://arxiv.org/html/2605.22924#Ch2.S5.SS1)  
      2. 2.5.2 第 B 部分:在试点数据集上测试 (https://arxiv.org/html/2605.22924#Ch2.S5.SS2)  
   6. 2.6 结论 (https://arxiv.org/html/2605.22924#Ch2.S6)  
3. 3.两阶段推荐系统 (https://arxiv.org/html/2605.22924#Ch3)  
   1. 3.1 引言 (https://arxiv.org/html/2605.22924#Ch3.S1)  
      1. 3.1.1 数据类别 (https://arxiv.org/html/2605.22924#Ch3.S1.SS1)  
      2. 3.1.2 两阶段推荐流水线 (https://arxiv.org/html/2605.22924#Ch3.S1.SS2)  
   2. 3.2 文献调查 (https://arxiv.org/html/2605.22924#Ch3.S2)  
      1. 3.2.1 候选生成模型 (https://arxiv.org/html/2605.22924#Ch3.S2.SS1)  
   3. 3.3 集中式推荐系统 (https://arxiv.org/html/2605.22924#Ch3.S3)  
      1. 3.3.1 通用推荐器 (https://arxiv.org/html/2605.22924#Ch3.S3.SS1)  
      2. 3.3.2 相关交叉共现算法 (https://arxiv.org/html/2605.22924#Ch3.S3.SS2)  
   4. 3.4 数据集 (https://arxiv.org/html/2605.22924#Ch3.S4)  
      1. 3.4.1 MovieLens 1M 数据集 (https://arxiv.org/html/2605.22924#Ch3.S4.SS1)  
   5. 3.5 评估指标 (https://arxiv.org/html/2605.22924#Ch3.S5)  
   6. 3.6 实验 (https://arxiv.org/html/2605.22924#Ch3.S6)  
   7. 3.7 结论 (https://arxiv.org/html/2605.22924#Ch3.S7)  
4. 4.联邦排名系统 (https://arxiv.org/html/2605.22924#Ch4)  
   1. 4.1 引言 (https://arxiv.org/html/2605.22924#Ch4.S1)  
   2. 4.2 联邦平均 (https://arxiv.org/html/2605.22924#Ch4.S2)  
   3. 4.3 使用点击率预测进行排序 (https://arxiv.org/html/2605.22924#Ch4.S3)  
   4. 4.4 实验 (https://arxiv.org/html/2605.22924#Ch4.S4)  
      1. 4.4.1 设置 (https://arxiv.org/html/2605.22924#Ch4.S4.SS1)  
      2. 4.4.2 联邦 vs 集中式评估 (https://arxiv.org/html/2605.22924#Ch4.S4.SS2)  
      3. 4.4.3 联邦模型的消融实验 (https://arxiv.org/html/2605.22924#Ch4.S4.SS3)  
   5. 4.5 结果讨论与结论 (https://arxiv.org/html/2605.22924#Ch4.S5)  
5. 5.结论 (https://arxiv.org/html/2605.22924#Ch5)  
   1. 5.1 主要贡献 (https://arxiv.org/html/2605.22924#Ch5.S1)  
   2. 5.2 挑战 (https://arxiv.org/html/2605.22924#Ch5.S2)  
   3. 5.3 未来工作 (https://arxiv.org/html/2605.22924#Ch5.S3)  
6. 参考文献 (https://arxiv.org/html/2605.22924#bib)  

###### 表格列表  

1. 表 2.1:来自不同类别的移动传感器和设备信息的输入,作为 Lerna SDK 的输入 (https://arxiv.org/html/2605.22924#Ch2.T1)  
2. 表 2.2:UCI 与真实场景 HAR 数据集之间的差异 (https://arxiv.org/html/2605.22924#Ch2.T2)  
3. 表 2.3:Lerna 试点研究数据集摘要 (https://arxiv.org/html/2605.22924#Ch2.T3)  
4. 表 2.4:用户会话中的主要应用类别摘要 (https://arxiv.org/html/2605.22924#Ch2.T4)  
5. 表 2.5:从原始加速度和陀螺仪传感器数据计算的特征集描述列表 (https://arxiv.org/html/2605.22924#Ch2.T5)  
6. 表 2.6:活动识别实验的结果 (https://arxiv.org/html/2605.22924#Ch2.T6)  
7. 表 2.7:Lerna 试点数据集上不同实验的比较结果 (https://arxiv.org/html/2605.22924#Ch2.T7)  
8. 表 3.1:比较 UR 引擎在不同输入下与先前文献基准方法的实验结果 (https://arxiv.org/html/2605.22924#Ch3.T1)  
9. 表 4.1:集中式与联邦学习设置下实验的汇总表。联邦实验根据客户端的数据划分策略进一步细分 (https://arxiv.org/html/2605.22924#Ch4.T1)  
10. 表 4.2:AutoInt 模型架构的消融实验结果表 (https://arxiv.org/html/2605.22924#Ch4.T2)  

###### 图表列表  

1. 图 1.1:公司产品的高层架构,专为应用所有者或发布者设计。公司的产品包括一个集成到应用代码中的移动 SDK 库,以提供联邦推荐。此外,一个完全托管的云服务器协调来自边缘设备的模型权重更新,并集成差分隐私引擎。还提供仪表盘和监控等服务 (https://arxiv.org/html/2605.22924#Ch1.F1)  
2. 图 1.2:Lerna AI 的仪表盘系统,监控模型性能和参与联邦学习网络的活跃移动设备 (https://arxiv.org/html/2605.22924#Ch1.F2)  
3. 图 2.1:人类活动识别流水线[1] (https://arxiv.org/html/2605.22924#Ch2.F1)  
4. 图 2.2:UCI 数据集中不同活动类别的数据分布 (https://arxiv.org/html/2605.22924#Ch2.F2)  
5. 图 2.3:用于更好理解 UCI HAR 数据集的降维技术 (https://arxiv.org/html/2605.22924#Ch2.F3)  
6. 图 2.4:真实场景 HAR 数据集中不同类别的数据分布 (https://arxiv.org/html/2605.22924#Ch2.F4)  
7. 图 2.5:用于更好理解真实场景 HAR 数据集的降维技术 (https://arxiv.org/html/2605.22924#Ch2.F5)  
8. 图 2.6:LSTM 模型在测试集上的混淆矩阵。模型能够轻松区分不同类别,宏观 F1 分数达到 97.66% (https://arxiv.org/html/2605.22924#Ch2.F6)  
9. 图 3.1:提出的两阶段推荐流水线 (https://arxiv.org/html/2605.22924#Ch3.F1)  
10. 图 3.2:通用推荐系统的系统架构图,详述各个组件。系统的输入包括 a) 包含用户-项目交互(如喜欢/购买等)的事件 JSON 和 b) 包含用户/项目属性的上下文 JSON。系统的示例查询在 c) 查询 JSON 中定义,输出 d) 推荐 JSON 及其计算出的对数似然相似度分数一起返回 (https://arxiv.org/html/2605.22924#Ch3.F2)  
11. 图 4.1:a) FedAvg 训练流水线的工作流图(来源:[educative_fedavg]);b) FedAvg 算法的训练伪代码 [mcmahan2017communication] (https://arxiv.org/html/2605.22924#Ch4.F1)  
12. 图 4.2:来自 Fig.1 的 AutoInt CTR 模型架构 [song2019autoint] (https://arxiv.org/html/2605.22924#Ch4.F2)  
13. 图 4.3:MovieLens 1M 数据集在 10 个客户端上的非独立同分布情况 (https://arxiv.org/html/2605.22924#Ch4.F3)  
14. 图 4.4:消融实验在各联邦聚合轮次中的测试 AUC 和 LogLoss 图 (https://arxiv.org/html/2605.22924#Ch4.F4)  

## 缩略语与缩写列表  

\{twocolumnlist\}  
.2\.7 GDPR 通用数据保护条例  
CTR 点击率  
SDK 软件开发工具包  
HAR 人类活动识别  
UCI 加利福尼亚大学尔湾分校  
ADL 日常生活活动  
t-SNE t-分布随机邻域嵌入  
PacMAP 成对控制流形逼近  
CCO 相关交叉共现  
NCF 神经协同过滤  

## 致谢  

我衷心感谢主办公司 Lerna AI 和 MITACS 为我提供了这次实习机会,这是我硕士学习的一部分。我感谢 Lerna AI 的导师 Dr Georgios Kellaris 和 Georgios Depastas 在整个实习期间给予的卓越指导、支持和建设性反馈。我特别欣赏公司在实习期间提供的既有全职又有兼职部分的工作环境和灵活性。我非常享受与 Lerna AI 团队一起工作期间遇到的工程和研究挑战。我还要感谢 MILA-魁北克人工智能研究所和蒙特利尔大学的实习协调团队,他们顺利推进并批准了实习流程。感谢他们为我攻读硕士学位和完成这次实习提供了必要的资源和环境。此外,我衷心感谢我的导师、MILA 博士生 Fuyuan Lyu 在我们每周会议中提供的研究指导。他的反馈和支持在寻找相关文献方面极大地帮助了实习方向的推进。最后,我要感谢我的家人:姐姐、姐夫和母亲,他们的坚定支持让我能够追求我的学术目标。他们的耐心、爱和理解让我超越了自身的能力。没有他们的支持,我无法在人生中达到这一学术里程碑。  

## 引言  

### 问题背景  

软件产品和服务的个性化是积极客户体验的最重要驱动力之一。通过提供推荐而非固定产品来实现超个性化,可以降低用户流失率并提高转化率。随着智能手机已成为访问互联网和消费内容的普遍工具,越来越多的公司将其服务聚焦于移动优先的使用方式,而非传统的网页浏览。移动优先应用中实现超个性化的两个关键决策是:何时向用户发送通知以及显示什么内容。第一个任务涉及“何时”部分,根据用户的使用习惯在用户最有可能参与时通过个性化通知进行引导。第二个任务涉及“什么”部分,是从项目数据库中推荐与用户兴趣最相关的精选内容。该流水线的一个简单示例是:一款移动应用通过学习用户习惯和兴趣,在晚餐时间推荐电影,或在午餐时间推荐短视频内容。  

### 解决方案  

在本工作中,我们处理了该流水线的第二部分,即决定向用户显示什么个性化内容。推荐引擎通常处理以下两类数据中的一种或两种:用户特征和项目特征。用户特征包括人口统计数据(年龄、性别、城市等)和交互历史(购买、点击、浏览等),而项目特征对应与产品相关的元数据。对于移动应用,另一类用户特征来自传感器数据、位置、使用习惯、设备状态等。这些数据本质上是敏感的,并且对于超个性化具有巨大潜力,但传统推荐系统未能解决用户的隐私问题,无法以安全隐私的方式利用这些数据。为此,我们构建了一个以联邦方式向移动用户提供推荐服务的系统,其中用户的敏感数据永远不会离开设备。本工作中提出的系统是一个两阶段流水线:第一阶段是一种基于交叉共现算法[ferrel_unified_recommender]的协同过滤方法,用于生成初始的相关项目候选池;第二阶段是一种点击率(CTR)预测算法,从给定候选池中生成针对特定用户进行超个性化的 top-k 项目列表。后一阶段涉及用户隐私数据,因此是联邦机器学习系统,而第一阶段是部署在云服务器上的集中式系统。  

### 项目目标划分  

本工作分为若干章节,每章描述构建系统时解决的子任务。每个子任务相对于完整流水线而言是独立的问题,报告的组织方式使得每个章节自成一体,包含各自的文献综述、数据集描述、方法论和结果讨论。章节分布如下:  

1. 第一章:公司介绍与项目范围描述、工作时间线、使用的软件和工具。  
2. 第二章:从移动设备中挖掘数据。在本章中,我们列出了从用户移动设备收集的用于个性化的完整传感器和设备数据套件。我们详细介绍了从原始传感器数据(如加速度计、陀螺仪等)中提取有用信息的方法,用于活动识别问题(本章 A 部分)。在本章 B 部分,我们详细介绍了

相似文章

τ-Rec:面向智能推荐系统的可验证基准

Hugging Face Daily Papers

τ-Rec是一个用于智能推荐系统的可验证基准,它用可验证奖励和控制对话约束取代了主观的LLM-as-a-judge评估,揭示了主流模型存在陡峭的可靠性悬崖——即便是表现最佳的模型,其pass@1也仅有约57%。

智能代理推荐

Reddit r/LocalLLaMA

本文探讨了由AI智能代理驱动的推荐系统。