从感知到行动:智能眼镜作为第一人称智能平台

Hugging Face Daily Papers 论文

摘要

本文综述了智能眼镜作为统一的第一人称智能平台,提出了针对受限硬件和多样化应用的感知-状态-交互-行动循环系统框架及评估协议。

智能眼镜正从捕捉和显示配件演变为第一人称智能平台,连接人类感知、持久上下文以及数字或物理动作。其身载视角与佩戴者的视觉、听觉、运动及手-物交互对齐,但必须在严格的能量、热管理、隐私和反馈约束下运行。尽管在增强现实、自我中心视觉、多模态模型、人机交互和具身智能方面进展迅速,文献仍分散在设备、任务和基准中。关键挑战不在于模型是否能独立识别、回答、记忆或行动,而在于一个完整系统能否维持可靠、时序有效、可纠正、可治理的感知-状态-交互-行动循环。本综述是\textbf{首个通过这种统一框架系统研究智能眼镜的综述}。我们形式化了第一人称数据流和受限任务效用,沿八个可验证硬件能力轴表征设备,围绕七个相互依赖的基础能力组织文献,并引入了涵盖捕捉、反应式感知、情境辅助、持久状态、治理行动和具身耦合的L0-L5框架。在九个应用场景中,我们将任务与数据集、系统、产品、利益相关者、失败后果和证据差距联系起来。我们进一步提出了一个九维部署框架、一个基于主张的评估协议,以及一个从受控测量到纵向现场验证和审计的证据阶梯。这些元素共同使智能眼镜更具可比性、可部署性和可重复评估性,同时勾勒出通往可信赖第一人称智能的路线图。
查看原文
查看缓存全文

缓存时间: 2026/08/26 07:13

论文页面 - 从观察到行动:智能眼镜作为第一人称智能平台

来源:https://huggingface.co/papers/2608.24877

摘要

本文综述智能眼镜作为统一的第一人称智能平台,需要在受限硬件和多样化应用中构建持续的感知-状态-交互-行动闭环。

智能眼镜正从捕捉与显示配件演变为连接人类感知、持久上下文及数字或物理行动的第一人称智能平台。其佩戴视角与穿戴者的视觉、听觉、运动及手-物交互对齐,但必须在严格的能耗、散热、隐私与反馈限制下运行。尽管增强现实、自我中心视觉(https://huggingface.co/papers?q=egocentric%20vision)、多模态模型(https://huggingface.co/papers?q=multimodal%20models)、人机交互和具身智能(https://huggingface.co/papers?q=embodied%20intelligence)等领域进展迅速,现有文献仍呈现设备、任务与基准的碎片化特征。关键挑战并非模型能否独立识别、应答、记忆或行动,而在于完整系统能否维持可靠、时序有效、可纠正且受控的感知-状态-交互-行动闭环。本综述是\textbf{首个通过统一框架系统研究智能眼镜的学术工作}。我们形式化第一人称数据流与受限任务效用,沿八个可验证硬件能力轴对设备特性进行刻画,围绕七个相互依存的基础能力组织文献,并提出涵盖捕获、反应式感知、情境辅助、持久状态、受控行动与具身耦合的L0-L5框架。通过九类应用场景,我们将任务与数据集、系统、产品、利益相关方、失效后果及证据缺口相连接。此外,我们提出九维部署框架、声明条件评估协议,以及从受控测量到纵向现场验证与审计的证据阶梯。这些要素共同使智能眼镜更具可比性、可部署性及可复现评估性,并勾勒出迈向可信第一人称智能的路线图。

查看arXiv页面(https://arxiv.org/abs/2608.24877)查看PDF(https://arxiv.org/pdf/2608.24877)项目页面(https://github.com/zhangzjn/awesome-smart-glasses)GitHub3(https://github.com/zhangzjn/awesome-smart-glasses)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.24877)

在你的智能体中获取此论文:

hf papers read 2608\.24877

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型数量:0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.24877以从此页面建立链接。

引用本文的数据集数量:0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.24877以从此页面建立链接。

引用本文的Space数量:0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.24877以从此页面建立链接。

包含本文的合集数量:0

无合集包含此论文

将此论文添加到合集(https://huggingface.co/new-collection)以从此页面建立链接。

相似文章

面向设备上机器学习的全传感器智能眼镜平台

arXiv cs.LG

本文介绍了ARGO,一个面向设备上机器学习的智能眼镜平台,该平台集成了多模态传感器套件和优化的YOLOv11模型,用于实时城市障碍物识别,实现了隐私保护的本地处理,具有低延迟和2.483 MB的内存占用。