从感知到行动:智能眼镜作为第一人称智能平台
摘要
本文综述了智能眼镜作为统一的第一人称智能平台,提出了针对受限硬件和多样化应用的感知-状态-交互-行动循环系统框架及评估协议。
查看缓存全文
缓存时间: 2026/08/26 07:13
论文页面 - 从观察到行动:智能眼镜作为第一人称智能平台
来源:https://huggingface.co/papers/2608.24877
摘要
本文综述智能眼镜作为统一的第一人称智能平台,需要在受限硬件和多样化应用中构建持续的感知-状态-交互-行动闭环。
智能眼镜正从捕捉与显示配件演变为连接人类感知、持久上下文及数字或物理行动的第一人称智能平台。其佩戴视角与穿戴者的视觉、听觉、运动及手-物交互对齐,但必须在严格的能耗、散热、隐私与反馈限制下运行。尽管增强现实、自我中心视觉(https://huggingface.co/papers?q=egocentric%20vision)、多模态模型(https://huggingface.co/papers?q=multimodal%20models)、人机交互和具身智能(https://huggingface.co/papers?q=embodied%20intelligence)等领域进展迅速,现有文献仍呈现设备、任务与基准的碎片化特征。关键挑战并非模型能否独立识别、应答、记忆或行动,而在于完整系统能否维持可靠、时序有效、可纠正且受控的感知-状态-交互-行动闭环。本综述是\textbf{首个通过统一框架系统研究智能眼镜的学术工作}。我们形式化第一人称数据流与受限任务效用,沿八个可验证硬件能力轴对设备特性进行刻画,围绕七个相互依存的基础能力组织文献,并提出涵盖捕获、反应式感知、情境辅助、持久状态、受控行动与具身耦合的L0-L5框架。通过九类应用场景,我们将任务与数据集、系统、产品、利益相关方、失效后果及证据缺口相连接。此外,我们提出九维部署框架、声明条件评估协议,以及从受控测量到纵向现场验证与审计的证据阶梯。这些要素共同使智能眼镜更具可比性、可部署性及可复现评估性,并勾勒出迈向可信第一人称智能的路线图。
查看arXiv页面(https://arxiv.org/abs/2608.24877)查看PDF(https://arxiv.org/pdf/2608.24877)项目页面(https://github.com/zhangzjn/awesome-smart-glasses)GitHub3(https://github.com/zhangzjn/awesome-smart-glasses)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.24877)
在你的智能体中获取此论文:
hf papers read 2608\.24877
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型数量:0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.24877以从此页面建立链接。
引用本文的数据集数量:0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.24877以从此页面建立链接。
引用本文的Space数量:0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.24877以从此页面建立链接。
包含本文的合集数量:0
无合集包含此论文
将此论文添加到合集(https://huggingface.co/new-collection)以从此页面建立链接。
相似文章
这些无摄像头的智能眼镜让我感觉自己像托尼·斯塔克
极米(Xgimi)在CES 2026上展示的MemoMind One智能眼镜现已在Kickstarter上众筹,它提供无摄像头、注重隐私的AI显示体验,拥有浮动绿色屏幕,但测试版存在漏洞,户外可见性有限。
能否制造出不令人毛骨悚然的智能眼镜?
一篇WIRED专题报道,探讨带有摄像头的智能眼镜引发的隐私担忧,尤其是Meta的Ray-Ban眼镜,以及谷歌、三星和苹果等公司如何应对这一问题。
最佳智能眼镜排名:Meta、Viture 等(2026)
《连线》杂志2026年最佳智能眼镜排行榜,涵盖 Meta、Viture、Even Realities 和 RayNeo 的型号,并附有各自的优缺点和规格。
马克·扎克伯格的十年愿景:为什么他认为智能眼镜最终将取代手机
马克·扎克伯格概述了他为期十年的愿景,即智能眼镜将取代智能手机成为主要计算设备。
面向设备上机器学习的全传感器智能眼镜平台
本文介绍了ARGO,一个面向设备上机器学习的智能眼镜平台,该平台集成了多模态传感器套件和优化的YOLOv11模型,用于实时城市障碍物识别,实现了隐私保护的本地处理,具有低延迟和2.483 MB的内存占用。