标签
Qwen Intelligence 推出三款最先进的移动AI智能体:用于任务分解的Mobile Planner Agent、具有高端到端成功率的Mobile-Use Agent,以及用于快速内容生成的Mobile Creative Agent,同时开放一个用于评估的基准测试套件。
TierKV提出一种预测性多层KV缓存框架,用于优化长上下文大型语言模型在移动设备上的内存使用和吞吐量,在最小精度损失下实现显著的性能提升。
Edge0-35B-A3B-preview 是一个稀疏的MoE模型,通过流式专家卸载和量化技术,实现移动设备上的高效AI推理,以低于3 GiB的内存达到15 tok/s的性能。
SnapBench引入了一个配对干扰基准测试,用于移动端稳健的即拍即问多模态检索,揭示图像噪声是关键降级因素,并提出一种自适应融合方法以增强模态可靠性。
这条推文推测,苹果、高通和谷歌可能成为领先的AI公司,原因在于专注于便携式边缘AI设备,并以在NVIDIA Jetson上运行的Google Gemma为例。
本文描述了在 Ubuntu Touch 智能手机上运行 AI 智能体的体验——该手机全天候开机,可访问传感器,并能通过 Telegram 持续对话。
Google DeepMind 宣布了SL2T,这是一个与聋人社区共同开发的系统,旨在将ASL输入引入手机,并计划将这项技术扩展到更多手语和应用中。
bigedgeonmoe开源代码库的创建者使得在移动设备和消费级PC上运行大规模MoE模型(高达120B参数)成为可能,在中端手机上实现了Qwen 35B模型每秒6个token的速度。
本文通过实验研究提示词表述如何影响端侧大语言模型的能耗,表明关键词选择会显著影响解码长度和总能耗,并提示工程可作为轻量级能耗优化手段。
LightMem-Ego是一种轻量级流式多模态记忆系统,用于日常生活辅助,它持续捕捉第一人称视角的视觉和音频流,将其组织成分层记忆,并检索基于事实的答案来回答用户关于过去经历的查询,可部署在智能手机和AI眼镜上。
Khosla 支持的初创公司 PrismML 发布了 Qwen-3.6-27B 的压缩版本,声称这是有史以来在 iPhone 上运行的最大 AI 模型。
PyTorch基金会支持了在旧金山举办的ExecuTorch黑客马拉松,超过100名参与者使用PyTorch和ExecuTorch在搭载Snapdragon的三星Galaxy S25 Ultra设备上构建了实时端侧AI应用。获奖项目包括SafeScreen AI、SixthSense和Toddle AI,展示了本地执行在响应性、隐私保护和离线能力方面的优势。
宣布推出Acti,一个代理型键盘,将被动键盘转变为主动界面,能够直接在应用内执行操作,例如调取Notion文档或生成迷你应用。
在Google Pixel 10 Pro上使用llama.cpp运行Gemma 12B模型,实现了每秒6.5个token的提示处理和每秒1.3个token的生成,功耗低于10瓦,展示了高效的设备端AI推理。
本文介绍了首个完全运行在移动NPU(Snapdragon X Elite上的Qualcomm Hexagon)上的端到端RAG流水线,相比CPU实现了高达18倍的LLM预填充加速和4倍的能耗降低,且无质量退化。
基准测试显示,在iPhone上本地运行Stable Diffusion 1.5,使用Realistic Vision V5.1 Hyper等优化模型,生成512x512图像最快仅需3.1秒,使得设备端AI图像生成变得切实可行。
本文认为,将Gemini更深地整合进Android的真正问题不仅仅是隐私,而是行动边界——即AI可以读取、建议、起草、更改、发送、购买或删除什么——并提出了针对不同AI代理级别的分级许可模型。
谷歌和苹果正将 AI 驱动的 'vibe coding' 引入移动端,允许用户通过自然语言提示创建自定义 Android 应用、小组件和快捷方式,正如在 Google I/O 2026 上所展示,并据报道将在 iOS 上实现。
Google AI Edge Gallery v1.0.13 和 v1.0.14 更新增加了对 Gemma 4 的多令牌预测支持、Pixel TPU 优化、实验性 MCP、新技能以及聊天历史保存功能,提升了设备端生成式 AI 能力。