mobile-agents

标签

Cards List
#mobile-agents

驱动移动智能体的虚拟机(Instinct,Claude Code)

Hacker News Top · 6天前 缓存

本文详细介绍了驱动移动AI智能体的虚拟机技术,例如Claude Code的Firecracker微虚拟机和Instinct使用的E2B沙箱,强调其安全性和生命周期管理。

0 人收藏 0 人点赞
#mobile-agents

@omooretweets: 真正有效的智能体(尤其在移动设备上)将为语音AI带来巨大助力,我已大幅增加尝试次数…

X AI KOLs Timeline · 2026-08-30 缓存

该推文讨论了移动设备上功能齐全的智能体如何推动语音AI增长,作者提到因Instinct而大幅增加语音输入使用,并引用Jane Manchun Wong关于Instinct在iPhone上的“Talk to Instinct”功能的推文。

0 人收藏 0 人点赞
#mobile-agents

我认为我们可能一直在以错误的方式思考移动代理。API 提供控制,但理解屏幕能带来别的东西。

Reddit r/AI_Agents · 2026-08-29

作者质疑依赖 API 访问的传统移动代理方法,并提出通过类似 aiden-firmware 的硬件使用屏幕理解来实现更通用的代理,使其能像人类一样交互。

0 人收藏 0 人点赞
#mobile-agents

基于步级后果推理与聚合的移动代理自动化轨迹评估

arXiv cs.AI · 2026-08-24 缓存

本文介绍了CRATE,一个使用步级后果推理来评估移动代理的两阶段框架,在AndroidWorld和MobileRisk等基准测试上取得了高F1分数。

0 人收藏 0 人点赞
#mobile-agents

CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications

arXiv cs.AI · 2026-08-13 缓存

CoAdapt-GUI is a test-time adaptation framework for mobile GUI agents that jointly adapts workflow context and policy, improving performance on unseen-app benchmarks like AndroidWorld-Generalization and AndroidWorld Plus.

0 人收藏 0 人点赞
#mobile-agents

移动智能体评估中的 LLM 评判器基准测试

arXiv cs.AI · 2026-08-13 缓存

本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。

0 人收藏 0 人点赞
#mobile-agents

AndroidReality: How Far Are Mobile Agents from the Real World?

arXiv cs.AI · 2026-08-11 缓存

Introduces AndroidReality, a perturbation-based framework for evaluating and improving the robustness of mobile agents, with a taxonomy of real-world interface perturbations and a training-free Test-Time Introspective Recovery (TTIR) mechanism.

0 人收藏 0 人点赞
#mobile-agents

iOSWorld:个性化智能手机代理的基准测试

Hugging Face Daily Papers · 2026-06-08 缓存

介绍了iOSWorld,一个交互式原生iOS模拟器基准测试,具有跨26个应用的持久用户身份,旨在通过133个难度递增的任务评估个性化移动代理的能力。

0 人收藏 0 人点赞
#mobile-agents

MIRAGE:具备隐式推理与生成式世界模型的移动智能体

arXiv cs.AI · 2026-06-04 缓存

MIRAGE 是一个面向移动端 GUI 智能体的框架,它以紧凑的连续潜在表示取代冗长的思维链推理,并融入生成式世界模型视角,在执行操作前预测未来的屏幕状态。在 AndroidWorld 和 AndroidControl 基准测试中,该框架在减少超过 75% 生成 token 的同时,实现了具有竞争力或更优的性能表现。

0 人收藏 0 人点赞
#mobile-agents

感知先行推理:一种高效可靠的主动移动代理的预推理感知框架

arXiv cs.AI · 2026-06-03 缓存

本文提出了一种用于主动移动代理的预推理感知框架(PRPF),将干预时机与辅助生成解耦,以提高效率并减少误触发。

0 人收藏 0 人点赞
#mobile-agents

状态追踪是手机用AI最难的部分吗?

Reddit r/AI_Agents · 2026-05-20

作者观察到手机用AI代理最难的部分是追踪状态变化,因为移动界面相比桌面有更多动态和中断性的UI变化,并询问他人的经验。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈