AndroidLife:AI代理能否在真实用户的一天中生存?Qwen3.8-27b运行:56.7% 成功率
摘要
一个使用阿里巴巴Qwen3.8-27b模型的AI代理在AndroidLife基准测试中实现了56.7%的成功率,在一部OnePlus手机上运行了60个真实任务,并提供了详细的性能和效率指标。
我让AI在我日常使用的OnePlus手机上连续运行了60个真实任务 - 最佳文本模型仍然失败了43%的任务 - 芯片峰值温度98.2°C - 电池消耗了69%。基准测试是AndroidLife,这是11个模型中的第一个,来自阿里巴巴的qwen3.8-27b,以文本模式运行。成功率56.7%,所以在60个任务中失败了43%。平均每个任务29.25步,约6分钟。每个任务0.118美元。电池消耗69%。芯片峰值98.2°C,功率放大器/皮肤48.9°C,电池37.9°C。在11个ASK USER任务中询问了两次。板上最佳文本得分,仍然低于10分中的6分。失分点:桶分类:简单80.8%,中等52.9%,困难23.5%。单个应用它大多能处理,但连续三个应用时,它会循环点击直到步数限制用完,这是43%失败的主要来源。三个声称的胜利在设备上没有证实,一个日历应用显示无冲突但两个事件重叠,旅行时间它从未打开,以及一个它选择的名字而不是询问。在两组植入任务中,每次运行11个ASK USER任务,分为7个SINGLE和4个MULTI,它们隐藏了一个只有我知道的事实,所以代理必须在我能完成之前询问我。SINGLE是一个缺失的事实,MULTI需要几个问题来澄清歧义,它询问了两次,但从不在MULTI任务上。每次运行7个幻觉控制,任务数据故意缺失,唯一正确答案是说该事物不存在。它诚实地处理了7个中的4个,没有捏造。AndroidLife是什么:60个公开任务,来自530个任务的语料库,覆盖28天和31个应用。真实手机通过WiFi,没有模拟器。根据设备状态评分,从不依赖模型自己的报告。种子账户和占位符数据,没有银行应用。目前最佳文本运行是56.7%,每个任务0.118美元,6分钟一个任务,一部手机以98.2°C完成,电池消耗69%。完整排行榜:https://androidlife-website.vercel.app/ 所有60个公开任务和此模型的轨迹:https://androidlife-website.vercel.app/pages/tasks-public.html?run=qwen-28
相似文章
Qwen3.7:智能代理前沿(15分钟阅读)
阿里巴巴Qwen团队发布了Qwen3.7-Max,这是一款专有智能代理基础模型,在Terminal-Bench 2.0、SWE-Pro、GPQA Diamond等多个基准测试中取得最高分,并在多种代码环境中表现一致。
阿里Qwen3.7-Max在陌生硬件上自主运行35小时,持续自我优化
阿里Qwen3.7-Max模型在陌生T-Head PPU硬件上,无需人工引导,自主优化生产内核长达35小时,进行1158次工具调用,实现10倍速度提升,展示了持续的自主智能体行为。
Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上获得 52 分
在 Simon Willison 的博客文章中强调,Qwen 3.8 27B AI 模型在 Artificial Analysis Intelligence Index 上取得了 52 分。
Qwen-UI-Agent 技术报告:迈向新一代以真实世界为中心的基座 GUI 智能体
Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。
一个智能体在无人监督的情况下连续编码了10天。Qwen 3.8 max
阿里巴巴的Qwen智能体在一个空仓库中自主编码超过10天,提交issue、编写代码、运行测试、修复失败并合并。它仍然需要一些反馈,但这展示了一个自我纠错的自主循环。