AndroidLife:AI代理能否在真实用户的一天中生存?Qwen3.8-27b运行:56.7% 成功率

Reddit r/LocalLLaMA 新闻

摘要

一个使用阿里巴巴Qwen3.8-27b模型的AI代理在AndroidLife基准测试中实现了56.7%的成功率,在一部OnePlus手机上运行了60个真实任务,并提供了详细的性能和效率指标。

我让AI在我日常使用的OnePlus手机上连续运行了60个真实任务 - 最佳文本模型仍然失败了43%的任务 - 芯片峰值温度98.2°C - 电池消耗了69%。基准测试是AndroidLife,这是11个模型中的第一个,来自阿里巴巴的qwen3.8-27b,以文本模式运行。成功率56.7%,所以在60个任务中失败了43%。平均每个任务29.25步,约6分钟。每个任务0.118美元。电池消耗69%。芯片峰值98.2°C,功率放大器/皮肤48.9°C,电池37.9°C。在11个ASK USER任务中询问了两次。板上最佳文本得分,仍然低于10分中的6分。失分点:桶分类:简单80.8%,中等52.9%,困难23.5%。单个应用它大多能处理,但连续三个应用时,它会循环点击直到步数限制用完,这是43%失败的主要来源。三个声称的胜利在设备上没有证实,一个日历应用显示无冲突但两个事件重叠,旅行时间它从未打开,以及一个它选择的名字而不是询问。在两组植入任务中,每次运行11个ASK USER任务,分为7个SINGLE和4个MULTI,它们隐藏了一个只有我知道的事实,所以代理必须在我能完成之前询问我。SINGLE是一个缺失的事实,MULTI需要几个问题来澄清歧义,它询问了两次,但从不在MULTI任务上。每次运行7个幻觉控制,任务数据故意缺失,唯一正确答案是说该事物不存在。它诚实地处理了7个中的4个,没有捏造。AndroidLife是什么:60个公开任务,来自530个任务的语料库,覆盖28天和31个应用。真实手机通过WiFi,没有模拟器。根据设备状态评分,从不依赖模型自己的报告。种子账户和占位符数据,没有银行应用。目前最佳文本运行是56.7%,每个任务0.118美元,6分钟一个任务,一部手机以98.2°C完成,电池消耗69%。完整排行榜:https://androidlife-website.vercel.app/ 所有60个公开任务和此模型的轨迹:https://androidlife-website.vercel.app/pages/tasks-public.html?run=qwen-28
查看原文

相似文章

Qwen3.7:智能代理前沿(15分钟阅读)

TLDR AI

阿里巴巴Qwen团队发布了Qwen3.7-Max,这是一款专有智能代理基础模型,在Terminal-Bench 2.0、SWE-Pro、GPQA Diamond等多个基准测试中取得最高分,并在多种代码环境中表现一致。