三星 Note 8(2017款)手机上的 Qwen3-0.6B(400 MB)模型可操控桌面版 Chrome 浏览器
摘要
本文展示了如何利用运行在2017款三星Note 8手机上的Qwen3-0.6B模型,通过本地代理系统控制桌面版Chrome浏览器,完成结构化页面处理任务。
首先说明一下:我是参与开发此处所使用的页面感知层的团队成员之一。我们最初从测试小型本地模型开始,结果比最初的测试更加有趣。实验涉及12个小型模型、3项可验证的任务、日志记录以及离线回放功能。实验环境配置为:2017款三星Galaxy Note 8手机(运行Android 9系统,内存6GB)、Termux中的llama.cpp工具、Qwen3-0.6B Q4_K_M模型,以及一台打开Chrome浏览器的笔记本电脑(非无头模式)。手机通过我们的代理系统来操控浏览器。该模型的工作流程为:首先获取页面的结构化表示(此处约为10个带名称的链接或字段,总字符数约200个token),根据名称选择其中一个字段,最后将获取到的信息以JSON格式输出。其余所有操作——包括将页面转换为结构化数据、候选项筛选、点击操作、信息读取以及结果验证——都由模型周围的处理流程完成。该模型永远不会直接看到HTML代码、截图或URL地址。实验任务包括:1)sandbox网站books.toscrape.com上的分类、书籍信息以及价格/评分/库存数据获取;2)实时版维基百科上,从无关页面跳转至三星Galaxy Note系列页面后,在页面约760个交互节点中识别出“Note 8”、“Samsung Galaxy Note 8.0”、“Galaxy Note 8.0”、“Note FE”等相似名称中的“Note 8”,并从信息框中提取发布日期;3)从表格中提取包括UPC码在内的5项数据。每项任务均执行10次,并与预设的期望结果进行比对。12种模型在任务1中的测试结果(使用相同脚本和提示词)如下:模型参数 | 任务1得分 | Qwen3-0.6B 0.6B | 10/10 | Qwen2.5-1.5B 1.5B | 10/10 | GLM-Edge-1.5B 1.5B | 10/10 | rating as digit Gemma-2-2B 2.6B | 10/10 | Llama-3.2-3B 3B | 10/10 | MiniCPM5-2B 2B | 9/10 | "£" -> "$" once Qwen2.5-0.5B 0.5B | 6/10 | LFM2.5-1.2B 1.2B | 0/10 | placeholder Llama-3.2-1B 1B | 0/10 | pseudo-code Gemma-3-1B 1B | 0/10 | placeholder LFM2-350M 0.35B | 0/10 | random click Gemma-3-270M 0.27B | 0/10 | placeholder。该模型在维基百科任务上的得分为10/10,在五字段任务上也为10/10。若使用原始HTML而非结构化页面表示,所有操作保持不变:在sandbox任务中,模型5次中有4次能完成目标,但每次处理所需token数达12k,耗时约22分钟,而使用结构化数据时仅需约500个token和80秒;在维基百科任务中,页面HTML总长度为467k字符,其中仅9%的内容能被模型纳入16k的上下文范围,而模型也未能在该9%的内容中找到目标链接,因此该任务得分为0/3。该实验存在一些限制:所有任务均为名称匹配和信息复制类型,凡是需要对页面内容进行判断的任务,参数为15亿参数的模型就无法完成——它无法从大量干扰项中选出正确选项,且尚未测试分页功能。顺便提一下,关于“识别特定设备型号”这一问题,“replay.py”脚本(可在github仓库查看)会根据日志重新生成提示词,并在任何兼容OpenAI的本地服务器上运行这些提示词。即便没有我们的协助,仅通过该脚本也需要10分钟时间来验证模型是否能在干扰项中选出“Note 8”。这仅仅是针对三项固定任务的测试结果,并非正式的性能基准测试。相关代码仓库地址为:github.com/e2llm/edge-browser-agent,其中包含所有脚本、原始JSONL文件(包括早期因程序缺陷导致的测试结果)、模型哈希值以及实验环境配置。“replay.py”功能可在任何本地服务器上离线重新运行模型,无需通过代理系统,也不需要账号。需注意:这并非全新概念,AgentOccam曾在GPT-4系列模型上展示过类似效果,WebLINX和MindAct则在经过微调的小型模型上实现了相同功能,而此处则是将实验推向了极端:未进行任何微调,模型参数低于10亿,且运行在2017年的旧款手机上。
相似文章
“Browser OS”由Qwen 3.6 35B实现:这是我从本地模型获得的最佳结果
一位用户报告称,通过Qwen 3.6 35B在本地运行'Browser OS'实现,取得了令人印象深刻的结果,凸显了该模型在不依赖云端的情况下执行复杂任务的能力。
@ngxson: Qwen3.6-27B 在 WebGPU 上 100% 运行。速度不是最快,但仍然不错
一位开发者演示在浏览器中完全通过 WebGPU 运行 Qwen3.6-27B AI 模型,尽管速度并非最优。
Qwen 3.8 Flash Next 在普通手机上本地运行 速度达3.5 tok/s
证明 Qwen 3.8 Flash Next 可以在中端 Android 手机上以3.5 tok/s的速度本地运行,通过优化和低量化实现。
在Zeus(小米12 Pro,12GB RAM)上运行Qwen 3.6 35B MoE(Q4_K_M)
演示在搭载12GB RAM的小米12 Pro上以Q4_K_M量化方式运行Qwen 3.6 35B MoE模型,展示了在移动设备上进行本地AI推理。
Qwen3.6 35B-A3B在笔记本上的运行:我的从零到一时刻
作者分享了在ASUS Zenbook Pro 14上本地运行Qwen3.6 35B-A3B的体验,在32k上下文下实现了27 TPS的生成速度,标志着向完全本地化AI以保护隐私的个人里程碑。