浏览器中的1位LLM
摘要
一款1位LLM(Bonsai)现在可以通过WebGPU在浏览器中运行,实现高效的设备端推理。
查看缓存全文
缓存时间: 2026/07/20 09:47
Bonsai 1-bit WebGPU - webml-community 的 Hugging Face Space
来源:https://huggingface.co/spaces/webml-community/bonsai-webgpu
Spaces(https://huggingface.co/spaces)Hugging Face 的 logo(https://huggingface.co/)— https://huggingface.co/webml-community webml-community(https://huggingface.co/webml-community)/ bonsai-webgpu(https://huggingface.co/spaces/webml-community/bonsai-webgpu)运行中
应用(https://huggingface.co/spaces/webml-community/bonsai-webgpu)文件文件(https://huggingface.co/spaces/webml-community/bonsai-webgpu/tree/main)社区1(https://huggingface.co/spaces/webml-community/bonsai-webgpu/discussions)
刷新中
相似文章
Bonsai 27B:使用自定义WebGPU内核在浏览器中本地运行的1比特密集型大语言模型
Bonsai 27B是一个1比特密集型大语言模型,通过使用自定义WebGPU内核可以在浏览器中本地运行,实现高效的设备端推理。
@xenovacom: Bonsai 27B 彻底改变了本地 LLM 的游戏规则。1位量化将其从 54GB 缩小到仅 3.8GB(减少 93%),同时……
Bonsai 27B 通过 1 位量化实现了 93% 的体积缩减,同时保留了 90% 的智能,借助自定义 WebGPU 内核实现本地浏览器推理。
Bonsai 27B(1位LLM):首个能在手机上运行的27B级别模型
PrismML宣布推出Bonsai 27B,这是Qwen3.6 27B的1位与三元量化版本,可在手机和笔记本电脑上运行,保留基线性能的90-95%,占用3.9GB空间,支持自主智能体与多模态的端侧AI。
LFM2.5 230M 使用自定义 WebGPU 内核在浏览器中以 1,400 tok/s 运行
LFM2.5 230M 模型使用自定义 WebGPU 内核在浏览器中实现每秒 1,400 个 token,展示了高效的本地推理。
WebLLM: 高性能浏览器内LLM推理引擎
WebLLM是一个高性能的浏览器内LLM推理引擎,它利用WebGPU进行硬件加速,并且完全兼容OpenAI API,使得开源语言模型可以在本地运行。