高通推出GenieX,在其Windows笔记本电脑上运行LLM
摘要
高通推出了GenieX,这是一个用于在Windows笔记本电脑上运行LLM的SDK,在Gemma 4 26B上实现了20 tok/s,并支持使用GGUF模型的llama.cpp。
高通落后于所有主要芯片制造商,因此在SDK方面正在追赶。https://aihub.qualcomm.com/geniex 我能够在GPU或NPU上运行Gemma 4 26B A4B,首token 0.5s,达到20 tok/s;在GPU上运行Qwen 3.6 27B MTP达到10 tok/s。要使用llama.cpp,只需获取任何Q4_0 GGUF模型,它就能在CPU、GPU、NPU上运行。
相似文章
在MLX中使用turboquant(及自定义内核)运行Gemma4 26b MoE
一位开发者成功在Apple MacBook Air M5上使用MLX、turboquant和自定义内核运行了Gemma4 26b MoE,实现了比llama.cpp更快的提示处理和生成速度,且内存占用更低。实现方式包括本地部署说明。
在单个16GB GPU + 64GB RAM上的本地LLM自动补全与代理式编码
使用 llama.cpp 在单块 16GB GPU 及 64GB+ 内存上设置本地 LLM 自动完成(Qwen2.5-Coder-7B)与代理编码(Qwen3.6-35B-A3B)的技术指南,包含命令与性能基准。
16块AMD MI50 32GB:GLM-5.2 Q4 在 llama.cpp RPC 上以 12.2 tok/s 运行
描述了在由16块AMD MI50 GPU组成的集群上,使用llama.cpp的RPC以4位量化运行GLM-5.2模型,达到12.2令牌每秒的速度,并在10.7k上下文中实现了连贯的长文本生成。
@_lewtun: 你现在可以在笔记本上免费全天候运行 AI 研究员了!使用 llama.cpp 和 4-bi…
本文重点介绍了如何在本地笔记本上使用 llama.cpp 和 Unsloth 4-bit 量化免费运行 Qwen3-35B-A3B。
@leopardracer: GEMMA 4 26B 在 RTX 4060 上运行,拥有 248K Token 上下文窗口,每秒 20 个 Token,上下文窗口大得可以……
Gemma 4 26B 在 RTX 4060 上运行,通过 llama.cpp 和 Q4_K_XL 量化实现 248K Token 上下文和每秒 20 Token 的速度,从而在消费级硬件上本地处理整个代码库。