高通推出GenieX,在其Windows笔记本电脑上运行LLM

Reddit r/LocalLLaMA 工具

摘要

高通推出了GenieX,这是一个用于在Windows笔记本电脑上运行LLM的SDK,在Gemma 4 26B上实现了20 tok/s,并支持使用GGUF模型的llama.cpp。

高通落后于所有主要芯片制造商,因此在SDK方面正在追赶。https://aihub.qualcomm.com/geniex 我能够在GPU或NPU上运行Gemma 4 26B A4B,首token 0.5s,达到20 tok/s;在GPU上运行Qwen 3.6 27B MTP达到10 tok/s。要使用llama.cpp,只需获取任何Q4_0 GGUF模型,它就能在CPU、GPU、NPU上运行。
查看原文

相似文章