XHToken/Spark-X2.5-4B-GGUF

Hugging Face Models Trending 模型

摘要

这个仓库提供了 Spark-X2.5-4B 语言模型的 BF16 GGUF 转换,使其能够使用 Ollama 和 LM Studio 进行本地推理。

任务:文本生成 标签: gguf, llama.cpp, ollama, lm-studio, sparkx2_5, text-generation, en, zh, base_model:XHToken/Spark-X2.5-4B, base_model:quantized:XHToken/Spark-X2.5-4B, license:apache-2.0, endpoints_compatible, region:us, conversational
查看原文
查看缓存全文

缓存时间: 2026/09/10 20:11

XHToken/Spark-X2.5-4B-GGUF · Hugging Face 来源:https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF

本仓库提供了 Spark-X2.5-4B 模型的 BF16 格式 GGUF 转换版本。Spark-X2.5 是一款紧凑型通用语言模型,适用于对话、写作、翻译、推理、编码、工具调用及智能体工作流。它采用混合注意力架构,原生支持最高 100 万 token 的上下文长度,并覆盖超过 200 种语言。关于其架构、训练方法、基准测试结果、微调及引用信息,请参阅 Spark-X2.5-4B 模型页面(https://huggingface.co/XHToken/Spark-X2.5-4B)。

https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF#local-deployment 本地部署

GGUF 文件可用于通过 OllamaLM Studio 进行本地推理。对 Spark-X2.5 的支持由 XHToken/llama.cpp(https://github.com/XHToken/llama.cpp)提供,因此以下快速入门指南将使用此兼容实现。

https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF#ollama-quick-start Ollama 快速入门

https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF#build 构建

git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
git clone https://github.com/ollama/ollama.git ollama-spark
cd ollama-spark
export OLLAMA_LLAMA_CPP_SOURCE="$(cd ../llama.cpp-spark && pwd)"
cmake -S . -B build
cmake --build build --parallel 8

https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF#import-the-gguf 导入 GGUF 模型

请将下方的模型路径替换为已下载 GGUF 文件的绝对路径:

printf 'FROM /absolute/path/to/Spark-X2.5-4B.gguf\n' > ./Modelfile.spark

https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF#create-and-run 创建并运行

在第一个终端窗口中启动 Ollama 服务器:

./ollama serve

在同一个 ollama-spark 目录下打开第二个终端窗口:

./ollama create Spark-X2.5-4B -f ./Modelfile.spark
./ollama run Spark-X2.5-4B --think=false

--think=false 参数会禁用思考模式,以实现更快速、直接的响应。

https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF#lm-studio-quick-start LM Studio 快速入门

https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF#build-the-compatible-llamacpp-runtime 构建兼容的 llama.cpp 运行时

git clone https://github.com/XHToken/llama.cpp.git llama.cpp-spark
cd llama.cpp-spark
cmake -S . -B build
cmake --build build --parallel 8

https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF#configure-lm-studio 配置 LM Studio

  1. 关闭 LM Studio。
  2. 备份所选的 LM Studio 运行时目录:
    /extensions/backends/你的运行时目录/
    
  3. llama.cpp-spark 的构建输出复制到所选的运行时目录中,替换现有的运行时文件。
  4. Spark-X2.5-4B.gguf 放置在:
    /models/你的模型目录/
    
    Apple Silicon 上的运行时目录示例:
    ./build/bin/* -> ~/.lmstudio/extensions/backends/llama.cpp-mac-arm64-apple-metal-advsimd-/
    

https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF#run 运行

打开 LM Studio,在“我的模型”下选择该模型,点击“加载”,然后开始新的对话。 您也可以使用 lms 命令行工具:

lms ls
lms load
lms chat

https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF#license 许可证

本项目基于 Apache License 2.0(https://www.apache.org/licenses/LICENSE-2.0)发布。

相似文章

新型模型:Spark-X2.5-4B, Spark-X2.5-1.7B

Reddit r/LocalLLaMA

推出Spark-X2.5-4B和Spark-X2.5-1.7B,这两款紧凑型通用语言模型原生支持百万token上下文,具备强大的编码与智能体能力,并提供广泛的硬件兼容性。

Jackrong/Qwopus3.6-27B-Coder-MTP-GGUF

Hugging Face Models Trending

GGUF量化版本的Qwopus3.6-27B-Coder-MTP模型已发布在Hugging Face上,针对本地推理进行了优化,兼容Transformers、vLLM、SGLang和Unsloth Studio。

AngelSlim/Hy3-GGUF

Hugging Face Models Trending

AngelSlim/Hy3-GGUF 是一个用于在 llama.cpp 上量化和部署 Hy3 大语言模型的工具包,具有 MTP 自我推测解码和思考/工具调用解析器,以实现高效推理。

huihui-ai/Huihui-GLM-5.2-abliterated-GGUF

Hugging Face Models Trending

Hugging Face 上发布了已消除限制的 GLM-5.2 模型的量化 GGUF 版本,可使用 Transformers、llama.cpp 和 vLLM 等工具进行本地推理。