LiquidAI/LFM2.5-2.6B-GGUF
摘要
此 Hugging Face 模型卡片介绍了 LiquidAI 的 LFM2.5-2.6B 模型(GGUF 量化格式),并提供了通过 llama.cpp、vLLM、Ollama 等工具在本地运行的说明。
查看缓存全文
缓存时间: 2026/08/06 13:42
LiquidAI/LFM2.5-2.6B-GGUF · Hugging Face
笔记本Google Colab (https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF/colab)Kaggle (https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF/kaggle)本地应用设置 (https://huggingface.co/settings/local-apps)llama.cpp (https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF?local-app=llama.cpp)如何在 llama.cpp 中使用 LiquidAI/LFM2.5-2.6B-GGUF:
安装(macOS、Linux)
`` curl -LsSf https://llama.app/install.sh | sh
启动一个兼容 OpenAI 的本地服务器,并带有 Web UI:
llama serve -hf LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M
直接在终端中运行推理:
llama cli -hf LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M ``
通过 WinGet 安装(Windows)
`` winget install llama.cpp
启动一个兼容 OpenAI 的本地服务器,并带有 Web UI:
llama serve -hf LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M
直接在终端中运行推理:
llama cli -hf LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M ``
使用预构建二进制文件
``
从以下地址下载预构建二进制文件:
https://github.com/ggerganov/llama.cpp/releases
启动一个兼容 OpenAI 的本地服务器,并带有 Web UI:
./llama-server -hf LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M
直接在终端中运行推理:
./llama-cli -hf LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M ``
从源代码构建
`` git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake –build build -j –target llama-server llama-cli
启动一个兼容 OpenAI 的本地服务器,并带有 Web UI:
./build/bin/llama-server -hf LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M
直接在终端中运行推理:
./build/bin/llama-cli -hf LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M ``
使用 Docker
docker model run hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M
LM StudioJanvLLM (https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF?local-app=vllm)如何在 vLLM 中使用 LiquidAI/LFM2.5-2.6B-GGUF:
通过 pip 安装并启动模型服务
``
通过 pip 安装 vLLM:
pip install vllm
启动 vLLM 服务器:
vllm serve “LiquidAI/LFM2.5-2.6B-GGUF”
使用 curl 调用服务器(兼容 OpenAI 的 API):
curl -X POST “http://localhost:8000/v1/chat/completions”
-H “Content-Type: application/json”
–data ‘{
“model”: “LiquidAI/LFM2.5-2.6B-GGUF”,
“messages”: [
{
“role”: “user”,
“content”: “What is the capital of France?”
}
]
}’
``
使用 Docker
docker model run hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M
Ollama (https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF?local-app=ollama)如何在 Ollama 中使用 LiquidAI/LFM2.5-2.6B-GGUF:
ollama run hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M
Unsloth Studio (https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF?local-app=unsloth)如何在 Unsloth Studio 中使用 LiquidAI/LFM2.5-2.6B-GGUF:
安装 Unsloth Studio(macOS、Linux、WSL)
`` curl -fsSL https://unsloth.ai/install.sh | sh
运行 unsloth studio
unsloth studio -H 0.0.0.0 -p 8888
然后在浏览器中打开 http://localhost:8888
搜索 LiquidAI/LFM2.5-2.6B-GGUF 以开始聊天
``
安装 Unsloth Studio(Windows)
`` irm https://unsloth.ai/install.ps1 | iex
运行 unsloth studio
unsloth studio -H 0.0.0.0 -p 8888
然后在浏览器中打开 http://localhost:8888
搜索 LiquidAI/LFM2.5-2.6B-GGUF 以开始聊天
``
使用 HuggingFace Spaces 运行 Unsloth
``
无需设置
在浏览器中打开 https://huggingface.co/spaces/unsloth/studio
搜索 LiquidAI/LFM2.5-2.6B-GGUF 以开始聊天
``
Pi (https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF?local-app=pi)如何在 Pi 中使用 LiquidAI/LFM2.5-2.6B-GGUF:
启动 llama.cpp 服务器
``
安装 llama.cpp:
brew install llama.cpp
启动一个兼容 OpenAI 的本地服务器:
llama serve -hf LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M ``
在 Pi 中配置模型
``
安装 Pi:
npm install -g @mariozechner/pi-coding-agent
添加到 ~/.pi/agent/models.json:
{ “providers”: { “llama-cpp”: { “baseUrl”: “http://localhost:8080/v1”, “api”: “openai-completions”, “apiKey”: “none”, “models”: [ { “id”: “LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M” } ] } } } ``
运行 Pi
``
在你的项目目录中启动 Pi:
pi ``
OpenClawnew (https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF?local-app=openclaw)如何在 OpenClaw 中使用 LiquidAI/LFM2.5-2.6B-GGUF:
启动 llama.cpp 服务器
``
安装 llama.cpp:
brew install llama.cpp
启动一个兼容 OpenAI 的本地服务器:
llama serve -hf LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M ``
配置 OpenClaw
``
安装 OpenClaw:
npm install -g openclaw@latest
注册本地服务器并将其设置为默认模型:
openclaw onboard –non-interactive –mode local
–auth-choice custom-api-key
–custom-base-url http://127.0.0.1:8080/v1
–custom-model-id “LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M”
–custom-provider-id llama-cpp
–custom-compatibility openai
–custom-text-input
–accept-risk
–skip-health
``
运行 OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Docker Model Runner (https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF?local-app=docker-model-runner)如何在 Docker Model Runner 中使用 LiquidAI/LFM2.5-2.6B-GGUF:
docker model run hf.co/LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M
Lemonade (https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF?local-app=lemonade)如何在 Lemonade 中使用 LiquidAI/LFM2.5-2.6B-GGUF:
拉取模型
``
从 https://lemonade-server.ai/ 下载 Lemonade
lemonade pull LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M ``
运行并与模型聊天
lemonade run user.LFM2.5-2.6B-GGUF-Q4_K_M
列出所有可用模型
lemonade list
Hermes Agent (https://huggingface.co/LiquidAI/LFM2.5-2.6B-GGUF?local-app=hermes-agent)如何在 Hermes Agent 中使用 LiquidAI/LFM2.5-2.6B-GGUF:
启动 llama.cpp 服务器
``
安装 llama.cpp:
brew install llama.cpp
启动一个兼容 OpenAI 的本地服务器:
llama serve -hf LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M ``
配置 Hermes
``
安装 Hermes:
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup
将 Hermes 指向本地服务器:
hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default LiquidAI/LFM2.5-2.6B-GGUF:Q4_K_M ``
运行 Hermes
hermes
相似文章
LiquidAI/LFM2.5-8B-A1B-GGUF
LiquidAI 发布了其 LFM2.5-8B-A1B 模型的 GGUF 量化版本,并提供了在多个推理引擎上的使用说明。
@LottoLabs: 给显卡不够用的兄弟们的一个超酷模型,在一个海量token上训练的8b a1b模型,速度飞快…
LottoLabs 宣布了 LiquidAI 的 LFM2.5-8B-A1B-GGUF 模型,这是一个8B参数的模型,在大量token上训练,并针对有限GPU硬件上的快速推理进行了优化,支持 llama.cpp、Ollama、vLLM 等。
GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF
MiniCPM5-1B-Claude-Opus-Fable5-Thinking 模型的 GGUF 量化版本已在 Hugging Face 上发布,并附有 llama.cpp、vLLM 和 Ollama 的使用说明。
当你没有数据中心GPU时
LiquidAI 发布了 LFM2.5-230M,一个 230M 参数的语言模型,专为在有限硬件上运行而设计,支持 transformers、vLLM 和 SGLang。
LiquidAI/LFM2.5-2.6B
Liquid AI released LFM2.5-2.6B, a 2.6B-parameter hybrid model optimized for on-device deployment with 128K context, agentic post-training, and fast inference (220 tok/s on Apple M5 Max) under 2.5GB memory.