@tom_doerr: 本地LLM工具和硬件精选列表 https://github.com/0xSojalSec/LLMs-local…
摘要
一份精选列表,包含用于本地运行大语言模型的平台、工具、模型、硬件和资源,托管在GitHub上。
查看缓存全文
缓存时间: 2026/06/12 19:01
精选的本地LLM工具和硬件列表 https://t.co/LNDKQzn8f3 https://t.co/LpqptHnL4n — # 0xSojalSec/LLMs-local 来源:https://github.com/0xSojalSec/LLMs-local # LLMs-local 精彩平台、工具和资源列表,用于本地运行LLMs ## 目录 - 推理平台 - 推理引擎 - 用户界面 - 大型语言模型 - 探索者、基准测试、排行榜 - 模型提供商 - 特定模型 - 通用型 - 编码 - 多模态 - 图像 - 音频 - 杂项 - 工具 - 模型 - 智能体框架 - 模型上下文协议 - 检索增强生成 - 编码智能体 - 计算机使用 - 浏览器自动化 - 内存管理 - 测试、评估和可观测性 - 研究 - 训练和微调 - 杂项 - 硬件 - 教程 - 模型 - 提示工程 - 上下文工程 - 推理 - 智能体 - 检索增强生成 - 杂项 - 社区 ## 推理平台 - LM Studio (https://lmstudio.ai/) - 发现、下载并运行本地LLM - jan (https://github.com/menloresearch/jan) - 一个完全离线运行在电脑上的ChatGPT开源替代品 - LocalAI (https://github.com/mudler/LocalAI) - OpenAI、Claude等工具的免费开源替代品 - ChatBox (https://github.com/ChatBoxAI/ChatBox) - 适用于AI模型/LLM的用户友好桌面客户端应用 - lemonade (https://github.com/lemonade-sdk/lemonade) - 支持GPU和NPU加速的本地LLM服务器 返回目录 ## 推理引擎 - ollama (https://github.com/ollama/ollama) - 快速上手并运行LLM - llama.cpp (https://github.com/ggml-org/llama.cpp) - 用C/C++实现的LLM推理 - vllm (https://github.com/vllm-project/vllm) - 高吞吐量、内存高效的LLM推理和服务引擎 - exo (https://github.com/exo-explore/exo) - 使用日常设备在家中运行自己的AI集群 - BitNet (https://github.com/microsoft/BitNet) - 1-bit LLM的官方推理框架 - sglang (https://github.com/sgl-project/sglang) - 大型语言模型和视觉语言模型的快速服务框架 - Nano-vLLM (https://github.com/GeeeekExplorer/nano-vllm) - 从头构建的轻量级vLLM实现 - koboldcpp (https://github.com/LostRuins/koboldcpp) - 通过KoboldAI UI轻松运行GGUF模型 - gpustack (https://github.com/gpustack/gpustack) - 在GPU集群上简单、可扩展的AI模型部署 - mlx-lm (https://github.com/ml-explore/mlx-lm) - 在Apple Silicon上使用MLX生成文本和微调大型语言模型 - distributed-llama (https://github.com/b4rtaz/distributed-llama) - 将家庭设备连接成强大集群以加速LLM推理 - ik_llama.cpp (https://github.com/ikawrakow/ik_llama.cpp) - llama.cpp的分支,具有额外的SOTA量化和改进的性能 - FastFlowLM (https://github.com/FastFlowLM/FastFlowLM) - 在AMD Ryzen™ AI NPU上运行LLM - vllm-gfx906 (https://github.com/nlzy/vllm-gfx906) - 适用于AMD gfx906 GPU(如Radeon VII / MI50 / MI60)的vLLM - llm-scaler (https://github.com/intel/llm-scaler) - 在Intel Arc™ Pro B60 GPU上运行LLM 返回目录 ## 用户界面 - Open WebUI (https://github.com/open-webui/open-webui) - 用户友好的AI界面(支持Ollama、OpenAI API等) - Lobe Chat (https://github.com/lobehub/lobe-chat) - 开源、现代设计的AI聊天框架 - Text generation web UI (https://github.com/oobabooga/text-generation-webui) - 具有高级功能、易于设置和多种后端支持的LLM UI - SillyTavern (https://github.com/SillyTavern/SillyTavern) - 面向高级用户的LLM前端 - Page Assist (https://github.com/n4ze3m/page-assist) - 使用本地运行的AI模型在网页浏览中提供帮助 返回目录 ## 大型语言模型 ### 探索者、基准测试、排行榜 - AI Models & API Providers Analysis (https://artificialanalysis.ai/) - 了解AI领域,为你的用例选择最佳模型和提供商 - LLM Explorer (https://llm-explorer.com/) - 探索开源LLM模型列表 - Dubesor LLM基准测试表 (https://dubesor.de/benchtable) - 小规模手动性能比较基准 - oobabooga基准测试 (https://oobabooga.github.io/benchmark.html) - 按每个分数(磁盘大小)排序的列表 返回目录 ### 模型提供商 - Qwen (https://huggingface.co/Qwen) - 由阿里云提供支持 - Mistral AI (https://huggingface.co/mistralai) - 开拓性的法国人工智能初创公司 - Tencent (https://huggingface.co/tencent) - 中国跨国科技集团和控股公司的个人资料 - Unsloth AI (https://huggingface.co/unsloth) - 专注于使AI对所有人更易访问(GGUF等) - bartowski (https://huggingface.co/bartowski) - 提供流行LLM的GGUF版本 - 北京智源人工智能研究院 (https://huggingface.co/BAAI) - 从事AI研究和开发的私营非营利组织 - Open Thoughts (https://huggingface.co/open-thoughts) - 一个研究人员和工程师团队,负责策划最佳开源推理数据集 返回目录 ### 特定模型 #### 通用型 - DiffusionGemma-26B-A4B-it (https://huggingface.co/google/diffusiongemma-26B-A4B-it) - Google新的基于扩散的多模态LLM(2026年6月10日发布)。26B MoE,1100+ tokens/秒,可在消费级硬件上量化运行。 - MiniMax M3 (https://huggingface.co/minimax-ai/MiniMax-M3) - 前沿开放权重模型,支持1M上下文、原生多模态和顶级编码/智能体性能(2026年6月)。 - DeepSeek-V4 (https://huggingface.co/deepseek-ai/DeepSeek-V4) - 最新的DeepSeek系列(V4-Pro和Flash),出色的长上下文推理和编码(2026年5月下旬)。 - Kimi-K2.6 (https://huggingface.co/moonshotai/Kimi-K2.6) - Moonshot AI最新面向智能体的长上下文模型(2026年5月/6月)。 - Qwen3-Next (https://huggingface.co/collections/Qwen/qwen3-next-68c25fd6838e585db8eeea9d) - 最新一代Qwen LLM的集合 - Gemma 3 (https://huggingface.co/collections/google/gemma-3-release-67c6c6f89c4f76621268bb6d) - Google轻量级、最先进的开源模型系列,基于与创建Gemini模型相同的研究和技术构建 - gpt-oss (https://huggingface.co/collections/openai/gpt-oss-68911959590a1634ba11c7a4) - OpenAI的开放权重模型集合,专为强大的推理、智能体任务和多样化的开发者用例而设计 - Ministral 3 (https://huggingface.co/collections/mistralai/ministral-3) - 边缘模型集合,包含基础、指令和推理变体,三种尺寸:3B、8B和14B,均具备视觉能力 - GLM-4.5 (https://huggingface.co/collections/zai-org/glm-45-687c621d34bda8c9e4bf503b) - 为智能代理设计的混合推理模型集合 - Hunyuan (https://huggingface.co/collections/tencent/hunyuan-dense-model-6890632cda26b19119c9c5e7) - 腾讯开源高效LLM集合,专为跨多样计算环境的通用部署而设计 - Phi-4-mini-instruct (https://huggingface.co/microsoft/Phi-4-mini-instruct) - 基于合成数据和过滤后的公开网站构建的轻量级开源模型 - NVIDIA Nemotron v3 (https://huggingface.co/collections/nvidia/nvidia-nemotron-v3) - NVIDIA的开放模型系列,包含开放权重、训练数据和配方,为构建专用AI代理提供领先的效率和准确性 - Llama Nemotron (https://huggingface.co/collections/nvidia/llama-nemotron-67d92346030a2691293f200b) - NVIDIA的开放生产级企业模型集合 - OpenReasoning-Nemotron (https://huggingface.co/collections/nvidia/openreasoning-nemotron-687730dae0170059860f1f01) - NVIDIA的模型集合,针对数学、代码和科学领域在500万推理轨迹上训练 - Granite 4.0 (https://huggingface.co/collections/ibm-granite/granite-40-language-models-6811a18b820ef362d9e5a82c) - IBM轻量级、最先进的开源基础模型系列,原生支持多语言能力、广泛的编码任务(包括中间填充(FIM)代码补全)、检索增强生成(RAG)、工具使用和结构化JSON输出 - EXAONE-4.0 (https://huggingface.co/collections/LGAI-EXAONE/exaone-40-686b2e0069800c835ed48375) - LG AI Research的LLM集合,融合非推理和推理模式 - ERNIE 4.5 (https://huggingface.co/collections/baidu/ernie-45-6861cd4c9be84540645f35c9) - 百度的大规模多模态模型集合 - Seed-OSS (https://huggingface.co/collections/ByteDance-Seed/seed-oss-68a609f4201e788db05b5dcd) - 字节跳动Seed团队开发的LLM集合,专为强大的长上下文、推理、智能体和通用能力而设计,并提供灵活的开发者友好特性 返回目录 #### 编码 - Qwen3-Coder (https://huggingface.co/collections/Qwen/qwen3-coder-687fc861e53c939e52d52d10) - Qwen迄今最具智能体的代码模型集合 - Devstral 2 (https://huggingface.co/collections/mistralai/devstral-2) - 针对软件工程任务的智能体LLM,擅长使用工具探索代码库、编辑多个文件,并为SWE代理提供动力 - Mellum-4b-base (https://huggingface.co/JetBrains/Mellum-4b-base) - JetBrains的LLM,针对代码相关任务优化 - OlympicCoder-32B (https://huggingface.co/open-r1/OlympicCoder-32B) - 在LiveCodeBench和2024国际信息学奥林匹克竞赛等竞争性编码基准测试中表现强劲的代码模型 - NextCoder (https://huggingface.co/collections/microsoft/nextcoder-6815ee6bfcf4e42f20d45028) - 基于Qwen2.5-Coder Instruct变体开发的代码编辑LLM系列 返回目录 #### 多模态 - Qwen3-Omni (https://huggingface.co/collections/Qwen/qwen3-omni-68d100a86cd0906843ceccbe) - Qwen的原生端到端多语言全模态基础模型集合 返回目录 #### 图像 - Qwen-Image (https://huggingface.co/Qwen/Qwen-Image) - Qwen系列的图像生成基础模型,在复杂文本渲染和精确图像编辑方面取得显著进步 - Qwen-Image-Edit-2509 (https://huggingface.co/Qwen/Qwen-Image-Edit-2509) - Qwen-Image的图像编辑版本,将基础模型的独特文本渲染能力扩展到图像编辑任务,实现精确的文本编辑 - Qwen3-VL (https://huggingface.co/collections/Qwen/qwen3-vl-68d2a7c1b8a8afce4ebd2dbe) - Qwen系列迄今最强大的视觉语言模型集合 - GLM-4.5V (https://huggingface.co/zai-org/GLM-4.5V) - 基于智谱AI下一代旗舰文本基础模型GLM-4.5-Air的VLLM - HunyuanImage-2.1 (https://huggingface.co/tencent/HunyuanImage-2.1) - 用于高分辨率(2K)文本到图像生成的高效扩散模型 - FastVLM (https://huggingface.co/collections/apple/fastvlm-68ac97b9cd5cacefdd04872e) - Apple的高效视觉编码VLM集合 - MiniCPM-V-4_5 (https://huggingface.co/openbmb/MiniCPM-V-4_5) - 在手机上实现GPT-4o级别的MLLM,支持单图像、多图像和高FPS视频理解 - LFM2-VL (https://huggingface.co/collections/LiquidAI/lfm2-vl-68963bbc84a610f7638d5ffa) - 视觉语言模型集合,专为设备端部署设计 - ClipTagger-12b (https://huggingface.co/inference-net/ClipTagger-12b) - 专为大规模视频理解设计的视觉语言模型(VLM) 返回目录 #### 音频 - Voxtral-Small-24B-2507 (https://huggingface.co/mistralai/Voxtral-Small-24B-2507) - Mistral Small 3的增强版,融合了最先进的音频输入能力,同时保持一流的文本性能 - chatterbox (https://huggingface.co/ResembleAI/chatterbox) - 首个生产级开源TTS模型 - VibeVoice (https://huggingface.co/collections/microsoft/vibevoice-68a2ef24a875c44be47b034f) - Microsoft的前沿文本到语音模型集合 - canary-1b-v2 (https://huggingface.co/nvidia/canary-1b-v2) - NVIDIA的多任务语音转录和翻译模型 - parakeet-tdt-0.6b-v3 (https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3) - NVIDIA的多语言语音到文本模型 - Kitten TTS (https://huggingface.co/KittenML/models) - 开源逼真文本到语音模型集合,专为轻量级部署和高质量语音合成设计 返回目录 #### 杂项 - Jan-v1-4B (https://huggingface.co/janhq/Jan-v1-4B) - Jan系列的第一个版本,专为Jan应用内的智能体推理和问题解决而设计 - Jan-nano (https://huggingface.co/Menlo/Jan-nano) - 一个紧凑的40亿参数语言模型,专门为深度研究任务设计和训练 - Jan-nano-128k (https://huggingface.co/Menlo/Jan-nano-128k) - Jan-nano的增强版,具有原生128k上下文窗口,能够实现更深、更全面的研究能力,而不会出现上下文扩展方法常见的性能下降 - Arch-Router-1.5B (https://huggingface.co/katanemo/Arch-Router-1.5B) - 最快的LLM路由器模型,能够对齐主观使用偏好 - gpt-oss-safeguard (https://huggingface.co/collections/openai/gpt-oss-safeguard) - 基于gpt-oss构建的安全推理模型集合 - Qwen3Guard (https://huggingface.co/collections/Qwen/qwen3guard-68d2729abbfae4716f3343a1) - 基于Qwen3构建的安全审核模型集合 - HunyuanWorld-1 (https://huggingface.co/tencent/HunyuanWorld-1) - 开源3D世界生成模型 - Hunyuan-GameCraft-1.0 (https://huggingface.co/tencent/Hunyuan-GameCraft-1.0) - 用于游戏环境中高动态交互视频生成的新型框架 返回目录 ## 工具 ### 模型 - unsloth (https://github.com/unslothai/unsloth) - LLM的微调和强化学习 - outlines (https://github.com/dottxt-ai/outlines) - LLM的结构化输出 - heretic (https://github.com/p-e-w/heretic) - 语言模型的完全自动审查移除 - llama-swap (https://github.com/mostlygeek/llama-swap) - 任何本地OpenAI兼容服务器(如llama.cpp、vllm等)的可靠模型交换 返回目录 ### 智能体框架 - AutoGPT (https://github.com/Significant-Gravitas/AutoGPT) - 一个强大的平台,允许你创建、部署和管理自动化复杂工作流的持续AI代理 - langflow (https://github.com/langflow-ai/langflow) - 构建和部署AI驱动的代理和工作流的强大工具 - langchain (https://github.com/langchain-ai/langchain) - 构建上下文感知的推理应用 - autogen (https://github.com/microsoft/autogen) - 用于智能体AI的编程框架 -
相似文章
@bytebytego: 如何在本地运行LLMs
一份指南,说明如何在您自己的硬件上本地运行大型语言模型。
@tom_doerr: 精选的 LLM、多模态模型与智能体列表 https://github.com/eudk/awesome-ai-tools…
一个精心策划的GitHub仓库,收录了大型语言模型、多模态生成工具、AI智能体和开发者平台,自2023年起持续维护。
@tom_doerr:通过无代码 GUI 微调大型语言模型 https://github.com/h2oai/h2o-llmstudio…
H2O LLM Studio 是一个开源框架和无代码图形界面,可简化大型语言模型的微调过程,支持 LoRA、DPO 等技术,并能与 Hugging Face 集成。
@TheAhmadOsman: 想替代 Anthropic/OpenAI?从这里开始——本地运行 LLM 的圣经现已开放在线阅读……
一份涵盖多种硬件和软件配置的 LLM 本地运行全面指南现已免费在线阅读,涉及 llama.cpp、vLLM 等工具。
@oliviscusAI: 有人刚刚开发了一款工具,可以准确告诉你哪些大语言模型可以在你的硬件上运行。它会扫描你的内存、CPU 和 GPU……
一款新工具已发布,它通过扫描用户的硬件规格(内存、CPU、GPU)来确定哪些大语言模型可以本地运行,并根据性能指标对这些模型进行排名。