HN展示:Shoehorn – 将任何模型量化以在本地机器上运行
摘要
Shoehorn是一款开发者工具,可将语言模型量化,以完美适配机器的可用内存,实现高达99.99%的内存使用效率,用于本地推理。
目前支持Mac、Linux和Windows系统。我提供了一个简单的图形用户界面,用于查找新模型并进行构建和设置。对我来说,它在几个模型上运行得相当不错。GitHub上的README和DESIGN.md文件详细说明了其原理和原因,目前为止它运行得非常出色。<a href="https://github.com/notactuallytreyanastasio/shoehorn" rel="nofollow">https://github.com/notactuallytreyanastasio/shoehorn</a>
查看缓存全文
缓存时间: 2026/08/18 16:04
# shoehorn — 让任何语言模型适配你的设备
来源:https://notactuallytreyanastasio.github.io/shoehorn/
让你的设备实际内存跑得下任何语言模型。
预设量化方案无视你的硬件配置:要么选择超出内存的方案导致浪费大量质量上限,要么在加载时才发现根本装不下。shoehorn 从你实际可用内存出发,扣除推理所需资源,通过逐张量混合精度分配方案,将内存占用精确控制在余量误差范围内——常规情况下可实现**99.99%**的预算利用率,有时甚至精确到字节。
$ shoehorn fit unsloth/Qwen3\-4B\-GGUF \-\-serve**权重:519.2 MiB 占用 / 519.2 MiB 预算(利用率99.998%,仅13 KB未使用)**
下载前须知
## 适配你设备的模型?
选择硬件配置,本页面会扫描 Hugging Face 下载量最高的模型列表,筛选出可适配你内存预算的方案,并按你的内存能实现的最高质量排序——整个过程完全在浏览器内运行。
你的设备
会话空间
获取 shoehorn
## 安装
shoehorn 需要将 llama.cpp (https://github.com/ggml-org/llama.cpp) 置于系统路径中作为推理后端(通过 Homebrew 安装时会自动处理)。随后使用 `shoehorn ui` 启动本地应用——选择模型,点击按钮,即可开始对话。
`brew install notactuallytreyanastasio/shoehorn/shoehorn`
或从源码安装:克隆仓库 (https://github.com/notactuallytreyanastasio/shoehorn) 后执行 `cargo install \-\-path \.`。所有版本发布 (https://github.com/notactuallytreyanastasio/shoehorn/releases)。
应用介绍
## 一键启动,榨干预算
本地 Web 应用会检测设备性能、动态计算适配方案、以量尺可视化内存预算、显示适配消耗的困惑度指标,最终呈现对话按钮。
已完成的适配方案:量尺显示99.998%预算利用率、按类型混合的精度配置、对话与测量按钮
模型发现卡片:按预算能力排序的模型列表,每个模型配备使用按钮
相似文章
Show HN:在 4 GB 笔记本 GPU 上微调 8B 模型
Soup 是一个开源命令行工具,通过单条命令简化 LLM 的微调和后训练,支持基于 QLoRA 的训练,通过逐层流式传输仅需 4 GB 显存即可在消费级 GPU 上运行。最新版本新增了 DPO、ORPO、SimPO 和 KTO 等偏好损失,且不会使内存需求翻倍。
Show HN:在 Mac 上仅用 4.3 GB 内存运行 80B Qwen,以及在 iPhone 上运行 35B
演示了在 Mac 上仅用 4.3 GB 内存运行 80B Qwen 模型,以及在 iPhone 上运行 35B 模型,展示了本地 LLM 推理的极致内存优化。
Show HN:Maple-Preview——在 iPhone 上以 120 tok/s 运行的三值 20B MoE
Maple-Preview 是一个三值 20B MoE 模型,在 iPhone 上每秒可运行 120 个 token,展现了高效的端侧推理能力。
Show HN: Reame – 一个随着运行而变快的CPU推理服务器
Reame 是一个基于 llama.cpp 构建的 LLM 推理服务器,通过缓存提示前缀和生成的 n-gram 来优化 CPU 硬件,随着重复使用变得越来越快。它专为廉价硬件设计,如共享 vCPU 和免费套餐,适用于重复性的 AI 工作负载,例如文档提取和批量处理管道。
MixQuant:大语言模型的自适应混合精度量化
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。