HN展示:Shoehorn – 将任何模型量化以在本地机器上运行

Hacker News Top 工具

摘要

Shoehorn是一款开发者工具,可将语言模型量化,以完美适配机器的可用内存,实现高达99.99%的内存使用效率,用于本地推理。

目前支持Mac、Linux和Windows系统。我提供了一个简单的图形用户界面,用于查找新模型并进行构建和设置。对我来说,它在几个模型上运行得相当不错。GitHub上的README和DESIGN.md文件详细说明了其原理和原因,目前为止它运行得非常出色。<a href="https://github.com/notactuallytreyanastasio/shoehorn" rel="nofollow">https://github.com/notactuallytreyanastasio/shoehorn</a>
查看原文
查看缓存全文

缓存时间: 2026/08/18 16:04

# shoehorn — 让任何语言模型适配你的设备 来源:https://notactuallytreyanastasio.github.io/shoehorn/ 让你的设备实际内存跑得下任何语言模型。 预设量化方案无视你的硬件配置:要么选择超出内存的方案导致浪费大量质量上限,要么在加载时才发现根本装不下。shoehorn 从你实际可用内存出发,扣除推理所需资源,通过逐张量混合精度分配方案,将内存占用精确控制在余量误差范围内——常规情况下可实现**99.99%**的预算利用率,有时甚至精确到字节。 $ shoehorn fit unsloth/Qwen3\-4B\-GGUF \-\-serve**权重:519.2 MiB 占用 / 519.2 MiB 预算(利用率99.998%,仅13 KB未使用)** 下载前须知 ## 适配你设备的模型? 选择硬件配置,本页面会扫描 Hugging Face 下载量最高的模型列表,筛选出可适配你内存预算的方案,并按你的内存能实现的最高质量排序——整个过程完全在浏览器内运行。 你的设备 会话空间 获取 shoehorn ## 安装 shoehorn 需要将 llama.cpp (https://github.com/ggml-org/llama.cpp) 置于系统路径中作为推理后端(通过 Homebrew 安装时会自动处理)。随后使用 `shoehorn ui` 启动本地应用——选择模型,点击按钮,即可开始对话。 `brew install notactuallytreyanastasio/shoehorn/shoehorn` 或从源码安装:克隆仓库 (https://github.com/notactuallytreyanastasio/shoehorn) 后执行 `cargo install \-\-path \.`。所有版本发布 (https://github.com/notactuallytreyanastasio/shoehorn/releases)。 应用介绍 ## 一键启动,榨干预算 本地 Web 应用会检测设备性能、动态计算适配方案、以量尺可视化内存预算、显示适配消耗的困惑度指标,最终呈现对话按钮。 已完成的适配方案:量尺显示99.998%预算利用率、按类型混合的精度配置、对话与测量按钮 模型发现卡片:按预算能力排序的模型列表,每个模型配备使用按钮

相似文章

Show HN:在 4 GB 笔记本 GPU 上微调 8B 模型

Hacker News Top

Soup 是一个开源命令行工具,通过单条命令简化 LLM 的微调和后训练,支持基于 QLoRA 的训练,通过逐层流式传输仅需 4 GB 显存即可在消费级 GPU 上运行。最新版本新增了 DPO、ORPO、SimPO 和 KTO 等偏好损失,且不会使内存需求翻倍。

Show HN: Reame – 一个随着运行而变快的CPU推理服务器

Hacker News Top

Reame 是一个基于 llama.cpp 构建的 LLM 推理服务器,通过缓存提示前缀和生成的 n-gram 来优化 CPU 硬件,随着重复使用变得越来越快。它专为廉价硬件设计,如共享 vCPU 和免费套餐,适用于重复性的 AI 工作负载,例如文档提取和批量处理管道。

MixQuant:大语言模型的自适应混合精度量化

arXiv cs.LG

MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。