开发者生态
morning
Show HN:Shoehorn – 量化任何模型以在您的机器上运行
摘要
shoehorn Make any language model fit the memory you actually have. Preset quantizations ignore your hardware: pick one that fits and you either waste hundreds of megabytes of quality headroom or find ...
the
shoehorn
your
Mac
fit
GPU
you
and
budget
VRAM
2026-08-19
1 阅读
约3分钟阅读
rhgraysonii
字号:
鞋拔子 让任何语言模型都适合你实际拥有的记忆。预设量化会忽略您的硬件:选择一个适合的硬件,您要么浪费数百兆字节的质量空间,要么在加载时发现它根本不适合。 Shoehorn 从您实际拥有的内存开始,减去推理本身所需的内容,并解决每个张量的混合精度分配,该分配落在余数的舍入误差内 - 通常使用 99.99% 的预算,有时甚至到字节。 $ 鞋拔子适合 unsloth/Qwen3-4B-GGUF --serve 重量:519.2 MiB 预算中的 519.2 MiB(已使用 99.998%,剩余 13 KB) 在下载之前 什么适合您的机器?选择您的硬件,此页面会扫描 Hugging Face 下载次数最多的型号,找到适合您预算的鞋拔 - 根据您的内存提供的质量进行排名。完全在您的浏览器中运行。您的机器 Mac — 8 GB Mac — 16 GB Mac — 24 GB Mac — 32 GB Mac — 48 GB Mac — 64 GB Mac — 96 GB Mac — 128 GB GPU — 8 GB VRAM GPU — 12 GB VRAM GPU — 16 GB VRAM GPU — 24 GB VRAM GPU — 32 GB VRAM 自定义… 对话室 4k 代币 — 简短聊天 8k 代币 — 日常使用 16k令牌 — 长文档 32k 令牌 — 整个中篇小说 可用 GPU 内存,GiB 查找模型 获取鞋拔子 安装鞋拔子需要 llama.cpp 在您的 PATH 中作为推理后端(Homebrew 安装会为您拉取它)。然后,shoehorn ui 打开本地应用程序 - 选择一个模型,按一个按钮,聊天。 brew install notactuallytreyanastasio/shoehorn/shoehorn 复制或从源: Cargo install --path 。克隆存储库后。全部发布。应用程序 一键,您的全部预算本地网络应用程序测量您的机器,流式传输拟合,将预算呈现为卷尺,对拟合成本给出一个困惑的数字,最后以聊天按钮结束。麻省理工学院许可。量化器是在 Rust 中从头开始实现的——没有链接 llama.cpp 代码——并且输出是标准 GGUF v3,llama.cpp 下游的任何内容都会加载。来源·设计历史·发布
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱