开发者生态
morning
我在 M4 Pro Mac Mini 上的本地模型设置
摘要
I run a local LLM server on my M4 Pro Mac mini with 48 GB of RAM. It handles everything from my Hermes agent backend to quick chat queries on my phone. The whole thing takes about 30 minutes to set up...
the
and
for
with
model
Mac
that
your
they
have
2026-09-02
1 阅读
约7分钟阅读
raybb
字号:
我在配备 48 GB RAM 的 M4 Pro Mac mini 上运行本地 LLM 服务器。它处理从 Hermes 代理后端到手机上的快速聊天查询的所有事务。整个安装过程大约需要 30 分钟。这是堆栈: Qwen3.6-35B-A3B-OptiQ-4bit :我的主要模型,用于任何需要推理或深度的东西 Gemma-4-E4B-it-OptiQ-4bit :用于简单聊天、格式化和其他例行任务的轻量级模型 oMLX :推理服务器 Tailscale :连接 Mac mini、我的 iPhone 和我的 MacBook 的 tailnet Hermes 在 Mac mini 上作为代理后端运行,我的 MacBook 运行桌面客户端和我的手机运行 Telegram。对于非 Hermes 的使用,我使用 iOS 上的 Apollo 进行快速聊天(读起来像 Claude,适合一次性问题),使用 Pi 作为我的编码代理(我已经写过有关该设置的文章),并使用 Mac 上的 Raycast AI 来处理随机问题。本地运行的主要原因:云API是租用的土地。他们可以更改定价、达到您的使用限制,或者随时更换幕后提供的模型。我经常每月订阅两次 200 美元的上限,感觉我在不同的时间点从他们那里得到了不同的东西。有时模型很好,有时它会在没有通知的情况下退化。数据隐私是另一个问题。您不知道这些公司获得您的数据后会如何处理这些数据。他们可能会限制它的使用方式,他们可能会出售它,他们可能会暴露它。无论哪种方式,都会造成操作安全风险。如果您使用敏感代码、客户端数据或专有工作流程,则将其发送到第三方 API 是您一旦做出且无法撤消的决定。然后是人工智能主权。我一直在关注美国政府如何限制各种型号的推出。任何政府、任何原因都可能发生这种情况,而且你无法控制它。如果您的工作流程依赖于受到限制的云模型,您就必须停止或混乱。避免这种情况的唯一方法是拥有自己的计算资源。其他实际优势: 成本可预测性。 API 是可变的。您的使用量激增,您的账单也随之增加。对于本地硬件,成本是硬件购买加上电费。平坦的。之后,每一次推论都是自由的。延迟。无网络往返意味着日常任务的响应速度更快。 M4 Pro 的媒体引擎处理推理的速度对于大多数提示来说都是即时的。离线能力。没有网络,仍然可以使用。对于在后台运行的代理工作流程来说,这比听起来更重要。没有速率限制。当您达到使用阈值时,API 提供商会限制您。你自己的机器并不关心你跑了多少。 Mac mini 始终处于开启状态。它放在我的桌子上,除非需要它,否则我几乎没有注意到它。 Hermes 也可以在 Mac mini 上运行,在同一台机器上使用本地模型。我通过 Telegram(在我的手机上)和 MacBook 上的 Hermes 桌面应用程序访问我的代理。 Hermes 桌面应用程序充当“外壳”并连接到另一台设备(在本例中为 Mac mini)上的 Hermes 后端。这意味着我在所有设备上共享后端、对话历史记录和技能集。然后还有其他一切:iOS 上的 Apollo,用于快速一次性聊天。我想要一些读起来像 Claude 的东西,但不需要 API 密钥或订阅。将 Apollo 连接到 http://[mac-mini-tailnet-url]/v1 即可完成。适合“重写此段落”或“此错误意味着什么”类型的问题。我的 Mac 上还可以使用 Raycast 来处理我不想安装任何东西的随机事件。 Pi 用于编码。已经写过有关该设置的文章。重点不是要取代基于 API 的模型。它是为了处理 80% 不需要 GPT-5 或 Claude Opus 的请求。当我确实需要这些时,它们已经可用。 Local 只免费涵盖了我的更多日常事务。在本地运行大型模型归结为一件事:内存中实际需要多少 RAM。大多数人在查看参数计数时都会产生错误的想法,因为密集模型和专家混合 (MoE) 模型之间的差异对于消费类硬件来说非常重要。以下是如何读取标识符: Qwen3.6-35B-A3B-OptiQ-4bit Qwen3.6 :模型系列和版本 35B :所有专家的总参数 A3B :每个令牌的活动参数(30 亿,而不是 35) OptiQ-4bit :混合精度量化(主要是 4 位,敏感层上为 8 位) gemma-4-e4b-it-4bit gemma-4 : Google 的 Gemma 4 系列 e4b:编码大小,总共大约 40 亿个参数:指令调整的 4 位:统一的 4 位量化 关键区别在于 A3B 部分。对于每个令牌,密集的 27B 模型始终在 RAM 中加载 270 亿个参数。像 Qwen3.6-35B-A3B 这样的 MoE 模型共有 350 亿个参数,分布在 256 位专家中,但每个代币实际激活的参数只有约 30 亿个。其余 320 亿则位于 RAM 中,什么都不做。在我的 48GB Mac mini 上,4 位的 Qwen3.6-35B-A3B 需要大约 20GB 的 RAM。剩下 28GB 用于上下文窗口、操作系统以及计算机上运行的其他所有内容。 Gemma-4-E4B 是 ro
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱