首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

本地运行 Qwen3.8 27B:来自我的 Mac Studio 的实数

2026-08-29 1 阅读 约7分钟阅读 speckx
分享:
字号:
这10天以来,Qwen3.8 27B一直作为后台助手静静地运行在我的Mac Studio上。它将我的 RSS 提要总结为晨间摘要,将我扫描的 PDF 重命名并归档为可搜索的内容,并处理我交给它的任何总结工作。世俗的东西。这就是吸引力:这是第一个我足够信任的本地模特,可以不去理会世俗的事物。然后上周,这个模型突然在 r/LocalLLaMA 上随处可见,我的提要充满了基准图表,我意识到我一直坐在大多数线程都缺少的一件事上:一台实际上可以正确运行它的机器,以及测量它的时间。所以我对它进行了基准测试。每个模型五次定时运行,相同的提示,相同的机器,加上一个让我两次惊讶的 1 位实验。这是我测量的所有内容,以及它对于您自己运行这个东西所需的硬件意味着什么。 TL;DR Qwen3.8 27B(Q4_K_M,17GB)通过 Ollama 在我的 Mac Studio M3 Ultra 上以约 14 个令牌/秒的速度生成。它的前身 qwen3.6:27b 在同一台机器上每秒执行约 28.6 个令牌。它还以大约三分之一的标记回答相同的提示,因此每个完成答案的挂钟接近平局。 1 位量化 (6.7GB) 在 llama.cpp 中以 27 个令牌/秒的速度运行,并且得到了正确的事实,但它无法给出答案。您需要过去几周的 llama.cpp。旧版本因未知模型架构而失败: 'qwen35' 。这是我自己打的32GB 内存可轻松运行 Q4。 16GB 运行第二季度。下面的 RAM 表列出了每个定量的数字。那么Qwen3.8 27B是什么? Qwen3.8-27B 是一个具有混合注意力设计的 27.3B 参数密集模型(GGUF 中的架构标签是 qwen35 ,稍后会提到)。它是多模式的,内置图像和视频理解,带有 262,144 个令牌的本机上下文窗口,并在 Apache 2.0 下发布。官方模型卡声称 SWE-bench Pro 上的得分为 61.7,GPQA Diamond 上的得分为 89.2,这些数字在一年前还属于前沿实验室领域。社区反应直接跳过了该基准表。引发话题的是人们在第一周对该模型所做的事情:一个团队将其作为付费 API 模型的替代品连接到他们的编码管道中,并报告说它经受住了考验,OCR 测试人员声称其质量高于某些商业云层。最受好评的帖子中的一句话让我印象深刻:“这是第一个感觉不仅仅是玩具的本地模型。”我的贡献是大多数图表都缺少的一个衡量标准:这个模型在你今天可以买到的苹果芯片上实际做了什么。我的数字:同一台机器上的 3.8 与 3.6 我的日常机器是 Mac Studio M3 Ultra,具有 256GB 统一内存,与我用于 DeepSeek V4 Flash 指南的盒子相同。我通过 ollama run --verbose 为每个模型运行了五次定时生成,提供了各种技术提示、约 200-500 个单词的答案,并对统计数据进行了平均。两种模型都是默认的 Ollama Q4_K_M 量化,磁盘上几乎都是 17GB。 qwen3.6:27b qwen3.8:27b 生成速度(5 次运行平均值) 28.6 tok/s 14.0 tok/s 提示处理 95.0 tok/s 93.1 tok/s 运行间差距 28.5-28.8(稳定) 13.2-15.4 每个答案使用的令牌 1,950-3,340 890-1,090 头条新闻:新型号的发电速度是其前身的一半。相同的参数数量、相同的定量大小、相同的机器。混合注意力架构是新的,Ollama 中的 Metal 内核显然还没有跟上。我预计随着运行时的成熟,这种差距会缩小;同样的事情也发生在其他新颖的架构上。不过,这实际上并没有花费我时间。 Qwen3.8 在大约 1,000 个标记中回答了相同的提示,而 3.6 在 2,000-3,300 个标记中回答了相同的提示。算术:28.6 tok/s 的 2,058 个令牌需要 72 秒,14.2 tok/s 的 955 个令牌需要 67 秒。每个标记较慢,每个答案较快。当它生成时,CPU 几乎不会注意到,因为在 Apple 芯片上,推理通过 Metal 在 GPU 上运行。这篇文章的封面图片正是那个时刻,用 macmon 中代捕捉到:GPU 固定在 100%,拉动 63.95W,CPU 消耗 6W,全程应答流。 Stats 菜单栏应用程序在 GUI 方面讲述了同样的故事:所有 60 个 GPU 核心均处于 100%,系统功耗达到 291W: 1 位实验:测量脑损伤 本周获得最高票数的 Qwen3.8 线程庆祝了 Unsloth 的 1 位 Quant,这是一个 6.7GB 的文件,发帖者亲切地称为“脑损伤量化”。 27B 型号的内存占用相当于 7B 型号。我不得不尝试一下。它运行速度很快:提示处理速度为 309 tok/s,生成速度为 27.2 tok/s。速度几乎是 Q4 速度的两倍,内存不足 8GB。然后我问它问题。事实回忆确实很好:它知道堪培拉是澳大利亚的首都,并正确解释了其背后的悉尼-墨尔本妥协。但当我要求一个简单的 bash 语句时,它生成了一个工作命令,然后无法停止对自己进行事后猜测,在替代方案中循环燃烧 400 个代币,却从未承诺最终答案。这与 Unsloth 自己所说的相符:他们的量化
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱