首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

Qwen3.8 27B 量化基准测试:4 位保持,1 位崩溃

2026-09-09 1 阅读 约7分钟阅读 stared
分享:
字号:
在不牺牲质量的情况下运行 Qwen3.8 27B 实际上需要多少 GPU RAM?完整的 BF16 型号重 55 GB,超出了大多数消费类硬件。然而,17 GB Q4_K_M 与流行的代理编码基准 Terminal-Bench 2.1 上的完整模型相匹配。它适用于 RTX 4090 等 24 GB 卡,仍然为大约 64k 上下文标记留有空间。压缩最终达到了悬崖。在 1 位时,模型在 GPQA Diamond 上的表现围绕随机机会,较长的推理会使情况变得更糟。背景 Qwen3.8 27B GGUF 量化可从 Unsloth on Hugging Face 获得。这么多可供选择!我将检查 8 位 Q8_0 (29 GB)、4 位 Q4_K_M (17 GB)、2 位 UD-Q2_K_XL (10.7 GB) 以及最小的 1 位 UD-IQ1_S (6.2 GB)。之前,我研究了 Qwen3.6 27B 模型,该模型即使在 12GB 的情况下也能很好地生成 SVG 鹈鹕,并且将其大部分知识保持到 16GB。与此同时,在 Reddit 帖子中,许多人抱怨所有量化,甚至是 8 位量化,都会给出更糟糕的结果 - 人们问为什么你当地的 LLM 感觉比实际情况更愚蠢。这些抱怨有根据吗?测量 token 预测差异(KL 散度、top-1 预测)很容易,但它并不能告诉我们模型在解决任务方面是否变得更糟。有些噪音可能与解决任务无关,因为(比如说)量化模型会生成完全相同质量的答案(稍微解释一下)。在其他情况下,单个不同的标记可能是逻辑错误,甚至突然结束输出。 70% 80% 90% 100% 6 10 20 30 50 GB 磁盘上的模型大小与 BF16 相同的 top-1 标记 UD-IQ1_S UD-IQ1_M UD-Q2_K_XL Q4_K_M Q8_0 BF16 因此,我专注于直接测量流行基准测试的结果 - GPQA Diamond、指令遵循 IFBench、编程终端工作台 2.1 。首先,复制完整模型 BF16 的官方结果,然后查看量化如何影响结果。当我使用 llama.cpp 使用 2026 年 8 月 16 日的版本运行模型时,我在 Modal GPU 上消耗了大约 3,000 美元,因为早期版本不适用于该模型。原则上,我可以在自己的笔记本电脑上运行它,但是(与鹈鹕一代不同),这些是耗时的基准测试。请注意,无论模型量化如何,我都使用 F16 KV 缓存,每 32k 令牌重约 2.3 GB。我使用 Unsloth 量化:v2 用于 2 位、4 位和 8 位模型,v3 用于 1 位模型。 Unsloth 于 2026 年 8 月 19 日替换了 v2 文件,因此用于大多数测试的确切文件不再可用。简而言之,如果您使用 4 位量化 Q4_K_M (17GB),您将不会注意到这些基准测试的差异。同时,工作量设置也很重要(请注意,默认值为 xhigh ) - 这是一个棘手的选择,因为它可能会过度思考。一次性测试 最简单的测试是一次性测试:在本例中,是研究生级别的科学 GPQA Diamond 和遵循指令的 IFBench。我以三种推理方式运行每个推理: low 、medium 和默认的 xhigh 。 GPQA Diamond 70% 75% 80% 85% 90% 95% 100% 10 20 30 50 GB 磁盘上的模型大小 GPQA Diamond 分数 xhigh(默认)由 Qwen 报告 低 中 UD-Q2_K_XL Q4_K_M Q8_0 BF16 首先,我很高兴我复制了官方结果。运行基准测试很困难;有许多隐藏的设置或假设可以极大地改变结果。在这里,第一次的结果如 Qwen 报告的那样。其次,除了噪声(条形是 Wilson 95% 置信区间,对于运行间噪声非常保守),低至 4 位几乎没有差异;只是2位的分数稍低一些。与此同时,思维水平极大地改变了分数。对于 xhigh 来说,最好的结果需要大约 8k 个推理标记。 IFBench 60% 80% 10 20 30 50 GB 磁盘上的模型大小 IFBench 遵循 Qwen 中低 UD-Q2_K_XL Q4_K_M Q8_0 BF16 报告的(严格)xhigh(默认)这里,令我大吃一惊的是,模型之间没有任何变化,降至一个不错的 2 位模型,重量不到 11 GB。然而,上下文甚至更低,大约 4k 个令牌。代理编码和 Terminal-Bench 2.1 它如何用于编程? Terminal-Bench 2.1 是一个标准的代理基准测试,有 89 项任务。这里我使用了 3 小时的超时,xhigh 的努力。我保留了 98k 上下文。由 Qwen 报告 55% 60% 65% 70% 75% 80% 10 20 30 40 50 GB 磁盘上的模型大小(对数刻度) Terminal-Bench 2.1 通过了 UD-Q2_K_XL Q4_K_M BF16 我对 BF16 的测量不仅复制了所述结果,而且令我惊讶的是,Q4_K_M 也如此。我不小心跳过了运行 Q8_0 ;然而,在这种情况下,我可以安全地在 4 位和完整模型的值之间进行插值。运行它既昂贵又不必要(并且会超出非正式博客文章的预算)。仅在 2 位 UD-Q2_K_XL 处,情况会出现一些问题。明显下降,但仍然是 Opus 4.7 或 Gemini 3.1 Pro 的水平。再说一次,远离边境,但也远非无用。结果是一回事,但过程又如何呢?较小的模型是否需要更多的回合、令牌或时间才能获得结果?与 BF16 相同 0.8x 1.0x 1.2x 1.4x 1.6x 1.8x 输出令牌与 BF
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱