智能AI
morning
Shapelearn Qwen 3.8 27B (13.1 GB VRAM)
摘要
We were a little impatient. Qwen 3.8 27B was released on August 14, 2026. Four days later, on August 18, we published our first set of GGUFs. We called them ShapeLearn-Lite for a reason: they were pro...
the
draft
ShapeLearn
Lite
27B
and
Qwen3
models
with
llama
2026-09-18
1 阅读
约10分钟阅读
syntaxing
字号:
我们有点不耐烦了。 Qwen 3.8 27B 于 2026 年 8 月 14 日发布。四天后,即 8 月 18 日,我们发布了第一组 GGUF。我们将它们称为 ShapeLearn-Lite 是有原因的:它们是使用更小的优化预算、更少的检查和更少的等待来生成的。现在完整的 ShapeLearn 模型已经完成,我们已经将它们与原始 Lite 集和竞争量化模型一起进行了基准测试。好消息:ShapeLearn-Lite 表现良好。我们稍后将在“ShapeLearn-Lite,回顾”中回顾这一点。更好的消息:完整的 ShapeLearn 模型甚至更好。快速开始 llama.cpp MTP 草稿头捆绑在每个 GGUF 中。 DFlash2 使用单独的 1.1 GB 草案模型。这两个命令都使用 GPU-5 。将标签替换为版本中的任何其他模型。 MTP 嵌入式草案。适用于图像输入。复制 llama-server \ -hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw \ --mmproj-auto \ --spec-type Draft-mtp --spec-draft-n-max 3 DFlash2 外部草稿。最快的选项,仅限文本。复制 llama-server \ -hf byteshape/Qwen3.8-27B-GGUF:Qwen3.8-27B-IQ4_XS-3.84bpw \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type Draft-dflash --spec-draft-n-max 7 \ --no-mmproj DFlash2 需要llama.cpp b10658 或更新版本。每个模型的准备运行命令以及建议的采样设置位于运行工具和模型卡上。 TL;DR Full ShapeLearn 将测量的质量速度前沿超越了 Lite。新版本中的所有五种型号在我们的六种 GPU 比较中均处于前沿。 GPU-5 是我们的默认推荐,无论它适合什么,达到 BF16 基准测试总分的 99.63%。如果它不适合您需要的环境,GPU-4 仍然非常有竞争力:它以更小的尺寸(11.0 GB 而不是 13.1 GB)达到 BF16 的 98.72%,而且速度更快。 ShapeLearn-Lite 的表现也比其 KLD 排名建议的要好:其六个模型中的三个在 Lite 与 Unsloth Dynamic v3 比较中处于前沿。使用 MTP 或 DFlash2 进行推测解码可提高测试的每个 ShapeLearn 模型和 GPU 的吞吐量。 DFlash2 通常速度更快,但需要更多内存,并且不支持使用 llama.cpp 进行图像输入。当内存允许时,选择 DFlash2 以获得最大纯文本吞吐量;当 VRAM 或多模式支持更重要时,选择 MTP。完整的 ShapeLearn 开拓了前沿 我们正在发布 Qwen 3.8 27B 的完整 ShapeLearn 运行版本。在此版本中,较大的模型可产生较高的总分数,而较小的模型可提供较高的吞吐量。该顺序适用于所有测试的 6 个 GPU。由于这是一个密集模型,并且内存传输是瓶颈,因此与 MoE 相比,较低的 BPW 更直接地转化为较高的 TPS。每个 GPU 的比较还包括 AtomicChat 、 Bartowski 、 ISTA-DASLab 和 Unsloth Dynamic v3 。 Bartowski 的最新型号是在我们测试后发布的,不包括在内。 Full ShapeLearn 在图中标记为 ByteShape。所有五个 ShapeLearn 模型都保持在测量的前沿,其中 GPU-5 在绘制的量化中获得了最高的总分。其他队伍也贡献竞技积分。值得注意的是,ISTA-DASLab 的优秀模型(下图中的黄色“d”)也位于前沿。我们所说的“前沿”是指没有其他绘制模型能够更快、更准确。 96 GB:RTX Pro 6000 RTX PRO 6000 是内存最多的 GPU,让我们展示了测试的全系列型号。 RTX Pro 6000:每秒令牌数与质量(完整的 ShapeLearn 和竞争量化) 点击下面的“显示图例”以了解模型详细信息。 RTX Pro 6000:每秒的代币与质量(完整的 ShapeLearn 和竞争量化)将鼠标悬停在气泡上,或单击下面的显示图例,了解模型详细信息。显示图例 # 型号 Acc TPS BPW ByteShape GPU-1 IQ2_XXS-2.56bpw 0.9304 116.11 2.56 GPU-2 IQ3_XXS-2.88bpw 0.9656 108.01 2.88 GPU-3 IQ3_XS-3.01bpw 0.9726 105.44 3.01 GPU-4 IQ3_S-3.23bpw 0.9872 101.11 3.23 GPU-5 IQ4_XS-3.84bpw 0.9963 90.42 3.84 不松动 A UD-IQ2_S 0.8633 114.81 2.49 B UD-Q2_K_XL 0.9572 106.95 2.82 C UD-IQ3_XXS 0.9359 100.51 3.14 D UD-IQ3_S 0.9555 95.53 3.47 E UD-Q3_K_XL 0.9760 90.88 3.80 F UD-IQ4_XS 0.9920 86.73 4.13 G UD-Q4_K_S 0.9877 82.21 4.46 H UD-Q4_K_M 0.9703 78.58 4.79 I UD-Q4_K_XL 0.9871 74.75 5.12 J UD-Q5_K_S 0.9878 71.00 5.44 K UD-Q5_K_M 0.9897 67.71 5.77 L UD-Q5_K_XL 0.9905 65.52 6.10 ISTA-DASLab a GSQ-RCO-IQ2_XS 0.8647 112.77 2.50 b GSQ-RCO-IQ2_S 0.9364 108.22 2.75 c GSQ-RCO-IQ3_XXS 0.9438 103.39 3.00 d GSQ-RCO-IQ3_S 0.9943 94.77 3.50 巴托夫斯基 a IQ2_XXS 0.7986 112.21 2.72 b IQ2_S 0.9296 106.33 2.99 c Q2_K 0.9616 96.08 3.45 d IQ3_XXS 0.9594 92.43 3.68 e IQ3_XS 0.9582 88.36 3.89 f IQ3_M 0.9667 86.17 4.06 AD-IQ2_XXS 0.8385 116.28 2.58 b AD-IQ2_XS 0.9296 108.67 2.85 c AD-IQ2_S 0.9061 100.28 3.22 d AD-IQ3_XXS 0.9644 95.29 3.50 e AD-IQ3_S 0.9730 88.52 4.04 GPU-5 是我们的默认配置,无论您可以在哪里安装它:它在 BF16 基线的
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱