首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

DFlash 2:保持绘图并行

摘要

DFlash 2: Keep Drafting Parallel August 18, 2026 Inference is the bottleneck of the agent era. Agents read, plan, and call tools, often for hours or days. They consume tokens at a rate chat never appr...

the DFlash one and tokens pass with for model runs
2026-08-20 1 阅读 约9分钟阅读 mike-the-brain
分享:
字号:
DFlash 2:保持起草并行 2026 年 8 月 18 日 推理是代理时代的瓶颈。客服人员通常需要花费数小时或数天的时间来阅读、计划和调用工具。他们以聊天从未达到的速度消耗代币。这些标记中的每一个都对模型进行完整的前向传递。在 Inco AI,我们正在构建适应未来代币经济的推理堆栈。这篇文章是一个先睹为快的文章。我们团队在一月份发布了DFlash;它现在在 SGLang、vLLM、TensorRT-LLM 和 llama.cpp 中运行。 NVIDIA 在 Blackwell GPU 上测量了高达 15 的吞吐量;谷歌报告称,TPU 上每秒增加 3 个令牌; CoreWeave 的生产 Kimi K2.7 代码端点是人工分析上该模型最快的,默认运行 DFlash。现在生态系统建立在它的基础上:NVIDIA、Red Hat 和 Modal 都发布了 DFlash 起草者; Meta ( Muse Glimmer )、Poolside ( Laguna )、Xiaomi ( MiMo-V2.5-Pro ) 和 NVIDIA ( Nemotron 3.5 Lightning ) 都发布了官方绘图员自己的模型。在 Hugging Face 上,DFlash 模型的下载量已超过 350 万次(截至 2026 年 8 月)。推测解码是现代推理堆栈的核心部分。 1 一个小型草稿模型猜测一个令牌块,目标模型在一次前向传递中验证整个块。好的猜测可以将一次通行证变成多个令牌;坏的就会被扔掉。然而,多年来,草案本身一直处于自回归状态:一次一个象征。 DFlash 也做到了一次性:整个块、每个位置都是并行预测的。使用 oMLX 在 Apple M5 Max 上为 Qwen3.8-27B 起草 DFlash 2,与自回归解码并排。 DFlash 2 将并行起草进一步推进:每次验证通过的输出增加超过 20%,周期延迟增加约 1%,且输出可证明没有变化。在基准测试中,收益达到 16% - 25%。随着今天发布的 Qwen3.8-27B 起草器,SGLang 在批量大小为 1 时以 2.7×3.4 的自回归解码吞吐量提供服务。独立预测每个位置在两个地方留下了空间:选择正确的令牌并将准确性保持到块的末尾。 DFlash 2 在不放弃一次性设计的情况下恢复了两者。 DFlash 2 已经运行在主流推理引擎中: SGLang vLLM llama.cpp oMLX pip install "sglang[all] @ git+https://github.com/sgl-project/sglang.git#subdirectory=python" python -m sglang.launch_server \ --model-path Qwen/Qwen3.8-27B \ --speculative-algorithm DFLASH \ --speculative-draft-model-path incoai/Qwen3.8-27B-DFlash2 \ --speculative-num-draft-tokens 8 pip install -U "vllm @ git+https://github.com/vllm-project/vllm.git@refs/pull/52816/head" vllm 服务 Qwen/Qwen3.8-27B \ --speculative-config '{ "method": "dflash", "model": "incoai/Qwen3.8-27B-DFlash2", "num_speculative_tokens": 7 }' git clone https://github.com/ggml-org/llama.cpp.git cd llama.cpp git fetch origin pull/27342/head:pr-27342 git switch pr-27342 # NVIDIA CUDA cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_CUDA=ON cmake --build build -j # Apple Silicon cmake -B build -DCMAKE_BUILD_TYPE=Release -DGGML_METAL=ON cmake --build build -j ./build/bin/llama-server \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd incoai/Qwen3.8-27B-DFlash2-GGUF:Q4_K_M \ --spec-type Draft-dflash \ --spec-draft-n-max 7 下载并安装支持 DFlash 2 的预构建 oMLX。要使用 DFlash 2 运行 Qwen3.8-27B: 打开 oMLX 模型下载器并下载: 打开模型管理器并编辑 mlx-community/Qwen3.8-27B-4bit 。使用以下设置配置 DFlash: DFlash:启用 草稿模型:incoai/Qwen3.8-27B-DFlash2 草稿量化:启用 运行时块大小:5 验证模式:dflash 保存设置并加载目标模型。 DFlash 独立、并行地预测每个位置。每个选择本身都是合理的。然而,没有任何东西可以使它们组合在一起,并且在验证时,不连贯的块会被缩短。最近的方法,如 Domino 和 DSpark,通过重写每个位置的完整词汇分布的顺序头部来获得连贯性。但这种代价高昂的自回归校正真的有必要吗?不会。证据已经在 DFlash 自己的候选列表中。采取第一位置:DFlash 的首选在 85.4% 的情况下是正确的,但正确的代币在 99.5% 的情况下位于其前 16 个候选者中。即使首选错误,正确的标记通常也会出现在列表中。公制 0 1 2 3 4 5 6 接受长度 Recall@1 85.4% 80.3% 79.4% 78.3% 77.5% 75.9% 72.9% 4.27 Recall@16 99.5% 97.3% 94.8% 92.6% 90.8% 89.4% 87.8% 6.79 表 1. 每个选秀位置的 Recall@1(状元签正确的频率)和 Recall@16(正确标记进入前 16 名的频率),条件是每个较早的位置都是正确的。 GSM8K 上的五层 Qwen3-4B DFlash。接受长度包括验证者的下一个令牌。如果预言机总是从前 16 名中选出合适的候选人,那么接受长度就会从 4.27 提高到 6.79。这个差距就是纯粹的选择空间。我们只需要通过候选人选择正确的路径即可。扩散是
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱