开发者生态
morning
Show HN:DeepSeek-V4 潜在推理 – 将“思维”转移到潜在空间
摘要
DeepSeek-V4-Flash-0731-Latent-Reasoning. A self-contained model that does thinking in latent space, NVFP4-quantized, with a production vllm form for serving runtime. https://huggingface.co/nmitchko/De...
the
The
head
DeepSeek
Flash
model
that
one
0731
Latent
2026-08-09
1 阅读
约8分钟阅读
nmitchko
字号:
DeepSeek-V4-Flash-0731-潜在推理。一个独立的模型,在潜在空间中思考,NVFP4 量化,具有用于服务运行时的生产 vllm 形式。 https://huggingface.co/nmitchko/DeepSeek-V4-Flash-0731-Latent-Reasoning 发布于 blog.n.ichol.ai 上一版未完成的地方 上次我将 CoLaR 头(压缩潜在推理)移植到 DeepSeek Flash v4 上。该作品具备演示的所有要素。让模型在潜在空间中思考的头部。一个有学识的停止头,决定何时思考足够。这个谜语说明了为什么简单的自回归生成会反省缓存的答案而不是推理。但有一个诚实的问题:头部是一个适配器。有什么东西在旁边栓住了。为了服务它,你必须手工组装基本模型、头部、停止标准和自定义运行时间,然后希望这些部件适合。重量都集中在一处。另一个推理机制。 “这就是你如何运行它”是一个跳跃式的故事。这个版本缩小了这一差距。该作品现已成为一个完整的、独立的模型。为其提供服务所需的每一个重量都存放在一个存储库中。主干被量化为 NVFP4,因此它适合真正的硅。潜在循环由适当的、经过基准测试的服务运行时驱动。型号:nmitchko/DeepSeek-V4-Flash-0731-Latent-Reasoning 重大变化:这不再是适配器 此版本的重点是包装。旧版本是您必须附加的头。新的就是一个模型。现在,服务所需的每个权重都位于一个 HuggingFace 存储库中:DeepSeek-V4-Flash-0731 主干网,在路由的 MoE 专家上量化为 NVFP4(组大小 16)。请注意,共享专家、LM 头和拔模座保持更高的精度。 TP=2 时每个 GPU 的权重约为 79 GiB(总共 158–164 GiB)。 DSpark 草稿块(3 层),从源中保留,因此推测解码在盒子中提供。训练有素的潜在推理头脑。 35.7M 参数,从单个 Latent_reasoning_head.safetensors 加载(~152 MB)。由于权重已完成,模型卡最终可以报告真实的基准,而不是“很快就会有更多基准”。首先评估 BBH (BIG-Bench Hard)、cot_zeroshot 、27 个子任务:总计 0.94 ± 0.008。使用 lm-evaluation-harness 0.4.12 针对 OpenAI 兼容端点进行测量。 Deepseek Latent 在给出单独的 0.94 与 0.88 精确匹配后重新评估结果。思维启用。每个子任务 50 个项目,总共 1350 个项目。子任务得分 Tracking_shuffled_objects_ Three_objects 1.00 date_understanding 0.92 Tracking_shuffled_objects_ Five_objects 1.00 sports_understanding 0.88 Tracking_shuffled_objects_seven_objects 1.00 Logical_deduction_ Five_objects 0.88 penguins_in_a_table 1.00 web_of_lies 0.86形式谬误 1.00 snarks 0.84 布尔表达式 1.00 废墟名称 0.84 单词排序 0.98 电影推荐 0.84 时间序列 0.98 突出翻译错误检测 0.76 对象计数 0.98 几何形状 0.74 导航 0.98 因果判断0.66 Logical_deduction_ Three_objects 0.98 disambiguation_qa 0.58 Reasoning_about_colored_objects 0.96 dyck_languages 0.26 hyperbaton 0.96 multistep_arithmetic_two 0.94 Logical_deduction_seven_objects 0.94 该模式正是您希望从潜在推理模型中获得的模式。当推理意味着多步状态跟踪时,它是最强的。 tracking_shuffled_objects、boolean_expressions、formal_fallacies、penguins_in_a_table 均达到 1.00。它在机械、语法繁重的工作上最弱。 dyck_languages(括号匹配)为 0.26,这是明显的异常值。这是一个真正的弱点,而不是测量伪影。关于阅读表格的两个诚实的注意事项:阅读灵活提取,而不是严格匹配。 BBH 的严格匹配正则表达式的字面短语答案是 X 。该模型不会发出该短语,因为它在潜在空间中进行推理。其接近零的严格匹配分数是答案格式化的产物,而不是推理失败。每个子任务值在每个 50 项时约为 ±0.05–0.07。总计 0.880 是可靠的数字。为什么头部现在看起来不同了 该架构继承了最初 CoLaR 想法的剩余部分,但现在它在模型中拥有了合适的位置。一个小头读取主干的第 35 层隐藏状态,将其投影到 1024 维的潜在状态,并将其解码回剩余流。一个潜在步骤代表多个推理标记(记录的压缩因子为 6)。学习停止头会在可变的、与内容相关的深度处自行终止循环。隐藏层 35 (4096-d) | v LayerNorm +--------- ReasoningCompressionHead ----------+ |线性 4096 -> 2048 。丝路 | |线性 2048 -> 2048 。丝路 | |线性 2048 -> 2048 -> [mu, log_sigma] | | | |停止头: | |线性 4096 -> 1024 。丝路 | |线性 1024 -> 1 | -> 推理结束 +--------------------------------------------------------+ | mu (1024-d 潜在) v LayerNorm +------------------------ LatentDecoder ----------------+ |线性 1024 -> 2048 。丝路 | |线性 2048 -> 2048 。丝路 | |线性 2048 -> 40
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱