开发者生态
morning
开放Jev
摘要
A live, local experiment Decision model in your browser. A local model can either read probabilities for your allowed options without decoding them, or write the same kind of distribution token by tok...
model
the
probabilities
and
your
token
for
same
browser
options
2026-09-18
1 阅读
约3分钟阅读
ilreb
字号:
浏览器中的实时本地实验决策模型。本地模型可以读取允许选项的概率而不对其进行解码,也可以逐个写入相同类型的分布令牌。选择一个大小,在您自己的 GPU 上运行两者,然后测量差异。仅浏览器 无后端 您的计时 1.56 GB 型号庆祝活动 没有候补名单!试试看吧 ↓ 默认选择MiniCPM5 2B。在手机或更小的设备上,如果需要,请切换到型号包装盒中的 Qwen3 0.6B。 00/设置 加载模型一次 型号 Qwen3 0.6B · 推荐用于手机和小型设备 MiniCPM5 2B · 推荐用于桌面 Qwen3.5 4B · 高内存桌面下载加载 MiniCPM5 2B 较大型号。加载速度可能较慢,或者可能不适合某些低端设备。模型性能越高越好 Native BF16 · TypeSafe:相同的 102 行子集 · Jev:发布的结果 · 浏览器构建是量化的 下载/缓存 - 仅当您单击加载模型时才启动 加载 - 下载并准备预热 - 两种方法的编译过程 权重来自 Hugging Face 并保留在浏览器缓存中。输入永远不会离开此页面。首次加载可能需要几分钟时间,具体取决于所选的型号、网络和 GPU。 01 / 决策 给它一个真正的选择 play_arrow 运行两种方法 尝试一个示例 帐户支持 电子邮件分类 两条路径都会收到相同的决策。直接读取选项概率;另一个要求模型将其选项概率写入 JSON 文本。你的决策状态 + 问题 + 选项 → 相同的本地模型 MiniCPM5 · 2B ↗ ↘ 读取 logits A…T 概率 写入标记 { options + probabilities } 02A / 直接读出 选择概率 无解码 读取模型的选择 logits 并仅对您提供的选项进行标准化。等待运行总计 — 输入 — 输出 1 读出 02B / 逐个令牌生成 JSON 概率 要求模型估计相同的显示选项分布并将其写入 JSON。观察每一个令牌的到达。等待运行第一个令牌 — 总计 — 输入 — 输出 — 测量的墙时间比率 在 GPU 上运行 这些方法在同一加载模型上按顺序运行,因此它们不会争用一个 GPU。首先直接运行,然后生成。这些数字意味着什么——不意味着什么——条件概率。直接分数是仅针对显示的选项标记的 softmax。它们没有经过校准的置信度,并且不包含模型可能喜欢的每个答案。本地模型层。手机型号以精度换取尺寸。 MiniCPM 是桌面默认设置。 4B 选项需要更多的内存。据称无人能与杰夫相匹配。真正的本地时间。设置、预热、提示准备、直接执行、首次生成令牌和生成完成均通过 Performance.now() 进行计时。没有出现预设结果。量化权重。该演示使用通过 wllama 固定的 GGUF 构建。量化可以改变质量和速度。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱