首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

Kimi K3 (2.8T) 在 MacBook Pro 上以 1 token/s 的速度从四个 SSD 进行流传输

2026-09-09 1 阅读 约7分钟阅读 Argonautlabs
分享:
字号:
gavamedia/deltafin (MIT) 的一个分支,在 Apple Silicon 上的 SSD 上运行 Kimi K3,并具有 ARGODRIVE 存储功能。基准测试包、放置清单和结果位于 k3-public-bench/ 中;测量仪器单独发布为 ARGODRIVE 。积分以及此分叉的变化:CREDITS.md。上游自述文件如下。 ____ _ _ __ _ | _ \ ___| | |_ __ _ / _(_)_ __ | | | |/_\| __/ _` | |_| | '_ \ | |_| | __/ | || (_| | _| | | | | |____/ \___|_|\__\__,_|_| |_|_| |_| 在消费类硬件上尽可能“快”地运行完整的、从未修剪过的 2.8 万亿参数 Kimi K3 Deltafin 是运行完整 Kimi K3 的单个本机二进制文件。没有任何修剪。没有任何跳过。K3 决定每个令牌。所有 16 位专家,每个令牌。否这正是 Moonshot 发布的质量规则:K3 自己决定每个令牌,其他人都不允许猜测(这就是大部分速度的来源),但 K3 会检查每个猜测,如果没有官方签名,您将无法获得任何结果。M1 Max 笔记本电脑上的最新基准测试为 0.2901 令牌/秒(3.447 秒/令牌)——吞吐量比之前高出 1.9%。最后更新历史 M1 基准: 0.2847 代币/秒(2026 年 8 月 2 日)— 吞吐量提高 7.0% 0.2660 代币/秒(2026 年 7 月 30 日)— 吞吐量提高 102.9% 0.1311 代币/秒(2026 年 7 月 28 日)— 吞吐量提高 829.8% 0.0141 代币/秒(7 月) 2026 年 2 月 27 日)纯粹的未切割的 K3 质量,速度绝不能来自于降低模型质量。 Deltafin 将所有 16 个路由专家和完整的 K3 目标作为每个代币的唯一权威,我们的目标是在运行像 K3 这样的大型模型时,尽可能地提高效率……除了降低质量之外,Deltafin 不是一个关于消费者硬件可以推向多远的实验。 Kimi K3 的目标是 16 个节点和大约 4.8 TB 的总 VRAM 规模的基础设施,这意味着在任何家庭设置中都没有修剪过的 1M 代币上下文窗口。每 1% 的改进都是来之不易的。但这就是我们的使命。产品”来打动风险投资家。如果 Deltafin 帮助使前沿模型可在 15,000 美元的家庭设置上使用,而不是像 Kimi 推荐的那样在 2,000,000 美元的基础设施上使用,我们相信这在我们的自托管人工智能之旅中是有价值的进展。此外,一路上学到的一切甚至可以以意想不到的方式使其他项目受益。“我们选择在本地运行完整的 2.8 万亿参数模型,并做其他事情,不是因为它们很容易,而是因为它们“它们很难。” — John F. Kennedy 可能其他项目似乎运行完整的 K3,不知何故更快。但仔细看看:他们已经将 K3 的专家库重新编码为约 3 位。朝着不同的目标进行巧妙的工程:适合并且“足够接近”的最小 K3。这些权重不再是 Moonshot 发布的,包括他们在内的没有人测量过这些妥协的成本。Deltafin 是另一个实验:每个专家字节都与 Moonshot 交付的完全一样,速度与物理一样快Deltafin 几乎可以安装它需要的所有内容。 # 1. 获取它 git clone https://github.com/gavamedia/deltafin.git cd deltafin # 2. 构建它 cars build --locked --release # 3. 将完整的 1.7 TB K3 模型下载到磁盘(可选,但速度最快) ./target/release/deltafin setup --full 或者,如果您没有足够的磁盘空间: # 3. Stream K3 当你使用它时(速度较慢,但启动时需要 215 GB) ./target/release/deltafin setup --stream setup --stream 安装驻留模型并仅按需获取精确的专家,当路由还没有本地缓存时,最初运行速度要慢得多,随着时间的推移,这可能是节省空间的一种方法,只存储你使用的模型的部分,完全在磁盘上运行默认 DSpark(和可选的 Qwen)。 Kimi-K3-DSpark 需要 6.635 GiB,在运行时占用约 4.49 GiB,当有益时,聊天和服务器请求会自动使用 DSpark;Qwen 是一个单独的附加组件,可实现更快的原始文本继续运行:#4. ./target/release/deltafin setup-qwen Qwen 仅加速原始完成:小模型猜测接下来会发生什么,K3 检查猜测,您可以在更短的时间内获得相同的输出,这有助于代码自动完成和其他 /v1/completions 流量,加上 deltafin run --prompt ... — 使用相同的输出 ID,测量的 17 个令牌完成速度提高了 2.7 倍,这会在磁盘上增加 4.337 GiB。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱