首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

Bonsai 2 27B:近乎无损压缩,占地面积缩小 9 倍

摘要

Two months ago, we released our first Bonsai 27B models and showed that a 27B-class multimodal model could be compressed enough to run efficiently on a local device. Today, we’re releasing Ternary Bon...

27B Bonsai the and model Ternary local capability performance first
2026-09-18 1 阅读 约6分钟阅读 JonSchneider
分享:
字号:
两个月前,我们发布了第一个 Bonsai 27B 模型,并表明 27B 级多模态模型可以被压缩到足以在本地设备上高效运行。今天,我们发布了 Ternary Bonsai 2 27B,这是我们迄今为止最强大的模型。 Ternary Bonsai 2 27B 基于 Qwen3.8 27B,为 Bonsai 系列带来了更强的推理、编码、视觉和代理能力,同时保留了定义它的部署配置文件:显着更小的内存占用、高本地吞吐量和更好的能源效率。三元 Bonsai 2 27B 使用三元 {−1, 0, +1} 权重和 FP16 分组缩放,每个权重有 1.76 个有效位,总模型占用空间为 5.9GB。低位表示在整个语言模型中端到端应用。它支持 262K 令牌上下文窗口、多模式文本和图像输入,并根据 Apache 2.0 许可证发布。与全精度对应产品相比,Ternary Bonsai 2 27B 小了 9 倍多,同时保留了 98.2% 的总体基准性能。在这种保留水平上,压缩成为一种部署解锁:几乎相同的功能,但占用空间可以在更多地方运行。与第一个 Bonsai 27B 版本相比发生了什么变化 我们的第一个 Bonsai 27B 版本是一个重要的里程碑,提供了一种在本地设备上运行 27B 级智能的实用方法。 Bonsai 2 27B 重点关注下一步:提高实际本地应用程序所需的模型质量和运行时性能。与上一代 Bonsai 27B 相比,Bonsai 2 27B 带来了: 更强大的基础模型,Qwen3.8 27B 相对于全精度模型,聚合能力保留率更高,高达 98.2% 改进的推理、编码、视觉和长视野代理性能 同一部署点的能力更高 跨基准套件,涵盖推理、数学、编码、指令跟踪、视觉和代理工具使用,三元 Bonsai 2 27B 得分83.9,保留了 Qwen3.8 27B 总体性能的 98.2%。 ‍ 图一:三元盆景 2 27B(思维模式)与全精度 Qwen3.8 27B 和 Qwen3.6 27B 基线对比的基准分数。白皮书中包含完整的每个基准测试结果。 ‍ 关键结果不仅在于总分,还在于保留了能力。编码代理、工具使用系统、多模式工作流程和长期任务对模型退化特别敏感,因为小错误可能会在许多步骤中复合。 Bonsai 2 27B 在这些领域保留了全精度模型的大部分性能,同时只占用一小部分内存。与全精度模型和其他低位替代品相比,Bonsai 2 27B 在智能密度方面表现突出。许多低位替代方案只有放弃有意义的编码、视觉或代理工具使用能力才能部署。 Bonsai 2 27B 将前沿推向更高的性能和更低的内存使用量。图二:Ternary Bonsai 2 27B 与相同参数类别的其他模型相比的智能密度(每 GB)。演示 I:使用 Cline 对代理进行编码,由 NVIDIA GeForce RTX 5090 上的 Ternary Bonsai 2 27B 提供支持。演示 II:由 NVIDIA GeForce RTX 5090 上的 Ternary Bonsai 2 27B 模型提供支持的计算机使用。 借助 Bonsai 2 27B,本地模型可以开始承担真正的知识工作:编码代理循环、计算机使用工作流程、私人文档分析、多模式调试和混合编排,其中本地模型处理敏感或高频任务,同时有选择地升级到云端。吞吐量和能效 Ternary Bonsai 2 27B 在 NVIDIA GeForce RTX 5090 上达到每秒 143 个令牌,在 M5 Max 上达到每秒 46.8 个令牌。在 RTX 4090 上,Ternary Bonsai 2 27B 仅消耗 0.714 mWh/token,比全精度运行的 8B 模型节能 40%。对于编码助理来说,更高的吞吐量意味着更快的编辑-调试循环。对于多模式代理来说,这意味着屏幕截图、文档和工具调用的迭代速度更快。对于私有本地工作流程,更好的能源效率意味着在同一设备上进行更有用的推理、更长的电池寿命以及更现实的助理路径,可以在后台保持可用状态,而无需不断调用云。为什么此版本很重要 与 Ternary Bonsai 27B 相比,新的 Ternary Bonsai 2 27B 将全精度模型之间的保留率差距从 95% 缩小到 98% 以上。这是一项重大改进,使当前版本几乎“无损”。它进一步巩固了这样的观念:低位模型可能是部署人工智能的最佳方式。这所产生的影响远远超出了局部推论。低位模型可以改变跨设备、工作站和数据中心的人工智能系统的经济性和架构:将更大的模型放入同一内存包络中,在同一硬件上为更多用户提供服务,减少每次推理的能耗,并启用混合系统,动态决定哪些内容应在本地运行,哪些内容应在云端运行。问题是
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱