开源推荐
morning
GitHub 热门项目:gemma.cpp
摘要
GitHub项目:gemma.cpp 仓库地址:https://github.com/google/gemma.cpp Stars:7020 | 作者:google 项目描述:lightweight, standalone C++ inference engine for Google's Gemma models. ========================================...
and
gemma
https
for
com
google
cpp
Gemma
github
inference
2026-08-13
1 阅读
约5分钟阅读
GitHub Trending
字号:
GitHub项目:gemma.cpp
仓库地址:https://github.com/google/gemma.cpp
星级:7020 | 作者:谷歌
项目描述:适用于 Google Gemma 模型的轻量级独立 C++ 推理引擎。
===================================================
自述文件内容:
# 宝石.cpp
gemma.cpp 是 Gemma 的轻量级独立 C++ 推理引擎
来自 Google 的基础模型。
有关杰玛的更多信息,请参阅
[ai.google.dev/gemma](https://ai.google.dev/gemma)。模型权重,包括
gemma.cpp 特定的工件是
[可在 kaggle 上找到](https://www.kaggle.com/models/google/gemma-2)。
## 这个项目适合谁?
现代法学硕士推理引擎是复杂的系统,通常带有定制的
超越传统神经网络运行时的功能。有了这个
通过高水平的协同设计带来研究和创新的机会
算法和低级计算。然而,两者之间存在差距
面向部署的 C++ 推理运行时,其设计目的不是
实验和以 Python 为中心的 ML 研究框架,这些框架抽象了
通过编译进行低级计算。
gemma.cpp 提供了 Gemma-2、Gemma-3 和 Gemma-2 的极简实现
PaliGemma-2模型,注重简单和直接而不是完整
普遍性。这是受到垂直集成模型实现的启发,例如
作为[ggml](https://github.com/ggerganov/ggml),
[llama.c](https://github.com/karpathy/llama2.c),以及
[llama.rs](https://github.com/srush/llama2.rs)。
gemma.cpp 的目标是实验和研究用例。它的目的是
可以直接嵌入到其他项目中,并且依赖性最小
通过小型 ~2K LoC 核心实现(以及 ~4K LoC
支持公用事业)。我们使用[谷歌
Highway](https://github.com/google/highway) 库可利用
用于 CPU 推理的便携式 SIMD。
对于面向生产的边缘部署,我们建议标准部署
使用 JAX、Keras、PyTorch 和 Transformers 等 Python 框架的途径
([此处所有模型变体](https://www.kaggle.com/models/google/gemma))。
## 贡献
欢迎大大小小的社区贡献。参见
[DEVELOPERS.md](https://github.com/google/gemma.cpp/blob/main/DEVELOPERS.md)
为开发人员贡献更多注释并[通过以下方式加入不和谐
此邀请链接](https://discord.gg/H5jCBAWxAe)。该项目如下
[Google 的开源社区
指南](https://opensource.google.com/conduct/)。
> [!NOTE] 目前正在“dev”分支上进行积极的开发。请打开
> 针对“dev”分支而不是“main”的拉取请求,其目的是
> 更加稳定。
## 里面有什么?
- 法学硕士
- 仅 CPU 推理:Gemma 2-3、PaliGemma 2。
- 使用 TopK 和温度进行采样。
- 用于 Gemma 研究的后向传递 (VJP) 和 Adam 优化器。
- 优化
- 混合精度(fp8、bf16、fp32、fp64 位)GEMM:
- 专为BF16指令设计,可以高效地模拟它们。
- 自动运行时自动调整每个矩阵形状的 7 个参数。
- 重量压缩直接集成到 GEMM 中:
- 自定义 fp8 格式,具有 2..3 尾数位;张量缩放。
- 还有 BF16、F32
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱