智能AI
morning
本地部署的 LLM 的能源效率:消费类硬件的初步定量 GPU 功率基准
摘要
arXiv:2608.00008v1 Announce Type: new Abstract: The local deployment of large language models (LLMs) is gaining traction due to privacy concerns and the desire for on-premise inference. However, the e...
the
energy
and
token
prompt
per
model
LLMs
due
inference
2026-08-04
1 阅读
约1分钟阅读
Philipp M. Z\"ahl, Anika Hennig
字号:
arXiv:2608.00008v1 公告类型:新 摘要:由于隐私问题和对本地推理的渴望,大型语言模型 (LLM) 的本地部署正在获得关注。然而,消费类硬件的能源成本仍然没有得到很好的描述,因为大多数基准测试只关注准确性。本文提出了在单个消费级 GPU (RTX 4060Ti 16GB) 上执行的九个开源 LLM(1B 到 7B 参数)的可重复的硬件级能源基准。使用 Ollama 推理引擎,通过 nvidia-smi 在固定提示集上以 2Hz 的频率对 GPU 功耗进行采样。我们评估平均/峰值功率、每个提示的总能量 (J/prompt)、每个输出令牌的能量 (J/token) 和吞吐量 (tok/s)。我们的研究结果表明,原始参数计数之外的因素(包括模型架构和量化策略)可以提高能源效率。具体来说,gemma3:1b 和 llama3.2:1b 实现了最低的能源成本(0.56 J/token 和 0.65 J/token)和最高的吞吐量(>170 tok/s)。相比之下,7B-Mistral 模型每个代币消耗的能量比最高效模型多 4.4 倍。值得注意的是,由于扩展的内部推理,qwen3.5:2b 显示出异常高的每次提示能量,这凸显了在效率指标中区分令牌生成模式的需要。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱