首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

本地部署的 LLM 的能源效率:消费类硬件的初步定量 GPU 功率基准

摘要

arXiv:2608.00008v1 Announce Type: new Abstract: The local deployment of large language models (LLMs) is gaining traction due to privacy concerns and the desire for on-premise inference. However, the e...

the energy and token prompt per model LLMs due inference
2026-08-04 1 阅读 约1分钟阅读 Philipp M. Z\"ahl, Anika Hennig
分享:
字号:
arXiv:2608.00008v1 公告类型:新 摘要:由于隐私问题和对本地推理的渴望,大型语言模型 (LLM) 的本地部署正在获得关注。然而,消费类硬件的能源成本仍然没有得到很好的描述,因为大多数基准测试只关注准确性。本文提出了在单个消费级 GPU (RTX 4060Ti 16GB) 上执行的九个开源 LLM(1B 到 7B 参数)的可重复的硬件级能源基准。使用 Ollama 推理引擎,通过 nvidia-smi 在固定提示集上以 2Hz 的频率对 GPU 功耗进行采样。我们评估平均/峰值功率、每个提示的总能量 (J/prompt)、每个输出令牌的能量 (J/token) 和吞吐量 (tok/s)。我们的研究结果表明,原始参数计数之外的因素(包括模型架构和量化策略)可以提高能源效率。具体来说,gemma3:1b 和 llama3.2:1b 实现了最低的能源成本(0.56 J/token 和 0.65 J/token)和最高的吞吐量(>170 tok/s)。相比之下,7B-Mistral 模型每个代币消耗的能量比最高效模型多 4.4 倍。值得注意的是,由于扩展的内部推理,qwen3.5:2b 显示出异常高的每次提示能量,这凸显了在效率指标中区分令牌生成模式的需要。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱