首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

批量 LLM 服务的请求级能量归因

摘要

arXiv:2608.00026v1 Announce Type: new Abstract: Batched LLM serving improves throughput but complicates energy accounting. GPU power telemetry is aggregate, whereas sustainability reporting, chargebac...

energy and request Shapley under the attribution batching that accounting
2026-08-04 1 阅读 约2分钟阅读 Qi Luo, Kunlin Li, Ziwen Wang, Dongsheng Wang, Yun Chen
分享:
字号:
arXiv:2608.00026v1 公告类型:新 摘要:批量 LLM 服务提高了吞吐量,但使能源核算变得复杂。 GPU 功率遥测是聚合的,而可持续性报告、退款和工作负载分析通常需要请求级别的能源费用。现有的推理能源基准报告模型、阶段或代币级别的能源,而最近的碳核算工作从概念上激发了沙普利公平性。两者都没有提供衡量请求级别的基本事实,因此实践中使用的会计规则与公平分配的偏差有多大仍然未知。我们推出 JouleShare,一个包含两个组件的归因框架。离线工具通过使用可重现的协议重放 vLLM 下的请求子集、集成 GPU 功率遥测并计算每个请求的精确 Shapley 能量来建立这一基本事实。然后,轻量级校准模型 JCalib 学习从廉价的请求特征中预测 Shapley 份额,以便在服务时使用。在 16 个模型/工作负载运行中,令牌比例归因与精确 Shapley 的差异在静态批处理下平均为 0.440 标准化 L1,在连续批处理下为 0.458,这一差距在三个数据中心 GPU 上重现。 JCalib 在静态批处理下将此误差降低至 0.116,在连续批处理下将误差降低至 0.177,甚至低于在线无法获得的独立测量基线,同时保持精确的批处理能源效率。采样沙普利将测量参考扩展到更大的组规模,其中差距仍然存在,并且单个离线校准仍然是最准确的可部署规则。结果表明,令牌归因并不是批量执行下边际能量的可靠代理,并且测量的 Shapley 地面实况可以校准低成本请求特征以实现更公平的归因。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱