北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%
过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。 然而,随着模型规模持续增
共找到 18 篇相关文章
过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。 然而,随着模型规模持续增
Cache Aware Scheduling is one of the most exciting kernel innovations to land in Linux this year。While it was finally me
The long-in-development work on Cache Aware Scheduling looks like it will come to a head soon with it looking like Cache
新智元报道 编辑:元宇 【新智元导读】 一张普通的24G家用显卡,竟然能让一个32B的超大模型一口气读完6份长文档、自动写出周报。英伟达、MIT、浙大华人研究者联合出新招,让内存消耗直接暴降10倍,不降智也不爆显存,彻底击穿硬件天花板。一张
06676v1 Announce Type: new Abstract: Long-context inference in Large Language Models (LLMs) is bottlenecked by the linea