开发者生态
morning
Gimlet B 系列
2026-09-05
1 阅读
约5分钟阅读
bigcat12345678
字号:
今天,我们宣布完成 3 亿美元的 B 轮融资,由 Andreessen Horowitz 领投,Sapphire Ventures、Menlo Ventures、645 Ventures、Arm、Eclipse、Emergence、Factory、Hudson River Trading、M12、OnePrime Capital、Prosperity7、QuantumLight、Samsung Ventures、Tiger Global Management、Triatomic、Wing Ventures 和 XTX Markets 跟投。自 3 月份以来,我们已经增加了数十亿美元的合同收入、千兆瓦的数据中心管道,并正在迅速扩展到数百兆瓦的托管容量。对吞吐量和速度的需求 自 5 个多月前我们的 A 轮融资以来,对代币的需求持续以惊人的速度增长。每月代币生成量在 12 个月内增加了 6 倍,一些预测称到 2030 年将再增加 20 倍。为了支持这一需求,该行业已经开始了也许是现代历史上最雄心勃勃的投资项目,每年已接近 1T 美元,预计到 2030 年累计将达到 7T 美元。电力正在迅速成为最关键的资源瓶颈。到 2025 年,人工智能数据中心消耗的容量约为 18 吉瓦,预计到 2030 年该数字将增加两倍。支持这一增长需要新的发电、电网容量、互连和用户侧能源生产。我们最终将达到我们可以大规模提供的资源的极限。最大化每千瓦吞吐量使行业能够继续扩展,同时减少对物理资源的影响。除了原始吞吐量之外,我们还看到对非常快速的推理层和低延迟令牌的需求不断增长,其驱动因素是: 代理工作负载。代理执行多步推理循环,通常需要数十次顺序模型调用和工具交互。这些调用的延迟会增加。更大的型号。模型从几年前的几个100B参数扩展到今天的3-10T参数。更大的上下文窗口。 2023 年,上下文窗口限制为约 100K 个令牌。如今,上下文窗口可以达到 100 万个令牌甚至更多。业界能够单独提供高吞吐量或低延迟。问题是当这些要求复合时。吞吐量-交互性帕累托图已广泛流传,它说明了团队在吞吐量和延迟之间进行的权衡。挑战不仅在于最大化吞吐量或最大化速度,还在于以高吞吐量交付快速令牌。传统的同质推理基础设施将用户限制在高吞吐量、低交互性的最佳状态。通过异构分解,我们能够将推理云中的前沿工作负载的性能提高 3-10 倍。当我们创立 Gimlet 时,我们采取了以下立场:人工智能推理将成为软件(而不仅仅是人工智能)的主要工作负载。人工智能推理的效率明显低于其可以/应该达到的效率,达多个数量级。因此,人工智能基础设施需要从头开始重新构想和重建,并考虑到推理,以满足这些工作负载的需求。随着行业已从训练转向推理作为主要工作负载,提供模型的最快方法是将最初为训练而构建的相同基础设施(在某些情况下,如加密货币挖掘等用例)重新用于推理。然而,推理与训练有着根本的不同,即使在推理中,底层硬件的要求也存在很大差异。幸运的是,芯片设计人员一直在积极构建高度优化的人工智能加速器。我们现在可以使用差异很大的架构,每种架构都有自己独特的优势。不同的芯片架构擅长不同的任务,并提供性能/效率的权衡。在 Gimlet Labs,我们正在构建第一个多硅云,从头开始构建以提高推理性能。 Gimlet 基于异构硬件构建,可利用不同类型的加速器,包括 GPU、近内存计算、数据流架构和 CPU。我们的软件堆栈智能地分解这些芯片上的工作负载,以便在其最优化的芯片架构上运行推理工作负载的每个阶段。通过分解模型并在不同类型的加速器上运行它,我们能够在相同的功耗下实现 5-10 倍的加速,或者在相同的延迟下实现类似的吞吐量改进。这一点至关重要,因为功耗是当今人工智能部署的限制因素。有多种方法可以分解模型并在异构硬件上运行它们,并且不同的分割提供不同的性能特征。在我们的软件堆栈中,模型被跟踪并分解为不同的部分,并根据工作负载 SLA 和可用硬件在加速器上进行调度。我们根据可用硬件动态重新平衡工作负载,以便计算不会搁浅或未使用。即使一种类型的硬件被充分利用来完成给定的任务(例如解码),如果
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱