首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

英伟达Vera Rubin首秀,DeepSeek V4 Pro跑出30倍特工吞吐

2026-08-25 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心编辑部 过去几年,AI 基础设施的竞争核心是 GPU。更大的模型、更高的参数规模、更强的推理能力,都推动着数据中心不断堆叠 GPU。 但随着 AI Agent 开始执行越来越复杂的任务,新的计算需求出现。一个 Agent 不再只是完成一次模型推理,它需要持续规划任务、调用工具、执行代码、处理数据,并在多个步骤之间保持上下文。 根据 NVIDIA 引用的 OpenRouter 数据,真实 AI 流量中平均 Prompt 长度已增长约 4 倍,单次 Agentic 请求消耗的 token 数量最高可达普通聊天请求的 15 倍。这意味着,AI 系统需要的不只是更强的模型,也需要一套专门支撑 Agent 运行的计算架构。 就在今天早上,NVIDIA 首次公布了基于真实芯片的 Vera Rubin 性能测试结果。 在针对 Agent 工作负载的测试中, Vera Rubin 相比上一代 GB300 NVL72 最高实现每兆瓦吞吐提升 30 倍,并将 token 成本最高降低 35 倍 。 就在同一时间, SpaceXAI 宣布将部署 NVIDIA Vera CPU ,并计划基于 Vera Rubin 架构扩展支撑 Grok 的 AI 基础设施,进一步探索将优化后的 Vera Rubin NVL72 系统部署到轨道计算环境。 从 Agent 性能测试,到 SpaceX 的轨道计算探索,NVIDIA 展示了一个新的方向:未来 AI 竞争的关键,不只是模型能力,还有支撑 Agent 持续行动的计算基础设施。 Vera Rubin 首次面向 Agent 工作负载测试 过去的大模型性能测试,更多关注固定输入长度下的推理速度。但 AI Agent 改变了这一标准。衡量 Agent 基础设施能力,不能再依赖传统的固定 Prompt 测试,而需要接近真实生产环境的工作负载。这也是 NVIDIA 此次测试的重点。 NVIDIA 采用 SemiAnalysis 的 AgentX 工作负载 ,对 Vera Rubin NVL72 的 Agent 性能进行评估。AgentX 是一个面向 Agentic Coding Inference(智能体代码推理)的基准测试,通过回放真实生产风格的 Agent 会话,评估计算系统处理真实 Agent 请求的能力。 智能体(Agent)会话会产生动态变化的推理序列。 与传统聊天任务不同,Agent 会话具有明显的长链路特征:一次任务中可能包含连续的模型调用、工具使用以及不断累积的上下文。AgentX 会保留原始任务中的上下文长度、输入输出序列、推理时间以及工具调用延迟,以模拟真实 Agent 运行状态。 例如,一个代码 Agent 完成开发任务时,可能需要理解需求、分析代码库、修改程序、执行测试,并根据测试结果继续调整方案。随着任务推进,系统不仅需要处理更长的上下文,还需要持续复用此前已经处理的信息。 NVIDIA 展示的一条真实 Agent 轨迹中,主 Agent 的上下文可以从约 6 万 token 一路增长到接近 40 万 token,同时穿插多个子 Agent 请求。也就是说,对 Agent 而言,「长上下文」是在任务推进过程中自然形成的运行状态,而非偶尔出现的极端情况。 NVIDIA 将这样的指标定义为 AI 工厂级的「 每兆瓦吞吐量」(tokens per megawatt)。AgentX 同时关注吞吐效率、端到端延迟、首 token 时间等指标,以衡量系统是否能够在高效率下保持良好的交互体验。 在测试中, NVIDIA 使用 DeepSeek V4 Pro 模型运行 AgentX 工作负载 。结果显示,在每位用户 160 tokens/s 交互目标下,Vera Rubin NVL72 相比 GB300 NVL72 最高实现 30 倍更高的 AI 工厂级每兆瓦吞吐量,意味着在相同能源预算下,可以支撑更多 Agent 推理任务。 NVIDIA 将 Vera 定义为「 首款为 AI Agent 打造的 CPU」。它采用 88 个 NVIDIA 设计的 Olympus 核心,并搭载高带宽 LPDDR5X 内存,最高提供 1.2TB/s 内存带宽。 当然,Vera 并不是要替代 GPU,它在 AI 系统中承担新的角色:GPU 继续负责大规模模型计算,Vera 则负责支撑 Agent 运行过程中的任务调度、代码执行和数据处理。 30 倍从哪里来? 如果只把 30 倍归因于 Rubin GPU 本身,就会低估 Vera Rubin 真正发生的变化。NVIDIA 此次展示的性能,本质上是一项 rack-scale system result,而不是单颗 chip result。 Agent 运行到后期,会不断处理越来越长的上下文。推理系统不仅需要执行 Transformer 计算,还必须高效保存和复用 KV Cache,并在不同 GPU 之间交换模型专家、上下文状态和中间结果。随着上下文长度、用户交互速度和并发规模不断提高,瓶颈也开始从单纯的 GPU 算力扩展到内存、通信、缓存管理和系统调度。 为此,Vera Rubin NVL72 将 Rubin GPU、HBM4、NVLink 6 以及新的推理软件栈放在一起进行协同设计。Rubin 单 GPU 配置 288 GB HBM4,内存带宽达到 22 TB/s;NVLink 6 则为单 GPU 提供 3.6 TB/s scale-up 双向带宽。对于 72 颗 GPU 组成的 NVL72 而言,更大的统一 scale-up domain 能够让 MoE 专家并行、分布式 KV Cache 等机制在整个机架内运行。 软件层面的变化同样重要。NVIDIA 列出的关键机制包括 Prefill/Decode 分离、Distributed KV Cache、KV Cache offloading、KV-aware routing 以及大规模 Expert Parallelism。 以 KV-aware routing 为例,当一个 Agent 再次发起请求时,系统可以尽量将任务路由到已经保存对应上下文缓存的 GPU,从而避免重新计算此前处理过的大量 token。对于上下文可能持续增长到几十万 token 的 Agent 而言,这种缓存复用会直接影响吞吐、延迟以及每个 token 的实际成本。 换句话说,Rubin 真正升级的并不只是一颗 GPU,而是一条完整的「token 生产流水线」:从读取长上下文、执行模型,到交换 KV Cache 和 MoE 专家,再到持续生成 token,每一层都会共同决定最终能够服务多少 Agent。 而 NVIDIA 还在进一步拆分这条 token 生产流水线。 就在公布 Vera Rubin Agent 性能测试的同一天, NVIDIA 宣布 Groq 3 LPX 进入全面量产,并将其纳入 Vera Rubin 平台。 Groq 3 LPX 被定位为面向交互式 AI 的低延迟推理加速器,它并不是替代 Rubin GPU,而是针对 Agent 推理中另一类计算特征进行专门优化。 大模型推理通常可以粗略分成两个阶段:
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱