首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

水星2.5

摘要

Today, we’re releasing Mercury 2.5, our most capable production model yet. It is a significant step up in quality over Mercury 2, with the same low-latency, low-cost serving profile. Since Mercury 2’s...

Mercury and the production per search NVIDIA million model with
2026-09-09 1 阅读 约6分钟阅读 Topfi
分享:
字号:
今天,我们发布了 Mercury 2.5,这是我们迄今为止最强大的生产模型。与 Mercury 2 相比,它在质量上有了显着提升,并具有相同的低延迟、低成本服务配置。自 Mercury 2 推出以来,已有数千名开发人员使用它进行构建,数十家企业已将其投入生产,使用量增长了一个数量级。它现在为搜索、语音和编码产品中的延迟敏感型工作负载提供服务。这些工作负载给了我们比单独的基准测试更清晰的信号。我们利用客户反馈和生产失败案例来加强评估和重点培训。 Mercury 2.5 是该循环的第一个结果。 Mercury 2.5 的改变是市场上最有能力的扩散法学硕士。据我们所知,它是有史以来训练过的最大的扩散语言模型。质量:Mercury 2 的智能提高了 40%。可与 GPT-5.6 Luna(低)、Gemini 3.5 Flash-Lite 和 Claude Haiku 4.5 等成本优化的前沿模型相媲美。速度:在广泛使用的 NVIDIA GPU 上每秒 1,107 个令牌。上下文:260K 代币。价格:每百万投入 0.20 美元,每百万产出 0.75 美元。 Mercury 2.5 推出时可享受 80% 的折扣,每百万输入 0.04 美元,每百万输出 0.15 美元。功能:可调推理、并行工具调用和模式对齐 JSON。自 Mercury 2 推出以来,我们见证了 Inception 在 NVIDIA AI 基础设施上进一步推进基于扩散的语言模型。 Mercury 2.5 在智能方面的进步以及持续的速度和低成本反映了新架构能够以多快的速度成熟为 NVIDIA 平台上的生产就绪系统。 Shruti Koparkar,NVIDIA Mercury 生产中的加速计算组产品高级经理 搜索代理和 RAG 管道 一个搜索请求可以触发数十个模型调用:规划搜索、重写查询、重新排列结果、构造事实、总结来源并检查答案。 Mercury 使这些调用保持足够快的速度,以保持在单个用户交互中。几家领先的搜索基础设施公司现在正在生产中运行它。语音代理和交互式应用程序在语音中,延迟不是基础设施的细节。这是呼叫者听到的停顿声。 OpenCall 构建了处理实时客户呼叫的 AI 电话代理。在生产工作负载方面,Mercury 的模型响应延迟中值接近 170 毫秒。视频 在我们改用 Mercury 后,我们的 P99 响应时间从几分钟下降到仅一秒,我们的 P50 从 0.4 秒下降到 0.2 秒以下——明显快于我们见过的任何其他提供商,其中包括推理。 Oliver Silverstein,OpenCall 联合创始人兼首席执行官 编码子代理和助理 编码代理已经跨模型分工工作。一个人可以计划或编写代码,而其他人则搜索、运行工具、路由请求、总结状态或压缩长会话。这些支持呼叫一次又一次地发生,因此延迟和成本很快就会复合。 Augment Code 使用 Mercury 进行上下文压缩、模型路由和 MCP 工具搜索。将压缩转移到 Mercury 将延迟减少了 82%,从大约 150 秒减少到 27 秒,并在保持质量的同时将成本降低了 90%。工具搜索摘要在一秒钟内返回。同样的速度也适用于开发网络应用程序。观看 Mercury 2.5 根据下面演示中的一些提示生成一个可用的音乐发现日志 Web 应用程序。视频 Mercury Voice 和 Mercury Router 预览版 除了 Mercury 2.5 之外,我们还发布了 Mercury Voice 和 Mercury Router 预览版。 Mercury Voice 的首次令牌时间 (TTFT) 低于 170 毫秒,是针对延迟预算最紧的语音代理进行优化的 dLLM。 Mercury Router 通过 dLLM 了解传入的提示,并将其路由到提供最佳质量、速度和成本组合的最佳模型(开放式和封闭式模型)。开始使用 Mercury 模型可通过我们的 Inception API、Baseten 和 OpenRouter 获得。企业部署支持专用容量、自动扩展、合规性控制和可配置的数据保留。在聊天中试用 Mercury 2.5 使用 1 亿个免费代币试用 API · 阅读 API 文档 Baseten 客户:通过现有 Baseten 设置部署 Mercury 2.5。 Y Combinator 公司:索取 500,000 美元的部署收益。评估 Mercury 的声音?我们将与您一起测试工作负载适合度,并验证您的服务限制下的性能。联系我们。下一步我们已经开始训练我们的下一个模型。这是我们迄今为止最大的型号,我们的目标是在未来几个月内发布。我们的下一个模型将在不放弃扩散速度和代币效率的情况下实现能力的飞跃。这需要在模型训练、推理、评估和基础设施方面取得进展。如果这就是您想要解决的问题,我们很乐意听取您的意见。很快就会有更多。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱