首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

$0.09 和 $290.12 都是 1M 产出代币的价格

2026-08-02 1 阅读 约7分钟阅读 OsamaJaber
分享:
字号:
九美分。两百九十美元十二美分。这些都是一百万个产出代币的价格。相同的单位,相同的数据集,在同一周读取供应商页面。第一个是单个 MI355X 上的 gpt-oss-120b。第二个是八台 H100 上的 Qwen3.5。两者都不是错字,也不是技巧。而它们之间的差距几乎都不是型号。所以我去寻找它到底是什么。以下是我对 24 个提供商和 378 个 GPU 租赁费率进行测量后发现的结果,按从小到大的顺序排列:五个杠杆。大家谈论的两个是最小的两个。这篇文章在列表中名列前茅。披露 我们构建了 RunInfra,它使模型在您自己的 GPU 上运行得更快。当人们自我托管时我们就能赚钱。这与本文所回答的问题存在直接利益冲突,因此请以相反的方式阅读这些数字。每一个都带有一个源 URL 和一个存储库末尾的检索日期。每个测量杠杆的最佳情况和最坏情况之间的差距。首先,每个人实际问的问题是自托管,在您租用或拥有的计算上运行模型推理,而不是从托管模型 API 购买每个请求。比 API 便宜吗?这是同类比较。相同的重量、相同的型号、每一侧最便宜的已发布选项。最便宜的已发布选项,每 100 万输出代币美元 开放模型 最便宜的托管 API 自托管 @90% @60% @30% DeepSeek-R1-0528 $2.15 $0.88 $1.32 $2.63 MiniMax-M3 $1.20 $0.31 $0.47 $0.93 Llama-3.3-70B $0.40 $0.82 $1.24在三种利用率假设下,托管 API 与自托管成本为 2.47 美元。利用率为 90% 硬件执行有用推理工作的付费加速器时间的比例。自托管需要三个中的两个。对于大多数实际部署来说,30% 已经足够了,API 需要三分之二。所以这个问题的答案是这取决于你的利用率,这并不令人满意,但也是事实。但更有用的发现是,该表中的每个数字都是表中没有的决策的下游。杠杆 1:加速器。 2.3倍。上述每一个自托管胜利都是在 AMD MI355X 上实现的。没有人使用 NVIDIA。 Vultr 上的 MI355X 每 GPU 小时 2.59 美元。我们发现的最便宜的 B200 价格是 5.89 美元。与 DeepSeek-R1 上测得的更高吞吐量相比,价格不到一半。这还不是AMD更好。问题是加速器市场的定价远低于模型市场,而且几乎没有人购买。证明这一点的证据是:我们调查的八家主流 GPU 提供商中没有一家首先公布按需的每 GPU MI355X 价格。市场上最便宜的容量也是最难获得号码的。我们无法定价的输入中的每一行都留空,而不是根据猜测计算成本。每个已计算成本的配置得一分。横轴为租金价格,纵轴为测得的吞吐量。 AMD Instinct MI350 系列平台。图片:AMD。杠杆 2:哪个提供商运行相同的权重。 3.2倍。相同型号 ID。相同的重量。标准层。彼此之间只有一个 API 调用。文本输出 $/1M,最便宜的主机与最昂贵的主机,相同的权重 gpt-oss-120b #################################### 3.0x $0.25 -> $0.75 gemma-4-31b-it ############################## 2.6x $0.38 -> $0.97 qwen3.7-max ####################### 2.0x $3.75 -> $7.50 gpt-oss-20b ######################### 2.0x $0.15 -> $0.30 gemma-3-27b-it ####################### 1.9x $0.16 -> $0.30 glm-5.2 ##################### 1.8x $2.40 -> $4.40 kimi-k2.6 ############### 1.3x $3.40 -> $4.50 这是阅读本文的任何人都可以节省的最便宜的费用,并且需要更改基本 URL。分布并不均匀,这是值得了解的部分。 Kimi K3 在七个主机上的价格为 3 美元,费用为 15 美元,其中包括 Moonshot 自己的 API。那里没有套利。 Llama-3.3-70B 射程为 3.2 倍。检查每个模型,因为直觉传递得很差。相同型号重量的最便宜和最贵的公布标准价格。杠杆 3:您的批处理配置。 3.5倍。相同型号。相同的 2x H100。租金率相同。仅并发 服务系统同时处理的请求数。变化。 text gpt-oss-120b,2x H100,利用率为 30% 时每 1M 输出的成本 658 tok/s ################################## $5.60 998 tok/s ####################### $3.69 1,385 tok/s ################ $2.66 1,825 tok/s ############ $2.02 2,282 tok/s ########## $1.61 配置标志移动成本为 3.5 倍。这比市场上最便宜和最昂贵的 GPU 之间的差距还要大。这是一个真正的权衡,因为更高的并发性意味着更差的每用户延迟。但这是一个你可以在一个下午调整的权衡。硬件采购则不然。人们苦恼于购买哪种加速器,然后以并发数 8 运行它。更多的并发性可以降低成本,但会降低每个用户的服务体验。杠杆4:利用率。 9x。相同的硬件,相同的租金,相同的配置。只有盒子实际工作的一小部分时间会发生变化。 MiniMax-M2.5 在 4x MI355X 上,每秒 15,775 个令牌,
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱