汽车
morning
AI 大模型周榜:国产 GLM-5.3-Flash 首秀杀进代码榜前十,千问 3.8-Max 登顶前端榜
2026-09-02
1 阅读
约10分钟阅读
IT之家
字号:
IT之家9月2日消息,Arena( arena.ai )平台发布2026年第35周(8月24日~8月30日)AI大模型盲测排行榜,本期如何国产新模型首发,且取得亮眼排名。国产GLM-5.3-Flash首次进入代码榜Top 10,Qwen3.8-Max-0902首次入榜即登顶前端开发榜榜首,Kimi-K3-Max稳定守住综合榜前10名位置,整体考察国内模型在细分领域继续保持获利能力。 IT之家注:本排行榜基于Arena( arena.ai )平台匿名盲测投票,通过ELO(智能体榜为信号)计算排名,用户偏好偏好绝对能力测试;不同分榜相互独立,不宜跨排行榜比较,分差在棋盘范围内均视为并列,新模型也需积累投票量后才会正式入榜。综合榜本周综合榜头部格局稳定,Claude-Fable-5以1508分蝉联榜首,人类多款模型舆位前七,排名变化均在1位以内,ELO另外,本周有两款新模型入榜,分别是谷歌Gemini-3-Flash 和智谱GLM-5.3-Flash,首秀分别排在第27位和第30位,ELO分数分别为1474分和1473分。国产模型一个中上游位置:月之暗kimi-k3-max排名最高,位列第10名,ELO 1489分,持平;智谱排名glm-5.3-max位列第17名,ELO 1482分,较上周下降4位;阿里qwen3.8-max位列第20名,ELO 1479分,较上周下降1位;阿里qwen3.7-max-preview位列第28位名,ELO 1474 分,排名下降 1 位;智谱 glm-5.3-flash 位列第 30 名,ELO 1473 分,为本周新入榜模型。 排名 较上周模型厂商分数 (±CI) 票数 价格 ($/M) 输入 / 输出 上下文 1 - claude-fable-5 Anthropic 1508 ±5 27013 $10 / $50 1M 2 - claude-opus-4-6-high Anthropic 1505 ±4 72114 $5 / $25 1M 3 - claude-opus-4-7-high Anthropic 1502 ±4 60125 $5 / $25 1M 4 - muse-spark-1.2 (xHigh) Meta 1499 ±10 3245 $1.25 / $4.25 N/A 5 - claude-opus-4-6 Anthropic 1498 ±3 76040 $5 / $25 1M 6 - claude-opus-4-7 Anthropic 1494 ±4 61248 $5 / $25 1M 7 - claude-opus-5-high Anthropic 1492 ±5 34718 $5 / $25 1M 8 - muse-spark-1.1 Meta 1491 ±5 23814 $1.25 / $4.25 N/A 9 - gemini-3.7-flash-high Google 1491 ±8 5682 $0.75 / $3.57 1.05M 10 - kimi-k3-max Moonshot 1489 ±5 17908 N/A N/A — 以下为 Top 10 国外的国产模型 — 17 ↓ 4 glm-5.3-max Z.ai 1482 ±7 7454 $1.4 / $4.4 1.05M 20 ↓ 1 qwen3.8-max 阿里巴巴 1479 ±6 13190 $2 / $6 1M 28 ↓ 1 qwen3.7-max-preview 阿里巴巴 1474 ±10 3707 $1.48 / $4.43 1M 30 新上榜 glm-5.3-flash Z.ai 1473 ±9 4451 $0.15 / $0.5 1.05M 代码榜 本周代码榜同样由 Anthropic 垄断,Claude-Opus-4-7-high 至 1552分稳居第一,前三名 ELO 分差仅 1 分,在抽屉范围内视为并列。最值得关注的是国产新模型 GLM-5.3-Flash 首次入榜即闯入 Top 10,排在第 7 名,ELO 分数达到 1535 分,超过了头部海外模型。另外 OpenAI 新模型 GPT-5.6-Terra-Xhigh 也首次入榜,排在第 30 名,ELO国产模特在代码榜已多款进入前列:月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名持平;智谱 glm-5.3-flash 位列第 7 名,ELO 1535 分,本周新入榜;智谱 glm-5.3-max 位列第 16 名,ELO 1528分,阿里上周下降6位;qwen3.7-max-preview位列第18名,ELO 1525分,下降1位;小米mimo-v2.5-pro位列第24名,ELO 1521分,上升3位;阿里qwen3.8-max位列第29名,ELO 1519分,下降4位。较上周模型 厂商分数 (±CI) 票数 价格 ($/M) 输入/输出上下文 1 - claude-opus-4-7-high Anthropic 1552 ±6 17190 $5 / $25 1M 2 - claude-opus-4-6-high Anthropic 1552 ±6 18804 $5 / $25 1M 3 - claude-fable-5 人类 1551 ±8 7247 $10 / $50 1M 4 - claude-opus-4-7 人类 1547 ±6 17347 $5 / $25 1M 5 - claude-opus-4-6 人类 1546 ±5 21209 $5 / $25 1M 6 - kimi-k3-max Moonshot 1542 ±9 4674 N/A N/A 7 新上榜 glm-5.3-flash Z.ai 1535 ±18 1213 $0.15 / $0.5 1.05M 8 - claude-opus-4-8-high Anthropic 1534 ±6 13386 $5 / $25 1M 9 - muse-spark-1.2 (xHigh) Meta 1534 ±20 936 $1.25 / $4.25 N/A 10 ↓ 3 claude-opus-5-high Anthropic 1533 ±7 9237 $5 / $25 1M — 以下为前 10 名外的国产模型 — 16 ↓ 6 glm-5.3-max Z.ai 1528 ±14 1961 $1.4 / $4.4 1.05M 18 ↓ 1 qwen3.7-max-preview 阿里巴巴 1525 ±18 1119 $1.48 / $4.43 1M 24 ↑ 3 mimo-v2.5-pro 小米 1521 ±6 15762 $0.44 / $0.87 1.05M 29 ↓ 4 qwen3.8-max 阿里巴巴 1519 ±10 3828 $2 / $6 1M 前沿开发榜 本周重点开发榜惊人重大变化,阿里新模型 Qwen3.8-max-0902 首次入榜即直接登顶,以 1691 分关注榜首,将前面的 Claude-Opus-5-Max 挤到第二。 腾讯新模型 Hy4-Preview 首秀排在第 8名,ELO
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱