汽车
morning
AI 大模型周榜:国产多模型扎堆入榜前端开发榜,阿里 wan3.0 冲进视频榜前三
2026-09-07
1 阅读
约10分钟阅读
IT之家
字号:
IT之家9月7日消息,Arena( arena.ai )平台本周发布2026年第36周(8月31日~9月6日)AI大模型盲测排名,本期迎来多个重量级新模型入榜,其中多款国产模型在外围实现亮眼突破。东方开发榜中,阿里qwen3.8-max-0902首次入榜即位列第4 ,阿里qwen3.8-flash-next、腾讯hy4-preview、智谱glm-5.3-flash也同步首次入榜并杀入前15;AI视频榜中,阿里旺3.0首次入榜直接冲进前三,开展自制生成视频模型的最新战斗。整体考察,头部格局仍以海外模型为主,但国产模型在精细领域的速度进步值得关注。 arena.ai )平台盲测投票,通过 ELO(智能体榜为人口信号)计算排名反应,用户倾向偏好而非绝对能力测试;不同分榜相互独立,不宜跨排行榜比较,分差在睡眠范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。综合排行榜本期排行榜整体排名稳定,claude-fable-5以1507分蝉联榜首,claude-opus-4-6-high以1505分紧随其后,双方分差仅2分,在光子范围内算是接近。本周有两人新模首次入榜,Anthropic claude-fable-5.1-max直接冲入前三,ELO得分1504分,位列第3;Google gemini-3.8-flash-high位列第8,ELO得分1494分,目前仍为初赛阶段。头部前10名分数均在1492分以上,分差均小于30分,整体竞争力非常胶着。国产模型整体在上游位置,梯队相对稳定:月之暗面kimi-k3-max排名最高,位列第12名,ELO 1489分,排名持平;智谱glm-5.3-max位列第20名,ELO 1482分,较阿里上周位下降 5 位; qwen3.8-max 列第 22 名,ELO 1480 分,排名下降 2 位;排名较上周模型厂商分数 (±CI) 票数 价格 ($/M) 输入 / 输出上下文 1 - claude-fable-5 Anthropic 1507 ±5 27189 $10 / $50 1M 2 - claude-opus-4-6-high Anthropic 1505 ±4 72099 $5 / $25 1M 3 新上榜 claude-fable-5.1-max Anthropic 1504 ±11 2906 $10 / $50 1M 4 ↓ 1 claude-opus-4-7-high Anthropic 1502 ±4 60103 $5 / $25 1M 5 ↓ 1 muse-spark-1.2 (xHigh) Meta 1499 ±10 3240 $1.25 / $4.25 N/A 6 ↓ 1 claude-opus-4-6 Anthropic 1498 ±3 76015 $5 / $25 1M 7 ↓ 1 claude-opus-4-7 Anthropic 1494 ±4 61238 $5 / $25 1M 8 新上榜 gemini-3.8-flash-high Google 1494 ±9 5125 $0.75 / $3.75 1.05M 9 ↓ 2 claude-opus-5-high Anthropic 1493 ±5 35174 $5 / $25 1M 10 ↓ 2 muse-spark-1.1 Meta 1492 ±5 24064 $1.25 / $4.25 N/A — 以下为前 10 名国产模型 — 12 ↓ 2 kimi-k3-max Moonshot 1489 ±5 18090 N/A N/A 20 ↓ 5 glm-5.3-max Z.ai 1482 ±7 7668 $1.4 / $4.4 1.05M 22 ↓ 2 qwen3.8-max 阿里巴巴 1480 ±6 13346 $2 / $6 1M 代码榜 代码榜头部格局 同样稳定,claude-opus-4-7-high 和 claude-opus-4-6-high 同以 1552 分并列前三人,claude-fable-5 以 1551本周谷歌 gemini-3.8-flash-high 首次入榜即位列第 7,ELO 1537 分;OpenAI gpt-5.5-high 也首次入榜,位列第 28,ELO 1520 分。国产模型 glm-5.3-flash 排名上升 2 位,来到第 9,表现亮眼。国产模型在代码榜已有多款进入前 30,具体排名:如下月之暗面 kimi-k3-max 位列第 6 名,ELO 1542 分,排名持平;智谱 glm-5.3-flash 位列第 9 名,ELO 1534 分,较上周上升 2 位;智谱 glm-5.3-max 位列第 16 名,ELO 1528分,较阿里上周位下降 3 位; qwen3.8-max 列第 30 名,ELO 1520 分,较上周下降 4 位;排名较上周模型厂商份额 (±CI) 票数 价格 ($/M) 输入 / 输出上下文 1 - claude-opus-4-7-high Anthropic 1552 ±6 17176 $5 / $25 1M 2 - claude-opus-4-6-high 人类 1552 ±6 18800 $5 / $25 1M 3 - claude-fable-5 人类 1551 ±8 7293 $10 / $50 1M 4 - claude-opus-4-7 人类 1547 ±6 17342 $5 / $25 1M 5 - claude-opus-4-6 Anthropic 1546 ±5 21198 $5 / $25 1M 6 - kimi-k3-max Moonshot 1542 ±9 4719 N/A N/A 7 新上榜 gemini-3.8-flash-high Google 1537 ±16 1456 $0.75 / $3.75 1.05M 8 ↑ 1 claude-opus-4-8-high Anthropic 1534 ±6 13439 $5 / $25 1M 9 ↑ 2 glm-5.3-flash Z.ai 1534 ±17 1274 $0.15 / $0.5 1.05M 10 ↓ 3 muse-spark-1.2 (xHigh) Meta 1533 ±20 935 $1.25 / $4.25 N/A — 以下为 Top 10 国外的国产模型 — 16 ↓ 3 glm-5.3-max Z.ai 1528 ±14 2008 $1.4 / $4.4 1.05M 19 ↓ 1 qwen3.7-max-preview 阿里巴巴 1525 ±18 1118 $1.48 / $4.43 1M 26 ↑ 1 mimo-v2.5-pro 小米 1520 ±6 15813 $0.44 / $0.87 1.05M 30 ↓ 4 qwen3.8-max 阿里巴巴 1520 ±10 3867 $2 / $6 1M 最新开发榜 前沿开发榜 本周密集新模型入榜, OpenAI gpt-6-astra-max首次登榜即拿下榜首,ELO 1797 分;Anthropic claude-fable-5.1-max 首次入榜位列第二
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱