汽车
morning
AI 大模型周榜:阿里 qwen3.8-max 冲进综合榜 Top 6,国产多模型表现亮眼
2026-08-11
1 阅读
约10分钟阅读
IT之家
字号:
IT之家8月10日消息,Arena(arena.ai)平台发布2026年第32周(8月3日~8月9日)AI大模型盲测排名,本周共有多新模型入榜,其中国内模型阿里qwen3.8-max表现突出,杀入综合榜第6名,ELO分数达到1497分,全部款达到第一梯队。推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 位,成为海外阵营的亮眼新秀。本周多重细分都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。 IT之家注:本排行榜基于 Arena( arena.ai )平台匿名盲测投票,通过ELO(智能体榜为信号)计算排名,反应用户偏好而非绝对能力测试;不同分榜相互独立,不宜跨排行榜比较,分差在棋盘范围内均视为并列,新模型也需积累投票量后才会正式入榜。 综合榜本周综合排行榜头部格局相对稳定,Anthropic推出claude-fable-5多个问题榜首位置,ELO分数为1507分,claude-opus-4-6-thinking、claude-opus-4-7-thinking紧随其后位列第二、三名,三者分均在10分以内,在曲目范围内视为接近。 本周最大看点是两新模型强势闯入头部:Meta新发布的muse-spark-1.2 (xHigh)首排名第4,ELO 1498分;阿里全新qwen3.8-max拿到第6名,ELO 1497分,与第5名的claude-opus-4-6同分,仅因投资信区间差异排名靠后,同样在统计范围内并列。头部整体分数分布,前10名分数均在1488分以上,竞争极为激烈。国内模型在综合榜已有多款进入中上游,具体排名如下:阿里qwen3.8-max排名第6名,ELO 1497 分;月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。 排名 较上周模型 厂商分数 (±CI) 票数价格 ($/M) 输入 / 输出 背面 1 - claude-fable-5 人类 1507 ±6 19390 $10 / $50 1M 2 - claude-opus-4-6-thinking 人类 1505 ±4 69336 $2.5 / $12.5 1M 3 - claude-opus-4-7-thinking 人类 1502 ±4 57018 $5 / $25 1M 4 新上榜 muse-spark-1.2 (xHigh) Meta 1498 ±13 2057 $1.25 / $4.25 N/A 5 ↓ 1 claude-opus-4-6 Anthropic 1497 ±3 73158 $2.5 / $12.5 1M 6 新上榜 qwen3.8-max 阿里巴巴 1497 ±9 4662 $2 / $6 1M 7 ↓ 2 claude-opus-4-7 人类 1493 ±4 58135 $5 / $25 1M 8 ↓ 2 claude-opus-5-高 人类 1493 ±6 14902 $5 / $25 1M 9 ↓ 2 claude-opus-5-max 人类1488 ±8 7137 $5 / $25 1M 10 ↓ 1 muse-spark Meta 1488 ±6 13476 N/A N/A — 以下为 Top 10 国外的国产模型 — 14 ↓ 2 kimi-k3-max Moonshot 1485 ±7 9861 N/A N/A 23 ↓ 2 qwen3.7-max-preview 阿里巴巴1475 ±10 3695 $1.48 / $4.43 1M 代码榜 代码榜头部仍被 Anthropic 模型垄断,claude-fable-5 蝉联第一,ELO 1553 分,claude-opus-4-7-thinking、claude-opus-4-6-thinking 分别为第二、三名。月之暗面 kimi-k3-max 本周排名从第 8 名开始位上升至第6位,ELO分数上涨11分至1542分,进入Top 6,成为代码榜排名最高的国产模型。阿里qwen3.8-max排名第8,ELO 1532分,同样进入前十。Meta muse-spark-1.2 (xHigh)本周首次进入排行榜排名第15,ELO 1526分。国产模型在代码榜已有多款进入前30,具体如下:月之暗面 kimi-k3-max 排名第 6 名,ELO 1542 分,较上周上涨 2 位;阿里 qwen3.8-max 排名第 8 名,ELO 1532 分;阿里 qwen3.7-max-preview 排名第 17 名,ELO 1526 分,排名最后 1 位;小米mimo-v2.5-pro 排名第 28 名,ELO 1519 分,排名持平;智谱 glm-5.1 排名第 30 名,ELO 1517 分,较上周恢复 3 位。 排名较上周模型厂商分数 (±CI) 票数价格 ($/M) 输入 / 输出 内部 1 - claude-fable-5 Anthropic 1553 ±9 5234 $10 / $50 1M 2 - claude-opus-4-7-thinking 人类 1552 ±6 16303 $5 / $25 1M 3 - claude-opus-4-6-thinking 人类 1551 ±6 18015 $2.5 / $12.5 1M 4 - claude-opus-4-6人类 1547 ±6 20444 $2.5 / $12.5 1M 5 - claude-opus-4-7 人类 1546 ±6 16534 $5 / $25 1M 6 ↑ 2 kimi-k3-max Moonshot 1542 ±12 2611 N/A N/A 7 ↓ 1 claude-opus-4-8-thinking Anthropic 1535 ±7 10509 $2.5 / $12.5 1M 8 新上榜 qwen3.8-max 阿里巴巴 1532 ±16 1411 $2 / $6 1M 9 ↑ 1 muse-spark-1.1 Meta 1532 ±10 4199 $1.25 / $4.25 N/A 10 ↓ 1 claude-opus-4-5-20251101-thinking-32k Anthropic 1530 ±7 7603 $5 / $25 200K — 以下为 Top 10 外的国产模型 — 17 ↓ 1 qwen3.7-max-preview 阿里巴巴 1526 ±18 1112 $1.48 / $4.43 1M 28 - mimo-v2.5-pro 小米 1519 ±7 13199 $0.44 / $0.87 1.05M 30 ↓ 3 glm-5.1 Z.ai 1517 ±7 10330 $1.4 / $4.4 202.8K 尖端开发榜 本周尖端开发榜首依然是 claude-opus-5-max,ELO 1686分,月之暗面kimi-k3-max稳定保持第二位,ELO 1675分,仅下跌1分,仍紧逼头部海外模型。阿里qwen3.8-max拿下第四名,ELO 1667分,直接进入前
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱