汽车
evening
千问迎战Kimi、DeepSeek,阿里的胜算在哪?
摘要
文 | AIX财经,作者 | 雷晶,编辑 | 金玙璠 8月3日,预热两周后,阿里正式发布Qwen3.8-Max。模型参数规模达到2.4万亿,支持最长100万Token上下文,重点提升编程、办公、科研和长周期任务能力。按照官方说法,它不仅可以回答问题,还能调用工具、修改代码,并端到端完成复杂任务。 开发者可通过千问AI平台获得Qwen3.8-Max的API服务,每百万Token输入12元、输出36元...
Qwen3
Opus
AIX财经
金玙璠
8月3日
预热两周后
阿里正式发布Qwen3
Max
模型参数规模达到2
4万亿
2026-08-04
1 阅读
约10分钟阅读
AIX财经
字号:
文 | AIX财经,作者 | 雷晶,编辑 | 金玙璠 8月3日,预热两周后,阿里正式发布Qwen3.8-Max。模型参数规模达到2.4万亿,支持最长100万Token上下文,重点提升编程、办公、科研和长周期任务能力。按照官方说法,它不仅可以回答问题,还能调用工具、修改代码,并端到端完成复杂任务。 开发者可通过千问AI平台获得Qwen3.8-Max的API服务,每百万Token输入12元、输出36元,在国产头部模型中处于中间价位。阿里还计划开源Qwen3.8系列的27B小尺寸模型,为本地部署和低成本应用提供更多选择。这也意味着,千问一边用Max级别模型冲击能力上限,一边继续通过开源模型扩大开发者生态。 7月19日预览版上线时,千问称该模型正以“天”为单位持续进化,并对标Anthropic最强旗舰模型Fable 5,宣称它“可能是除了Fable 5以外最强大的模型”。口号不小,实际成色如何?先看它和Fable 5的基准测试成绩对比。 我们挑了两类项目:一类是Qwen3.8-Max反超Fable 5的,一类是差距仍然明显的。可以看出,Qwen3.8-Max确实在科研编程、Agent和办公任务中取得明显进步,部分项目超过海外旗舰模型,但在真实软件工程和复杂环境操作中仍有差距。 预览版发布后的两周里,不少开发者参与测试,千问团队也在根据反馈持续调整模型。如今正式版上线,千问会给国产模型的竞争带来变数吗? 01.最新模型,强在哪儿 、 差在哪儿? 先看跑分成绩。 在官方发布的基准测试中,千问将Fable 5、Opus 4.8和GPT-5.6 Sol等海外旗舰模型作为对比对象。从结果来看,Qwen3.8-Max相较前代提升明显,但还没有做到全面领先。 进步最突出的是科研编程和Agent任务。PaperBench要求模型理解论文、搭建实验并复现结果,Qwen3.8-Max从上一代的64.8分升至93分;在Agents’ Last Exam测试中,其任务通过率也从11.8%升至27%。两项成绩同时提高,一定程度上反映出它在代码生成、工具调用、连续执行和反馈修正方面的进步。 但在真实软件工程测试中,Qwen3.8-Max还没有追上最强模型。在SWE-bench Pro测试中,Qwen3.8-Max得到67.7分,比Fable 5低12.3分,也略低于Claude Opus 4.8的69.2分。这类测试要求模型进入已有代码仓库,完成跨文件修改,并避免引入新问题。Qwen3.8-Max更会解决复杂任务了,但在真实项目中的全局理解和修改稳定性仍是短板。 再来看一下第三方榜单成绩。这里我们选择了Arena榜单来进行解读,Arena主要依靠用户盲选投票,更接近模型最终交付给用户的实际体验。其中,Vision Arena主要反映图像理解和视觉问答体验,Text Arena考察通用文本、指令执行和表达质量,Code Arena则更关注模型生成网页的视觉效果、交互和完成度。 Qwen3.8-Max在视觉和文本榜单上分别排名第二和第五,与榜首均相差13分。文本榜单分差相对集中,Qwen3.8-Max虽然排名第五,但仍处于头部区间。在前端代码榜单中,它排名第四,比榜首的Opus 5-Max低37分。官方编程基准成绩较好,与Arena未能登顶并不矛盾,前者主要反映解题和工程任务能力,后者更侧重生成结果的视觉效果、交互完成度和用户偏好。 图源 / 千问官网 不过,比单项成绩更值得关注的是长周期任务。 随着头部模型在单次问答、知识推理和代码生成上的差距越来越小,竞争的重点变成了模型能不能把一项工作持续做完。 大模型从业者王楠将长周期任务的难点概括为远距离规划、状态追踪和错误恢复。每一步操作都会改变环境,一次错误的后果可能在数步之后才显现。模型不仅要记得最终目标,还要判断任务进行到了哪里、前一步是否正确,以及失败后应该从哪里重新开始。 他介绍,目前行业主要通过任务规划、结构化记忆、多Agent协作等方式解决这些问题。简单来说,就是给模型增加任务管理、质量检查和回滚机制,让长周期任务不再只依赖模型自身,而是由模型和外部工程系统共同完成。 千问给出的案例是,Qwen3.8-Max连续运行约16天,从零构建了一个名为oh-my-cli的开源项目。用户反馈、社区实践和模型自测结果先被整理为Issue(任务单),再由Agent领取;代码完成后运行构建、单元测试和端到端测试,验证失败则退回修改。在这套循环中,issue负责记录任务状态,自动测试提供外部反馈,退回修改则对应错误恢复。 这说明千问展示的不只是模型能够连续生成代码的能力,更是它能否借助工程系统持续接收任务、验证结果并修正错误的能力。 不过,连续运行16天仍不能直接证明长周期能力已经成熟。王楠表示,真正需要验证的是模型能否长期保持目标一致,能否及时发现错误,以及出错后能否恢复。落到实际使用中,还要考察最终功能是否可用、重复执行是否稳定、中途需要多少次人工接管,以及完成任务所需的Token和算力成本。 综合来看,Qwen3.8-Max已经进入头部模型的竞争范围,在办公、多模态理解、搜索和部分编程任务提升明显;短板则主要集中在真实代码仓库、复杂工具调用和动态环境中的连续操作。 长周期任务可能是Qwen3.8-Max的亮点,但目前最有代表性的证据仍来自官方搭建的项目,它能否在不同任务中以较少的人工介入稳定交付,还需要开发者社区进一步验证。 02.跑分和口碑的落差 千问系列模型一直不缺少好成绩。5月20日,阿里发布的Qwen3.7-Max曾位列Code Arena第四名,是当时国产模型的第一;在Text Arena也一度排名第六。 但在实际使用中,Qwen3.7-Max的口碑并不一致。开发者艾林认为,Qwen3.7-Max对项目的理解比较清晰,在问题分析和输出逻辑上略胜一筹。但在处理复杂代码时,前期看起来进展顺利,检查结果时却会发现漏洞,反而增加了工作量。 当时,围绕Qwen3.7-Max的评价主要集中在,它擅长阅读代码、分析问题和提出方案,进入执行阶段后却可能扩大修改范围、改动无关配置,或者没有严格遵守需求。 新一代的模型Qwen3.8-Max在上代模型的基础上进行了提升,艾林测试后认为,Qwen3.8-Max在任务拆解、Agent调用、需求理解和UI设计方面均有明显提升,不过与Fable系列仍有距离。 独立开发者李默也感受到编程和复杂任务能力的进步,认为Qwen3.8-Max已经摸到了第一梯队的门槛。但在生成交互网站时,模型没有完整实现核心拖动功能,还把HTML标签直接显示在页面上。“Qwen3.8-Max有点懒”,需要把要求拆得非常具体,才能执行到位。 相比Qwen3.7-Max,Qwen3.8-Max更会拆解任务,也更容易做出接近成品的页面,但没有完全解决稳定性和交付意识的问题。 个体体验有落差,那放到国产模型的竞争里看,千问排在什么水平? 一个细节值得注意:上一代发布时,千问的对标名单里还有智谱、月之暗面、深度求索等国内厂商;这一次,对标对象只剩OpenAI和Anthropic的旗舰模型。这并不意味着它已经甩开国产对手,随着Kimi K3和DeepSeek V4的发布,国内竞争只会更激
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱