首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude

2026-08-03 1 阅读 约9分钟阅读 梦瑶
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude 梦瑶 2026-08-03 13:41:02 来源: 量子位 梦瑶 发自 凹非寺 量子位 | 公众号 QbitAI 不er?你告诉我现在搁哪儿还有便宜还好用的模型啊……(真心发问.jpg) 说时迟那时快,友友们,这不就来了嘛!!! 就在刚刚,阿里巴巴突袭发布新一代基座大模型 Qwen3.8-Max 。 用四个字概括就是:「能打」「便宜」。 总参数量达到2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景上的表现直接next level。 就在今天最新放榜的权威第三方榜单Arena中,Qwen3.8-Max更是一路冲到全球大模型第一梯队,表现直逼Anthropic的Claude系列模型: △Text Arena文本能力榜单,包含数学、代码、创业写作等领域 在编程表现上,Qwen3.8-Max甚至还超过了 Claude Opus 5 和 Fable 5 的High版本,确实有亿点不简单??? △编程能力(前端)榜单,考察多步骤推理及工具调用的编程智能体能力等 性能能打是一方面,关键是吧,人家连价格也一块打了下来—— 国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,输入与输出的国际价格仅为Opus5的40%与24%……真·便宜大碗。 性价比高,能力还强,那还了得? 瞧嘛,此前抢先体验Qwen3.8-Max预览版的网友,已经火速交上第一批实!测!反!馈! 看下面这位老哥,直接用Qwen3.8-Max复刻了一版《愤怒的小鸟》,直言价格很合适,一周使用下来额度消耗不到九成,赞! 还有网友只用一条提示词,就用Qwen3.8-Max搭出了一个完整、可交互的开发者作品集,最后给出的评价也相当言简意赅:《夯》! 哦对了,还有一堆网友们,已经针对模型「超能打」的表现开始聊得火热朝天了! 下面这位友友表示,已经迫不及待想把Qwen3.8-Max用起来了,顺便还不忘祝A社、O社IPO好运~(夺笋啊) 下面这位网友还提到,Qwen3.8-Max基准测试都把5.6-Sol给KO了,大家对A社和OpenAI的期待恐怕也得跟着变—— 毕竟又贵又闭源,门槛确实摆在那儿…… 还有朋友实测后感慨,Qwen3.8-Max的表现甚至超过了Fable 5,这波能力属实有点超出预期了奥! 真·有口皆碑了也是。 既然,Qwen3.8-Max来都来了,我们也直接实测一波,看看模型到底能不能打! 编程、专业工作、长程任务、多模态分析统统梭哈! 说实话,阿里Qwen的前几代模型我几乎是发了一个测一个,零零散散测下来,最大的感受就是—— 确实夯,也确实能打…… 而这次到了Qwen3.8-Max,感觉又不一样了,因为面对真实世界里的复杂问题,这模型已经能一路拆解、执行,直到交付最终成果了。 在具体评测表现中,Qwen3.8-Max在科研复现、多模态理解、长视频和电脑操作多项超越GPT-5.6、Opus 4.8与Fable 5,在编程、终端Agent和专业工作也稳居行业头部—— 贴心的我,也帮大家浅浅总结了一下Qwen3.8-Max的亮点能力,让大家一睹为快! 编程能力: 能把复杂任务端到端地自主交付,理解需求、搭建工程、运行实验、检查结果、继续优化全流程梭哈。官方披露的一个极端案例是,它能从一个空文件夹出发、在无人干预下自主推进十多天,最终交付一个真实可用的完整项目。 长线程任务: 具备系统级自主规划与执行能力,在数千轮超长程交互里也不迷失目标。 专业工作: 能一次交付需要返修3到5轮的APP原型,也能在一小时内处理数百份法律文档,完成上千个条款标注。 多模态智能体: 几百页的复杂材料、上百小时的视频内容都能消化,还能顺手整理成直接可用的成果。 我:如此之能干,如此之务实,还有这好事儿?那我可就直接狠狠一个大测特测!!! Vibe一下,编程能力大考验 既然,Qwen3.8-Max如此擅长AI Coding,那我们直接上来就考察一下这模型的「编程本事」。 好巧不巧的是,最近的我正愁每周例会上该怎么把这一周的AI热点捋清楚,做成一份能给领导交差的分享。 这下好了,我索性把这事儿交给Qwen3.8-Max~(鬼点子生成中) 不过,光用一句提示词搭个网页,多少有点太简单了,于是乎—— 我直接化身产品经理,喂给了Qwen3.8-Max整整一大页产品需求,让它「从零」开发一个可运行的AI资讯网页。 在具体需求上,我不仅明确要求了网页需要具备的核心功能,还对数据、页面体验、技术约束、验收标准、交付要求进行了明确约束,主打一个狠狠刁难!!! 大概过了5分钟。 我的这位产品经理Qwen3.8-Max,就直接给我端上来了一份接近 正式产品交付水准 的全链路解决成果—— 整个交付过程页面我从头拉到尾,说实话,确实有点让我震惊。 需求拆解、技术选型、项目结构、功能实现,该有的环节一个没落,完全是一套真实项目从开发到交付的完整流程。 然后,我再定眼一看,发现Qwen3.8-Max还专门整理了一份 「问题与解决记录」 ,开发过程中碰到了什么报错、问题出在哪儿、最后怎么修好的,它全给列得明明白白。 而作为提出需求的那个人,我真的全程一次手都没插,甚至直到看见这份记录,我才知道中间居然还冒出过这么多麻烦??? 不是我说,这模型是真·有问题自己解决啊,Qwen3.8-Max:事情交给我您放心哈~ 此外,在检查模型作业的过程中,我又发现了点我属实没料到的东西…… Qwen3.8-Max在交付前,还给整个项目来了一轮正儿八经的 「功能验收」 ???? 从安装依赖、本地启动,到生产构建和预览,它把项目能不能跑起来逐项过了一遍。 甚至,连数据量、分类覆盖范围、搜索清空后的页面恢复,它都一项项列进了验收清单,最后统一打上「通过」。 别说,整个从零搭建项目的全过程真有点真实工程内味儿了,be like: 真的就几分钟。 我写下的一整页产品需求,就这么被Qwen3.8-Max直接交付成了一个能跑的项目。 我忐忑地打开Qwen3.8-Max给我的代码跑了一下网页,没有报错,也没有哪项功能突然掉链子。 页面布局、资讯分类、搜索、排序、收藏……几乎和需求文档里写的一模一样,交互也没有问题, 原本可能需要我自己一轮轮试错、查报错、补功能、跑测试的工程过程,就这么全让模型一个人干了。 我只想说,Qwen3.8-Max,你这是真·端到端啊…… 长长长长文本分析也来探一探 能搞定编程项目的全流程交付,确实不亿般。 But,在日常学习工作场景中,我们很多时候未必有那么多需要Coding的场合。 很多时候真正想让我们口吐芬芳的,反倒是一些《蛮基础》的工作场景,就比如啊—— 长文本分析。 (doge) 估计有友友该说了,这有啥难的啊,直接喂给AI资料,然后坐享其成得了呗~ 单纯的文本分析当然不难,but,让AI对几十页复杂文档进行「交叉分析」那事情就不一样了。 之前我就喂给过GP
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱