开发者生态
evening
Token消耗减少75%,千问办公创造了新的“省钱模式”
摘要
在功能逐渐趋同、越来越难以拉开代差的当下,办公 Agent 的竞争正在卷向模型与 Agent 架构的深度协同。 8 月 26 日晚,阿里千问大模型团队发布 Qwen3.8-Flash,并同步开源(开放权重的模型版本为 Qwen3.8-Flash-Next)。这是一个 多模态 MoE 模型,主模型参数量为 125B,额外加入 51B N-gram Embedding,每个 Token 只激活 6B ...
Agent
Qwen3
Flash
Token
Tokens
High
在功能逐渐趋同
越来越难以拉开代差的当下
的竞争正在卷向模型与
架构的深度协同
2026-08-28
1 阅读
约10分钟阅读
凌敏
字号:
在功能逐渐趋同、越来越难以拉开代差的当下,办公 Agent 的竞争正在卷向模型与 Agent 架构的深度协同。 8 月 26 日晚,阿里千问大模型团队发布 Qwen3.8-Flash,并同步开源(开放权重的模型版本为 Qwen3.8-Flash-Next)。这是一个 多模态 MoE 模型,主模型参数量为 125B,额外加入 51B N-gram Embedding,每个 Token 只激活 6B 参数。 该模型拥有极致性价比,输入每百万 Tokens 仅需 0.8 元,输出每百万 Tokens 2.7 元。 几乎是同一时间,Qwen3.8-Flash 首发上线千问办公全新的标准模式,其单任务生成速度提升约 100%,Token 消耗平均减少 75%,同时还保证了任务质量,Agent 使用成本大幅降低 。 对办公 Agent 来说,比单纯拉低使用成本更有意义的是,千问大模型与千问办公团队实现模型和 Agent 双向协同,打破了成本、性能和速度的不可能三角,用户使用标准模式就可以覆盖约 95% 的日常任务。如果这个数字成立,过去那种精打细算、舍不得把 Agent 用在小事上的使用方式,或许真的可以成为历史。 价格已经足够低,能力到底有没有跟上?是否真的跨过 Agent“斩杀线”?我们实际跑了几轮任务,给千问办公来了场突击小考。 95% 的办公任务,不需要最贵的 AI? 先从职场人最熟悉的周报开始。一周的工作散落在会议纪要、聊天记录、待办列表和各种临时笔记里,把这些零散材料一股脑丢给千问办公,让它别写流水账,自己找重点,整理成一份领导能直接看的周报。看看它怎么说: 它没有机械地按照原始材料的顺序重新排列,而是把重复出现的项目进展做了合并,也区分出了本周主要成果、风险与需协调事项、下周工作重点。并且千问办公还能连接外部应用、日历和服务,连上钉钉后,精简版周报可以直接发到钉钉消息里,从整理材料到交付,中间不需要再复制粘贴一次。 除了标准办公任务,一些临时冒出来的奇思妙想,也可以直接丢给它。 比如,我提了一个需求:需要一个网站自动抓取各个天气网站未来一周内的天气情况,综合分析,并根据温度、舒适度、雨雪等分析推荐出今日通勤的服装和注意事项。 这个需求如果自己动手,至少要先找天气数据接口,再处理城市定位、页面结构和穿衣规则。千问办公很快给出方案,调用公开天气 API,完成页面和规则逻辑,最后交付了一个可以直接打开的网页。 经常用 Agent 的人都知道,最纠结的不是某个任务要不要交给它跑,而是到底该选哪一档。 像千问办公这类 Agent,通常都会给用户提供几个不同能力档位。比如 Manus 有 1.6 Lite、1.6 和 1.6 Max;ChatGPT 也提供 Instant、Medium、High、Extra High、Pro 等不同推理档位;还有一些 Agent 把选择权交给用户,放上一堆模型让用户自己选;千问办公过去的模型供给也分为经济、基础、高级三种模式,这次更新之后,直接收拢为标准和高级两档。 选择看起来很多,但真碰上稍微复杂一点的任务,用户大都本能地往高级模式上选。毕竟已经花时间上传了一堆文件、写了一长串提示词,谁都不想最后只拿到一个 60 分的结果。与其返工重来,不如一开始就把最好的模型用上。 这也是标准模式真正需要回答的问题:便宜归便宜,到底够不够用? 我们又拿同一个任务分别跑了标准模式和高级模式。这一次,我们丢给千问办公一份工作报告,让它把原本的文字材料做成一个带留言框的网页。最终两个版本的完成度比较接近。高级模式在部分细节处理和页面呈现上更完整一些,但标准模式已经能把需求理解、内容组织、页面生成和基础交互完整跑下来。 标准模式: 高级模式: 差距更明显的地方,是积分。 标准模式执行过程中,单次积分消耗大多还停留在零点几;切到高级模式后,同类任务的积分消耗很快进入两位数。如果每天都把整理材料、做网页、处理文件这类任务交给 Agent,差距会迅速累积起来。 这也是标准模式更有意思的地方。它未必要在每一道题上都超过高级模式。只要那些每天都会发生、结果达到可用线就够的工作能够稳定完成,用户就少了一个每次都往高级模式上点的理由。从精打细算地用,到想到什么就随手丢进去,差的其实就是这一步。 标准模式为什么能便宜这么多,还够用?这笔账,要从模型内外两头算。 模型和 Agent 协同:两“王炸”双向优化 千问办公这轮变化,实际上发生在两个层面:模型内,首发 Qwen3.8-Flash 继续提高单位计算量能够换来的能力;模型外,通过 Agent Harness、上下文管理和工具调用,把这些能力更高效地用起来。 先看模型内。 Qwen3.8-Flash 最核心的变化,是在尽量少增加计算开销的前提下,把模型容量和实际能力继续往上推。 它采用 MoE 架构,主模型参数量达到 125B,但每个 Token 只激活 6B 参数,同时额外加入 51B N-gram Embedding。总参数量很大,真正参与单次计算的部分却很小。这也是它所谓“高智能密度”的来源之一:模型可以保留千亿级参数带来的容量,又不需要每生成一个 Token,都让全部参数参与计算。 这种效率提升,来自 Qwen3.8-Flash 对 Attention、Residual、Embedding 和 Optimization 四个部分的系统升级。其中,给笔者带来最大惊喜的是 Attention 层面的变化。 办公 Agent 天生是长上下文大户,任务跑得越久,需要处理的 Token 越多,传统 Full Attention 的计算和 KV Cache 访存成本也会随之上涨。 Qwen3.8-Flash 延续了 Qwen3.5 的架构设计,采用 GDN + Attention 的 Hybrid 架构:每四层中三层使用 GDN,将历史信息持续压缩到固定大小的状态中;另一层保留全局 Attention,负责精确检索全局信息。此外,Qwen3.8-Flash 还引入了 Qwen Sparse Attention(QSA),通过压缩式轻量 Indexer 在 micro-block 粒度上筛选重要上下文。可以理解成,GDN 负责把大量历史信息压缩记住,真正需要找细节时,QSA 先做一轮粗筛,从长上下文里找到最相关的区域,不用每次都把全部内容重新过一遍。 根据官方披露的数据,在 1M Token 上下文下,QSA 的 Attention Kernel 在 Prefill 和 Decode 阶段最高分别实现 7.6 倍和 4.9 倍加速;在 Prefix Cache 命中率 90% 的测试条件下,Qwen3.8-Flash 的 Prefill 吞吐达到 Qwen3.7-Plus 的 8.6 倍。 Residual、Embedding 和 Optimization 也分别从信息传递、模型容量和训练效率上继续压缩成本: Residual: 引入 Gated Residual(GR),把原本单一的 Residual Stream 扩展为 4 条分支,再通过动态 Gate 控制不同信息的读取和写入。相当于给模型内部的信息传递多开了好几条路,重要信息一路保留下来,减少信
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱