首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

2026 年的云栖,阿里给 AI 行业递了一把新尺子

摘要

2026 年,AI 行业最大的关键词可能不是某个模型的发布。 而是两个字:落地。 最早采用企业级 Agent 的企业已经开始算成本账,并对三个问题尤为好奇:Agent 的故事讲了两年,究竟能落地多少?Token 的消耗呈指数级增长,到底贡献了什么业务价值?企业级 Agent 平台除了全栈自研,还有无其他选择? 当模型和 Token 的供给不断扩大,AI 厂商要解决的问题也随之变得更加复杂:如何让智...

Agent Token MaaS 2026 行业最大的关键词可能不是某个模型的发布 而是两个字 最早采用企业级 的企业已经开始算成本账 并对三个问题尤为好奇 的故事讲了两年
2026-09-23 1 阅读 约10分钟阅读 王一鹏
分享:
字号:
2026 年,AI 行业最大的关键词可能不是某个模型的发布。 而是两个字:落地。 最早采用企业级 Agent 的企业已经开始算成本账,并对三个问题尤为好奇:Agent 的故事讲了两年,究竟能落地多少?Token 的消耗呈指数级增长,到底贡献了什么业务价值?企业级 Agent 平台除了全栈自研,还有无其他选择? 当模型和 Token 的供给不断扩大,AI 厂商要解决的问题也随之变得更加复杂:如何让智能运行得更高效、覆盖更广,并最终把 Token 转化为生产力。 阿里巴巴集团战略副总裁、阿里巴巴 ATH 事业群 MaaS 业务线总裁文征表示,在机器智能变革中,要让 AI 成为整个社会的基础设施,真正的问题是谁能把智能变成最后交付的结果。 这也意味着,衡量 AI 的尺子需要随之变化。 在 2026 年云栖大会 MaaS & Agent 技术主论坛上,文征给出了一个新公式: 智能价值密度 = 单任务价值 × Token 生产效率 × Token 单位能力。 先是趋势判断,再是价值衡量公式,文征实际上勾勒了下一阶段 Agent 的竞争方向。 文征显然对千问 AI 平台信心十足。一组数据揭示了这种信心的来源:过去不到一年,该平台客户数增长了 6 倍。 仅以 Token 消耗量衡量 MaaS 业务已经过于片面,更应该关注的应当是智能所创造的价值。与之对应,千问 AI 平台的能力边界也向外延伸,不止步于模型和算力服务。 千问 AI 平台几乎接管了阿里 AI 全栈服务体系“半壁江山”的对外出口,芯片、云资源、模型服务、Agent 服务、AI 应用、行业方案都由此对外输出。现在的千问 AI 平台,在底层,围绕 Agent 负载优化模型服务、训练推理;中间层,正式上线生产级 Agent 服务平台 Agent Studio;应用层,发布一系列 Agent 应用的新版本,并推出手机与智能座舱两大行业解决方案。 千问 AI 平台正在扩展新的供给宽度:从模型服务,到 Agent 服务,再到 AI 原生应用与行业方案,最终进入企业的具体生产任务。同时将模糊的趋势判断,变成可预期的价值交付。 只供给 MaaS 不够了,企业更关注智能所生产的价值 过去两年,多数 MaaS 平台的推理引擎是为聊天机器人场景设计的——一问一答,短会话,低并发。 但 Agent 不是这么工作的。 文征在演讲中描述了一个真实场景,他管它叫“开机风暴”:大型客户每天早上 9 点上班,员工陆续到岗——销售让 Agent 写拜访材料,研发打开编程 Agent 跑代码,每个人跑自己的任务。从平台视角看,这就是短时间内涌进来的海量调度请求。 一个 Agent 任务可能触发几十次模型调用,上下文长度远超普通对话,突发并发可能瞬间翻几倍。而且它要 7×24 小时不停地跑,而是在生产环境里持续运转。 可以说,相较于 ChatBot,Agent 是一种完全不同的计算负载,需要不同的技术能力来支撑。 这也是千问 AI 平台此次升级模型服务的逻辑。它围绕模型生态、推理效率、生产保障和服务模式,重新组织了一套面向 Agent 的供给体系。 首先是把模型供给做全,并跟上迭代速度。 根据发布资料,自 2025 年 9 月的 Qwen3 Max 以来,千问旗舰语言模型一年迭代五代。同时,千问 AI 平台覆盖语言、图像、视频、音乐、音频等不同模态,以及从端侧轻量模型到云侧旗舰模型的不同尺寸;对于 DeepSeek、Kimi、GLM、MiniMax 等开放模型,则强调第一时间接入可用。 这背后对应的是企业任务的多样性:读懂一份材料、生成一段语音、处理复杂推理,需要的未必是同一个模型。平台的价值,不只是把自研模型推向客户,也在于让开发者能够根据任务选择能力,而不必为每一种模型重新搭建一套服务。 但模型可选,只是第一步。Agent 真正运行起来,考验的是供给效率。 Agent 任务集中启动时,平台要快速调来资源;任务持续推进时,又要尽量减少每一轮的等待和重复计算。 千问 AI 平台因此把优化推进到启动、调度、推理、峰值保障和缓存五个环节。按照此次公布的数据,FlashBoot 将模型弹性启动时间从 1200 秒缩短至 70 秒,UniScheduler 将集群调度决策耗时从 20 秒压缩至 0.4 秒。两者分别解决资源“准备得慢”和“分配得慢”的问题,让计算资源更快跟上任务变化。 推理侧,平台通过推理性能及分布式调度优化,将首 Token 延迟降低 38%;通过多阶段服务质量保障与请求级调度,将峰值吞吐提升至原来的两倍。前者减少调用等待,后者应对任务密集涌入——对于相互依赖的多轮执行,这些环节的效率会共同影响最终交付时间。 缓存则瞄准另一类浪费。Agent 执行任务时,企业知识、工具说明、历史记录等上下文往往被反复使用。千问 AI 平台引入 Vineyard 分布式全局 KV 缓存,支持显式与隐式缓存,减少重复上下文计算。据官方数据,Prompt caching 成本节省幅度最高达到 95%,这对应的是缓存复用环节,而非整项任务的总成本。 把这些动作连起来看,阿里云优化的不只是 Token 生成速度,而是智能供给过程中的等待、拥堵与重复劳动。 接下来,是把性能优势变成企业能够依赖的生产保障。 千问 AI 平台把这部分能力概括为“可承诺、可信任、可监控”。在供给保障上,平台提供 99.9% 的服务 SLA,并通过 AutoTPM,将自动基线与动态突发容量结合起来,减少企业手动估算配额、申请扩容的负担;配合业务空间级隔离与管控、提升至 3600 秒的超时上限,适应更长程的任务调用。 数据与治理同样被纳入模型服务。CMaaS 机密推理围绕“数据可用不可见”的目标,结合加密与审计机制;接入层提供身份认证、权限管控、提示词注入防护和内容安全审核。监控侧则覆盖 API、吞吐预留和独占吞吐等服务形态,对时延、错误率、容量与预算提供监控告警,并支持接入企业已有的运维体系。 这些能力的意义在于,企业使用 AI 时,不必另外拼出一套孤立的管理系统。模型调用也可以进入既有的权限、审计和成本管理流程。服务 SLA 并不保证业务答案正确,但它为企业持续使用模型提供了更可管理的基础。 最后,是让同一套模型能力,以不同方式进入不同规模的业务。 个人开发者希望低门槛试用,团队需要统一订阅和成员管理,产品集成商看重高峰期的吞吐保障,大型企业则可能要求资源独占与定制部署。千问 AI 平台据此提供从免费额度、按量付费、Token Plan,到吞吐预留 PTU、独占吞吐 DTU 及定制化推理部署的多层选择。 本次新发布的 API 优速模式 Prime,面向延迟敏感的调用:按平台公布的口径,Token 生成速度达到标速模式的 1.5 至 2 倍,通过切换模型 ID 使用,仍按 Token 计费,无需预购资源。它降低的是获得更快响应的门槛。 吞吐预留则回应另一种需求——业务高峰到来时,企业希望提前锁定供给,而不只是临时争取资源。此次 PTU 更新提供标速、高速及 8 小时选项,其中 8 小时版目前仅提供夜间标速模式,让适合夜间执行的任务获得更细粒度的资源安排。 面向个人和团队的 Token Plan,则把多模型、多 Agent
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱