开发者生态
morning
Ming-Flash-Omni:全模态统一大模型的关键技术与实践
2026-08-05
1 阅读
约10分钟阅读
作者 :郭清沛
字号:
在大型语言模型向多模态方向持续演进的今天,业界正经历从“语言模型 + 多模态外挂”到“原生全模态统一”的范式迁移。本文整理自蚂蚁集团高级算法专家郭清沛在 QCon 全球软件开发大会 2026 北京站的分享《Ming-Flash-Omni:全模态统一大模型的关键技术与实践》。 郭清沛系统阐述了Ming-flash-omni全模态统一大模型的技术架构与研发实践,从模态统一、任务统一到工程优化三个维度,揭开了一个千亿参数全模态模型从理论到落地的完整技术路径。 以下是演讲实录(经 InfoQ 进行不改变原意的编辑整理)。 多模态大模型发展趋势 我们对于多模态大模型发展趋势的整体判断,可以用一句话来总结:这个模型会越来越像人。从感知层面来看,它会引入视觉感知和听觉感知。从能力层面来看,它会把人的认知、表达、理解和生成这些能力都统一起来。所以我们从模态维度和任务维度这两个坐标出发来观察大模型的演化方向,结论是一致的——模型正在变得更加类人化,感知上拥有更多模态的感知能力,能力上逐渐实现理解与表达的一体化,实现生成和理解的统一。 基于这个趋势判断,Ming模型从立项之初的定位,就是做一个统一的多模态大模型。但是在深入技术细节之前,我们需要先厘清几个核心概念。这几个概念在当前的技术讨论中频繁出现,但各自的边界和内涵往往被混用。只有把概念定义清楚,才能真正理解我们在全模态统一大模型上做了哪些工作。 首先是原生多模态。原生多模态要解决的核心问题是模态统一中“怎么统一”的路径选择。在模态统一这个目标下,我们有两条路可以走。一条路是基于已有的语言模型,通过桥接的方式去拓展多模态能力,先训好一个语言模型,再把视觉、音频的encoder加上去,让这些模态往语言模型的空间对齐。另一条路是在训练语言模型的同时,直接用多模态序列来训练,也就是在LM预训练阶段就把多模态序列引入进来,训出来的模型天然就是一个多模态模型。所谓原生多模态,指的就是后一条路径,它是模态统一的一种具体实现方式。 第二个概念是全模态大模型。全模态大模型强调的是模型能够理解更多模态,把音频、视频、图片、文本这些模态全部放在一个模型里,实现全模态的理解。这个概念的侧重点在于“模态的广度”,它不涉及生成任务,只关注理解能力能否覆盖所有主流模态。 第三个概念是理解与生成统一。这个强调的是任务层面的统一,是让模型既能做理解任务,又能做生成任务,实现感知和表达的闭环。这是从能力维度的统一,而不是模态维度的统一。 搞清楚这三个概念之后,今天我们要讨论的主题——全模态统一大模型,它的内涵就非常清楚了。全模态统一大模型包含两个维度:首先,它要能够实现音频、视频、图片、文本这种全模态的理解;其次,它要实现任务的统一,能够把理解任务和生成任务统一在一个模型里。也就是说,全模态统一大模型等于全模态大模型加上理解与生成统一。而原生多模态,是实现模态拓展的一种具体路径选择,是实现全模态大模型的其中一条技术路线。 把这些概念界定清楚之后,我们再来看构建一个全模态统一大模型到底面临哪些核心挑战。 构建全模态统一大模型的核心挑战 如果要做一个全模态统一大模型,我们面临的核心挑战可以归纳为三个维度。 第一个挑战是模态统一。这里的模态统一,指的是我们怎么基于一个统一的架构,实现音视图文这种全模态的协同理解。这个问题又包含了两个层面。在基础技术层面,我们需要在模型架构和训练策略上做出设计,让各个模态在一个模型里能够协同工作,而不是互相干扰。在训练范式层面,我们需要回答那个路线选择的问题:是走桥接路线,在已有的语言模型上拓展多模态能力;还是走原生路线,在LM训练一开始就直接融入多模态序列。 第二个挑战是任务统一。任务统一要解决的核心问题,是基于统一的架构来实现感知和表达的闭环。理解任务和生成任务在表征的要求上存在着天然的冲突。对于理解任务而言,它的核心操作是去噪,从海量的输入信息中提取高层的语义表达,把那些无关的细节过滤掉。对于生成任务而言,它的核心操作恰恰相反,一个是还原细节,另一个是发散创造。生成需要细粒度的表征来做精确的像素级输出,需要发散的能力来做创意表达。这两个任务的目标和表征需求可以说是背道而驰的。所以在任务统一这个挑战上,我们要解决的核心矛盾,就是理解与生成在表征层面的冲突。 第三个挑战是数据异构性和模型异构性。当我们真正把音频、视频、图片、文本这些多模态序列放在一个训练框架里时,各个模态本身的数据异构性就暴露出来了。不同模态的序列长度差异巨大,文本token很短,一张图片的token就长得多,视频的token更长。同时,不同模态和不同任务之间的收敛速度也是不一致的,简单感知任务收敛得非常快,复杂推理任务则需要更多的训练步数。这种数据异构和模型异构的问题,在统一的训练框架中必须得到系统性的解决。 值得一提的是,在全模态统一大模型这个方向上,上述三个挑战中的任意一个如果取得突破性进展,都可能带来整个业界范式的一次更新。比如说,如果我们在模态统一上突破了原生统一方案,那么在语言大模型训练的时候,视觉感知能力就会成为语言大模型的标配,业界就不会再去区分语言大模型和多模态大模型了。事实上,从今年年初k2.5、qwen3.5等模型发布之后,我们可以看到,后续大部分厂家在发布大模型的时候,视觉感知能力基本上已经成为标配。同样,如果在任务统一上取得突破,那么大模型就不会再去区分理解大模型和生成大模型,而是真正实现多模态在感知和创造上的闭环。 Ming-flash-omni 全模态统一大模型的解决方案 我们把模态统一的挑战进一步分解为两块。第一块是基础问题,包含两个核心子问题:一是怎么设计一个跨模态融合的模型架构,让各个模态放在一起之后不会出现任务冲突,并且联合训练的效果要好于各个模态独立训练;二是在训练策略上,怎么把各个模态真正放在一起实现任务协同,保证在训练结束时每个模态都能达到各自的最佳效果。第二块是训练范式的迁移问题,也就是我们刚才反复讨论的路线选择——桥接还是原生。 我们先来看跨模态融合架构这个基础问题。现在大模型的主流架构是MOE,它有很好的scaling law特性,而且推理时成本更低。但当前的MOE架构主要是基于语言模型来设计的。当我们把音频、视频、图片、文本这些多模态序列都放进去的时候,会面临两个具体的挑战。 第一个挑战是,MOE的router在多模态场景下会出现模态分化的问题。不同模态的特征表征天然存在差异,那么在语言模型上已经训练好的router,是否能够很好地泛化到其他模态上?为了验证这个问题,我们做了一个preliminary study。结果发现,用语言模型上训练好的router去路由视觉模态(包括图片和视频)和音频模态时,专家分布的概率分布与原始语言模型的分布基本上是一致的。这意味着原来的router没有能力很好地区分语言模态和其他模态——它把所有的token都按照语言模型的习惯来分配专家了。 基于这个观察,我们设计了一个multi-router的方案。核心做法是,针对每一个模态,我们都单独设计一个router,每个router也有自己独立的均衡策略。这样,视觉tokens走视觉的router,音频tokens走音频的router,文本tokens走文本的rout
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱