Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
InfoQ AI · 2026/8/5 15:57:15
Ming-Flash-Omni:全模态统一大模型的关键技术与实践

Ming-Flash-Omni:全模态统一大模型的关键技术与实践

AI 中文解读
蚂蚁集团最新发布的Ming-Flash-Omni模型,给AI装上了"全感官",让机器不再只是"会聊天",而是能同时看懂图片、听懂声音、理解视频,还能把这些能力融合在一起思考。过去AI处理不同信息要靠"外挂"设备,现在则像人脑一样天生就具备多模态感知能力。最厉害的是,这个模型把"理解"和"创造"统一起来——既能分析内容,也能生成新内容,就像人类既能看懂一幅画,也能自己画一幅。这项技术如果普及,普通人用AI的方式会彻底改变:拍张照片问AI穿搭建议,录段语音让AI写会议纪要,甚至对着视频提问"这个动作怎么做",AI都能像朋友一样自然回应。未来AI不再只是打字工具,而是真正能"看"会"听"的全能助手。
在大型语言模型向多模态方向持续演进的今天,业界正经历从“语言模型 + 多模态外挂”到“原生全模态统一”的范式迁移。本文整理自蚂蚁集团高级算法专家郭清沛在 QCon 全球软件开发大会 2026 北京站的分享《Ming-Flash-Omni:全模态统一大模型的关键技术与实践》。郭清沛系统阐述了 Ming-flash-omni 全模态统一大模型的技术架构与研发实践,从模态统一、任务统一到工程优化三个维度,揭开了一个千亿参数全模态模型从理论到落地的完整技术路径。以下是演讲实录(经 InfoQ 进行不改变原意的编辑整理)。多模态大模型发展趋势我们对于多模态大模型发展趋势的整体判断,可以用一句话来总结:这个模型会越来越像人。从感知层面来看,它会引入视觉感知和听觉感知。从能力层面来看,它会把人的认知、表达、理解和生成这些能力都统一起来。所以我们从模态维度和任务维度这两个坐标出发来观察大模型的演化方向,结论是一致的——模型正在变得更加类人化,感知上拥有更多模态的感知能力,能力上逐渐实现理解与表达的一体化,实现生成和理解的统一。基于这个趋势判断,Ming 模型从立项之初的定位,就是做一个统一的多模态大模型。但是在深入技术细节之前,我们需要先厘清几个核心概念。这几个概念在当前的技术讨论中频繁出现,但各自的边界和内涵往往被混用。只有把概念定义清楚,才能真正理解我们在全模态统一大模型上做了哪些工作。首先是原生多模态。原生多模态要解决的核心问题是模态统一中“怎么统一”的路径选择。在模态统一这个目标下,我们有两条路可以走。一条路是基于已有的语言模型,通过桥接的方式去拓展多模态能力,先训好一个语言模型,再把视觉、音频的 encoder 加上去,让这些模态往语言模型的空间对齐。另一条路是在训练语言模型的同时,直接用多模态序列来训练,也就是在 LM 预训练阶段就把多模态序列引入进来,训出来的模型天然就是一个多模态模型。所谓原生多模态,指的就是后一条路径,它是模态统一的一种具体实现方式。第二个概念是全模态大模型。全模态大模型强调的是模型能够理解更多模态,把音频、视频、图片、文本这些模态全部放在一个模型里,实现全模态的理解。这个概念的侧重点在于“模态的广度”,它不涉及生成任务,只关注理解能力能否覆盖所有主流模态。第三个概念是理解与生成统一。这个强调的是任务层面的统一,是让模型既能做理解任务,又能做生成任务,实现感知和表达的闭环。这是从能力维度的统一,而不是模态维度的统一。搞清楚这三个概念之后,今天我们要讨论的主题——全模态统一大模型,它的内涵就非常清楚了。全模态统一大模型包含两个维度:首先,它要能够实现音频、视频、图片、文本这种全模态的理解;其次,它要实现任务的统一,能够把理解任务和生成任务统一在一个模型里。也就是说,全模态统一大模型等于全模态大模型加上理解与生成统一。而原生多模态,是实现模态拓展的一种具体路径选择,是实现全模态大模型的其中一条技术路线。把这些概念界定清楚之后,我们再来看构建一个全模态统一大模型到底面临哪些核心挑战。构建全模态统一大模型的核心挑战如果要做一个全模态统一大模型,我们面临的核心挑战可以归纳为三个维度。第一个挑战是模态统一。这里的模态统一,指的是我们怎么基于一个统一的架构,实现音视图文这种全模态的协同理解。这个问题又包含了两个层面。在基础技术层面,我们需要在模型架构和训练策略上做出设计,让各个模态在一个模型里能够协同工作,而不是互相干扰。在训练范式层面,我们需要回答那个路线选择的问题:是走桥接路线,在已有的语言模型上拓展多模态能力;还是走原生路线,在 LM 训练一开始就直接融入多模态序列。第二个挑战是任务统一。任务统一要解决的核心问题,是基于统一的架构来实现感知和表达的闭环。理解任务和生成任务在表征的要求上存在着天然的冲突。对于理解任务而言,它的核心操作是去噪,从海量的输入信息中提取高层的语义表达,把那些无关的细节过滤掉。对于生成任务而言,它的核心操作恰恰相反,一个是还原细节,另一个是发散创造。生成需要细粒度的表征来做精确的像素级输出,需要发散的能力来做创意表达。这两个任务的目标和表征需求可以说是背道而驰的。所以在任务统一这个挑战上,我们要解决的核心矛盾,就是理解与生成在表征层面的冲突。第三个挑战是数据异构性和模型异构性。当我们真正把音频、视频、图片、文本这些多模态序列放在一个训练框架里时,各个模态本身的数据异构性就暴露出来了。不同模态的序列长度差异巨大,文本 token 很短,一张图片的 token 就长得多,视频的 token 更长。同时,不同模态和不同任务之间的收敛速度也是不一致的,简单感知任务收敛得非常快,复杂推理任务则需要更多的训练步数。这种数据异构和模型异构的问题,在统一的训练框架中必须得到系统性的解决。值得一提的是,在全模态统一大模型这个方向上,上述三个挑战中的任意一个如果取得突破性进展,都可能带来整个业界范式的一次更新。比如说,如果我们在模态统一上突破了原生统一方案,那么在语言大模型训练的时候,视觉感知能力就会成为语言大模型的标配,业界就不会再去区分语言大模型和多模态大模型了。事实上,从今年年初 k2.5、qwen3.5 等模型发布之后,我们可以看到,后续大部分厂家在发布大模型的时候,视觉感知能力基本上已经成为标配。同样,如果在任务统一上取得突破,那么大模型就不会再去区分理解大模型和生成大模型,而是真正实现多模态在感知和创造上的闭环。Ming-flash-omni 全模态统一大模型的解决方案我们把模态统一的挑战进一步分解为两块。第一块是基础问题,包含两个核心子问题:一是怎么设计一个跨模态融合的模型架构,让各个模态放在一起之后不会出现任务冲突,并且联合训练的效果要好于各个模态独立训练;二是在训练策略上,怎么把各个模态真正放在一起实现任务协同,保证在训练结束时每个模态都能达到各自的最佳效果。第二块是训练范式的迁移问题,也就是我们刚才反复讨论的路线选择——桥接还是原生。我们先来看跨模态融合架构这个基础问题。现在大模型的主流架构是 MOE,它有很好的 scaling law 特性,而且推理时成本更低。但当前的 MOE 架构主要是基于语言模型来设计的。当我们把音频、视频、图片、文本这些多模态序列都放进去的时候,会面临两个具体的挑战。第一个挑战是,MOE 的 router 在多模态场景下会出现模态分化的问题。不同模态的特征表征天然存在差异,那么在语言模型上已经训练好的 router,是否能够很好地泛化到其他模态上?为了验证这个问题,我们做了一个 preliminary study。结果发现,用语言模型上训练好的 router 去路由视觉模态(包括图片和视频)和音频模态时,专家分布的概率分布与原始语言模型的分布基本上是一致的。这意味着原来的 router 没有能力很好地区分语言模态和其他模态——它把所有的 token 都按照语言模型的习惯来分配专家了。基于这个观察,我们设计了一个 multi-router 的方案。核心做法是,针对每一个模态,我们都单独设计一个 router,每个 router 也有自己独立的均衡策略。这样,视觉 tokens 走视觉的 router,音频 tokens 走音频的 router,文本 tokens 走文本的 router。从右侧展示的实验报告来看,如果我们只用单个 router 去处理所有模态,各个模态的总体指标都不如各自独立训练的 baseline。但当我们切换到 multi-router 方案之后,各个模态合在一起的效果全面超越了独立训练的 baseline。这说明 multi-router 确实能够兼顾模态间的差异,实现了专家按模态分化,同时保留了各模态自身的特征。第二个挑战是,传统 MOE 架构中每个 token 分配的专家数是固定的,比如固定激活 6 个或 8 个专家。对于文本 token 来说,这是合理的,因为每个文本 token 的语义丰富度都比较高。但当我们引入图片和视频这类冗余度非常高的模态时,情况就不同了。图片中大量的背景区域 token 其实没有太多信息量,视频中相邻帧之间也存在大量的信息冗余。给这些冗余 token 分配同样数量的专家,会带来严重的训练效率瓶颈。我们的核心思考是,应该根据 token 的重要程度来动态决定分配多少专家。对语义上比较重要的 token,我们希望能分配更多的专家,但整体的专家预算应该保持恒定。具体的实现方式是在 MOE 的路由层增加一个 token 重要性判断模块:当我们检测到某个 token 比较重要,这个 token 可能来自文本、图像、视频或者音频中的任何一个模态,就在给定的专家预算下给这个 token 尽可能多地分配专家。而对于被判定为冗余的 token,我们就大幅减少分配给它的专家数。我们把这个方案称为 AnyExperts。它的优势是,在相同的专家预算总量下,AnyExperts 能取得比固定 k 个专家更好的效果。同时,因为一些 token 分配的专家数更少,推理速度也会更快。在工程实现上,为了保证推理过程中的矩阵运算规整性,我们做了一个处理:即使给某个 token 实际分配的专家只有两个,也会给它配上六个“空专家”。这些空专家实际上就是一个恒等变换,不会对特征做任何实质性的操作,只是为了让整个矩阵运算的 shape 保持一致。我们也通过可视化来验证 AnyExperts 是否真的能够识别各模态中的重要 token。右下角的可视化结果给出了一个直观的例子。在一个视频画面中,当那个接电话的男人出现在画面中时,这两帧的 token 重要程度评分,明显比男人没有出现的
分享
阅读原文