蚂蚁集团Ming-Flash-Omni全模态统一大模型研发实践
蚂蚁集团
千亿参数
Ming-Flash-Omni全模态统一大模型参数量
6个或8个
传统MOE架构固定激活的专家数量
百分之二十
训练早期引入的多模态序列占比
百分之八十
训练早期引入的纯语言token占比
项目背景
当前多模态大模型正从「语言模型+多模态外挂」向「原生全模态统一」范式迁移,行业方向是让模型兼具多模态感知能力与理解、生成一体化能力,原生多模态、全模态覆盖、理解生成统一是该领域的核心发展目标。 本案例依据「InfoQ 中文」公开发布的信息整理,原文:https://www.infoq.cn/article/OlBv9DATXabu0bb4kAPt?utm_source=rss&utm_medium=article
面临的痛点
全模态统一大模型研发存在三类核心挑战:一是模态统一层面,难以基于统一架构实现音视图文多模态协同理解,需在桥接或原生训练范式中做合理选择;二是任务统一层面,理解任务的去噪需求与生成任务的细节还原、发散创造需求存在天然的表征冲突,难以在同一架构下实现感知与表达闭环;三是多模态数据与模型存在异构性,不同模态序列长度、不同任务收敛速度差异较大,联合训练难度高。
优秘的方案
针对核心挑战,团队分两部分落地解决方案:模态统一层面,设计适配多模态的multi-router MOE架构解决多模态专家分化问题,推出AnyExperts方案按token重要程度动态分配专家,兼顾训练效果与推理效率;配套全模态协同训练策略,按能力维度划分训练阶段动态匹配各模态数据配比,基于任务收敛速度动态调节学习率;采用原生多模态训练范式,在语言模型预训练早期引入多模态序列实现表征空间共同对齐。任务统一层面,先基于冻结的全模态理解MOE基座引入可学习query实现图像、语音生成能力,后续补充生成式分割预训练任务提升生成侧细粒度知识,确保生成任务加入不损害原有理解任务效果。
multi-router方案AnyExperts跨模态融合架构全模态协同训练策略
实施路径
1
设计适配多模态的multi-router MOE架构,为不同模态配置独立router及均衡策略
2
推出AnyExperts方案,基于token重要程度动态分配专家数量,通过空专家配置保证矩阵运算规整性
3
落地全模态协同训练策略,按感知力、知识力、推理力、行动力维度划分训练阶段,动态匹配各模态数据配比
4
采用基于收敛速度的动态均衡策略,训练过程中根据任务validation loss变化动态调整学习率
5
采用原生多模态训练范式,在语言模型预训练早期引入多模态序列,实现表征空间共同对齐
6
基于冻结的全模态理解基座引入可学习query,叠加图像生成与语音合成能力
落地成效
千亿参数
Ming-Flash-Omni全模态统一大模型参数量
6个或8个
传统MOE架构固定激活的专家数量
百分之二十
训练早期引入的多模态序列占比
百分之八十
训练早期引入的纯语言token占比
想成为下一个成功案例?
预约专属顾问,结合你的行业与规模,给出可落地的 AI 化方案