今天介绍一下原生统一多模态大模型(Native Unified Multimodal Models,  UMMs):UMMs是人工智能领域的一项前沿技术。它的核心目标是打破传统AI模型“各司其职”的壁垒,在一个单一的框架内,同时实现多模态的“理解”与“生成”任务.在传统的多模态AI设计中,它们依赖预训练的视觉编码器(如CLIP)来负责“理解”,同时使用另一套独立的视觉表示(如VAE的潜空间)来负责“生成”6。这种解耦的设计导致了两个核心痛点:表征不一致(Representation Mismatch):理解和生成使用不同的视觉特征,难以实现从原始像素到最终输出的端到端全流程优化。任务偏见与性能瓶颈:预训练编码器往往带有固定的归纳偏置(如固定分辨率、丢失细粒度底层特征),这限制了模型在复杂感知任务上的上限.以 Meta 与港大等机构联合发布的 Tuna 模型为代表,原生统一多模态大模型通过构建“统一的连续视觉表示空间”来解决上述问题。统一视觉空间:Tuna 将 VAE 编码器与表示编码器(如 SigLIP 2)级联,构建出统一的视觉表示。单一框架处理:在这个统一空间内,图像和视频的 token 与文本 token 结合,由一个大语言模型(LLM)解码器统一处理。该解码器既能进行自回归的文本生成(用于理解),也能进行基于流匹配(Flow-matching)的视觉生成(用于生成)。相互促进:在这种统一设定下,联合训练理解数据和生成数据,不仅不会相互干扰,反而能让这两项任务相互受益.

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐