Unified Multimodal Models

February 15, 2026 · View on GitHub

< Back to Main README

Unified Multimodal Models

120+ models · 30+ benchmarks · 3 sub-domains

Architectures that jointly understand and generate across modalities within a shared representational space


Sub-domains

Sub-domainFocusContent
Models & ArchitecturesDiffusion, autoregressive, hybrid, any-to-any120+ models
Datasets & Training CorporaPretraining data, interleaved corpora30+ datasets
Evaluation & BenchmarksUnderstanding and generation benchmarks30+ benchmarks

Model Taxonomy

Diffusion-Based Unified Models

ModelTitleDate
UniModelA Visual-Only Framework for Unified Multimodal Understanding and Generation2025/11
MMaDAMultimodal Large Diffusion Language Models2025/05
MudditLiberating Generation Beyond T2I with Unified Discrete Diffusion2025/05
UniDiscUnified Multimodal Discrete Diffusion2025/03
Dual DiffusionDual Diffusion for Unified Image Generation and Understanding2024/12

Autoregressive MLLM — Pixel & Semantic Encoding

ModelEncodingTitleDate
Emu3.5PixelNative Multimodal Models are World Learners2025/10
Qwen-ImageSemanticQwen-Image Technical Report2025/08
OmniGen2SemanticExploration to Advanced Multimodal Generation2025/06
SelftokPixelDiscrete Visual Tokens of Autoregression, by Diffusion, and for Reasoning2025/05
HarmonPixelHarmonizing Visual Representations for Unified Understanding and Generation2025/03
LiquidSemanticLanguage Models are Scalable and Unified Multi-modal Generators2024/12
Emu3PixelNext-Token Prediction is All You Need2024/09
ChameleonPixelMixed-Modal Early-Fusion Foundation Models2024/05

Hybrid Encoding & AR-Diffusion

ModelArchitectureTitleDate
BAGELAR + DiffusionEmerging Properties in Unified Multimodal Pretraining2025/05
Show-o2AR + DiffusionImproved Native Unified Multimodal Models2025/06
Janus-ProHybrid Enc.Unified Understanding and Generation with Data and Model Scaling2025/01
JanusFlowAR + FlowHarmonizing Autoregression and Rectified Flow2024/11
Show-oAR + DiffusionOne Transformer to Unify Understanding and Generation2024/08
TransfusionAR + DiffusionPredict Next Token and Diffuse Images with One Model2024/08

Any-to-Any Multimodal Models

ModelTitleDate
Qwen3-OmniQwen3-Omni Technical Report2025/09
Ming-OmniUnified Multimodal Model for Perception and Generation2025/06
OmniFlowAny-to-Any Generation with Multi-Modal Rectified Flows2024/12
NExT-GPTAny-to-Any Multimodal LLM2023/09
CoDiAny-to-Any Generation via Composable Diffusion2023
ImageBindOne Embedding Space To Bind Them All2023

Key Benchmarks

BenchmarkFocusVenueYear
General-BenchMultimodal generalist evaluationICML2025
MMMUMulti-discipline multimodal understandingCVPR2023
MM-Vet v2Integrated capabilities of LMMsarXiv2024
MMBenchAll-around multi-modal evaluationECCV2023
UniBenchUnified evaluation for unified models2024
OpenINGOpen-ended interleaved generation2024

< Back to Main README · View on Website