Text-to-Video & Image-to-Video Generation

February 15, 2026 · View on GitHub

< Back to Main README

Text-to-Video & Image-to-Video Generation

370+ papers · 25+ datasets · Covers T2V, I2V, and Video Editing

Foundation video generation from GANs to diffusion transformers, image animation, and temporal dynamics


Sub-domains

Sub-domainFocusKey Models
T2V Foundation ModelsCore text-to-video synthesisSora, Wan 2.1, Veo 2, CogVideoX, LaVIE
Controllable SynthesisControllable and efficient video generationAnimateDiff, ControlVideo, VideoComposer
T2V BenchmarksVideo generation benchmarks and datasetsVBench, EvalCrafter, FETV
I2V Animation & PortraitsImage animation, talking heads, character-driven videoLivePortrait, Animate Anyone, MagicAnimate
I2V Video EditingVideo editing, motion transfer, enhancementTokenFlow, Rerender-A-Video, CoDeF

Foundation T2V Models

ModelTitleYear
SoraVideo Generation Models as World Simulators2024
Wan 2.1Scalable Diffusion Transformer for Video Generation2025
Veo 2Photorealistic Video Generation from Google DeepMind2025
CogVideoXText-to-Video Diffusion Models with An Expert Transformer2024
KlingHigh-Quality Video Generation from Kuaishou2024
Align your LatentsHigh-Resolution Video Synthesis with Latent Diffusion2023
LaVIEHigh-Quality Video Generation with Cascaded Latent Diffusion2023
Make-A-VideoText-to-Video Generation without Text-Video Data2022
Imagen VideoHigh Definition Video Generation with Diffusion Models2022
CogVideoLarge-scale Pretraining for T2V via Transformers2022

Image-to-Video Animation

ModelTitleYear
LivePortraitEfficient Portrait Animation with Stitching and Retargeting2024
Animate AnyoneConsistent and Controllable Image-to-Video Synthesis2024
MagicAnimateTemporally Consistent Human Image Animation2024
AnimateDiffAnimate Your Personalized T2I Diffusion Models2023
DreamPoseFashion Image-to-Video Synthesis via Stable Diffusion2023

Cross-Modal Synthesis (Text to Video / 3D / Motion)

ModelTitleVenueYear
SoraVideo Generation Models as World SimulatorsOpenAI2024
AnimateDiffAnimate Your Personalized T2I Diffusion ModelsarXiv2023
InstructPix2PixLearning to Follow Image Editing InstructionsCVPR2023
Text2LIVEText-Driven Layered Image and Video EditingarXiv2022
DreamFusionText-to-3D using 2D DiffusionICLR2023
ProlificDreamerHigh-Fidelity Text-to-3D with Variational Score DistillationarXiv2023
Magic3DHigh-Resolution Text-to-3D Content CreationarXiv2022
T2M-GPTGenerating Human Motion from Textual DescriptionsarXiv2023

< Back to Main README · T2V Website · I2V Website