README.md
July 24, 2026 · View on GitHub
🎉 Awesome-Human-Motion-Video-Generation 🔥
You can click on
Watch and
Star to get the latest updates at any time.
Watch Me !
Watch Me !
Watch Me !
Star Me !
Star Me !
Star Me !
🎁 >>>>>>>> [English Introduction] <<<<<<<<<<
This project provides a thorough summary of the latest advancements in the field of 2D digital human motion video generation, covering papers, datasets, and code repositories.
The repository is organized into three main conditions: Vision-driven, Text-driven, and Audio-driven, while also considering LLM Planning Papers.
Unlike previous summaries, this project clearly outlines the five key stages in the field of digital human video generation:
🌑 Stage 1: Input Phase. Clarifying the driving source (Vision, Text, Audio) and driving region (Part, Holistic), where "Part" mainly refers to the face;
🌒 Stage 2: Motion planning Phase. Most work involves feature mapping to learn motion mappings, while a few works use large language models (LLMs) for motion planning;
🌓 Stage 3: Motion Video Generation Phase;
🌔 Stage 4: Video Refinement Phase, focusing on optimizing specific parts such as the face, lips, teeth, and hands;
🌕 Stage 5: Acceleration Phase, aiming to speed up training and deployment inference as much as possible, with the goal of achieving real-time output.
🎉 We welcome everyone to contribute your research and submit PRs to collectively advance the technology of human motion video generation.
If you have any questions, feel free to contact us at (WinniyGD@outlook.com), and we will respond as soon as possible. Additionally, we warmly welcome new members from related fields to join us, learn together, and make endless progress!
🏆 >>>>>>>> [🧡中文简要介绍💜] <<<<<<<<<<
本项目认真总结了👍2D数字人动作视频生成👏相关领域的最新进展,包括论文、数据集和代码库。
Repo以 Vision-driven、Text-driven、Audio-driven 三大方向作以总结,同时考虑 LLM Planning 前沿论文。
分类时,我们定义Audio>Text>Vision优先级,当出现文本不出现音频时,归纳为Text-Driven方法,当文本音频同时出现时,归纳为Audio-Driven方法,以此类推。
区别于以往的总结,项目明确总结了数字人视频生成领域的五大阶段:
🌑 第1阶段 明确驱动源(Vision、Text、Audio)与驱动区域(Part、Holistic),其中Part主要以脸部为主;
🌒 第2阶段 动作规划阶段,大多数工作以特征Mapping学习动作映射,少部分工作以大语言模型LLMs进行动作规划;
🌓 第3阶段 人体视频生成,大部分工作以Diffusion Models为基础,少部分工作以Transformer为基础;
🌔 第4阶段 视频优化阶段,针对脸部、嘴唇、牙齿、手部单独做Refinement优化;
🌕 第5阶段 加速输出阶段,尽可能地加速训练与部署推理,目标Real-Time实时输出。
🔑本项目由六位核心成员全力推进:
- 薛海威(清华大学,负责人) - 罗向阳(清华大学) - 胡璋昊(爱丁堡大学) - 张鑫(西安交通大学) - 向迅之(中国科学院大学) - 戴语琴(南京理工大学)💖核心综述由以下老师全力支持并悉心指导:
- 刘健庄老师(中国科学院深圳先进技术研究院) - 张镇嵩博士(华为诺亚2012实验室) - 李明磊博士(零一万物) - 马飞博士(光明实验室) - 吴志勇老师(清华大学/香港中文大学)
另外,非常感谢常恒师兄 ( https://github.com/SwiftieH )、余伟江师兄的支持!
🎉 欢迎大家贡献自己的研究成果并PR,共同推动人体运动视频生成技术的发展。
如有任何问题,可以随时联系邮件(WinniyGD@outlook.com),我们会尽快回复。
另外,我们非常欢迎有新的相关领域的同学一同加入我们,一起学习,无限进步!
🍦 Exploring the latest papers in human motion video generation. 🍦
Introduction
This work delves into Human Motion Video Generation, covering areas such as Portrait Animation, Dance Video Generation, Text2Face, Text2MotionVideo, and Talking Head. We believe this will be the most comprehensive survey to date on human motion video generation technologies. Please stay tuned! 😘😁😀
It's important to note that for the sake of clarity, we have excluded 3DGS and NeRF technologies (2D-3D-2D) from the scope of this paper.
✨You are welcome to provide us your work with a topic related to human motion video generation.✨
If you discover any missing work or have any suggestions,
please feel free to submit a pull request or contact us ( WinniyGD@outlook.com ).
We will promptly add the missing papers to this repository.
🍔 Highlight
[1] We decompose human motion video generation into five key phases, covering all subtasks across various driving sources and body regions. To the best of our knowledge, this is the first survey to offer such a comprehensive framework for human motion video generation.
[2] We provide an in-depth analysis of human motion video generation from both motion planning and motion generation perspectives, a dimension that has been underexplored in existing reviews.
[3] We clearly delineate established baselines and evaluation metrics, offering detailed insights into the key challenges shaping this field.
[4] We present a set of potential future research directions, aimed at inspiring and guiding researchers in the field of human motion video generation.
🕑 Timeline

🎁 Notes
We are excited to announce the upcoming launch of a new benchmark, including enhanced evaluation metrics, comprehensive datasets, and with a fast implementation for evaluation. However, due to the author's current graduation commitments and tight deadlines, we kindly ask for your patience as we work towards this release. Please stay tuned!
💙 News
[2025/09/05][TOP] IMPORTANT NEWS
Links:
Arxiv: https://arxiv.org/abs/2509.03883
IEEE Access: https://ieeexplore.ieee.org/document/11106267
Github Repo: https://github.com/Winn1y/Awesome-Human-Motion-Video-Generation
Huggingface link: https://huggingface.co/papers/2509.03883
[2025/07/26][TOP] IMPORTANT NEWS
Our paper has been accepted by TPAMI.🎉🎉🎉🎉🎉 Stay tuned for our updates! Here we share the timeline:
🏁 May 30, 2024: Project launch
🏁 June 24, 2024: First draft completed
🏁 August 30, 2024: Final draft completed
🏁 September 1, 2024: Submission
🏁 December 12, 2024: First-round review comments returned
🏁 January 10, 2025: First-round rebuttal submitted
🏁 April 9, 2025: Second-round review comments returned
🏁 May 5, 2025: Second-round rebuttal submitted
🏁 July 26, 2025: Acceptance email received
[2026/07/24] V24.2 Vision: Update Methods.
GroupVideo: Multi-Identity Customized Text-to-Video Generation (Text, Text2MotionVideo) 【中科院大学、中科院自动化所、蚂蚁集团】
[2026/07/23] V24.1 Vision: Update Methods.
StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation (Text, Text2MotionVideo) 【国科大、可灵AI研究、成大】
Vera: Identity-Faithful Human Subject-to-Video Generation (Text, Text2MotionVideo) 【快手 中科院自动化所 清华 】
[2026/07/16] V24.0 Vision: Update Methods.
Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation (Text, Text2MotionVideo) 【中科大】
[2026/07/16] V23.9 Vision: Update Methods.
SlotMem: Character-Addressable Internal Memory for Narrative Long Video Generation (Text, Text2MotionVideo) 【港大、清华】
[2026/07/16] V23.8 Vision: Update Methods.
MultiAnimate: A Unified Framework for Controllable Multi-Character Animation (Visual, Pose-Guided Dance Video Generation) 【中科大、阿里通义实验室、南洋理工大学】
[2026/07/08] V23.7 Vision: Update Methods.
Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment (Text, Text2MotionVideo) 【腾讯混元】
Vidu S1: A Real-Time Interactive Video Generation Model (Audio, Audio-Driven Holistic Body Driving) 【清华大学、生数科技】
Conversational Human Audio-visual Talking Dialogue Generation (Text, Text2MotionVideo) 【帝国理工】
SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation (Audio, Audio-Driven Holistic Body Driving) 【华南理工大学】
[2026/07/02] V23.6 Vision: Update Methods.
GaussianEmoTalker: Real-Time Emotional Talking Head Synthesis with Audio-Driven and Blendshape-Based 3D Gaussian Splatting (Audio, Head Pose Driving) 【南京理工大学;钱塘高等研究院;南京大学(苏州)】
[2026/07/01] V23.5 Vision: Update Methods.
SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation (Audio, Audio-Driven Holistic Body Driving) 【北大深研院、上海AI实验室、腾讯混元、vivo】
Towards Flexible, Natural, Efficient Interaction for Conversational Talking Face Generation (Audio, Audio-Driven Holistic Body Driving) 【中科院自动化所(MAIS) 国科大人工智能学院 中科院香港创新研究院人工智能与机器人中心(CAIR) 澳门科技大学(M.U.S.T)计算机科学与工程学院/信息工程学院(SCSE/FIE)】
[2026/06/26] V23.4 Vision: Update Methods.
Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models (Audio, Audio-Driven Holistic Body Driving) 【阿里巴巴集团(Wan Team)】
Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation (Text, Text2MotionVideo) 【中山大学;腾讯微信HPC;腾讯微信视觉。】
[2026/06/23] V23.3 Vision: Update Methods.
Avatar V: Scaling Video-Reference Avatar Video Generation (Audio, Audio-Driven Holistic Body Driving) 【HeyGen研究团队。】
JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence (Audio, Audio-Driven Holistic Body Driving) 【京东(JD.com)】
InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars (Audio, Audio-Driven Holistic Body Driving) 【西安交通大学(人机混合增强智能国重;人工智能与机器人研究所) 中国电信人工智能科技(北京)有限公司 武汉大学 中国电信 TeleAI 人工智能研究院】
[2026/06/11] V23.2 Vision: Update Methods.
ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation (Text, Text2MotionVideo) 【北大】
[2026/06/10] V23.1 Vision: Update Methods.
Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization (Audio, Head Pose Driving) 【韩国科院AI、AIPARK】
HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation (Text, Text2MotionVideo) 【腾讯混元。】
SCAIL-2: Unifying Controlled Character Animation with End-to-end In-Context Conditioning (Text, Text2MotionVideo) 【清华、智谱】
[2026/06/08] V23.0 Vision: Update Methods.
Beyond Skeletons: Learning Animation Directly from Driving Videos with Same2X Training Strategy (Visual, Video-Guided Dance Video Generation) 【清华大学;哈尔滨工业大学;鹏城实验室 Yuan Zeng;Yujia Shi;Yuhao Yang;Dongxia Liu;Zongqing Lu;Wenming Yang;Qingmin Liao 】
FreeAnimate: Training-Free Human Image Animation with Preview-Guided Denoising (Visual, Pose-Guided Dance Video Generation) 【清华大学深圳国际研究生院;哈工大;鹏城实验室 】
[2026/06/05] V22.9 Vision: Update Methods.
Resonant Minds: Closed-Loop Social Avatars with Theory of Mind (Audio, Head Pose Driving) 【华盛顿大学;北京大学;卡内基梅隆大学;宁波东方理工(EIT宁波) 】
[2026/06/02] V22.8 Vision: Update Methods.
Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation (Audio, Head Pose Driving) 【新南威尔士大学(UNSW)商学院;格里菲斯大学工程与建筑环境学院;CSIRO Data61 Zhicheng Zhang;Lei Wang;Yu Zhang;Yongsheng Gao 】
Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs (Audio, Audio-Driven Holistic Body Driving) 【微软研究院;微软AI 】
[2026/06/01] V22.7 Vision: Update Methods.
IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation (Visual, Video-Guided Dance Video Generation) 【信息工程大学;淮安大学;重庆邮电大学;南开大学 】
[2026/05/28] V22.6 Vision: Update Methods.
HarmoVid: Relightful Video Portrait Harmonization (Visual, Pose2Video) 【北卡罗来纳大学教堂山分校;Adobe研究院 Jun Myeong Choi;Jae Shin Yoon;Luchao Qi;Roni Sengupta;Joon-Young Lee 】
CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning (Audio, Head Pose Driving) 【哈尔滨工业大学;理想汽车;新南威尔士大学 He Feng;Yongjia Ma;Donglin Di;Lei Fan;Tonghua Su 】
[2026/05/26] V22.5 Vision: Update Methods.
StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration (Text, Text2MotionVideo) 【阿里巴巴通义实验室(阿里巴巴集团) 】
Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation (Audio, Head Pose Driving) 【新南威尔士大学(UNSW)商学院;格里菲斯大学工程与建成环境学院 Zhicheng Zhang;Lei Wang;Yu Zhang;Yongsheng Gao 】
Loki: Representation over Architecture for Diffusion-Based Portrait Animation (Visual, Video-Guided Dance Video Generation) 【俄亥俄州立大学;中佛罗里达大学 】
[2026/05/21] V22.4 Vision: Update Methods.
iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance (Visual, Try-On Video Generation) 【中山大学深圳校区 阿里巴巴淘天集团(淘宝天猫) 】
[2026/05/19] V22.3 Vision: Update Methods.
FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization (Text, Text2MotionVideo) 【厦门大学;阿里巴巴集团 】
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation (Audio, Audio-Driven Holistic Body Driving) 【上海交大;浙大;电子科大 】
StreamingEffect: Real-Time Human-Centric Video Effect Generation (Text, Text2MotionVideo) 【新加坡国立大学 Show Lab 】
[2026/05/15] V22.2 Vision: Update Methods.
EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration (Visual, Pose2Video) 【洛桑联邦理工学院(EPFL)VITA实验室】
[2026/05/12] V22.1 Vision: Update Methods.
Improving Human Image Animation via Semantic Representation Alignment (Text, Text2MotionVideo) 【上海交大人工智能学院;阿里巴巴集团 】
SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation (Text, Text2MotionVideo) 【东京大学;盛趣AI研究院(东京) 】
SDTalk: Structured Facial Priors and Dual-Branch Motion Fields for Generalizable Gaussian Talking Head Synthesis (Audio, Head Pose Driving) 【合肥工业大学;中国科学技术大学 】
Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation (Text, Text2MotionVideo) 【武汉大学】
[2026/05/11] V22.0 Vision: Update Methods.
MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation (Audio, Head Pose Driving) 【帝国理工学院 】
Implicit Preference Alignment for Human Image Animation (Visual, Pose-Guided Dance Video Generation) 【北师大人工智能学院;腾讯混元 】
AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models (Audio, Lip Synchronization) 【西湖大学;浙江大学;天工大学;湖南大学;香港中文大学(深圳) Kai Zheng;Zejian Kang;Rui Mao;Hongyuan Zou;Yuanchen Fei;Xuanyang Xu;Xiangru Huang 】
[2026/05/08] V21.9 Vision: Update Methods.
SuperFace: Preference-Aligned Facial Expression Estimation Beyond Pseudo Supervision (Visual, Portrait Animation) 【浙江大学;西湖大学;香港中文大学(深圳);湖南大学;上海创新研究院;德州大学奥斯汀分校 】
[2026/05/07] V21.8 Vision: Update Methods.
FaithfulFaces: Pose-Faithful Facial Identity Preservation for Text-to-Video Generation (Text, Text2Face) 【南洋理工、腾讯混元、中科大、北师大 】
[2026/05/01] V21.7 Vision: Update Methods.
TripVVT: A Large-Scale Triplet Dataset and a Coarse-Mask Baseline for In-the-Wild Video Virtual Try-On (Visual, Try-On Video Generation) 【南京大学、中国移动九天研究院、吉林大学、字节跳动 】
[2026/04/29] V21.6 Vision: Update Methods.
Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation (Text, Text2MotionVideo) 【南开大学、通义实验室、北京大学 Yupeng Zhou,Lianghua Huang,Zhifan Wu,Jiabao Wang,Yupeng Shi,Biao Jiang,Daquan Zhou,Yu Liu,Ming-Ming Cheng,Qibin Hou 】
[2026/04/28] V21.5 Vision: Update Methods.
Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation (Text, Text2MotionVideo) 【上海创新研究院;复旦大学;中国科学技术大学;南京大学;百度 Chunyu Li;Jiaye Li;Ruiqiao Mei;Haoyuan Xia;Hao Zhu;Jingdong Wang;Siyu Zhu 】
Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling (Audio, Head Pose Driving) 【香港科技大学;独立研究者;浙江大学;新加坡国立大学;香港中文大学;北京大学 Zhen Ye;Xu Tan;Aoxiong Yin;Hongzhan Lin;Guangyan Zhang;Peiwen Sun;Yiming Li;Chi-Min Chan;Wei Ye;Shikun Zhang;Wei Xue 】
EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence (Audio, Head Pose Driving) 【新疆大学 】
[2026/04/22] V21.4 Vision: Update Methods.
ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis (Visual, Pose2Video) 【港中大(深圳)理工学院 港中大(深圳)未来智能网络研究院 】
MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation (Audio, Head Pose Driving) 【浙江大学 Liyang Li;Wen Wang;Canyu Zhao;Tianjian Feng;Zhiyue Zhao;Hao Chen;Chunhua Shen 】
CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation (Audio, Audio-Driven Holistic Body Driving) 【清华大学;阿里巴巴 】
[2026/04/21] V21.3 Vision: Update Methods.
OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation (Audio, Head Pose Driving) 【北京大学;腾讯微信实验室;中科院 】
EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents (Audio, Head Pose Driving) 【华东师范大学;Garabido上海科技有限公司 】
[2026/04/17] V21.2 Vision: Update Methods.
TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation (Audio, Head Pose Driving) 【中科院自动化所(MAIS) 中科院大学 人工智能学院 美团 香港理工大学 中科院香港创新研究院CAIR(HKISI, CAS) 】
[2026/04/15] V21.1 Vision: Update Methods.
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation (Audio, Audio-Driven Holistic Body Driving) 【香港中文大学;字节跳动;莫纳什大学;香港大学 】
[2026/04/11] V21.0 Vision: Update Methods.
FIT: A Large-Scale Dataset for Fit-Aware Virtual Try-On (Visual, Try-On Video Generation) 【华盛顿大学;谷歌研究院 】
SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation (Audio, Head Pose Driving) 【中国科大;北京工业大学 Wenli Zhang;Xianglong Shi;Sirui Zhao;Xinqi Chen;Guo Cheng;Yifan Xu;Tong Xu;Yong Liao 】
Cross-Modal Emotion Transfer for Emotion Editing in Talking Face Video (Audio, Head Pose Driving) 【蔚山国立科学技术院(UNIST) 】
[2026/04/08] V20.9 Vision: Update Methods.
Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation (Visual, Pose2Video) 【武汉大学 】
Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision (Visual, Try-On Video Generation) 【Seoul 】
HumANDiff: Articulated Noise Diffusion for Motion-Consistent Human Video Generation (Visual, Try-On Video Generation) 【Stability AI 】
[2026/04/02] V20.8 Vision: Update Methods.
ONE-SHOT: Compositional Human-Environment Video Synthesis via Spatial-Decoupled Motion Injection and Hybrid Context Integration (Visual, Pose2Video) 【新国立 】
[2026/04/01] V20.7 Vision: Update Methods.
Gloria: Consistent Character Video Generation via Content Anchors (Audio, Audio-Driven Holistic Body Driving) 【中国科学技术大学、新南威尔士大学、香港大学、电子科技大学 】
[2026/03/25] V20.6 Vision: Update Methods.
InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance (Audio, Audio-Driven Holistic Body Driving) 【百度公司 】
FG-Portrait: 3D Flow Guided Editable Portrait Animation (Visual, Portrait Animation) 【新加坡国立大学、华威大学、帝国理工学院、萨里大学 】
[2026/03/24] V20.5 Vision: Update Methods.
Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model (Text, Text2MotionVideo) 【上海交通大学 SII-GAIR 实验室、Sand.ai 】
HumanOmni-Speaker: Identifying Who said What and When (Audio, Audio-Driven Holistic Body Driving) 【阿里巴巴集团通义实验室、深圳理工大学 】
EmoTaG: Emotion-Aware Talking Head Synthesis on Gaussian Splatting with Few-Shot Personalization (Audio, Head Pose Driving) 【密歇根州立大学高通技术公司 】
Identity-Consistent Video Generation under Large Facial-Angle Variations (Text, Text2MotionVideo) 【清华大学、百度公司、布里斯托大学、香港中文大学(深圳) 】
EARTalking: End-to-end GPT-style Autoregressive Talking Head Synthesis with Frame-wise Control (Audio, Head Pose Driving) 【中国科学技术大学、科大讯飞、浙江大学 】
[2026/03/23] V20.4 Vision: Update Methods.
PerformRecast: Expression and Head Pose Disentanglement for Portrait Video Editing (Visual, Portrait Animation) 【虎鲸数字媒体与娱乐集团 】
LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation (Text, Text2MotionVideo) 【浙江大学、阿里巴巴集团达摩院、湖畔实验室、新加坡国立大学 】
[2026/03/20] V20.3 Vision: Update Methods.
AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation (Visual, Pose-Guided Dance Video Generation) 【穆罕默德・本・扎耶德人工智能大学(阿联酋)挪威北极大学(挪威特罗姆瑟大学)中山大学深圳校区 】
Face-to-Face: A Video Dataset for Multi-Person Interaction Modeling (Audio, Audio-Driven Holistic Body Driving) 【约翰斯・霍普金斯大学 】
MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model (Visual, Pose2Video) 【澳大利亚国立大学、百度公司、中山大学、澳大利亚联邦科学与工业研究组织 】
AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising (Audio, Head Pose Driving) 【浙江大学北京邮电大学快手科技可灵团队清华大学 】
Garments2Look: A Multi-Reference Dataset for High-Fidelity Outfit-Level Virtual Try-On with Clothing and Accessories (Visual, Try-On Video Generation) 【香港理工大学呼呼人工智能有限公司 】
[2026/03/13] V20.2 Visiontree/20.2: Update Methods.
ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA (Text, Text2MotionVideo) 【特拉维夫大学 】
SoulX-LiveAct: Towards Hour-Scale Real-Time Human Animation with Neighbor Forcing and ConvKV Memory (Audio, Audio-Driven Holistic Body Driving) 【魂芯 AI 实验室、香港科技大学(广州)、苏州大学 】
[2026/03/11] V20.1 Vision: Update Methods.
DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary (Text, Text2MotionVideo) 【百度公司 】
OmniEdit: A Training-free framework for Lip Synchronization and Audio-Visual Editing (Audio, Head Pose Driving) 【同花顺研究院中国科学技术大学浙江大学 】
[2026/03/10] V20.0 Vision: Update Methods.
EmbedTalk: Triplane-Free Talking Head Synthesis using Embedding-Driven Gaussian Deformation (Audio, Head Pose Driving) 【利兹大学计算机学院 】
[2026/03/09] V19.9 Vision: Update Methods.
Text-Driven Emotionally Continuous Talking Face Generation (Audio, Head Pose Driving) 【哈尔滨工业大学SERES 】
[2026/03/05] V19.8 Vision: Update Methods.
UniSync: Towards Generalizable and High-Fidelity Lip Synchronization for Challenging Scenarios (Text, Text2Face) 【芒果 TV 】
[2026/03/04] V19.7 Vision: Update Methods.
Kling-MotionControl Technical Report (Text, Text2MotionVideo) 【快手科技 Kling 团队 】
[2026/03/03] V19.6 Vision: Update Methods.
UniTalking: A Unified Audio-Video Framework for Talking Portrait Generation (Audio, Head Pose Driving) 【华为中央媒体技术学院、北京航空航天大学计算机科学与工程学院 】
Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer (Text, Text2MotionVideo) 【天津大学、新南威尔士大学、电子科技大学、海南大学、奥克兰大学 】
IdGlow: Dynamic Identity Modulation for Multi-Subject Generation (Text, Text2Face) 【小红书、香港中文大学(深圳)、北京大学、清华大学 】
WildActor: Unconstrained Identity-Preserving Video Generation (Text, Text2MotionVideo) 【香港科技大学、美团、新加坡国立大学 】
FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation (Audio, Head Pose Driving) 【字节跳动 Seed、约翰斯・霍普金斯大学 】
[2026/03/02] V19.5 Vision: Update Methods.
U-Mind: A Unified Framework for Real-Time Multimodal Interaction with Audiovisual Generation (Audio, Audio-Driven Holistic Body Driving) 【清华大学、美团 】
[2026/02/27] V19.4 Vision: Update Methods.
MultiAnimate: Pose-Guided Image Animation Made Extensible (Visual, Pose-Guided Dance Video Generation) 【中国科学院计算技术研究所人工智能安全国家重点实验室、上海科技大学、上海交通大学 】
Face Time Traveller : Travel Through Ages Without Losing Identity (Visual, Portrait Animation) 【索尼印度研究院印度海得拉巴国际信息技术学院 】
[2026/02/25] V19.3 Vision: Update Methods.
Human Video Generation from a Single Image with 3D Pose and View Control (Visual, Pose2Video) 【加州大学默塞德分校、Stability AI 】
[2026/02/24] V19.2 Vision: Update Methods.
ExpPortrait: Expressive Portrait Generation via Personalized Representation (Visual, Portrait Animation) 【中国科学技术大学 】
Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space (Audio, Head Pose Driving) 【印度比拉理工学院皮拉尼分校海德拉巴校区计算机科学与信息系统系机器智能组美国佐治亚理工学院 】
[2026/02/20] V19.1 Vision: Update Methods.
CORAL: Correspondence Alignment for Improved Virtual Try-On (Visual, Try-On Video Generation) 【KAIST 人工智能实验室、NC 人工智能有限公司 】
[2026/02/17] V19.0 Vision: Update Methods.
EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation (Audio, Audio-Driven Holistic Body Driving) 【蚂蚁集团 】
OmniVTON++: Training-Free Universal Virtual Try-On with Principal Pose Guidance (Visual, Try-On Video Generation) 【中国海洋大学、南京理工大学、新加坡管理大学、哈尔滨工业大学(深圳) 】
[2026/02/14] V18.9 Vision: Update Methods.
DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation (Audio, Audio-Driven Holistic Body Driving) 【清华大学、字节跳动智能创作实验室 】
[2026/02/10] V18.8 Vision: Update Methods.
Toward Fine-Grained Facial Control in 3D Talking Head Generation (Audio, Head Pose Driving) 【东南大学、南洋理工大学、武汉大学、澳门大学、香港科技大学、紫金山实验室、东南大学区块链应用监管工程研究中心、武汉大学地理空间信息技术协同创新中心 】
AUHead: Realistic Emotional Talking Head Generation via Action Units Control (Audio, Head Pose Driving) 【国科大、新加坡国立大学、浙大 】
[2026/02/10] V18.7 Vision: Update Methods.
MVAnimate: Enhancing Character Animation with Multi-View Optimization (Visual, Video-Guided Dance Video Generation) 【南洋理工大学计算与数据科学学院、阿里巴巴集团 】
ALIVE: Animate Your World with Lifelike Audio-Video Generation (Text, Text2MotionVideo) 【字节跳动 】
IM-Animation: An Implicit Motion Representation for Identity-decoupled Character Animation (Visual, Video-Guided Dance Video Generation) 【中科院计算所、中国科学院大学、快手科技 Kling 团队、卡迪夫大学 】
SoulX-FlashHead: Oracle-guided Generation of Infinite Real-time Streaming Talking Heads (Audio, Head Pose Driving) 【中国 Soul AI 实验室 AIGC 团队 】
[2026/02/04] V18.6 Vision: Update Methods.
3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation (Text, Text2MotionVideo) 【快手科技 Kling 团队、清华大学、中国科学院自动化研究所 】
[2026/02/03] V18.5 Vision: Update Methods.
Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars (Audio, Audio-Driven Holistic Body Driving) 【清华大学、腾讯 HY 】
JoyAvatar: Unlocking Highly Expressive Avatars via Harmonized Text-Audio Conditioning (Audio, Audio-Driven Holistic Body Driving) 【京东科技 】
[2026/02/02] V18.4 Vision: Update Methods.
MIRRORTALK: Forging Personalized Avatars Via Disentangled Style and Hierarchical Motion Control (Audio, Head Pose Driving) 【平安科技(深圳)有限公司、中国科学技术大学 】
[2026/01/29] V18.3 Vision: Update Methods.
DiffVC-RT: Towards Practical Real-Time Diffusion-based Perceptual Neural Video Compression (Visual, Pose2Video) 【武汉大学遥感信息工程学院 】
Say Cheese! Detail-Preserving Portrait Collection Generation via Natural Language Edits (Text, Text2MotionVideo) 【中国人民大学高瓴人工智能学院 】
[2026/01/28] V18.2 Vision: Update Methods.
Audio-Driven Talking Face Generation with Blink Embedding and Hash Grid Landmarks Encoding (Audio, Head Pose Driving) 【上海理工大学、英国格拉斯哥大学 】
[2026/01/27] V18.1 Vision: Update Methods.
SkyReels-V3 Technique Report (Audio, Audio-Driven Holistic Body Driving) 【SkyReels 团队 】
[2026/01/26] V18.0 Vision: Update Methods.
AlphaFace: High Fidelity and Real-time Face Swapper Robust to Facial Pose (Visual, Portrait Animation) 【ProjectG.AI、剑桥大学、肯特大学、清华大学、等】
[2026/01/22] V17.9 Vision: Update Methods.
APPLE: Attribute-Preserving Pseudo-Labeling for Diffusion-Based Face Swapping (Visual, Portrait Animation) 【KAIST 人工智能研究所、三星公司 】
[2026/01/21] V17.8 Vision: Update Methods.
OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer (Text, Text2MotionVideo) 【字节跳动智能创作实验室 】
Exploring Talking Head Models With Adjacent Frame Prior for Speech-Preserving Facial Expression Manipulation (Audio, Lip Synchronization) 【广东工业大学、北京大学、中山大学 】
[2026/01/16] V17.7 Vision: Update Methods.
Beyond Inpainting: Unleash 3D Understanding for Precise Camera-Controlled Video Generation (Text, Text2MotionVideo) 【清华大学计算机科学与技术系、BNRist 实验室 】
FlowAct-R1: Towards Interactive Humanoid Video Generation (Audio, Audio-Driven Holistic Body Driving) 【字节跳动智能创作部门 】
[2026/01/07] V17.6 Vision: Update Methods. Happy New Year!🎈🎈🎈
DreamStyle: A Unified Framework for Video Stylization (Visual, Pose2Video) 【字节跳动智能创作实验室 】
[2026/01/06] V17.5 Vision: Update Methods. Happy New Year!🎈🎈🎈
MagicFight: Personalized Martial Arts Combat Video Generation (Visual, Pose2Video) 【深圳先进技术研究院、中国电信云技术有限公司、深圳理工大学 】
ESGaussianFace: Emotional and Stylized Audio-Driven Facial Animation via 3D Gaussian Splatting (Audio, Fine-Grained Style and Emotion-Driven Animation) 【上海交通大学、微软亚洲研究院 】
DreamID-V:Bridging the Image-to-Video Gap for High-Fidelity Face Swapping via Diffusion Transformer (Visual, Portrait Animation) 【清华大学、字节跳动智能创作实验室 】
Slot-ID: Identity-Preserving Video Generation from Reference Videos via Slot-Based Temporal Identity Encoding (Text, Text2Face) 【浙江大学 CAD&CG 国家重点实验室、伦敦大学学院计算机科学系 】
[2026/01/02] V17.4 Vision: Update Methods. Happy New Year!🎈🎈🎈
Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation (Audio, Audio-Driven Holistic Body Driving)
[2026/01/01] V17.3 Vision: Update Methods. Happy New Year!🎈🎈🎈
From Inpainting to Editing: A Self-Bootstrapping Framework for Context-Rich Visual Dubbing (Audio, Lip Synchronization)
DyStream: Streaming Dyadic Talking Heads Generation via Flow Matching-based Autoregressive Model (Audio, Lip Synchronization)
[2025/12/31] V17.2 Vision: Update Methods.
LiveTalk: Real-Time Multimodal Interactive Video Diffusion via Improved On-Policy Distillation (Audio, Audio-Driven Holistic Body Driving)
SoulX-LiveTalk Technical Report (Audio, Audio-Driven Holistic Body Driving)
ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum Learning (Audio, Audio-Driven Holistic Body Driving)
MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation (Visual, Pose2Video)
[2025/12/29] V17.1 Vision: Update Methods.
StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars (Audio, Audio-Driven Holistic Body Driving)
Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animation (Audio, Audio-Driven Holistic Body Driving)
High-Fidelity and Long-Duration Human Image Animation with Diffusion Transformer (Visual, Pose-Guided Dance Video Generation)
SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wild (Audio, Lip Synchronization)
[2025/12/24] V17.0 Vision: Update Methods.
The devil is in the details: Enhancing Video Virtual Try-On via Keyframe-Driven Details Injection (Visual, Try-On Video Generation)
TAVID: Text-Driven Audio-Visual Interactive Dialogue Generation (Audio, Lip Synchronization)
[2025/12/23] V16.9 Vision: Update Methods.
ActAvatar: Temporally-Aware Precise Action Control for Talking Avatars (Audio, Audio-Driven Holistic Body Driving)
In-Context Audio Control of Video Diffusion Transformers (Audio, Audio-Driven Holistic Body Driving)
MACE-Dance: Motion-Appearance Cascaded Experts for Music-Driven Dance Video Generation (Audio, Audio-Driven Holistic Body Driving)
EchoMotion: Unified Human Video and Motion Generation via Dual-Modality Diffusion Transformer (Text, Text2MotionVideo)
[2025/12/22] V16.8 Vision: Update Methods.
SynergyWarpNet: Attention-Guided Cooperative Warping for Neural Portrait Animation (Visual, Portrait Animation)
[2025/12/19] V16.7 Vision: Update Methods.
FlashPortrait: 6x Faster Infinite Portrait Animation with Adaptive Latent Prediction (Visual, Portrait Animation)
EverybodyDance: Bipartite Graph-Based Identity Correspondence for Multi-Character Animation (Visual, Pose-Guided Dance Video Generation)
[2025/12/18] V16.6 Vision: Update Methods.
DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations (Visual, Portrait Animation)
HiFi-Portrait: Zero-shot Identity-preserved Portrait Generation with High-fidelity Multi-face Fusion (Visual, Portrait Animation)
TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation (Audio, Head Pose Driving)
FacEDiT: Unified Talking Face Editing and Generation via Facial Motion Infilling (Audio, Head Pose Driving)
[2025/12/16] V16.5 Vision: Update Methods.
Soul: Breathe Life into Digital Human for High-fidelity Long-term Multimodal Animation (Visual, Pose2Video)
PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence (Visual, Pose2Video)
KlingAvatar 2.0 Technical Report (Audio, Audio-Driven Holistic Body Driving)
STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits (Audio, Head Pose Driving)
[2025/12/15] V16.4 Vision: Update Methods.
JoyAvatar: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive Diffusion (Audio, Head Pose Driving)
REST: Diffusion-based Real-time End-to-end Streaming Talking Head Generation via ID-Context Caching and Asynchronous Streaming Distillation (Audio, Head Pose Driving)
PersonaLive! Expressive Portrait Image Animation for Live Streaming (Visual, Portrait Animation)
[2025/12/09] V16.3 Vision: Update Methods.
ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation (Visual, Pose2Video)
[2025/12/08] V16.2 Vision: Update Methods.
SCAIL: Towards Studio-Grade Character Animation via In-Context Learning of 3D-Consistent Pose Representations (Visual, Pose2Video)
[2025/12/05] V16.1 Vision: Update Methods.
Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length (Audio, Audio-Driven Holistic Body Driving)
[2025/12/04] V16.0 Vision: Update Methods.
UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework (Visual, Pose2Video)
[2025/12/03] V15.9 Vision: Update Methods.
Co-speech Gesture Video Generation via Motion-Based Graph Retrieval (Audio, Audio-Driven Holistic Body Driving)
YingVideo-MV: Music-Driven Multi-Stage Video Generation (Audio, Audio-Driven Holistic Body Driving)
[2025/12/02] V15.8 Vision: Update Methods.
EvalTalker: Learning to Evaluate Real-Portrait-Driven Multi-Subject Talking Humans (Audio, Audio-Driven Holistic Body Driving)
TalkingPose: Efficient Face and Gesture Animation with Feedback-guided Diffusion Model (Audio, Audio-Driven Holistic Body Driving)
[2025/12/01] V15.7 Vision: Update Methods.
One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer (Visual, Pose2Video)
IMTalker: Efficient Audio-driven Talking Face Generation with Implicit Motion Transfer (Audio, Head Pose Driving)
AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement (Audio, Audio-Driven Holistic Body Driving)
[2025/11/25] V15.6 Vision: Update Methods.
SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation (Visual, Pose-Guided Dance Video Generation)
Eevee: Towards Close-up High-resolution Video-based Virtual Try-on (Visual, Try-On Video Generation)
[2025/11/11] V15.5 Vision: Update Methods.
ConsistTalk: Intensity Controllable Temporally Consistent Talking Head Generation with Diffusion Noise Search (Audio, Head Pose Driving)
Historical Update.
[2025/11/10] V15.4 Vision: Update Methods.
Shared Latent Representation for Joint Text-to-Audio-Visual Synthesis (Audio, Lip Synchronization)
[2025/11/04] V15.3 Vision: Update Methods.
ID-Composer: Multi-Subject Video Synthesis with Hierarchical Identity Preservation (Visual, Pose2Video)
Multi-View Consistent Human Image Customization via In-Context Learning (Visual, Pose2Video)
[2025/11/03] V15.2 Vision: Update Methods.
See the Speaker: Crafting High-Resolution Talking Faces from Speech with Prior Guidance and Region Refinement (Audio, Lip Synchronization)
[2025/10/28] V15.1 Vision: Update Methods.
MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity Control (Audio, Head Pose Driving)
Lookahead Anchoring: Preserving Character Identity in Audio-Driven Human Animation (Audio, Head Pose Driving)
[2025/10/21] V15.0 Vision: Update Methods.
From Mannequin to Human: A Pose-Aware and Identity-Preserving Video Generation Framework for Lifelike Clothing Display (Visual, Try-On Video Generation)
[2025/10/17] V14.9 Vision: Update Methods.
Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization (Visual, Pose2Video)
[2025/10/15] V14.8 Vision: Update Methods.
Playmate2: Training-Free Multi-Character Audio-Driven Animation via Diffusion Transformer with Reward Feedback (Audio, Audio-Driven Holistic Body Driving)
[2025/10/14] V14.7 Vision: Update Methods.
DEMO: Disentangled Motion Latent Flow Matching for Fine-Grained Controllable Talking Portrait Synthesis (Audio, Head Pose Driving)
VividAnimator: An End-to-End Audio and Pose-driven Half-Body Human Animation Framework (Audio, Audio-Driven Holistic Body Driving)
[2025/10/12] V14.6 Vision: Update Methods.
Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection (Visual, Try-On Video Generation)
[2025/10/09] V14.5 Vision: Update Methods.
A Bridge from Audio to Video: Phoneme-Viseme Alignment Allows Every Face to Speak Multiple Languages (Audio, Head Pose Driving)
[2025/10/06] V14.4 Vision: Update Methods.
Input-Aware Sparse Attention for Real-Time Co-Speech Video Generation (Audio, Audio-Driven Holistic Body Driving)
[2025/10/03] V14.3 Vision: Update Methods.
Audio Driven Real-Time Facial Animation for Social Telepresence (Audio, Head Pose Driving)
[2025/09/30] V14.2 Vision: Update Methods.
StableDub: Taming Diffusion Prior for Generalized and Efficient Visual Dubbing (Audio, Lip Synchronization)
X-Streamer: Unified Human World Modeling with Audiovisual Interaction (Audio, Head Pose Driving)
ControlHair: Physically-based Video Diffusion for Controllable Dynamic Hair Rendering (Visual, Pose2Video)
[2025/09/26] V14.1 Vision: Update Methods.
SynchroRaMa : Lip-Synchronized and Emotion-Aware Talking Face Generation via Multi-Modal Emotion Embedding (Audio, Head Pose Driving)
Talking Head Generation via AU-Guided Landmark Prediction (Audio, Head Pose Driving)
KSDiff: Keyframe-Augmented Speech-Aware Dual-Path Diffusion for Facial Animation (Audio, Head Pose Driving)
[2025/09/23] V14.0 Vision: Update Methods.
Stable Video-Driven Portraits (Visual, Portrait Animation)
Follow-Your-Emoji-Faster: Towards Efficient, Fine-Controllable, and Expressive Freestyle Portrait Animation (Visual, Portrait Animation)
[2025/09/18] V13.9 Vision: Update Methods.
Wan-Animate: Unified Character Animation and Replacement with Holistic Replication (Visual, Pose2Video)
[2025/09/16] V13.8 Vision: Update Methods.
AvatarSync: Rethinking Talking-Head Animation through Autoregressive Perspective (Audio, Head Pose Driving)
[2025/09/12] V13.7 Vision: Update Methods.
Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis (Audio, Audio-Driven Holistic Body Driving)
[2025/09/05] V13.6 Vision: Update Methods.
Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement (Text, Text2Motion)
[2025/08/27] V13.5 Vision: Update Methods.
MoCo: Motion-Consistent Human Video Generation via Structure-Appearance Decoupling (Visual, Pose2Video)
[2025/08/21] V13.4 Vision: Update Methods.
Taming Transformer for Emotion-Controllable Talking Face Generation (Audio, Head Pose Driving)
[2025/08/20] V13.3 Vision: Update Methods.
InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing (Audio, Audio-Driven Holistic Body Driving)
EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis (Audio, Head Pose Driving)
[2025/08/19] V13.2 Vision: Update Methods.
RealTalk: Realistic Emotion-Aware Lifelike Talking-Head Synthesis (Audio, Head Pose Driving)
[2025/08/18] V13.1 Vision: Update Methods.
FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation (Audio, Audio-Driven Holistic Body Driving)
[2025/08/16] V13.0 Vision: Update Methods.
HM-Talker: Hybrid Motion Modeling for High-Fidelity Talking Head Synthesis (Audio, Head Pose Driving)
[2025/08/14] V12.9 Vision: Update Methods.
LIA-X: Interpretable Latent Portrait Animator (Visual, Portrait Animation)
HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics (Visual, Pose2Video)
From Large Angles to Consistent Faces: Identity-Preserving Video Generation via Mixture of Facial Experts (Text, Text2MotionVideo)
Animate-X++: Universal Character Image Animation with Dynamic Backgrounds (Visual, Pose2Video)
X-UniMotion: Animating Human Images with Expressive, Unified and Identity-Agnostic Motion Latents (Visual, Pose2Video)
[2025/08/13] V12.8 Vision: Update Methods.
ShoulderShot: Generating Over-the-Shoulder Dialogue Videos (Text, Text2MotionVideo)
Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation (Text, Text2MotionVideo)
LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation (Text, Text2MotionVideo)
DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation (Audio, Head Pose Driving)
StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation (Audio, Head Pose Driving)
AnimateScene: Camera-controllable Animation in Any Scene (Visual, Pose2Video)
RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space (Visual, Pose2Video)
[2025/08/08] V12.7 Vision: Update Methods.
RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer (Audio, Head Pose Driving)
[2025/08/07] V12.6 Vision: Update Methods.
Motion is the Choreographer: Learning Latent Pose Dynamics for Seamless Sign Language Generation (Visual, Pose2Video)
[2025/08/06] V12.5 Vision: Update Methods.
READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation (Audio, Head Pose Driving)
X-Actor: Emotional and Expressive Long-Range Portrait Acting from Audio (Audio, Head Pose Driving)
MoCA: Identity-Preserving Text-to-Video Generation via Mixture of Cross Attention (Text, Text2Face)
DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework (Visual, Try-On)
[2025/08/05] V12.4 Vision: Update Methods.
Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering (Text, Text2Face)
[2025/08/01] V12.3 Vision: Update Methods.
X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention (Visual, Portrait Animation)
[2025/07/29] V12.2 Vision: Update Methods.
Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation (Audio, Head Pose Driving)
ChoreoMuse: Robust Music-to-Dance Video Generation with Style Transfer and Beat-Adherent Motion (Audio, Audio-Driven Holistic Body Driving)
[2025/07/28] V12.1 Vision: Update Methods.
Livatar-1: Real-Time Talking Heads Generation with Tailored Flow Matching (Audio, Head Pose Driving)
Face2VoiceSync: Lightweight Face-Voice Consistency for Text-Driven Talking Face Generation (Audio, Head Pose Driving)
[2025/07/24] V12.0 Vision: Update Methods.
CartoonAlive: Towards Expressive Live2D Modeling from Single Portraits (Visual, Portrait Animation)
[2025/07/23] V11.9 Vision: Update Methods.
HOComp: Interaction-Aware Human-Object Composition (Visual, Pose2Video)
Navigating Large-Pose Challenge for High-Fidelity Face Reenactment with Video Diffusion Model (Visual, Portrait Animation)
[2025/07/22] V11.8 Vision: Update Methods.
StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation (Visual, Pose-Guided Dance Video Generation)
[2025/07/20] V11.7 Vision: Update Methods.
FantasyPortrait: Enhancing Multi-Character Portrait Animation with Expression-Augmented Diffusion Transformers (Text, Text2Face)
ATL-Diff: Audio-Driven Talking Head Generation with Early Landmarks-Guide Noise Diffusion (Audio, Head Pose Driving)
Think-Before-Draw: Decomposing Emotion Semantics & Fine-Grained Controllable Expressive Talking Head Generation (Audio, Head Pose Driving)
M2DAO-Talker: Harmonizing Multi-granular Motion Decoupling and Alternating Optimization for Talking-head Generation (Audio, Head Pose Driving)
HairShifter: Consistent and High-Fidelity Video Hair Transfer via Anchor-Guided Animation (Visual, Portrait Animation)
[2025/07/12] V11.6 Vision: Update Methods.
Stable-Hair v2: Real-World Hair Transfer via Multiple-View Diffusion Model (Visual, Portrait Animation)
[2025/07/10] V11.5 Vision: Update Methods.
Democratizing High-Fidelity Co-Speech Gesture Video Generation (Audio, Audio-Driven Holistic Body Driving)
[2025/07/09] V11.4 Vision: Update Methods.
MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding (Audio, Head Pose Driving)
[2025/07/08] V11.3 Vision: Update Methods.
MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation (Audio, Head Pose Driving)
MoDA: Multi-modal Diffusion Architecture for Talking Head Generation (Audio, Head Pose Driving)
EchoMimicV3: 1.3B Parameters are All You Need for Unified Multi-Modal and Multi-Task Human Animation (Audio, Audio-Driven Holistic Body Driving)
Identity-Preserving Text-to-Video Generation Guided by Simple yet Effective Spatial-Temporal Decoupled Representations (Text, Text2MotionVideo)
[2025/07/04] V11.2 Vision: Update Methods.
CanonSwap: High-Fidelity and Consistent Video Face Swapping via Canonical Space Modulation (Visual, Portrait Animation)
[2025/07/03] V11.1 Vision: Update Methods.
FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases (Audio, Head Pose Driving)
ARIG: Autoregressive Interactive Head Generation for Real-time Conversations (Audio, Head Pose Driving)
JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching (Audio, Head Pose Driving)
GGTalker: Talking Head Systhesis with Generalizable Gaussian Priors and Identity-Specific Adaptation (Audio, Head Pose Driving)
Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router (Audio, Head Pose Driving)
Populate-A-Scene: Affordance-Aware Human Video Generation (Visual, Pose2Video)
Proteus-ID: ID-Consistent and Motion-Coherent Video Customization (Text, Text2MotionVideo)
MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation (Audio, Audio-Driven Holistic Body Driving)
Video Virtual Try-on with Conditional Diffusion Transformer Inpainter (Visual, Try-On Video Generation)
[2025/06/24] V11.0 Vision: Update Methods.
OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation (Audio, Audio-Driven Holistic Body Driving)
[2025/06/23] V10.9 Vision: Update Methods.
Controllable and Expressive One-Shot Video Head Swapping (Visual, Portrait Animation)
EchoShot: Multi-Shot Portrait Video Generation (Text, Text2MotionVideo)
[2025/06/18] V10.8 Vision: Update Methods.
3D Hand Mesh-Guided AI-Generated Malformed Hand Refinement with Hand Pose Transformation via Diffusion Model (Visual, Pose-Guided Dance Video Generation)
AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation (Audio, Audio-Driven Holistic Body Driving)
Audio-Visual Driven Compression for Low-Bitrate Talking Head Videos (Audio, Head Pose Driving)
[2025/06/13] V10.7 Vision: Update Methods.
Low-Barrier Dataset Collection with Real Human Body for Interactive Per-Garment Virtual Try-On (Visual, Try-On Video Generation)
DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers (Visual, Pose2Video)
[2025/06/12] V10.6 Vision: Update Methods.
Synthetic Human Action Video Data Generation with Pose Transfer (Visual, Pose2Video)
InterActHuman: Multi-Concept Human Animation with Layout-Aligned Audio Conditions (Audio, Audio-Driven Holistic Body Driving)
[2025/06/09] V10.5 Vision: Update Methods.
ChronoTailor: Harnessing Attention Guidance for Fine-Grained Video Virtual Try-On (Visual, Try-On Video Generation)
LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models (Audio, Head Pose Driving)
[2025/06/04] V10.4 Vision: Update Methods.
OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation (Visual, Pose-Guided Dance Video Generation)
SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers (Audio, Head Pose Driving)
[2025/06/03] V10.3 Vision: Update Methods.
DreamDance: Animating Character Art via Inpainting Stable Gaussian Worlds (Visual, Pose-Guided Dance Video Generation)
[2025/05/30] V10.2 Vision: Update Methods.
HyperMotion: DiT-Based Pose-Guided Human Image Animation of Complex Motions (Visual, Pose-Guided Dance Video Generation)
How Animals Dance (When You're Not Looking) (Visual, Pose-Guided Dance Video Generation)
Video Editing for Audio-Visual Dubbing (Audio, Lip Synchronization)
Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization and Temporal Motion Modulation (Audio, Head Pose Driving)
MMGT: Motion Mask Guided Two-Stage Network for Co-Speech Gesture Video Generation (Audio, Audio-Driven Holistic Body Driving)
[2025/05/29] V10.1 Vision: Update Methods.
LatentMove: Towards Complex Human Movement Video Generation (Visual, Pose-Guided Dance Video Generation)
Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation (Audio, Head Pose Driving)
FaceEditTalker: Interactive Talking Head Generation with Facial Attribute Editing (Audio, Head Pose Driving)
OmniResponse: Online Multimodal Conversational Response Generation in Dyadic Interactions (LLM, Large Lanuge Model Planer)
[2025/05/28] V10.0 Vision: Update Methods.
MagicTryOn: Harnessing Diffusion Transformer for Garment-Preserving Video Virtual Try-on (Visual, Try-On Video Generation)
OmniSync: Towards Universal Lip Synchronization via Diffusion Transformers (Audio, Head Pose Driving)
[2025/05/27] V9.9 Vision: Update Methods.
DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation (Visual, Video-Guided Dance Video Generation)
HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters (Visual, Audio-Driven Holistic Body Driving)
AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models (Visual, Pose2Video)
[2025/05/23] V9.8 Vision: Update Methods.
Interspatial Attention for Efficient 4D Human Video Generation (Visual, Pose-Guided Dance Video Generation)
[2025/05/13] V9.7 Vision: Update Methods.
ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images (Visual, Try-On Video Generation)
[2025/05/09] V9.6 Vision: Update Methods.
FlexiAct: Towards Flexible Action Control in Heterogeneous Scenarios (Visual, Video-Guided Dance Video Generation)
PAHA: Parts-Aware Audio-Driven Human Animation with Diffusion Model (Audio, Audio-Driven Holistic Body Driving)
HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation (Audio, Audio-Driven Holistic Body Driving)
[2025/05/01] V9.5 Vision: Update Methods.
MagicPortrait: Temporally Consistent Face Reenactment with 3D Geometric Guidance (Visual, Portrait Animation)
[2025/04/30] V9.4 Vision: Update Methods.
RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild (Visual, Pose-Guided Dance Video Generation)
AnimateAnywhere: Rouse the Background in Human Image Animation (Visual, Pose-Guided Dance Video Generation)
IM-Portrait: Learning 3D-aware Video Diffusion for Photorealistic Talking Heads from Monocular Videos (Visual, Portrait Animation)
3DV-TON: Textured 3D-Guided Consistent Video Try-on via Diffusion Models (Visual, Try-On Video Generation)
Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning (Audio, Head Pose Driving)
Disentangle Identity, Cooperate Emotion: Correlation-Aware Emotional Talking Portrait Generation (Audio, Head Pose Driving)
[2025/04/16] V9.3 Vision: Update Methods.
UniAnimate-DiT: Human Image Animation with Large-Scale Video Diffusion Transformer (Visual, Pose-Guided Dance Video Generation)
InterAnimate: Taming Region-aware Diffusion Model for Realistic Human Interaction Animation (Visual, Portrait Animation)
[2025/04/14] V9.2 Vision: Update Methods.
TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation (Visual, Pose-Guided Dance Video Generation)
EasyGenNet: An Efficient Framework for Audio-Driven Gesture Video Generation Based on Diffusion Model (Audio, Audio-Driven Holistic Body Driving)
[2025/04/09] V9.1 Vision: Update Methods.
Multi-identity Human Image Animation with Structural Video Diffusion (Visual, Pose-Guided Dance Video Generation)
FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis (Audio, Head Pose Driving)
SE4Lip: Speech-Lip Encoder for Talking Head Synthesis to Solve Phoneme-Viseme Alignment Ambiguity (Audio, Head Pose Driving)
Exploiting Temporal Audio-Visual Correlation Embedding for Audio-Driven One-Shot Talking Head Animation (Audio, Head Pose Driving)
FluentLip: A Phonemes-Based Two-stage Approach for Audio-Driven Lip Synthesis with Optical Flow Consistency (Audio, Lip Synchronization)
[2025/04/04] V9.0 Vision: Update Methods.
DreamActor-M1: Holistic, Expressive and Robust Human Image Animation with Hybrid Guidance (Visual, Video-Guided Dance Video Generation)
OmniTalker: Real-Time Text-Driven Talking Head Generation with In-Context Audio-Visual Style Replication (Text, Text2Face)
Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head Generation (Audio, Head Pose Driving)
VoiceCraft-Dub: Automated Video Dubbing with Neural Codec Language Models (Audio, Head Pose Driving)
[2025/04/02] V8.9 Vision: Update Methods.
Monocular and Generalizable Gaussian Talking Head Animation (Audio, Head Pose Driving)
[2025/04/01] V8.8 Vision: Update Methods.
HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled Generation (Text, Text2MotionVideo)
Dual Audio-Centric Modality Coupling for Talking Head Generation (Audio, Head Pose Driving)
[2025/03/31] V8.7 Vision: Update Methods.
Follow Your Motion: A Generic Temporal Consistency Portrait Editing Framework with Trajectory Guidance (Visual, Pose2Video)
High-Fidelity Diffusion Face Swapping with ID-Constrained Facial Conditioning (Visual, Portrait Animation)
Audio-Plane: Audio Factorization Plane Gaussian Splatting for Real-Time Talking Head Synthesis (Audio, Head Pose Driving)
[2025/03/26] V8.6 Vision: Update Methods.
EmoHead: Emotional Talking Head via Manipulating Semantic Expression Parameters (Audio, Fine-Grained Style and Emotion-Driven Animation)
MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait Animation (Audio, Fine-Grained Style and Emotion-Driven Animation)
DisentTalk: Cross-lingual Talking Face Generation via Semantic Disentangled Diffusion Model (Audio, Fine-Grained Style and Emotion-Driven Animation)
AudCast: Audio-Driven Human Video Generation by Cascaded Diffusion Transformers (Audio, Audio-Driven Holistic Body Driving)
[2025/03/25] V8.5 Vision: Update Methods.
HunyuanPortrait: Implicit Condition Control for Enhanced Portrait Animation (Visual, Portrait Animation)
EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation (Visual, Pose-Guided Dance Video Generation)
Teller: Real-Time Streaming Audio-Driven Portrait Animation with Autoregressive Motion Generation (Audio, Head Pose Driving)
[2025/03/24] V8.4 Vision: Update Methods.
Re-HOLD: Video Hand Object Interaction Reenactment via adaptive Layout-instructed Diffusion Model (Visual, Pose2Video)
[2025/03/21] V8.3 Vision: Update Methods.
Text-Driven Diffusion Model for Sign Language Production (Text, Text2MotionVideo)
[2025/03/20] V8.2 Vision: Update Methods.
Cafe-Talk: Generating 3D Talking Face Animation with Multimodal Coarse- and Fine-grained Control (Audio, Head Pose Driving)
[2025/03/19] V8.1 Vision: Update Methods.
Concat-ID: Towards Universal Identity-Preserving Video Synthesis (Text, Text2Face)
PC-Talk: Precise Facial Animation Control for Audio-Driven Talking Face Generation (Audio, Head Pose Driving)
MusicInfuser: Making Video Diffusion Listen and Dance (Audio, Audio-Driven Holistic Body Driving)
[2025/03/18] V8.0 Vision: Update Methods.
RASA: Replace Anyone, Say Anything -- A Training-Free Framework for Audio-Driven and Universal Portrait Video Editing (Audio, Head Pose Driving)
MagicID: Hybrid Preference Optimization for ID-Consistent and Dynamic-Preserved Video Customization (Text, Text2MotionVideo)
Snapmoji: Instant Generation of Animatable Dual-Stylized Avatars (Visual, Portrait Animation)
[2025/03/15] V7.9 Vision: Update Methods.
Semantic Latent Motion for Portrait Video Generation (Visual, Portrait Animation)
Cosh-DiT: Co-Speech Gesture Video Synthesis via Hybrid Audio-Visual Diffusion Transformers (Audio, Audio-Driven Holistic Body Driving)
[2025/03/13] V7.8 Vision: Update Methods.
SwapAnyone: Consistent and Realistic Video Synthesis for Swapping Any Person into Any Video (Visual, Pose2Video)
Versatile Multimodal Controls for Whole-Body Talking Human Animation (Audio, Audio-Driven Holistic Body Driving)
[2025/03/11] V7.7 Vision: Update Methods.
DynamicID: Zero-Shot Multi-ID Image Personalization with Flexible Facial Editability (Text, Text2Face)
[2025/03/07] V7.6 Vision: Update Methods.
FREAK: Frequency-modulated High-fidelity and Real-time Audio-driven Talking Portrait Synthesis (Audio, Head Pose Driving)
[2025/03/05] V7.5 Vision: Update Methods.
FaceShot: Bring Any Character into Life (Visual, Portrait Animation)
KeyFace: Expressive Audio-Driven Facial Animation for Long Sequences via KeyFrame Interpolation (Audio, Head Pose Driving)
[2025/02/28] V7.4 Vision: Update Methods.
High-Fidelity Relightable Monocular Portrait Animation with Lighting-Controllable Video Diffusion Model (Visual, Portrait Animation)
InsTaG: Learning Personalized 3D Talking Head from Few-Second Video (Audio, Head Pose Driving)
[2025/02/26] V7.3 Vision: Update Methods.
FantasyID: Face Knowledge Enhanced ID-Preserving Video Generation (Text, Text2MotionVideo)
[2025/02/25] V7.2 Vision: Update Methods.
X-Dancer: Expressive Music to Human Dance Video Generation (Audio, Audio-Driven Holistic Body Driving)
Dimitra: Audio-driven Diffusion model for Expressive Talking Head Generation (Audio, Head Pose Driving)
[2025/02/21] V7.1 Vision: Update Methods.
NeRF-3DTalker: Neural Radiance Field with 3D Prior Aided Audio Disentanglement for Talking Head Synthesis (Audio, Head Pose Driving)
[2025/02/18] V7.0 Vision: Update Methods.
HumanGif: Single-View Human Diffusion with Generative Prior (Visual, Pose-Guided Dance Video Generation)
SayAnything: Audio-Driven Lip Synchronization with Conditional Video Diffusion (Audio, Head Pose Driving)
SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers (Audio, Head Pose Driving)
[2025/02/16] V6.9 Vision: Update Methods.
Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model (Audio, Head Pose Driving)
[2025/02/13] V6.8 Vision: Update Methods.
AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance (Visual, Pose-Guided Dance Video Generation)
[2025/02/12] V6.7 Vision: Update Methods. Happy 2025 !!🍟
Contextual Gesture: Co-Speech Gesture Video Generation through Context-aware Gesture Representation (Audio, Audio-Driven Holistic Body Driving)
Playmate: Flexible Control of Portrait Animation via 3D-Implicit Space Guided Diffusion (Audio, Fine-Grained Style and Emotion-Driven Animation)
[2025/02/11] V6.6 Vision: Update Methods. Happy 2025 !!🍟
Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance (Visal, Pose-Guided Dance Video Generation)
[2025/02/10] V6.5 Vision: Update Methods. Happy 2025 !!🍟
HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation (Visal, Pose2Video)
[2025/02/04] V6.4 Vision: Update Methods. Happy 2025 !!🍟
EmoTalkingGaussian: Continuous Emotion-conditioned Talking Head Synthesis (Audio, Head Pose Driving)
OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models (Audio, Audio-Driven Holistic Body Driving)
[2025/02/03] V6.3 Vision: Update Methods. Happy 2025 !!🍟
Every Image Listens, Every Image Dances: Music-Driven Image Animation (Audio, Audio-Driven Holistic Body Driving)
[2025/01/30] V6.2 Vision: Update Methods. Happy 2025 !!🍟
Learning Semantic Facial Descriptors for Accurate Face Animation (Visual, Portrait Animation)
[2025/01/28] V6.1 Vision: Update Methods. Happy 2025 !!🍟
SyncAnimation: A Real-Time End-to-End Framework for Audio-Driven Human Pose and Talking Head Animation (Audio, Head Pose Driving)
[2025/01/24] V6.0 Vision: Update Methods. Happy New Year🍟
EchoVideo: Identity-Preserving Human Video Generation by Multimodal Feature Fusion (Text, Text2MotionVideo)
[2025/01/22] V5.9 Vision: Update Methods. Happy New Year🎀
CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation (Visual, Try-On Video Generation)
EMO2: End-Effector Guided Audio-Driven Avatar Video Generation (Audio, Audio-Driven Holistic Body Driving)
[2025/01/20] V5.8 Vision: Update Methods. Happy New Year🎀
X-Dyna: Expressive Dynamic Human Image Animation (Visual, Pose-Guided Dance Video Generation)
Textoon: Generating Vivid 2D Cartoon Characters from Text Descriptions (Text, Text2Motion)
[2025/01/18] V5.7 Vision: Update Methods. Happy New Year🎀
RealVVT: Towards Photorealistic Video Virtual Try-on via Spatio-Temporal Consistency (Visual, Try-On Video Generation)
DynamicFace: High-Quality and Consistent Video Face Swapping using Composable 3D Facial Priors (Visual, Portrait Animation)
[2025/01/16] V5.6 Vision: Update Methods. Happy New Year🎀
Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning (Visual, Portrait Animation)
[2025/01/14] V5.5 Vision: Update Methods. Happy New Year🎀
Identity-Preserving Video Dubbing Using Motion Warping (Audio, Lip Synchronization)
[2025/01/13] V5.4 Vision: Update Methods. Happy New Year🎀
Ingredients: Blending Custom Photos with Video Diffusion Transformers (Text, Text2MotionVideo)
Magic Mirror: ID-Preserved Video Generation in Video Diffusion Transformers (Text, Text2MotionVideo)
[2025/01/12] V5.3 Vision: Update Methods. Happy New Year🎀
MoEE: Mixture of Emotion Experts for Audio-Driven Portrait Animation (Audio, Head Pose Driving)
[2025/01/11] V5.2 Vision: Update Methods. Happy New Year🎀
UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting Control (Audio, Head Pose Driving)
[2025/01/10] V5.1 Vision: Update Methods. Happy New Year🎀
RAIN: Real-time Animation of Infinite Video Stream (Visual, Portrait Animation)
VideoMaker: Zero-shot Customized Video Generation with the Inherent Force of Video Diffusion Models (Text, Text2Face)
[2025/01/06] V5.0 Vision: Update Methods. Happy New Year🎀
Free-viewpoint Human Animation with Pose-correlated Reference Selection (Visual, Pose-Guided Dance Video Generation)
ManiVideo: Generating Hand-Object Manipulation Video with Dexterous and Generalizable Grasping (Visual, Pose2Video)
Follow-Your-MultiPose: Tuning-Free Multi-Character Text-to-Video Generation via Pose Guidance (Text, Text2MotionVideo)
[2025/01/04] V4.9 Vision: Update Methods. Happy New Year🎀
Consistent Human Image and Video Generation with Spatially Conditioned Diffusion (Visual, Pose-Guided Dance Video Generation)
[2024/12/17] V4.8 Vision: Update Methods.
VividFace: A Diffusion-Based Hybrid Framework for High-Fidelity Video Face Swapping (Visual, Portrait Animation)
VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization (Audio, Fine-Grained Style and Emotion-Driven Animation)
Dynamic Try-On: Taming Video Virtual Try-on with Dynamic Attention Mechanism (Visual, Try-On Video Generation)
SwiftTry: Fast and Consistent Video Virtual Try-On with Diffusion Models (Visual, Try-On Video Generation)
[2024/12/15] V4.7 Vision: Update Methods.
LatentSync: Audio Conditioned Latent Diffusion Models for Lip Sync (Audio, Lip Synchronization)
GoHD: Gaze-oriented and Highly Disentangled Portrait Animation with Rhythmic Poses and Realistic Expression (Audio, Head Pose Driving)
PortraitTalk: Towards Customizable One-Shot Audio-to-Talking Face Generation (Audio, Head Pose Driving)
IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation (Audio, Head Pose Driving)
INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations (Audio, Head Pose Driving)
MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation (Audio, Head Pose Driving)
DisPose: Disentangling Pose Guidance for Controllable Human Image Animation (Visual, Pose-Guided Dance Video Generation)
[2024/12/11] V4.6 Vision: Update Methods.
PEMF-VVTO: Point-Enhanced Video Virtual Try-on via Mask-free Paradigm (Visual, Try-On Video Generation)
SINGER: Vivid Audio-driven Singing Video Generation with Multi-scale Spectral Diffusion Model (Audio, Head Pose Driving)
EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation (Visual, Portrait Animation)
Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Diffusion Transformer Networks (Visual, Portrait Animation)
FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking Portrait (Visual, Portrait Animation)
DreamDance: Animating Human Images by Enriching 3D Geometry Cues from 2D Poses (Visual, Pose-Guided Dance Video Generation)
[2024/12/02] V4.5 Vision: Update Methods.
LokiTalk: Learning Fine-Grained and Generalizable Correspondences to Enhance NeRF-based Talking Head Synthesis (Audio, Head Pose Driving)
Ditto: Motion-Space Diffusion for Controllable Realtime Talking Head Synthesis (Audio, Head Pose Driving)
Fleximo: Towards Flexible Text-to-Human Motion Video Generation (Text, Text2MotionVideo)
[2024/11/28] V4.4 Vision: Update Methods.
HiFiVFS: High Fidelity Video Face Swapping (Visual, Portrait Animation)
MotionCharacter: Identity-Preserving and Motion Controllable Human Video Generation (Text, Text2Face)
Identity-Preserving Text-to-Video Generation by Frequency Decomposition (Text, Text2Face)
AnchorCrafter: Animate CyberAnchors Saling Your Products via Human-Object Interacting Video Generation (Visual, Pose2Video)
PersonalVideo: High ID-Fidelity Video Customization without Dynamic and Semantic Degradation (Text, Text2Face)
LetsTalk: Latent Diffusion Transformer for Talking Video Synthesis (Audio, Fine-Grained Style and Emotion-Driven Animation)
EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion (Audio, Fine-Grained Style and Emotion-Driven Animation)
Sonic: Shifting Focus to Global Audio Perception in Portrait Animation (Audio, Fine-Grained Style and Emotion-Driven Animation)
StableAnimator: High-Quality Identity-Preserving Human Image Animation (Visual, Pose-Guided Dance Video Generation)
[2024/11/25] V4.3 Vision: Update Methods.
FloAt: Flow Warping of Self-Attention for Clothing Animation Generation (Visual, Try-On Video Generation)
[2024/11/18] V4.2 Vision: Update Methods.
EchoMimicV2: Towards Striking, Simplified, and Semi-Body Human Animation (Audio, Audio-Driven Holistic Body Driving)
[2024/11/15 !WoW! More Star 100 🌟🌟🌟] V4.1 Vision: Update Methods.
JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation (Audio, Fine-Grained Style and Emotion-Driven Animation)
LES-Talker: Fine-Grained Emotion Editing for Talking Head Generation in Linear Emotion Space (Audio, Fine-Grained Style and Emotion-Driven Animation)
[2024/11/14]V4.0 Vision: Update Methods.
MikuDance: Animating Character Art with Mixed Motion Dynamics (Visual, Pose-Guided Dance Video Generation)
[2024/11/04]V3.9 Vision: Update Methods.
Fashion-VDM (Visual, Try-On Video Generation)
Towards High-fidelity Head Blending with Chroma Keying for Industrial Applications (Visual, Portrait Animation)
[2024/11/01]V3.8 Vision: Update Methods.
Stereo-Talker (Audio, Audio-Driven Holistic Body Driving)
[2024/10/29]V3.7 Vision: Update Methods.
MovieCharacter (Visual, Pose2Video)
[2024/10/24 Happy Coding Day!]V3.6 Vision: Update Methods.
EmoGene (Audio, Fine-Grained Style and Emotion-Driven Animation)
[2024/10/21]V3.5 Vision: Update Methods.
Takin-ADA: Emotion Controllable Audio-Driven Animation with Canonical and Landmark Loss Optimization (Audio, Fine-Grained Style and Emotion-Driven Animation)
[2024/10/18]V3.4 Vision: Update Methods.
DAWN: Dynamic Frame Avatar with Non-autoregressive Diffusion Framework for Talking Head Video Generation (Audio, Head Pose Driving)
[2024/10/15]V3.3 Vision: Update Methods.
Tex4D (Text, Text2MotionVideo)
TALK-Act: Enhance Textural-Awareness for 2D Speaking Avatar Reenactment with Diffusion Model (Audio, Audio-Driven Holistic Body Driving)
Animate-X: Universal Character Image Animation with Enhanced Motion Representation (Visual, Pose-Guided Dance Video Generation)
MuseTalk: Real-Time High Quality Lip Synchronization with Latent Space Inpainting (Audio, Lip Synchronization)
[2024/10/11]V3.2 Vision: Update Methods.
Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation (Audio, Fine-Grained Style and Emotion-Driven Animation)
[2024/10/10]V3.1 Vision: Update Methods.
MimicTalk: Mimicking a personalized and expressive 3D talking face in minutes (Audio, Fine-Grained Style and Emotion-Driven Animation)
[2024/10/08]V3.0 Vision: Update Methods.
TANGO (Audio, Audio-Driven Holistic Body Driving)
[2024/10/04]🎉🎉🎉V2.9 Vision I'm glad that our article is publicly available on TechRxiv. We welcome your attention and citations. The version on arXiv is still on hold, and we will update it when it becomes available.
@article{xue2024human,
title={Human Motion Video Generation: A Survey},
author={Xue, Haiwei and Luo, Xiangyang and Hu, Zhanghao and Zhang, Xin and Xiang, Xunzhi and Dai, Yuqin and Liu, Jianzhuang and Zhang, Zhensong and Li, Minglei and Yang, Jian and Ma, Fei and Wu, Zhiyong and Yang, Changpeng and Dai, Zonghong and Yu, Fei Richard},
journal={IEEE Transactions on Pattern Analysis and Machine Intelligence},
year={2025},
doi={10.1109/TPAMI.2025.3594034}
}
[2024/10/03]V2.8 Vision: Update Methods.
LaDTalk: Latent Denoising for Synthesizing Talking Head Videos with High Frequency Details (Audio, Head Pose Driving)
[2024/10/02]V2.7 Vision: Update Methods.
Replace Anyone in Videos (Visual, Video-Guided Dance Video Generation)
High Quality Human Image Animation using Regional Supervision and Motion Blur Condition (Visual, Pose-Guided Dance Video Generation)
[2024/09/27]V2.6 Vision: Update Methods.
SVP (Visual, Portrait Animation)
Self-Supervised Learning of Deviation in Latent Representation for Co-speech Gesture Video Generation (Audio, Audio-Driven Holistic Body Driving)
[2024/09/25]V2.5 Vision: Update Methods.
MIMO (Visual, Pose-Guided Dance Video Generation)
[2024/09/24]V2.4 Vision: Update Methods.
MIMAFace (Audio, Fine-Grained Style and Emotion-Driven Animation)
[2024/09/23]V2.3 Vision: Update Methods.
JoyHallo (Audio, Fine-Grained Style and Emotion-Driven Animation)
[2024/09/19] V2.2 Vision: Update Methods.
JEAN (Audio, Head Pose Driving)
[2024/09/17] V2.1 Vision: Update Methods.
LawDNet (Audio, Lip Synchronization)
StyleTalk++ (Audio, Fine-Grained Style and Emotion-Driven Animation)
[2024/09/13] V2.0 Vision: Update Methods.
DiffTED (Audio, Audio-Driven Holistic Body Driving)
[2024/09/12] V1.9 Vision: Update Methods.
EMOdiffhead (Audio, Fine-Grained Animation)
[2024/09/11] V1.8 Vision: Update Methods.
RealisDance (Visual, Pose-Guided Dance Video Generation)
[2024/09/10] V1.7 Vision: Update Methods.
Leveraging WaveNet for Dynamic Listening Head Modeling from Speech (Audio, Lip Synchronization)
KAN-Based Fusion of Dual-Domain for Audio-Driven Facial Landmarks Generation (Audio, Lip Synchronization)
PersonaTalk (Audio, Lip Synchronization)
[2024/09/06] V1.6 Vision: Update Methods.
SVP (Audio, Fine-Grained Animation)
SegTalker (Audio, Lip Synchronization)
[2024/09/05] V1.5 Vision: Update Methods.
Loopy (Audio, Fine-Grained Animation)
PoseTalk (Audio, Fine-Grained Animation)
[2024/09/04] V1.4 Vision: Update Methods.
CyberHost (Audio, Holistic Human Driving)
[2024/08/28] V1.3 Vision: Update Methods.
MegActor-Σ (Audio, Fine-Grained Animation)
Rafael Azevedo et al. (Text, Text2Face)
[2024/08/27] V1.2 Vision: Update Methods.
[2024/08/26] V1.1 Vision: Update Methods.
[2024/08/21] V1.0 Vision: Initialize the repository. If you find it helpful to you, welcome to star and share our work.
🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨
从2026年01月01日起,为便于快速更新follow最新的工作,下方的表格将不再更新,仅在上方快速推送。
Starting from January 1, 2026, to facilitate quick updates and follow the latest works, the table below will no longer be updated and will only be quickly pushed in the news section above.
🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨🧨
Vision Guidance
Part (Face) || Portrait Animation
Holistic Human || Video-Guided Dance Video Generation
Holistic Human || Pose-Guided Dance Video Generation
Holistic Human || Try-On Video Generation
Holistic Human || Pose2Video
Text Guidance
Part (Face) || Text2Face
Holistic Human || Text2MotionVideo
Audio Guidance
Part (Face) || Lip Synchronization
Part (Face) || Head Pose Driving
Holistic Human || Audio-Driven Holistic Body Driving
Part (Face) || Fine-Grained Style and Emotion-Driven Animation
LLM for Motion Planning
LLM for 2D
LLM for 3D
Cite The Survey
If you find our survey and repository useful for your research project, please consider citing our paper:
@article{xue2024human,
title={Human Motion Video Generation: A Survey},
author={Xue, Haiwei and Luo, Xiangyang and Hu, Zhanghao and Zhang, Xin and Xiang, Xunzhi and Dai, Yuqin and Liu, Jianzhuang and Zhang, Zhensong and Li, Minglei and Yang, Jian and Ma, Fei and Wu, Zhiyong and Yang, Changpeng and Dai, Zonghong and Yu, Fei Richard},
journal={IEEE Transactions on Pattern Analysis and Machine Intelligence},
year={2025},
doi={10.1109/TPAMI.2025.3594034}
}
Contributing
Contributions are welcome! Please feel free to create an issue or open a pull request with your contributions.
Haiwei Xue 💻 🎨 🤔 |
Xiangyang Luo 🐛 |
Zhanghao Hu 🥙 💻 |
Xin Zhang 😘🎪 😍 |
Xunzhi Xiang 🚄 😍 |
Yuqin Dai 😘 👸 |
License
This project is licensed under the MIT License - see the LICENSE file for details.
Acknowledgements
We would like to acknowledge the contributions of all researchers and developers in the field of human motion video generation. Their work has been instrumental in the advancement of this technology.